Contacto
Cerrar

Sobre nosotros

PUMPUN DIXITAL SL

Marqués de Valladares, 36201
Vigo

(+34) 886 11 40 26

sat@pumpun.com

ModelosIA_Competicion

Diez modelos de IA en cinco semanas: qué gana cada laboratorio en octubre de 2026

El modelo más comentado de octubre no ha salido. OpenAI lo tenía terminado y el 28 de septiembre decidió no publicar GPT-6.1 Astra porque, según su responsable de sistemas de seguridad, no cumplía su listón de mantenerse dentro de lo autorizado. Entre el 2 de septiembre y el 7 de octubre salieron diez modelos de cinco laboratorios, y ninguno gana en todo.

Precio, fecha y punto fuerte de cada modelo

Precio de lista estándar por millón de tokens, en dólares, a 8 de octubre de 2026. La última columna recoge lo que cada fabricante dice de su propio modelo.

ModeloLaboratorioLanzamientoEntrada / salida (USD)Pesos descargablesDónde dice destacar
GPT-6 AstraOpenAI3 sep10 / 50NoUso de ordenador, trabajo profesional
GPT-6.1 SolOpenAI29 sep2 / 10NoCasi Astra a un quinto del precio
Claude Opus 5.5Anthropic22 sep4 / 20NoProgramación agéntica, trabajo de oficina
Claude Haiku 5.5Anthropic7 oct0,10 / 0,50 (prompts hasta 100k)NoVolumen alto, subagentes
Gemini 3.8 FlashGoogle2 sep0,75 / 3,75 (hasta el 31 dic)NoCoste por tarea
Grok 4.7xAI21 sep2 / 6NoPrecio, trabajo jurídico
DeepSeek V4-ProDeepSeekversión 08131,32 / 3,96 (hora punta)SíPrecio fuera de hora punta
Mistral Large 4Mistral AI6 oct (preview)0,68 / 2,09 (oferta)SíPesos abiertos, proveedor europeo

Una advertencia antes de seguir: casi todas las cifras de rendimiento de este artículo las publica el propio fabricante, con su configuración y contra los rivales que elige. Sirven para saber qué defiende cada uno. No sustituyen una prueba con tus datos.

OpenAI: el techo más alto y el freno más visible

GPT-6 Astra es el modelo con más ambición de la lista. OpenAI le atribuye un 72,6 % en OSWorld 2.0, frente al 65,7 % de GPT-5.6 Sol, en tareas de manejar un ordenador de verdad: formularios, CRM, hojas de cálculo. Es su apuesta por el agente que trabaja en tu pantalla.

El precio acompaña: 10 dólares de entrada y 50 de salida. Y viene con condiciones. OpenAI lo clasifica en nivel Critical de ciberseguridad y la versión publicada se niega a generar pruebas de concepto de exploits.

Para la mayoría de cargas el modelo interesante es GPT-6.1 Sol: 2 y 10 dólares, presentado en el DevDay del 29 de septiembre como un Astra casi completo a un quinto del precio.

Pros: el mejor resultado declarado en uso de ordenador, una gama escalonada de precios y despliegue también en Azure y Bedrock.

Anthropic: menos tokens por tarea

Claude Opus 5.5 sale con una tesis económica: cuesta un 40 % menos que Opus 5 en cargas típicas, con entrada a 4 dólares, salida a 20 y lectura de caché a 0,20. En la tabla de Anthropic marca 66,4 % en Terminal-Bench 4.0, por encima del 57,9 % de GPT-6 Astra. La propia Anthropic matiza que, a este nivel, las diferencias en benchmarks dicen menos que antes sobre el uso real.

El otro argumento es la escritura. Respuestas más cortas y con lo importante al principio. Para quien revisa la salida de un agente después de seis horas de trabajo, esto se nota en horas de revisión.

En la gama baja, Haiku 5.5 cuesta 0,10 dólares de entrada y 0,50 de salida en prompts de hasta 100.000 tokens. Está pensado para clasificar, resumir y servir de subagente.

Pros: el mejor resultado declarado en programación agéntica, opción de retención cero de datos y disponibilidad en AWS, Google Cloud y Azure.

Google: el Flash que se renueva cada tres semanas

Google lleva tres versiones de Flash en seis semanas y ninguna Pro nueva desde la 3.1. Gemini 3.8 Flash cuesta 0,75 dólares de entrada y 3,75 de salida, pero esa es una tarifa de lanzamiento: el 1 de enero de 2027 se duplica a 1,50 y 7,50. Si dimensionas un presupuesto anual con el precio de hoy, te equivocas por la mitad.

Hay un detalle que un CISO tiene que leer. En la misma página de precios, Google indica que el contenido enviado por el nivel gratuito se usa para mejorar sus productos, y el del nivel de pago no. El nivel gratuito sirve para hacer pruebas, pero no para datos reales.

Gemini 4 sigue sin fecha. El responsable de DeepMind dijo a finales de septiembre que llegará bastante antes de fin de año.

Pros: el mejor precio por tarea entre los modelos cerrados de gama media, nivel gratuito para prototipar e integración con Workspace.

xAI: rendimiento cerca de la frontera a 6 dólares la salida

Grok 4.7 mantiene el precio de Grok 4.6: 2 dólares de entrada y 6 de salida. Es la salida más barata entre los modelos cerrados de primera línea. En la tabla de xAI saca un 19,6 % en el Harvey Legal Agent Benchmark, frente al 6,7 % de Claude Fable 5.1 y el 2,5 % de GPT-5.6 Sol. Si tu caso es documental o jurídico, ese dato merece una prueba propia.

Pros: relación precio-rendimiento y una variante rápida al doble de velocidad y al doble de precio.

DeepSeek y Mistral: los que puedes llevarte a casa

Aquí cambia la pregunta. Ya no es solo cuánto cuesta el token, sino quién controla el modelo.

DeepSeek factura V4-Pro a 1,32 dólares de entrada y 3,96 de salida en hora punta, y a la mitad el resto del tiempo. La hora punta va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. Los pesos de V4-Pro están publicados en Hugging Face, con 1,7 billones de parámetros. Ese tamaño los deja fuera del alcance de casi cualquier CPD que no sea de hiperescala, y la API la sirve una empresa china.

Mistral Large 4 llegó el 6 de octubre en public preview: pesos abiertos, 1,05 billones de parámetros en total con 52.000 millones activos por token, 1M de contexto y un precio de oferta de 0,68 / 2,09 dólares. Es el único modelo de la lista con pesos abiertos y un proveedor europeo detrás.

Pros: precio mínimo en DeepSeek. Soberanía real en Mistral, si tienes el hardware para ejecutarlo.

Elige por tarea, no por logotipo

Si necesitas…Empieza probando
Un agente que maneje aplicaciones de escritorioGPT-6 Astra
Programación larga sin vigilanciaClaude Opus 5.5
Millones de clasificaciones al mesClaude Haiku 5.5 o Gemini 3.8 Flash
Análisis documental y jurídicoGrok 4.7
Que el modelo no salga de tu infraestructuraMistral Large 4

Orientación a partir de lo que publica cada fabricante, no un benchmark propio.

La lista caduca, la arquitectura no

En los próximos dos meses esta tabla cambiará tres veces. Llegará Gemini 4, Gemini 3.8 Flash duplicará su precio y OpenAI decidirá qué hace con Astra. Si cada cambio de modelo te obliga a reescribir una integración, el problema no está en el modelo que elegiste.