El modelo más comentado de octubre no ha salido. OpenAI lo tenía terminado y el 28 de septiembre decidió no publicar GPT-6.1 Astra porque, según su responsable de sistemas de seguridad, no cumplía su listón de mantenerse dentro de lo autorizado. Entre el 2 de septiembre y el 7 de octubre salieron diez modelos de cinco laboratorios, y ninguno gana en todo.
Precio, fecha y punto fuerte de cada modelo
Precio de lista estándar por millón de tokens, en dólares, a 8 de octubre de 2026. La última columna recoge lo que cada fabricante dice de su propio modelo.
| Modelo | Laboratorio | Lanzamiento | Entrada / salida (USD) | Pesos descargables | Dónde dice destacar |
|---|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 3 sep | 10 / 50 | No | Uso de ordenador, trabajo profesional |
| GPT-6.1 Sol | OpenAI | 29 sep | 2 / 10 | No | Casi Astra a un quinto del precio |
| Claude Opus 5.5 | Anthropic | 22 sep | 4 / 20 | No | Programación agéntica, trabajo de oficina |
| Claude Haiku 5.5 | Anthropic | 7 oct | 0,10 / 0,50 (prompts hasta 100k) | No | Volumen alto, subagentes |
| Gemini 3.8 Flash | 2 sep | 0,75 / 3,75 (hasta el 31 dic) | No | Coste por tarea | |
| Grok 4.7 | xAI | 21 sep | 2 / 6 | No | Precio, trabajo jurídico |
| DeepSeek V4-Pro | DeepSeek | versión 0813 | 1,32 / 3,96 (hora punta) | Sí | Precio fuera de hora punta |
| Mistral Large 4 | Mistral AI | 6 oct (preview) | 0,68 / 2,09 (oferta) | Sí | Pesos abiertos, proveedor europeo |
Una advertencia antes de seguir: casi todas las cifras de rendimiento de este artículo las publica el propio fabricante, con su configuración y contra los rivales que elige. Sirven para saber qué defiende cada uno. No sustituyen una prueba con tus datos.
OpenAI: el techo más alto y el freno más visible
GPT-6 Astra es el modelo con más ambición de la lista. OpenAI le atribuye un 72,6 % en OSWorld 2.0, frente al 65,7 % de GPT-5.6 Sol, en tareas de manejar un ordenador de verdad: formularios, CRM, hojas de cálculo. Es su apuesta por el agente que trabaja en tu pantalla.
El precio acompaña: 10 dólares de entrada y 50 de salida. Y viene con condiciones. OpenAI lo clasifica en nivel Critical de ciberseguridad y la versión publicada se niega a generar pruebas de concepto de exploits.
Para la mayoría de cargas el modelo interesante es GPT-6.1 Sol: 2 y 10 dólares, presentado en el DevDay del 29 de septiembre como un Astra casi completo a un quinto del precio.
Pros: el mejor resultado declarado en uso de ordenador, una gama escalonada de precios y despliegue también en Azure y Bedrock.
Anthropic: menos tokens por tarea
Claude Opus 5.5 sale con una tesis económica: cuesta un 40 % menos que Opus 5 en cargas típicas, con entrada a 4 dólares, salida a 20 y lectura de caché a 0,20. En la tabla de Anthropic marca 66,4 % en Terminal-Bench 4.0, por encima del 57,9 % de GPT-6 Astra. La propia Anthropic matiza que, a este nivel, las diferencias en benchmarks dicen menos que antes sobre el uso real.
El otro argumento es la escritura. Respuestas más cortas y con lo importante al principio. Para quien revisa la salida de un agente después de seis horas de trabajo, esto se nota en horas de revisión.
En la gama baja, Haiku 5.5 cuesta 0,10 dólares de entrada y 0,50 de salida en prompts de hasta 100.000 tokens. Está pensado para clasificar, resumir y servir de subagente.
Pros: el mejor resultado declarado en programación agéntica, opción de retención cero de datos y disponibilidad en AWS, Google Cloud y Azure.
Google: el Flash que se renueva cada tres semanas
Google lleva tres versiones de Flash en seis semanas y ninguna Pro nueva desde la 3.1. Gemini 3.8 Flash cuesta 0,75 dólares de entrada y 3,75 de salida, pero esa es una tarifa de lanzamiento: el 1 de enero de 2027 se duplica a 1,50 y 7,50. Si dimensionas un presupuesto anual con el precio de hoy, te equivocas por la mitad.
Hay un detalle que un CISO tiene que leer. En la misma página de precios, Google indica que el contenido enviado por el nivel gratuito se usa para mejorar sus productos, y el del nivel de pago no. El nivel gratuito sirve para hacer pruebas, pero no para datos reales.
Gemini 4 sigue sin fecha. El responsable de DeepMind dijo a finales de septiembre que llegará bastante antes de fin de año.
Pros: el mejor precio por tarea entre los modelos cerrados de gama media, nivel gratuito para prototipar e integración con Workspace.
xAI: rendimiento cerca de la frontera a 6 dólares la salida
Grok 4.7 mantiene el precio de Grok 4.6: 2 dólares de entrada y 6 de salida. Es la salida más barata entre los modelos cerrados de primera línea. En la tabla de xAI saca un 19,6 % en el Harvey Legal Agent Benchmark, frente al 6,7 % de Claude Fable 5.1 y el 2,5 % de GPT-5.6 Sol. Si tu caso es documental o jurídico, ese dato merece una prueba propia.
Pros: relación precio-rendimiento y una variante rápida al doble de velocidad y al doble de precio.
DeepSeek y Mistral: los que puedes llevarte a casa
Aquí cambia la pregunta. Ya no es solo cuánto cuesta el token, sino quién controla el modelo.
DeepSeek factura V4-Pro a 1,32 dólares de entrada y 3,96 de salida en hora punta, y a la mitad el resto del tiempo. La hora punta va de 01:00 a 04:00 y de 06:00 a 10:00 UTC, de lunes a viernes. Los pesos de V4-Pro están publicados en Hugging Face, con 1,7 billones de parámetros. Ese tamaño los deja fuera del alcance de casi cualquier CPD que no sea de hiperescala, y la API la sirve una empresa china.
Mistral Large 4 llegó el 6 de octubre en public preview: pesos abiertos, 1,05 billones de parámetros en total con 52.000 millones activos por token, 1M de contexto y un precio de oferta de 0,68 / 2,09 dólares. Es el único modelo de la lista con pesos abiertos y un proveedor europeo detrás.
Pros: precio mínimo en DeepSeek. Soberanía real en Mistral, si tienes el hardware para ejecutarlo.
Elige por tarea, no por logotipo
| Si necesitas… | Empieza probando |
|---|---|
| Un agente que maneje aplicaciones de escritorio | GPT-6 Astra |
| Programación larga sin vigilancia | Claude Opus 5.5 |
| Millones de clasificaciones al mes | Claude Haiku 5.5 o Gemini 3.8 Flash |
| Análisis documental y jurídico | Grok 4.7 |
| Que el modelo no salga de tu infraestructura | Mistral Large 4 |
Orientación a partir de lo que publica cada fabricante, no un benchmark propio.
La lista caduca, la arquitectura no
En los próximos dos meses esta tabla cambiará tres veces. Llegará Gemini 4, Gemini 3.8 Flash duplicará su precio y OpenAI decidirá qué hace con Astra. Si cada cambio de modelo te obliga a reescribir una integración, el problema no está en el modelo que elegiste.
