Impulsado por
Technology

Los gigantes de la IA lanzan cuatro modelos de vanguardia en tres semanas, mientras la carrera se acelera al máximo

Cuatro laboratorios de inteligencia artificial (IA) de gran prestigio lanzaron modelos lingüísticos de vanguardia en un periodo de tres semanas en julio de 2026, y la diferencia entre lo que estos sistemas logran sin intervención humana y lo que se había conseguido anteriormente se ha reducido drásticamente.

ESCRITO POR
COMPARTIR
Los gigantes de la IA lanzan cuatro modelos de vanguardia en tres semanas, mientras la carrera se acelera al máximo

Puntos clave

  • xAI lanzó Grok 4.5 el 8 de julio a un precio de 2/6 dólares por millón de tokens, lo que supone una reducción de más del 60 % respecto al precio de Opus 4.8.
  • Anthropic lanzó Claude Opus 5 el 24 de julio como nuevo modelo predeterminado en las suscripciones a Claude Max.
  • Moonshot AI publicó Kimi K3, su modelo más grande con 2,8 billones de parámetros.

Grok 4.5 de xAI, Claude Opus 5 de Anthropic, la familia GPT-5.6 de OpenAI y Kimi K3 de Moonshot AI abordan el mismo problema: conseguir que un sistema de IA lleve a cabo una tarea de varias horas —desde la investigación hasta la programación y la elaboración de informes estructurados— sin perder de vista el plan.

Grok 4.5 se entrena con sesiones reales de desarrolladores

xAI lanzó Grok 4.5 el 8 de julio. El modelo funciona con una base de 1,5 billones de parámetros y se entrenó, en parte, con datos de uso reales de Cursor, la plataforma de programación que SpaceXAI adquirió a principios de este año. El precio es de 2 dólares por cada millón de tokens de entrada y de 6 dólares por cada millón de tokens de salida, con una ventana de contexto de 500 000 tokens.

Elon X post screenshot.
Elon hablando sobre el lanzamiento de Grok 4.5 el 8 de julio de 2026.

Elon Musk describió Grok 4.5 como un modelo de clase Opus que funciona más rápido y a un coste menor. Los observadores independientes lo sitúan en cuarto lugar en el Índice de Inteligencia Artificial Analítica, por delante de todos los modelos de peso abierto, con un precio más de un 60 % inferior al de Claude Opus 4.8 y GPT-5.5. En Terminal-Bench 2.1, una prueba que evalúa la capacidad de un modelo para completar tareas de ingeniería de línea de comandos, Grok 4.5 obtuvo una puntuación del 83,3 %.

El cambio más significativo se produce en la eficiencia de los tokens. xAI afirma que el modelo necesita aproximadamente una quinta parte de los tokens de salida que requería Opus 4.8 para tareas comparables, lo que reduce el coste de ejecutar sesiones prolongadas con el agente.

Claude Opus 5 mantiene su precio

Anthropic lanzó Claude Opus 5 el 24 de julio, posicionándolo como un modelo que se acerca al rendimiento de Claude Fable 5 —el lanzamiento más potente de la empresa— a la mitad del precio de Fable: 10 dólares por entrada y 50 dólares por salida. El propio Opus 5 mantiene los mismos precios que su predecesor, Opus 4.8: 5 dólares por entrada y 25 dólares por salida.

Claude X post screenshot.
Anuncio de Claude Opus 5 a través de X.

El modelo incluye una ventana de contexto de 1 millón de tokens, un máximo de 128 000 tokens de salida y un ajuste de esfuerzo de razonamiento regulable que va desde «bajo» hasta un nuevo modo «xhigh». Anthropic afirma que Opus 5 establece nuevos récords en Frontier-Bench y GDPval-AA, dos pruebas de evaluación de programación y trabajo de conocimiento, aunque queda por detrás del modelo restringido Claude Mythos 5 en tareas de ciberseguridad. Opus 5 es ahora el modelo predeterminado en Claude Max y la opción más potente en Claude Pro.

OpenAI divide GPT-5.6 en tres niveles

OpenAI puso GPT-5.6 a disposición del público general el 9 de julio, tras un periodo de prueba de dos semanas limitado a unas 20 organizaciones seleccionadas por el Gobierno de EE. UU., a raíz de una orden ejecutiva relacionada con la revisión de la seguridad de los modelos de vanguardia. La familia se ofrece en tres niveles: Sol, el modelo insignia, con un precio de 5 dólares por entrada y 30 dólares por salida por cada millón de tokens; Terra, un modelo de nivel medio a 2,50 y 15 dólares que, según OpenAI, equivale a GPT-5.5 a la mitad de coste; y Luna, un nivel rápido y de bajo coste a 1 y 6 dólares.

OpenAI X post screenshot.
Anuncio de ChatGPT 5.6 Sol a través de X.

OpenAI informa de que Sol lidera el Índice de Agentes de Codificación de Análisis Artificial (AACA) y alcanza un 88,8 % en Terminal-Bench 2.1, elevándose al 91,9 % cuando el modelo ejecuta cuatro subagentes en paralelo en su nuevo modo «ultra». Los tres niveles cuentan con la máxima calificación interna de riesgo de OpenAI por su potencial de uso indebido cibernético y biológico, lo que motivó una revisión adicional durante la fase de vista previa restringida al gobierno.

Kimi K3 impulsa los modelos de peso abierto hacia la vanguardia

Moonshot AI lanzó Kimi K3 el 16 de julio, un modelo de mezcla de expertos con 2,8 billones de parámetros, un total de 896 expertos y 16 activos por tarea. El modelo cuenta con una ventana de contexto de un millón de tokens y entrada multimodal nativa, con unos precios de la API de 3 dólares por entrada y 15 dólares por salida por cada millón de tokens. Moonshot se ha comprometido a publicar los pesos abiertos completos antes del 27 de julio.

Kimi Moonshot X post screenshot.
Anuncio de Kimi K3 a través de X.

K3 es el modelo de pesos abiertos más grande lanzado hasta la fecha, aproximadamente un 75 % más grande que el anterior modelo abierto más grande y ampliamente utilizado. Los rastreadores independientes sitúan a K3 en cuarto lugar entre los sistemas de vanguardia actuales, por detrás de Claude Fable 5 y GPT-5.6 Sol, pero por delante de Claude Opus 4.8.

Por qué es importante la diferencia con los modelos anteriores

Las ventanas de contexto por debajo de los 200 000 tokens obligaban antes a los desarrolladores a dividir en fragmentos grandes bases de código o paquetes de investigación. Ahora, todos los modelos de este grupo funcionan con 500 000 tokens o más, y tres de los cuatro alcanzan el millón, lo que permite que una sola sesión albergue un repositorio completo o una pila de documentos de fuente primaria.

La fiabilidad de los agentes también ha mejorado. Los sistemas de los años 2023 y 2024 solían perder su plan tras unas pocas llamadas a herramientas. Los modelos lanzados este mes están diseñados para mantener docenas de pasos coordinados y recuperarse cuando una llamada a una herramienta devuelve datos erróneos, en lugar de bloquearse.

Para los desarrolladores, el efecto práctico es un menor coste por tarea completada, más que un techo más alto en cualquier prueba de rendimiento concreta. Los controles de esfuerzo en Opus 5, la estructura de precios por niveles en GPT-5.6 y las afirmaciones de eficiencia que respaldan a Grok 4.5 apuntan hacia el mismo objetivo: permitir que los equipos elijan la cantidad de recursos de computación que merece una tarea, en lugar de pagar precios de gama alta por cada solicitud.

Para las empresas y los responsables políticos, el lanzamiento de GPT-5.6, regulado por el Gobierno, indica que la supervisión ya está integrada en los calendarios de lanzamiento de los modelos más grandes, y no se añade a posteriori. La breve suspensión del acceso a Fable y Mythos por parte de Anthropic en junio, a instancias del Gobierno, fue una versión anterior de este mismo patrón.

Este artículo fue traducido del inglés mediante IA. La versión original en inglés es la fuente autorizada; las traducciones automáticas pueden contener imprecisiones, especialmente en la terminología legal y regulatoria.