Quatre laboratoires de renommée mondiale spécialisés dans l’intelligence artificielle (IA) ont publié des modèles linguistiques de pointe en l’espace de trois semaines en juillet 2026, et l’écart entre ce que ces systèmes parviennent à réaliser sans intervention humaine et ce qui existait auparavant s’est considérablement réduit.
Les géants de l'IA lancent quatre modèles de pointe en trois semaines alors que la course s'accélère

Points clés
- xAI a lancé Grok 4.5 le 8 juillet au prix de 2 $/6 $ par million de tokens, soit un prix inférieur de plus de 60 % à celui d’Opus 4.8.
- Anthropic a lancé Claude Opus 5 le 24 juillet, qui devient le nouveau modèle par défaut des abonnements Claude Max.
- Moonshot AI a publié Kimi K3, son plus grand modèle avec 2,8 billions de paramètres.
Grok 4.5 de xAI, Claude Opus 5 d’Anthropic, la famille GPT-5.6 d’OpenAI et Kimi K3 de Moonshot AI s’attaquent tous au même problème : permettre à un système d’IA d’effectuer une tâche s’étalant sur plusieurs heures, de la recherche au codage en passant par la création de rapports structurés, sans perdre de vue l’objectif initial.
Grok 4.5 s'entraîne sur de véritables sessions de développement
xAI a lancé Grok 4.5 le 8 juillet. Ce modèle repose sur une base de 1 500 milliards de paramètres et a été entraîné en partie à partir de données d’utilisation réelles issues de Cursor, la plateforme de codage acquise par SpaceXAI plus tôt cette année. La tarification s’élève à 2 dollars par million de tokens d’entrée et à 6 dollars par million de tokens de sortie, avec une fenêtre de contexte de 500 000 tokens.

Elon Musk a décrit Grok 4.5 comme un modèle de classe Opus, plus rapide et moins coûteux. Des observateurs indépendants le classent quatrième de l’Artificial Analysis Intelligence Index, devant tous les modèles à poids ouverts, à un prix inférieur de plus de 60 % à celui de Claude Opus 4.8 et du GPT-5.5. Sur Terminal-Bench 2.1, un test qui évalue la capacité d’un modèle à accomplir des tâches d’ingénierie en ligne de commande, Grok 4.5 a obtenu un score de 83,3 %.
Le changement le plus notable concerne l’efficacité en termes de tokens. Selon xAI, le modèle nécessite environ un cinquième des tokens de sortie requis par Opus 4.8 pour des tâches comparables, ce qui réduit le coût d’exécution de longues sessions d’agent.
Claude Opus 5 maintient ses prix
Anthropic a lancé Claude Opus 5 le 24 juillet, le positionnant comme un modèle dont les performances se rapprochent de celles de Claude Fable 5, le modèle le plus performant de la société, à la moitié du prix de Fable (10 $ pour l’entrée et 50 $ pour la sortie). Opus 5 conserve les mêmes tarifs que son prédécesseur, Opus 4.8, à savoir 5 $ pour l’entrée et 25 $ pour la sortie.

Le modèle est livré avec une fenêtre de contexte d’un million de tokens, un nombre maximal de 128 000 tokens en sortie, et un paramètre d’effort de raisonnement réglable allant de « faible » à un nouveau mode « xhigh ». Anthropic indique qu’Opus 5 établit de nouveaux records sur Frontier-Bench et GDPval-AA, deux benchmarks d’évaluation du codage et du travail intellectuel, bien qu’il reste en retrait par rapport au modèle Claude Mythos 5 (à accès restreint) sur les tâches de cybersécurité. Opus 5 est désormais le modèle par défaut sur Claude Max et l’option la plus performante sur Claude Pro.
OpenAI divise GPT-5.6 en trois niveaux
OpenAI a rendu GPT-5.6 accessible au grand public le 9 juillet, après une phase de pré-lancement de deux semaines limitée à une vingtaine d’organisations agréées par le gouvernement américain, suite à un décret présidentiel lié à l’examen de la sécurité des modèles de pointe. La gamme se décline en trois niveaux : Sol, le modèle phare, au prix de 5 $ en entrée et 30 $ en sortie par million de jetons ; Terra, un modèle de milieu de gamme à 2,50 $ et 15 $ qui, selon OpenAI, offre des performances équivalentes à celles de GPT-5.5 pour un coût deux fois moindre ; et Luna, un niveau rapide et économique à 1 $ et 6 $.

OpenAI indique que Sol est en tête de l’indice Artificial Analysis Coding Agent Index et atteint 88,8 % sur Terminal-Bench 2.1, ce chiffre passant à 91,9 % lorsque le modèle exécute quatre sous-agents en parallèle dans son nouveau mode « ultra ». Ces trois niveaux sont assortis de la note de risque interne la plus élevée d’OpenAI en matière de potentiel d’utilisation abusive cybernétique et biologique, ce qui a déclenché un examen supplémentaire lors de la préversion réservée aux pouvoirs publics.
Kimi K3 repousse les limites des modèles à poids ouvert
Moonshot AI a lancé Kimi K3 le 16 juillet, un modèle « mixture of experts » de 2,8 billions de paramètres comprenant 896 experts au total et 16 experts actifs par tâche. Le modèle dispose d’une fenêtre contextuelle d’un million de tokens et prend en charge les entrées multimodales natives, avec une tarification de l’API fixée à 3 $ pour les entrées et 15 $ pour les sorties par million de tokens. Moonshot s’est engagé à publier l’intégralité des poids ouverts d’ici le 27 juillet.

K3 est le plus grand modèle à poids ouverts publié à ce jour, environ 75 % plus grand que le précédent plus grand modèle ouvert largement utilisé. Selon des observateurs indépendants, K3 se classe quatrième parmi les systèmes de pointe actuels, derrière Claude Fable 5 et GPT-5.6 Sol, mais devant Claude Opus 4.8.
Pourquoi l’écart avec les modèles plus anciens est-il important ?
Auparavant, les fenêtres de contexte inférieures à 200 000 tokens obligeaient les développeurs à fragmenter les bases de code volumineuses ou les paquets de recherche. Tous les modèles de ce groupe fonctionnent désormais avec 500 000 tokens ou plus, dont trois sur quatre atteignent le million, ce qui permet à une seule session de contenir un dépôt complet ou une pile de documents sources primaires.
La fiabilité des agents a également évolué. Les systèmes des années 2023 et 2024 perdaient souvent leur plan après quelques appels d’outils. Les modèles lancés ce mois-ci sont conçus pour gérer des dizaines d’étapes coordonnées et se rétablir lorsqu’un appel d’outil renvoie des données erronées, au lieu de se bloquer.
Pour les développeurs, cela se traduit concrètement par un coût par tâche achevée plus faible, plutôt que par un plafond plus élevé pour un benchmark donné. Les contrôles d’effort dans Opus 5, la tarification à plusieurs niveaux dans GPT-5.6 et les promesses d’efficacité de Grok 4.5 tendent vers le même objectif : permettre aux équipes de choisir la quantité de ressources de calcul nécessaire à une tâche, plutôt que de payer le prix fort pour chaque requête.
Pour les entreprises et les décideurs politiques, le déploiement de GPT-5.6 sous contrôle gouvernemental indique que la surveillance est désormais intégrée aux calendriers de lancement des plus grands modèles, et non plus ajoutée a posteriori. La brève suspension de l’accès à Fable et Mythos par Anthropic en juin, à la demande du gouvernement, constituait une version antérieure de ce même schéma.
Cet article a été traduit de l'anglais à l'aide de l'IA. La version originale en anglais fait foi ; les traductions automatiques peuvent contenir des inexactitudes, en particulier dans la terminologie juridique et réglementaire.

















