Offerto da
Technology

I giganti dell’IA lanciano 4 modelli all’avanguardia in 3 settimane, mentre la corsa entra nella fase più intensa

Nel luglio 2026, quattro prestigiosi laboratori di intelligenza artificiale (IA) hanno rilasciato modelli linguistici all’avanguardia nell’arco di tre settimane, e il divario tra ciò che questi sistemi riescono a realizzare senza intervento umano e quanto era stato fatto in precedenza si è notevolmente ridotto.

SCRITTO DA
CONDIVIDI
I giganti dell’IA lanciano 4 modelli all’avanguardia in 3 settimane, mentre la corsa entra nella fase più intensa

Punti chiave

  • xAI ha lanciato Grok 4.5 l’8 luglio al prezzo di 2/6 dollari per milione di token, sottoquotando il prezzo di Opus 4.8 di oltre il 60%.
  • Anthropic ha rilasciato Claude Opus 5 il 24 luglio come nuovo modello predefinito per gli abbonamenti a Claude Max.
  • Moonshot AI ha pubblicato Kimi K3, il suo modello più grande con 2,8 trilioni di parametri.

Grok 4.5 di xAI, Claude Opus 5 di Anthropic, la famiglia GPT-5.6 di OpenAI e Kimi K3 di Moonshot AI mirano tutti allo stesso obiettivo: far sì che un sistema di IA sia in grado di portare a termine un’attività della durata di diverse ore, dalla ricerca alla programmazione fino alla creazione di report strutturati, senza perdere di vista il piano.

Grok 4.5 si allena su sessioni reali degli sviluppatori

xAI ha rilasciato Grok 4.5 l’8 luglio. Il modello si basa su 1,5 trilioni di parametri ed è stato addestrato in parte su dati di utilizzo reali provenienti da Cursor, la piattaforma di programmazione acquisita da SpaceXAI all’inizio di quest’anno. Il prezzo è fissato a 2 dollari per milione di token in ingresso e a 6 dollari per milione di token in uscita, con una finestra di contesto di 500.000 token.

Elon X post screenshot.
Elon mentre parla del lancio di Grok 4.5 l’8 luglio 2026.

Elon Musk ha descritto Grok 4.5 come un modello di classe Opus che funziona più velocemente e a costi inferiori. Secondo valutatori indipendenti, si colloca al quarto posto nell’Artificial Analysis Intelligence Index, davanti a tutti i modelli a peso aperto, con un prezzo inferiore di oltre il 60% rispetto a Claude Opus 4.8 e GPT-5.5. Su Terminal-Bench 2.1, un test che valuta l’efficacia con cui un modello completa attività di ingegneria da riga di comando, Grok 4.5 ha ottenuto un punteggio dell’83,3%.

Il cambiamento più significativo riguarda l’efficienza dei token. xAI afferma che il modello richiede circa un quinto dei token di output necessari a Opus 4.8 per attività comparabili, il che riduce il costo di esecuzione di sessioni prolungate con l’agente.

Claude Opus 5 mantiene la linea sul prezzo

Anthropic ha rilasciato Claude Opus 5 il 24 luglio, posizionandolo come un modello che si avvicina alle prestazioni di Claude Fable 5, la versione più potente dell’azienda, a metà del prezzo di Fable, che è di 10 dollari per l’input e 50 dollari per l’output. Opus 5 mantiene gli stessi prezzi del suo predecessore, Opus 4.8: 5 $ per l’input e 25 $ per l’output.

Claude X post screenshot.
Annuncio di Claude Opus 5 tramite X.

Il modello è dotato di una finestra di contesto da 1 milione di token, un numero massimo di 128.000 token in output e un’impostazione regolabile dello sforzo di ragionamento che varia da “basso” a una nuova modalità “xhigh”. Anthropic afferma che Opus 5 stabilisce nuovi record su Frontier-Bench e GDPval-AA, due test di valutazione relativi alla programmazione e al lavoro intellettuale, sebbene sia inferiore al modello Claude Mythos 5 (a accesso limitato) nelle attività di sicurezza informatica. Opus 5 è ora il modello predefinito su Claude Max e l’opzione più potente su Claude Pro.

OpenAI suddivide GPT-5.6 in tre livelli

OpenAI ha reso GPT-5.6 disponibile al pubblico il 9 luglio, dopo un periodo di anteprima di due settimane limitato a circa 20 organizzazioni selezionate dal governo degli Stati Uniti, a seguito di un ordine esecutivo legato alla revisione della sicurezza dei modelli di frontiera. La famiglia è disponibile in tre livelli: Sol, il modello di punta, al prezzo di 5 dollari per l’input e 30 dollari per l’output per milione di token; Terra, un modello di fascia media a 2,50 e 15 dollari che, secondo OpenAI, eguaglia le prestazioni di GPT-5.5 a metà del costo; e Luna, un livello veloce e a basso costo a 1 e 6 dollari.

OpenAI X post screenshot.
Annuncio di ChatGPT 5.6 Sol tramite X.

OpenAI riferisce che Sol è in testa all’Artificial Analysis Coding Agent Index e raggiunge l’88,8% su Terminal-Bench 2.1, salendo al 91,9% quando il modello esegue quattro sotto-agenti in parallelo nella sua nuova modalità «ultra». Tutti e tre i livelli presentano il più alto rating interno di rischio di OpenAI per il potenziale di uso improprio informatico e biologico, il che ha comportato un’ulteriore revisione durante l’anteprima riservata alle autorità governative.

Kimi K3 spinge i modelli a peso aperto verso la frontiera

Il 16 luglio Moonshot AI ha rilasciato Kimi K3, un modello “mixture of experts” da 2,8 trilioni di parametri con 896 esperti in totale e 16 attivi per ogni attività. Il modello presenta una finestra di contesto di 1 milione di token e un input multimodale nativo, con un prezzo API di 3 dollari in ingresso e 15 dollari in uscita per ogni milione di token. Moonshot si è impegnata a pubblicare i pesi completamente aperti entro il 27 luglio.

Kimi Moonshot X post screenshot.
Annuncio di Kimi K3 su X.

K3 è il più grande modello a pesi aperti rilasciato fino ad oggi, circa il 75% più grande del precedente modello aperto più grande ampiamente utilizzato. Secondo i tracker indipendenti, K3 si colloca al quarto posto tra gli attuali sistemi all’avanguardia, dietro a Claude Fable 5 e GPT-5.6 Sol, ma davanti a Claude Opus 4.8.

Perché il divario rispetto ai modelli precedenti è importante

Finestre di contesto inferiori a 200.000 token un tempo costringevano gli sviluppatori a suddividere in frammenti grandi base di codice o pacchetti di ricerca. Ogni modello di questo gruppo ora funziona con 500.000 token o più, con tre dei quattro che raggiungono 1 milione, consentendo a una singola sessione di contenere un repository completo o una pila di documenti in formato sorgente.

Anche l’affidabilità degli agenti è migliorata. I sistemi del periodo 2023-2024 spesso perdevano il filo del discorso dopo poche chiamate agli strumenti. I modelli rilasciati questo mese sono progettati per sostenere decine di passaggi coordinati e per riprendersi quando una chiamata a uno strumento restituisce dati errati, invece di bloccarsi.

Per gli sviluppatori, l’effetto pratico è un costo inferiore per ogni attività completata, piuttosto che un limite massimo più elevato su un singolo benchmark. I controlli dello sforzo in Opus 5, i prezzi a livelli in GPT-5.6 e le dichiarazioni di efficienza alla base di Grok 4.5 puntano allo stesso obiettivo: consentire ai team di scegliere quanta potenza di calcolo meriti un’attività, anziché pagare prezzi da modello di punta per ogni richiesta.

Per le imprese e i responsabili politici, il lancio di GPT-5.6, subordinato all’approvazione governativa, segnala che la supervisione è ora integrata nei programmi di rilascio dei modelli più grandi, anziché essere aggiunta a posteriori. La breve sospensione dell’accesso a Fable e Mythos da parte di Anthropic, imposta dal governo nel mese di giugno, è stata una versione precedente dello stesso schema.

Questo articolo è stato tradotto dall'inglese tramite IA. La versione originale in inglese è la fonte autorevole; le traduzioni automatiche possono contenere imprecisioni, in particolare nella terminologia legale e normativa.