Oferit de
Technology

Giganții din domeniul IA lansează 4 modele de ultimă generație în doar 3 săptămâni, pe măsură ce competiția intră în viteză maximă

Patru laboratoare de renume din domeniul inteligenței artificiale (IA) au lansat modele lingvistice de ultimă generație într-un interval de trei săptămâni, în iulie 2026, iar diferența dintre ceea ce aceste sisteme realizează fără intervenție umană și ceea ce se făcea anterior s-a redus semnificativ.

SCRIS DE
DISTRIBUIE
Giganții din domeniul IA lansează 4 modele de ultimă generație în doar 3 săptămâni, pe măsură ce competiția intră în viteză maximă

Concluzii cheie

  • xAI a lansat Grok 4.5 pe 8 iulie la un preț de 2/6 dolari pe milion de tokenuri, subcotând prețul modelului Opus 4.8 cu peste 60%.
  • Anthropic a lansat Claude Opus 5 pe 24 iulie ca noul model implicit pentru abonamentele Claude Max.
  • Moonshot AI a lansat Kimi K3, cel mai mare model al său, cu 2,8 trilioane de parametri.

Grok 4.5 de la xAI, Claude Opus 5 de la Anthropic, familia GPT-5.6 de la OpenAI și Kimi K3 de la Moonshot AI vizează fiecare aceeași problemă: realizarea unui sistem de IA capabil să îndeplinească o sarcină de mai multe ore, de la cercetare la codificare și până la raportare structurată, fără a pierde din vedere planul.

Grok 4.5 este antrenat pe sesiuni reale ale dezvoltatorilor

xAI a lansat Grok 4.5 pe 8 iulie. Modelul funcționează pe o bază de 1,5 trilioane de parametri și a fost antrenat parțial pe date reale de utilizare provenite de la Cursor, platforma de programare achiziționată de SpaceXAI la începutul acestui an. Prețul este de 2 dolari pe milion de tokeni de intrare și 6 dolari pe milion de tokeni de ieșire, cu o fereastră de context de 500.000 de tokeni.

Elon X post screenshot.
Elon discutând despre lansarea Grok 4.5 pe 8 iulie 2026.

Elon Musk a descris Grok 4.5 ca fiind un model din clasa Opus care rulează mai rapid și la un cost mai mic. Analizatorii independenți îl plasează pe locul al patrulea în cadrul Artificial Analysis Intelligence Index, înaintea tuturor modelelor cu greutate deschisă, la un preț cu peste 60% mai mic decât cel al modelelor Claude Opus 4.8 și GPT-5.5. În cadrul Terminal-Bench 2.1, un test care evaluează cât de bine îndeplinește un model sarcini de inginerie pe linia de comandă, Grok 4.5 a obținut un scor de 83,3%.

Schimbarea cea mai importantă o reprezintă eficiența token-urilor. xAI afirmă că modelul are nevoie de aproximativ o cincime din token-urile de ieșire necesare modelului Opus 4.8 pentru sarcini comparabile, ceea ce reduce costul rulării sesiunilor lungi ale agentului.

Claude Opus 5 își menține prețul

Anthropic a lansat Claude Opus 5 pe 24 iulie, poziționându-l ca un model care se apropie de performanța lui Claude Fable 5, cea mai performantă versiune a companiei, la jumătate din prețul lui Fable: 10 dolari pentru intrare și 50 de dolari pentru ieșire. Opus 5 are același preț de 5 $ pentru intrare și 25 $ pentru ieșire ca și predecesorul său, Opus 4.8.

Claude X post screenshot.
Anunțul privind Claude Opus 5 prin intermediul X.

Modelul vine cu o fereastră de context de 1 milion de tokenuri, un număr maxim de 128.000 de tokenuri de ieșire și o setare ajustabilă a efortului de raționament, care variază de la nivel scăzut până la un nou mod „xhigh”. Anthropic afirmă că Opus 5 stabilește noi recorduri pe Frontier-Bench și GDPval-AA, două evaluări ale muncii de codare și cunoaștere, deși rămâne în urma modelului restricționat Claude Mythos 5 în ceea ce privește sarcinile de securitate cibernetică. Opus 5 este acum modelul implicit pe Claude Max și cea mai puternică opțiune pe Claude Pro.

OpenAI împarte GPT-5.6 în trei niveluri

OpenAI a lansat GPT-5.6 pentru publicul larg pe 9 iulie, după o perioadă de previzualizare de două săptămâni limitată la aproximativ 20 de organizații verificate de guvernul SUA, în urma unui ordin executiv legat de evaluarea siguranței modelelor de ultimă generație. Familia este disponibilă în trei niveluri: Sol, modelul de vârf, cu un preț de 5 USD pentru intrare și 30 USD pentru ieșire pe milion de token-uri; Terra, un model de nivel mediu, la 2,50 $ și 15 $, despre care OpenAI afirmă că este echivalent cu GPT-5.5 la jumătate din cost; și Luna, un nivel rapid și cu cost redus, la 1 $ și 6 $.

OpenAI X post screenshot.
Anunțul privind ChatGPT 5.6 Sol prin intermediul X.

OpenAI raportează că Sol conduce clasamentul Artificial Analysis Coding Agent Index și atinge 88,8% pe Terminal-Bench 2.1, ajungând la 91,9% atunci când modelul rulează patru sub-agenți în paralel în noul său mod „ultra”. Toate cele trei niveluri au primit cel mai înalt rating intern de risc al OpenAI pentru potențialul de utilizare abuzivă în domeniul cibernetic și biologic, ceea ce a determinat o evaluare suplimentară în timpul previzualizării restricționate la nivel guvernamental.

Kimi K3 împinge modelele cu greutate deschisă către frontieră

Moonshot AI a lansat Kimi K3 pe 16 iulie, un model de tip „mixture of experts” cu 2,8 trilioane de parametri, cu un total de 896 de experți și 16 activi per sarcină. Modelul dispune de o fereastră de context de 1 milion de tokenuri și de intrare multimodală nativă, prețul API-ului fiind de 3 dolari pentru intrare și 15 dolari pentru ieșire pe milion de tokenuri. Moonshot s-a angajat să publice ponderea completă deschisă până pe 27 iulie.

Kimi Moonshot X post screenshot.
Anunțul privind Kimi K3 pe X.

K3 este cel mai mare model cu ponderi deschise lansat până în prezent, cu aproximativ 75% mai mare decât precedentul cel mai mare model deschis utilizat pe scară largă. Observatorii independenți plasează K3 pe locul al patrulea printre sistemele de ultimă generație actuale, în urma modelelor Claude Fable 5 și GPT-5.6 Sol, dar înaintea modelului Claude Opus 4.8.

De ce contează diferența față de modelele mai vechi

Ferestrele de context sub 200.000 de tokeni îi obligau odată pe dezvoltatori să împartă bazele de cod mari sau pachetele de cercetare în fragmente. Fiecare model din acest grup rulează acum la 500.000 de tokeni sau mai mult, trei dintre cele patru ajungând la 1 milion, ceea ce permite unei singure sesiuni să conțină un depozit complet sau o stivă de documente sursă primare.

Fiabilitatea agenților s-a îmbunătățit, de asemenea. Sistemele din perioada 2023 și 2024 își pierdeau adesea planul după doar câteva apeluri către instrumente. Modelele lansate luna aceasta sunt concepute să susțină zeci de pași coordonați și să se recupereze atunci când un apel către un instrument returnează date eronate, în loc să se blocheze.

Pentru dezvoltatori, efectul practic este un cost mai mic pe sarcină finalizată, mai degrabă decât un plafon mai ridicat pentru orice benchmark individual. Controalele de efort din Opus 5, prețurile diferențiate din GPT-5.6 și afirmațiile privind eficiența din spatele Grok 4.5 indică același obiectiv: permiterea echipelor să aleagă câtă putere de calcul merită o sarcină, în loc să plătească prețuri de top pentru fiecare solicitare.

Pentru întreprinderi și factorii de decizie, lansarea controlată de guvern a GPT-5.6 semnalează faptul că supravegherea este acum integrată în programele de lansare ale celor mai mari modele, nu adăugată ulterior. Suspendarea temporară a accesului la Fable și Mythos de către Anthropic, la indicația guvernului, în luna iunie, a reprezentat o versiune anterioară a aceluiași model.

Acest articol a fost tradus din limba engleză cu ajutorul inteligenței artificiale. Versiunea originală în limba engleză este sursa autoritară; traducerile automate pot conține inexactități, în special în terminologia juridică și de reglementare.