Pokreće
Technology

AI divovi u 3 tjedna puštaju u pogon 4 frontier modela dok utrka ulazi u višu brzinu

Četiri visokoprofilna laboratorija za umjetnu inteligenciju (AI) objavila su granične jezične modele u razmaku od tri tjedna u srpnju 2026., a jaz između onoga što ti sustavi dovršavaju bez ljudske intervencije i onoga što je bilo prije naglo se suzio.

PODIJELI
AI divovi u 3 tjedna puštaju u pogon 4 frontier modela dok utrka ulazi u višu brzinu

Ključne poruke

  • xAI je 8. srpnja isporučio Grok 4.5 po cijeni od $2/$6 po milijunu tokena, čime je cijenu potkopao u odnosu na Opus 4.8 za više od 60%.
  • Anthropic je 24. srpnja objavio Claude Opus 5 kao novi zadani model na pretplatama Claude Max.
  • Moonshot AI je objavio Kimi K3, svoj najveći model s 2,8 bilijuna parametara.

Grok 4.5 iz xAI-ja, Claude Opus 5 iz Anthropica, obitelj GPT-5.6 iz OpenAI-ja i Kimi K3 iz Moonshot AI-ja ciljaju isti problem: natjerati AI sustav da iznese višesatni zadatak, od istraživanja preko kodiranja do strukturiranog izvještavanja, bez gubljenja plana.

Grok 4.5 trenira na stvarnim developerskim sesijama

xAI je 8. srpnja objavio Grok 4.5. Model se temelji na bazi od 1,5 bilijuna parametara i djelomično je treniran na stvarnim podacima korištenja iz Cursor-a, platforme za kodiranje koju je SpaceXAI ranije ove godine preuzeo. Cijene iznose $2 po milijunu ulaznih tokena i $6 po milijunu izlaznih tokena, uz kontekstni prozor od 500.000 tokena.

Elon X post screenshot.
Elon raspravlja o objavi Grok 4.5 8. srpnja 2026.

Elon Musk je opisao Grok 4.5 kao model klase Opus koji radi brže i uz niži trošak. Neovisni pratitelji svrstavaju ga na četvrto mjesto na Artificial Analysis Intelligence Indexu, ispred svakog modela s otvorenim težinama, uz cijenu koja je više od 60% niža od Claude Opus 4.8 i GPT-5.5. Na Terminal-Bench 2.1, testu koji ocjenjuje koliko dobro model dovršava inženjerske zadatke u naredbenom retku, Grok 4.5 postigao je 83,3%.

Veća promjena je učinkovitost tokena. xAI navodi da model treba otprilike petinu izlaznih tokena koje je Opus 4.8 zahtijevao za usporedive zadatke, što smanjuje trošak vođenja dugih agentskih sesija.

Claude Opus 5 zadržava cijenu

Anthropic je 24. srpnja objavio Claude Opus 5, pozicionirajući ga kao model koji se približava performansama Claude Fable 5, najsposobnijeg izdanja tvrtke, uz upola nižu cijenu od Fableovih $10 za ulaz i $50 za izlaz. Sam Opus 5 nosi istu cijenu od $5 za ulaz i $25 za izlaz kao i njegov prethodnik, Opus 4.8.

Claude X post screenshot.
Najava Claude Opus 5 putem X-a.

Model dolazi s kontekstnim prozorom od 1 milijun tokena, maksimalno 128.000 izlaznih tokena i podesivom postavkom napora rezoniranja koja se kreće od low do novog xhigh moda. Anthropic navodi da Opus 5 postavlja nove rezultate na Frontier-Bench i GDPval-AA, dvjema evaluacijama kodiranja i znanja-rada, iako zaostaje za ograničenim modelom Claude Mythos 5 na zadacima kibernetičke sigurnosti. Opus 5 sada je zadani model na Claude Maxu i najjača opcija na Claude Pro.

OpenAI dijeli GPT-5.6 u tri razine

OpenAI je 9. srpnja stavio GPT-5.6 u opću dostupnost nakon dvotjednog pregleda ograničenog na otprilike 20 organizacija koje je provjerila američka vlada, slijedom izvršne uredbe povezane s provjerom sigurnosti graničnih modela. Obitelj dolazi u tri razine: Sol, vodeći model, po cijeni od $5 za ulaz i $30 za izlaz po milijunu tokena; Terra, srednja razina po $2,50 i $15 za koju OpenAI kaže da odgovara GPT-5.5 uz upola nižu cijenu; te Luna, brza, niskobudžetna razina po $1 i $6.

OpenAI X post screenshot.
Najava ChatGPT 5.6 Sol putem X-a.

OpenAI izvještava da Sol vodi na Artificial Analysis Coding Agent Indexu i postiže 88,8% na Terminal-Bench 2.1, rastući na 91,9% kada model pokreće četiri pod-agenta paralelno u novom ultra modu. Sve tri razine nose OpenAI-jevu najvišu internu ocjenu rizika za potencijal zlouporabe u kibernetičkim i biološkim scenarijima, što je potaknulo dodatnu provjeru tijekom pregleda ograničenog od strane vlade.

Kimi K3 gura modele s otvorenim težinama prema fronti

Moonshot AI objavio je Kimi K3 16. srpnja, mješavinu eksperata od 2,8 bilijuna parametara s ukupno 896 eksperata i 16 aktivnih po zadatku. Model ima kontekstni prozor od 1 milijun tokena i izvorni multimodalni ulaz, uz API cijene od $3 za ulaz i $15 za izlaz po milijunu tokena. Moonshot se obvezao objaviti pune otvorene težine do 27. srpnja.

Kimi Moonshot X post screenshot.
Najava Kimi K3 putem X-a.

K3 je najveći model s otvorenim težinama objavljen do danas, otprilike 75% veći od prethodno najvećeg široko korištenog otvorenog modela. Neovisni pratitelji svrstavaju K3 na četvrto mjesto među trenutačnim graničnim sustavima, iza Claude Fable 5 i GPT-5.6 Sol, ali ispred Claude Opus 4.8.

Zašto je važan jaz u odnosu na starije modele

Kontekstni prozori ispod 200.000 tokena nekoć su prisiljavali developere da velike baze koda ili istraživačke pakete razbijaju na fragmente. Svaki model u ovoj skupini sada radi na 500.000 tokena ili više, a tri od četiri na 1 milijun, što omogućuje da jedna sesija obuhvati cijeli repozitorij ili hrpu primarnih izvornih dokumenata.

Pouzdanost agenata također se promijenila. Sustavi iz razdoblja 2023. i 2024. često su gubili plan nakon nekoliko poziva alata. Modeli objavljeni ovog mjeseca izgrađeni su da izdrže desetke koordiniranih koraka i da se oporave kada poziv alata vrati loše podatke, umjesto da zapnu.

Za developere, praktični učinak je niži trošak po dovršenom zadatku, a ne viši plafon na bilo kojem pojedinačnom benchmarku. Kontrole napora u Opusu 5, razine cijena u GPT-5.6 i tvrdnje o učinkovitosti iza Groka 4.5 upućuju na isti cilj: omogućiti timovima da biraju koliko računalnih resursa zadatak zaslužuje, umjesto da plaćaju vodeće cijene za svaki zahtjev.

Za poduzeća i kreatore politika, izdavanje GPT-5.6 uz ograničenje od strane vlade signalizira da je nadzor sada ugrađen u rasporede objavljivanja najvećih modela, a ne dodan naknadno. Anthropicova kratka, vladom usmjerena suspenzija pristupa Fableu i Mythosu u lipnju bila je ranija verzija istog obrasca.

Ovaj je članak preveden s engleskog jezika pomoću umjetne inteligencije. Izvorna engleska verzija mjerodavan je izvor; automatski prijevodi mogu sadržavati netočnosti, osobito u pravnoj i regulatornoj terminologiji.