Poganja
Technology

Velikani na področju umetne inteligence so v treh tednih predstavili štiri pionirske modele, tekma pa se zdaj še dodatno pospešuje

Štirje ugledni laboratoriji za umetno inteligenco (AI) so v treh tednih julija 2026 objavili najnaprednejše jezikovne modele, pri čemer se je razlika med tem, kar ti sistemi dosežejo brez človeškega posredovanja, in prejšnjimi dosežki močno zmanjšala.

DELI
Velikani na področju umetne inteligence so v treh tednih predstavili štiri pionirske modele, tekma pa se zdaj še dodatno pospešuje

Ključne ugotovitve

  • xAI je 8. julija na trg lansiral Grok 4.5 po ceni 2–6 dolarjev na milijon tokenov, s čimer je ceno Opusa 4.8 podkopal za več kot 60 %.
  • Anthropic je 24. julija izdal model Claude Opus 5 kot nov privzeti model za naročnine na storitev Claude Max.
  • Moonshot AI je objavil Kimi K3, svoj največji model z 2,8 bilijona parametrov.

Grok 4.5 podjetja xAI, Claude Opus 5 podjetja Anthropic, družina GPT-5.6 podjetja OpenAI in Kimi K3 podjetja Moonshot AI se vsi osredotočajo na isti problem: kako doseči, da sistem umetne inteligence opravi večurno nalogo, od raziskovanja prek kodiranja do strukturiranega poročanja, ne da bi izgubil pregled nad načrtom.

Grok 4.5 se usposablja na podlagi dejanskih sej razvijalcev

Podjetje xAI je 8. julija izdalo model Grok 4.5. Model temelji na 1,5 bilijona parametrov in je bil delno usposobljen na podlagi dejanskih podatkov o uporabi iz platforme za programiranje Cursor, ki jo je SpaceXAI pridobilo v začetku tega leta. Cena znaša 2 dolarja na milijon vhodnih tokenov in 6 dolarjev na milijon izhodnih tokenov, z oknom konteksta 500.000 tokenov.

Elon X post screenshot.
Elon ob razpravi o izdaji Grok 4.5 8. julija 2026.

Elon Musk je Grok 4.5 opisal kot model razreda Opus, ki deluje hitreje in po nižjih stroških. Neodvisni spremljevalci ga uvrščajo na četrto mesto na indeksu umetne analitične inteligence (Artificial Analysis Intelligence Index), pred vsemi modeli z odprto utežjo, pri ceni, ki je za več kot 60 % nižja od Claude Opus 4.8 in GPT-5.5. Na testu Terminal-Bench 2.1, ki ocenjuje, kako uspešno model opravlja inženirske naloge v ukazni vrstici, je Grok 4.5 dosegel 83,3 %.

Večja sprememba je v učinkovitosti tokenov. xAI navaja, da model potrebuje približno petino izhodnih tokenov, ki jih je Opus 4.8 potreboval za primerljive naloge, kar znižuje stroške izvajanja dolgih sej agenta.

Claude Opus 5 ohranja ceno

Podjetje Anthropic je 24. julija izdalo model Claude Opus 5 in ga pozicioniralo kot model, ki se po zmogljivosti približuje modelu Claude Fable 5, najzmogljivejši izdaji podjetja, pri čemer je cena za vnos polovična v primerjavi s Fableovo ceno 10 USD, cena za izhod pa enaka, tj. 50 USD. Opus 5 ima enako ceno 5 dolarjev za vhodne podatke in 25 dolarjev za izhodne podatke kot njegov predhodnik, Opus 4.8.

Claude X post screenshot.
Napoved modela Claude Opus 5 prek X.

Model ima kontekstno okno z 1 milijonom tokenov, največ 128.000 izhodnih tokenov ter nastavljivo stopnjo napora razmišljanja, ki sega od nizke do novega načina xhigh. Anthropic navaja, da Opus 5 postavlja nove mejnike na Frontier-Bench in GDPval-AA, dveh ocenah za programiranje in delo s znanjem, čeprav zaostaja za omejenim modelom Claude Mythos 5 pri nalogah s področja kibernetske varnosti. Opus 5 je zdaj privzeti model v Claude Max in najmočnejša možnost v Claude Pro.

OpenAI razdelil GPT-5.6 na tri stopnje

OpenAI je 9. julija omogočil splošno dostopnost modela GPT-5.6 po dvotedenskem predogledu, omejenem na približno 20 organizacij, ki jih je preverila ameriška vlada, v skladu z izvršilnim odlokom, povezanim s pregledom varnosti pionirskih modelov. Družina modelov je na voljo v treh stopnjah: Sol, paradni model, s ceno 5 USD za vnos in 30 USD za izhod na milijon tokenov; Terra, model srednjega razreda po ceni 2,50 $ in 15 $, za katerega OpenAI trdi, da ustreza GPT-5.5 po polovici cene; ter Luna, hiter in cenovno ugoden razred po ceni 1 $ in 6 $.

OpenAI X post screenshot.
Napoved ChatGPT 5.6 Sol prek X.

OpenAI poroča, da Sol vodi indeks Artificial Analysis Coding Agent Index in dosega 88,8 % na Terminal-Bench 2.1, pri čemer se ta vrednost poveča na 91,9 %, ko model v novem »ultra« načinu vzporedno izvaja štiri podagente. Vse tri stopnje imajo najvišjo notranjo oceno tveganja OpenAI glede potenciala za kibernetsko in biološko zlorabo, kar je sprožilo dodatno pregledovanje med predogledom, omejenim na vlado.

Kimi K3 premika modele z odprto težo proti novim mejam

Moonshot AI je 16. julija izdal Kimi K3, model »mixture of experts« z 2,8 bilijona parametrov, skupno 896 strokovnjaki in 16 aktivnimi na nalogo. Model ima kontekstno okno z 1 milijonom tokenov in nativni multimodalni vnos, cene API-ja pa znašajo 3 USD za vnos in 15 USD za izhod na milijon tokenov. Moonshot se je zavezal, da bo do 27. julija objavil popolne odprte uteži.

Kimi Moonshot X post screenshot.
Napoved modela Kimi K3 prek X.

K3 je največji model z odprtimi utežmi, ki je bil doslej objavljen, in je približno 75 % večji od prejšnjega največjega široko uporabljanega odprtega modela. Neodvisni spremljevalci uvrščajo K3 na četrto mesto med trenutnimi najnaprednejšimi sistemi, za modeloma Claude Fable 5 in GPT-5.6 Sol, a pred modelom Claude Opus 4.8.

Zakaj je razlika v primerjavi s starejšimi modeli pomembna

Okna konteksta z manj kot 200.000 tokenov so nekoč razvijalce prisilila, da so velike kodne baze ali raziskovalne pakete razdelili na fragmente. Vsak model v tej skupini zdaj deluje z 500.000 tokeni ali več, trije od štirih pa z 1 milijonom, kar omogoča, da ena sama seja vsebuje celotno repozitorij ali kup primarnih izvornih dokumentov.

Tudi zanesljivost agentov se je izboljšala. Sistemi iz obdobja 2023 in 2024 so pogosto izgubili svoj načrt že po nekaj klicih orodij. Modeli, izdani ta mesec, so zasnovani tako, da vzdržijo ducate usklajenih korakov in se obnovijo, ko klic orodja vrne napačne podatke, namesto da bi se ustavili.

Za razvijalce to v praksi pomeni nižje stroške na končano nalogo, ne pa višje zgornje meje pri posameznih merilih uspešnosti. Nadzor porabe v Opus 5, večstopenjska cena v GPT-5.6 in trditve o učinkovitosti modela Grok 4.5 kažejo na isti cilj: omogočiti ekipam, da same izberejo, koliko računske moči si naloga zasluži, namesto da bi za vsako zahtevo plačevale cene za vrhunske modele.

Za podjetja in oblikovalce politik vladno nadzorovano uvajanje modela GPT-5.6 pomeni, da je nadzor zdaj vgrajen v časovne načrte izdaje največjih modelov, namesto da bi se dodajal naknadno. Kratka, vladno usmerjena začasna prekinitev dostopa do modelov Fable in Mythos s strani podjetja Anthropic v juniju je bila zgodnejša različica istega vzorca.

Ta članek je bil iz angleščine preveden z umetno inteligenco. Izvirna angleška različica je verodostojni vir; samodejni prevodi lahko vsebujejo netočnosti, zlasti pri pravni in regulativni terminologiji.