Toetab
Technology

Tehisintellekti hiiglased toovad 3 nädala jooksul turule 4 uue tippmudeli, kui võidujooks läheb täiskäigule

2026. aasta juulis avaldasid neli tuntud tehisintellekti (AI) laborit kolme nädala jooksul uusimad keelemudelid, ning vahe selle vahel, mida need süsteemid suudavad ilma inimese sekkumiseta teha, ja varasemate süsteemide võimete vahel on järsult vähenenud.

KIRJUTAS
JAGA
Tehisintellekti hiiglased toovad 3 nädala jooksul turule 4 uue tippmudeli, kui võidujooks läheb täiskäigule

Peamised järeldused

  • xAI tõi 8. juulil turule Grok 4.5 hinnaga 2–6 dollarit miljoni tokeni kohta, alandades Opus 4.8 hinda üle 60%.
  • Anthropic avaldas 24. juulil Claude Opus 5, mis on Claude Maxi tellimuste uus vaikimudel.
  • Moonshot AI avaldas Kimi K3, oma suurima mudeli, millel on 2,8 triljonit parameetrit.

xAI-i Grok 4.5, Anthropic-u Claude Opus 5, OpenAI-i GPT-5.6-perekond ja Moonshot AI-i Kimi K3 on kõik suunatud sama probleemi lahendamisele: panna tehisintellekti süsteem täitma mitmetunnist ülesannet – alates uurimistööst kuni programmeerimise ja struktureeritud aruandluseni – ilma plaanist kõrvale kaldumata.

Grok 4.5 on treenitud reaalsete arendajate sessioonide põhjal

xAI avaldas Grok 4.5 8. juulil. Mudel põhineb 1,5 triljonil parameetril ja seda treeniti osaliselt reaalsete kasutamisandmete põhjal, mis pärinevad Cursorist – programmeerimisplatvormist, mille SpaceXAI omandas käesoleva aasta alguses. Hind on 2 dollarit miljoni sisendtokeni kohta ja 6 dollarit miljoni väljundtokeni kohta, kontekstiaken on 500 000 tokenit.

Elon X post screenshot.
Elon räägib Grok 4.5 väljalaskest 8. juulil 2026.

Elon Musk kirjeldas Grok 4.5-t kui Opus-klassi mudelit, mis töötab kiiremini ja madalamate kuludega. Sõltumatud jälgijad paigutavad selle tehisintellekti analüüsi indeksis neljandale kohale, edestades kõiki avatud kaaluga mudeleid, kusjuures hind on üle 60% madalam kui Claude Opus 4.8-l ja GPT-5.5-l. Terminal-Bench 2.1 testis, mis hindab, kui hästi mudel täidab käsurea insenerülesandeid, saavutas Grok 4.5 tulemuse 83,3%.

Suurem muutus on märkide efektiivsus. xAI väidab, et mudel vajab võrreldavate ülesannete täitmiseks umbes viiendiku sellest märkide hulgast, mida Opus 4.8 vajas, mis vähendab pikkade agendi seansside käitamise kulusid.

Claude Opus 5 hoiab hinna samal tasemel

Anthropic tõi 24. juulil turule Claude Opus 5, positsioneerides seda mudelina, mis jõuab lähedale ettevõtte võimsaima versiooni, Claude Fable 5, jõudlusele, kuid poole madalama hinnaga kui Fable’i 10-dollariline sisend- ja 50-dollariline väljundhind. Opus 5-l on samad sisend- ja väljundhinnad – vastavalt 5 ja 25 dollarit – nagu selle eelkäijal Opus 4.8-l.

Claude X post screenshot.
Claude Opus 5 teadaanne X-i kaudu.

Mudelil on 1 miljoni tokeni suurune kontekstiaken, maksimaalselt 128 000 väljundtokenit ning reguleeritav järeldamisvaeva seade, mis ulatub madalast tasemest uue xhigh-režiimini. Anthropic väidab, et Opus 5 seab uued rekordid kahel programmeerimis- ja teadmistepõhise töö hindamisel – Frontier-Bench ja GDPval-AA –, kuigi küberjulgeoleku ülesannete puhul jääb see maha piiratud juurdepääsuga mudelist Claude Mythos 5. Opus 5 on nüüd Claude Maxi vaikimisi mudel ja Claude Pro tugevaim valik.

OpenAI jagab GPT-5.6 kolmeks tasemeks

OpenAI tegi GPT-5.6 üldiselt kättesaadavaks 9. juulil pärast kahe nädala pikkust eelvaatamist, mis oli piiratud umbes 20-le Ameerika Ühendriikide valitsuse poolt kontrollitud organisatsioonile, järgides piirimudelite ohutuse läbivaatamisega seotud täidesaatvat korraldust. Tooteperekond on saadaval kolmes tasemes: lipulaev Sol, mille hind on 5 dollarit sisendiks ja 30 dollarit väljundiks miljoni tokeni kohta; „Terra“, keskklassi mudel, mille hind on 2,50 ja 15 dollarit ning mis OpenAI sõnul vastab GPT-5.5-le poole madalama hinnaga; ning „Luna“, kiire ja odav tase, mille hind on 1 ja 6 dollarit.

OpenAI X post screenshot.
ChatGPT 5.6 Soli teadaanne X-i kaudu.

OpenAI teatel juhib Sol tehisintellekti kodeerimisagendi indeksit (Artificial Analysis Coding Agent Index) ning saavutab Terminal-Bench 2.1 testis 88,8% tulemuse, mis tõuseb 91,9%ni, kui mudel käitab uues ultra-režiimis paralleelselt nelja alamagenti. Kõik kolm taset kannavad OpenAI kõrgeimat sisemist riskireitingut küber- ja bioloogilise väärkasutuse potentsiaali osas, mis tingis täiendava läbivaatamise valitsuse poolt piiratud eelvaate käigus.

Kimi K3 viib avatud kaaluga mudelid uuele tasemele

Moonshot AI avaldas 16. juulil Kimi K3, 2,8 triljoni parameetriga ekspertide segamudeli, milles on kokku 896 eksperti ja 16 aktiivset ülesande kohta. Mudelil on 1 miljoni tokeni suurune kontekstiaken ja sisseehitatud multimodaalne sisend, kusjuures API hind on 3 dollarit sisendi ja 15 dollarit väljundi eest miljoni tokeni kohta. Moonshot on võtnud endale kohustuse avaldada täielikud avatud kaalud 27. juuliks.

Kimi Moonshot X post screenshot.
Kimi K3 teadaanne X-i kaudu.

K3 on seni avaldatud suurim avatud kaaludega mudel, mis on ligikaudu 75% suurem kui eelmine suurim laialdaselt kasutatav avatud mudel. Sõltumatute jälgijate hinnangul on K3 praeguste tipptasemel süsteemide seas neljandal kohal, jäädes maha Claude Fable 5-st ja GPT-5.6 Solist, kuid edestades Claude Opus 4.8-t.

Miks on vahe vanemate mudelitega oluline

Alla 200 000 tokeni suurused kontekstiaknad sundisid arendajaid varem suuri koodibaase või uurimispakette tükkideks jagama. Kõik selle rühma mudelid töötavad nüüd 500 000 tokeniga või rohkem, neist neljast kolm 1 miljoni tokeniga, mis võimaldab ühe seansiga hoida kogu repositooriumi või kogu esmaste allikadokumentide kogu.

Ka agentide usaldusväärsus on muutunud. 2023. ja 2024. aasta süsteemid kaotasid sageli oma plaani pärast vaid mõningaid tööriistakutseid. Sel kuul välja antud mudelid on ehitatud nii, et need suudavad läbi viia kümneid koordineeritud samme ja taastuda, kui tööriistakutse tagastab valeandmeid, selle asemel et töö seisma jääda.

Arendajate jaoks tähendab see praktikas pigem madalamat kulu ühe lõpetatud ülesande kohta kui ühegi üksiku võrdlusaluse kõrgemat ülempiiri. Opus 5 jõupingutuste kontroll, GPT-5.6 astmelised hinnad ja Grok 4.5 taga peituvad tõhususe väited viitavad samale eesmärgile: võimaldada meeskondadel valida, kui palju arvutusvõimsust ülesanne väärib, selle asemel et maksta iga päringu eest lipulaeva hindu.

Ettevõtete ja poliitikakujundajate jaoks näitab GPT-5.6 valitsuse poolt kontrollitud kasutuselevõtt, et järelevalve on nüüd suurimate mudelite väljalaskekavades sisse ehitatud, mitte hiljem lisatud. Anthropicu lühiajaline, valitsuse suunatud Fable’i ja Mythose juurdepääsu peatamine juunis oli sama mustri varasem versioon.

See artikkel tõlgiti inglise keelest tehisintellekti abil. Ingliskeelne originaalversioon on autoriteetne allikas; automaatsed tõlked võivad sisaldada ebatäpsusi, eriti juriidilises ja regulatiivses terminoloogias.