2026 júliusában három hét alatt négy neves mesterséges intelligencia (AI) kutatóintézet hozott nyilvánosságra úttörő nyelvi modelleket, és jelentősen csökkent a különbség az emberi beavatkozás nélkül ezekkel a rendszerekkel elérhető eredmények és a korábbi eredmények között.
Az AI-óriások 3 hét alatt 4 úttörő modellt mutattak be, miközben a verseny egyre nagyobb sebességre kapcsol

Főbb tanulságok
- Az xAI július 8-án dobta piacra a Grok 4.5-öt, millió tokenenként 2–6 dolláros áron, ami több mint 60%-kal alacsonyabb az Opus 4.8 áránál.
- Az Anthropic július 24-én kiadta a Claude Opus 5-öt, amely a Claude Max előfizetések új alapértelmezett modellje lett.
- A Moonshot AI közzétette a Kimi K3-at, amely 2,8 billió paraméterrel a legnagyobb modellje.
Az xAI Grok 4.5-je, az Anthropic Claude Opus 5-je, az OpenAI GPT-5.6-családja és a Moonshot AI Kimi K3-ja mind ugyanazt a problémát célozza meg: elérni, hogy egy AI-rendszer több órás feladatot hajtson végre – a kutatástól a kódoláson át a strukturált jelentéskészítésig – anélkül, hogy elveszítené a terv fonalát.
A Grok 4.5 valódi fejlesztői munkamenetek alapján tanult
Az xAI július 8-án tette közzé a Grok 4.5-öt. A modell 1,5 billió paraméterre épül, és részben a Cursor – a SpaceXAI által az év elején felvásárolt kódolási platform – valós használati adatai alapján lett betanítva. Az árak 2 dollár/millió bemeneti token és 6 dollár/millió kimeneti token, 500 000 tokenes kontextusablakkal.

Elon Musk a Grok 4.5-öt egy Opus-osztályú modellként jellemezte, amely gyorsabban és alacsonyabb költségekkel működik. Független elemzők az Artificial Analysis Intelligence Indexen a negyedik helyre sorolták, megelőzve minden nyílt súlyozású modellt, miközben ára több mint 60%-kal alacsonyabb, mint a Claude Opus 4.8 és a GPT-5.5 ára. A Terminal-Bench 2.1-en – egy olyan teszten, amely értékeli, mennyire jól hajtja végre a modell a parancssori mérnöki feladatokat – a Grok 4.5 83,3%-os eredményt ért el.
A nagyobb változás a tokenhatékonyság terén tapasztalható. Az xAI szerint a modellnek körülbelül az Opus 4.8-hoz képest az összehasonlítható feladatok elvégzéséhez szükséges kimeneti tokenek ötödére van szüksége, ami csökkenti a hosszú ügynöki munkamenetek futtatásának költségeit.
A Claude Opus 5 tartja az árszintet
Az Anthropic július 24-én kiadta a Claude Opus 5-öt, amelyet úgy pozícionált, mint egy olyan modellt, amely közelíti a vállalat legképzettebb kiadásának, a Claude Fable 5-nek a teljesítményét, a Fable 10 dolláros bemeneti és 50 dolláros kimeneti árának felénél. Maga az Opus 5 ugyanazt az 5 dolláros bemeneti és 25 dolláros kimeneti árat alkalmazza, mint elődje, az Opus 4.8.

A modell 1 millió tokenes kontextusablakkal, 128 000 maximális kimeneti tokennel, valamint egy állítható érvelési erőfeszítés-beállítással érkezik, amely az alacsony szinttől egy új „xhigh” módig terjed. Az Anthropic szerint az Opus 5 új mércét állít fel a Frontier-Bench és a GDPval-AA – két kódolási és tudásalapú feladatértékelő rendszer – tekintetében, bár a kiberbiztonsági feladatok terén elmarad a korlátozott hozzáférésű Claude Mythos 5 modelltől. Az Opus 5 mostantól a Claude Max alapértelmezett modellje, valamint a Claude Pro legerősebb opciója.
Az OpenAI három szintre osztja a GPT-5.6-ot
Az OpenAI július 9-én általánosan elérhetővé tette a GPT-5.6-ot, miután két héten át körülbelül 20, az amerikai kormány által átvilágított szervezet számára korlátozott előzetes tesztelést folytatott, a határterületi modellek biztonsági felülvizsgálatára vonatkozó elnöki rendelet nyomán. A termékcsalád három szintben érhető el: a zászlóshajó Sol, amelynek ára 5 dollár a bemeneten és 30 dollár a kimeneten millió tokenenként; a Terra, egy középkategóriás modell, amelynek ára 2,50 dollár a bemeneten és 15 dollár a kimeneten, és amely az OpenAI szerint a GPT-5.5-tel egyenértékű, de feleannyiba kerül; valamint a Luna, egy gyors, alacsony költségű szint, amelynek ára 1 dollár a bemeneten és 6 dollár a kimeneten.

Az OpenAI jelentése szerint a Sol vezeti az Artificial Analysis Coding Agent Indexet, és 88,8%-os eredményt ér el a Terminal-Bench 2.1-en, amely 91,9%-ra emelkedik, amikor a modell négy alügynököt futtat párhuzamosan az új „ultra” módban. Mindhárom szint az OpenAI legmagasabb belső kockázati besorolását kapta a kiber- és biológiai visszaélés kockázata miatt, ami további felülvizsgálatot tett szükségessé a kormányzati előzetes tesztelés során.
A Kimi K3 az Open Weight modelleket a határok felé tolja
A Moonshot AI július 16-án kiadta a Kimi K3-at, egy 2,8 billió paraméteres „mixture of experts” modellt, amely összesen 896 szakértőt tartalmaz, és feladatonként 16-ot aktivál. A modell 1 millió tokenes kontextusablakkal és natív multimodális bemenettel rendelkezik, az API ára pedig 3 dollár a bemeneten és 15 dollár a kimeneten millió tokenenként. A Moonshot vállalta, hogy július 27-ig közzéteszi a teljes nyílt súlyokat.

A K3 a mai napig kiadott legnagyobb nyílt súlyú modell, amely körülbelül 75%-kal nagyobb, mint az eddigi legnagyobb, széles körben használt nyílt modell. Független nyomon követők a K3-at a jelenlegi élvonalbeli rendszerek között a negyedik helyre sorolják, a Claude Fable 5 és a GPT-5.6 Sol mögé, de a Claude Opus 4.8 elé.
Miért fontos a régebbi modellekkel szembeni különbség?
A 200 000 token alatti kontextusablakok korábban arra kényszerítették a fejlesztőket, hogy a nagy kódbázisokat vagy kutatási csomagokat töredékekre bontsák. E csoport minden modellje ma már 500 000 token vagy annál több kapacitással működik, a négyből három pedig 1 millióval, így egyetlen munkamenetben egy teljes repository vagy elsődleges forrásdokumentumok halmaza is elfér.
Az ügynökök megbízhatósága is javult. A 2023-as és 2024-es időszakból származó rendszerek gyakran elvesztették a tervüket néhány eszközhívás után. Az ebben a hónapban kiadott modellek úgy lettek kialakítva, hogy több tucat összehangolt lépést képesek végrehajtani, és helyreállnak, ha egy eszközhívás hibás adatokat ad vissza, ahelyett, hogy leállnának.
A fejlesztők számára a gyakorlati hatás nem az egyes teljesítményteszteknél elérhető magasabb felső határ, hanem a befejezett feladatok alacsonyabb költsége. Az Opus 5 erőfeszítés-szabályozása, a GPT-5.6 rétegzett árazása és a Grok 4.5 hatékonysági ígéretei ugyanazt a célt szolgálják: lehetővé tenni a csapatok számára, hogy maguk döntsék el, mennyi számítási erőre van szükség egy feladat elvégzéséhez, ahelyett, hogy minden kérésért csúcsmodell-árakat kellene fizetniük.
A vállalatok és a döntéshozók számára a GPT-5.6 kormányzati felügyelet alatt történő bevezetése azt jelzi, hogy a legnagyobb modellek kiadási ütemterveibe már beépítették a felügyeletet, nem pedig utólag adták hozzá. Az Anthropic által júniusban végrehajtott, kormányzati utasításra történő rövid idejű Fable és Mythos hozzáférés-felfüggesztés ennek a mintának egy korábbi változata volt.
Ezt a cikket mesterséges intelligencia segítségével fordították le angolról. Az eredeti angol nyelvű változat a hiteles forrás; az automatikus fordítások pontatlanságokat tartalmazhatnak, különösen a jogi és szabályozási terminológiában.

















