Pinapagana ng
Technology

Inilunsad ng mga Higante ng AI ang 4 na Nangungunang Frontier Models sa loob ng 3 Linggo habang Pumapasok sa Overdrive ang Karera

May apat na kilalang laboratoryo ng artificial intelligence (AI) ang naglabas ng mga frontier language model sa loob ng tatlong linggo noong Hulyo 2026, at ang agwat sa pagitan ng kung ano ang natatapos ng mga sistemang ito nang walang interbensyong pantao at ng mga nauna rito ay mabilis na lumiit.

ISINULAT NI
IBAHAGI
Inilunsad ng mga Higante ng AI ang 4 na Nangungunang Frontier Models sa loob ng 3 Linggo habang Pumapasok sa Overdrive ang Karera

Mga Pangunahing Punto

  • Ipinadala ng xAI ang Grok 4.5 noong Hulyo 8 sa $2/$6 kada milyong token, na mas mababa ng mahigit 60% kumpara sa pagpepresyo ng Opus 4.8.
  • Inilabas ng Anthropic ang Claude Opus 5 noong Hulyo 24 bilang bagong default na modelo sa mga subscription ng Claude Max.
  • Inilathala ng Moonshot AI ang Kimi K3, ang pinakamalaki nitong modelo na may 2.8 trilyong parameter.

Ang Grok 4.5 mula sa xAI, Claude Opus 5 mula sa Anthropic, ang pamilyang GPT-5.6 mula sa OpenAI, at Kimi K3 mula sa Moonshot AI ay pawang tumutuon sa iisang problema: kung paano mapapatakbo ang isang AI system upang dalhin ang isang gawaing tumatagal ng ilang oras—mula pananaliksik hanggang pagko-code hanggang naka-istrukturang pag-uulat—nang hindi nalilihis sa plano.

Grok 4.5 Ay Sinanay Gamit ang Mga Totoong Session ng Developer

Inilabas ng xAI ang Grok 4.5 noong Hulyo 8. Tumatakbo ang modelo sa 1.5 trilyong parameter na base at sinanay, sa bahagi, gamit ang totoong datos ng paggamit mula sa Cursor, ang coding platform na in-acquire ng SpaceXAI mas maaga ngayong taon. Nasa $2 kada milyong input token at $6 kada milyong output token ang presyo, na may 500,000 token na context window.

Elon X post screenshot.
Si Elon na tinatalakay ang paglabas ng Grok 4.5 noong Hulyo 8, 2026.

Inilarawan ni Elon Musk ang Grok 4.5 bilang isang Opus-class na modelo na mas mabilis tumakbo at mas mababa ang gastos. Ibinibilang ito ng mga independent tracker bilang pang-apat sa Artificial Analysis Intelligence Index, na nauuna sa bawat open weight na modelo, at may pagpepresyong mahigit 60% na mas mababa kaysa Claude Opus 4.8 at GPT-5.5. Sa Terminal-Bench 2.1, isang pagsubok na sumusukat kung gaano kahusay tinatapos ng modelo ang mga command-line engineering task, nakakuha ang Grok 4.5 ng 83.3%.

Ang mas malaking pagbabago ay ang token efficiency. Sinasabi ng xAI na kailangan ng modelo ng humigit-kumulang ikalimang bahagi lamang ng output tokens na kailangan ng Opus 4.8 para sa mga kahalintulad na gawain, na nagpapababa sa gastos ng pagpapatakbo ng mahahabang agent session.

Claude Opus 5 Pinananatili ang Presyo

Inilabas ng Anthropic ang Claude Opus 5 noong Hulyo 24, at ipinuwesto ito bilang isang modelong halos umaabot sa performance ng Claude Fable 5, ang pinaka-capable na inilabas ng kumpanya, sa kalahati ng $10 input at $50 output na pagpepresyo ng Fable. Ang Opus 5 mismo ay may kaparehong $5 input at $25 output na pagpepresyo tulad ng nauna rito, ang Opus 4.8.

Claude X post screenshot.
Anunsyo ng Claude Opus 5 sa pamamagitan ng X.

Kasama sa model ang 1 milyong token na context window, 128,000 na max output tokens, at isang adjustable na setting ng reasoning effort na mula low hanggang sa bagong xhigh mode. Sinasabi ng Anthropic na nagtatakda ang Opus 5 ng mga bagong marka sa Frontier-Bench at GDPval-AA, dalawang pagsusuri para sa coding at knowledge work, bagama’t nahuhuli ito sa restricted na Claude Mythos 5 model sa mga cybersecurity task. Ang Opus 5 na ngayon ang default na modelo sa Claude Max at ang pinakamalakas na opsyon sa Claude Pro.

Hinati ng OpenAI ang GPT-5.6 sa Tatlong Antas

Inilipat ng OpenAI ang GPT-5.6 sa general availability noong Hulyo 9 matapos ang dalawang linggong preview na limitado sa humigit-kumulang 20 organisasyong na-vet ng gobyerno ng U.S., kasunod ng isang executive order na may kaugnayan sa frontier model safety review. Dumarating ang pamilya bilang tatlong antas: Sol, ang flagship, na may presyong $5 input at $30 output kada milyong token; Terra, isang mid-tier na modelo sa $2.50 at $15 na ayon sa OpenAI ay tumutugma sa GPT-5.5 sa kalahati ng gastos; at Luna, isang mabilis at mababang-gastusing antas sa $1 at $6.

OpenAI X post screenshot.
Anunsyo ng ChatGPT 5.6 Sol sa pamamagitan ng X.

Ipinapahayag ng OpenAI na nangunguna ang Sol sa Artificial Analysis Coding Agent Index at umabot sa 88.8% sa Terminal-Bench 2.1, na tumataas sa 91.9% kapag pinatakbo ang modelo na may apat na sub-agent nang sabay-sabay sa ilalim ng bagong ultra mode nito. Lahat ng tatlong antas ay may pinakamataas na internal risk rating ng OpenAI para sa potensyal na cyber at biological misuse, na nag-trigger ng dagdag na pagsusuri sa panahon ng preview na may gate ng gobyerno.

Itinutulak ng Kimi K3 ang Mga Open Weight Model Patungo sa Frontier

Ang Moonshot AI ay naglabas ng Kimi K3 noong Hulyo 16, isang 2.8 trilyong parameter na mixture of experts model na may 896 na kabuuang expert at 16 na aktibo kada task. Ang modelo ay may 1 milyong token na context window at native multimodal input, na may API pricing na $3 input at $15 output kada milyong token. Nangako ang Moonshot na ilalathala ang buong open weights pagsapit ng Hulyo 27.

Kimi Moonshot X post screenshot.
Anunsyo ng Kimi K3 sa pamamagitan ng X.

Ang K3 ang pinakamalaking open-weight model na nailabas hanggang ngayon, humigit-kumulang 75% na mas malaki kaysa sa naunang pinakamalaking malawakang ginagamit na open model. Ipinapakita ng mga independent tracker na pang-apat ang K3 sa mga kasalukuyang frontier system, sa likod ng Claude Fable 5 at GPT-5.6 Sol ngunit nauuna sa Claude Opus 4.8.

Bakit Mahalaga ang Agwat sa Mas Lumang Mga Modelo

Ang mga context window na mas mababa sa 200,000 token ay dating pumipilit sa mga developer na hati-hatiin ang malalaking codebase o mga research packet. Ang bawat modelo sa grupong ito ay tumatakbo na ngayon sa 500,000 token o higit pa, at tatlo sa apat ay nasa 1 milyon, na nagpapahintulot sa iisang session na maglaman ng isang buong repository o isang tumpok ng primary source na mga dokumento.

Umunlad na rin ang pagiging maaasahan ng agent. Ang mga sistema mula sa panahon ng 2023 at 2024 ay madalas nawawala ang kanilang plano matapos ang ilang tool call. Ang mga modelong inilabas ngayong buwan ay binuo upang mapanatili ang dose-dosenang magkakaugnay na hakbang at makabawi kapag ang isang tool call ay nagbalik ng maling datos sa halip na tumigil.

Para sa mga developer, ang praktikal na epekto ay mas mababang gastos kada natapos na gawain, sa halip na mas mataas na kisame sa alinmang iisang benchmark. Ang mga effort control sa Opus 5, tiered pricing sa GPT-5.6, at ang mga pahayag sa efficiency sa likod ng Grok 4.5 ay tumuturo sa iisang layunin: hayaan ang mga team na pumili kung gaano karaming compute ang nararapat sa isang gawain sa halip na magbayad ng flagship na presyo para sa bawat request.

Para sa mga enterprise at policymaker, ang rollout ng GPT-5.6 na may gate ng gobyerno ay nagpapahiwatig na ang oversight ay nakapaloob na ngayon sa mga iskedyul ng paglabas para sa pinakamalalaking modelo, hindi idinadagdag lamang pagkatapos. Ang maikling, government-directed na suspensyon ng access sa Fable at Mythos ng Anthropic noong Hunyo ay mas naunang bersyon ng kaparehong pattern.

Ang artikulong ito ay isinalin mula sa Ingles gamit ang AI. Ang orihinal na bersyon sa Ingles ang opisyal na pinagmumulan; maaaring maglaman ng mga kamalian ang mga awtomatikong pagsasalin, lalo na sa legal at regulatoryong terminolohiya.