Drivs av
Technology

AI-jättarna lanserar fyra banbrytande modeller på tre veckor när kapplöpningen går in i högvarv

Fyra framstående forskningslaboratorier inom artificiell intelligens (AI) lanserade banbrytande språkmodeller under en treveckorsperiod i juli 2026, och klyftan mellan vad dessa system kan åstadkomma utan mänsklig inblandning och vad som tidigare var möjligt har minskat kraftigt.

SKRIVEN AV
DELA
AI-jättarna lanserar fyra banbrytande modeller på tre veckor när kapplöpningen går in i högvarv

Viktiga slutsatser

  • xAI lanserade Grok 4.5 den 8 juli till ett pris på 2–6 dollar per miljon tokens, vilket underskred priset på Opus 4.8 med över 60 %.
  • Anthropic släppte Claude Opus 5 den 24 juli som den nya standardmodellen för Claude Max-abonnemang.
  • Moonshot AI lanserade Kimi K3, sin största modell med 2,8 biljoner parametrar.

Grok 4.5 från xAI, Claude Opus 5 från Anthropic, GPT-5.6-familjen från OpenAI och Kimi K3 från Moonshot AI riktar sig alla mot samma problem: att få ett AI-system att utföra en flera timmar lång uppgift, från forskning till kodning till strukturerad rapportering, utan att tappa bort planen.

Grok 4.5 tränas på verkliga utvecklarsessioner

xAI släppte Grok 4.5 den 8 juli. Modellen bygger på 1,5 biljoner parametrar och har delvis tränats på verkliga användningsdata från Cursor, den kodningsplattform som SpaceXAI förvärvade tidigare i år. Priset ligger på 2 dollar per miljon ingångstoken och 6 dollar per miljon utgångstoken, med ett kontextfönster på 500 000 token.

Elon X post screenshot.
Elon diskuterar lanseringen av Grok 4.5 den 8 juli 2026.

Elon Musk beskrev Grok 4.5 som en modell i Opus-klassen som körs snabbare och till lägre kostnad. Oberoende utvärderare placerar den på fjärde plats på Artificial Analysis Intelligence Index, före alla modeller med öppen viktning, till ett pris som är mer än 60 % lägre än Claude Opus 4.8 och GPT-5.5. I Terminal-Bench 2.1, ett test som mäter hur väl en modell utför tekniska uppgifter via kommandoraden, uppnådde Grok 4.5 83,3 %.

Den största förändringen gäller tokeneffektiviteten. xAI uppger att modellen behöver ungefär en femtedel av de utgående token som Opus 4.8 krävde för jämförbara uppgifter, vilket sänker kostnaden för att köra långa agentsessioner.

Claude Opus 5 håller prisnivån

Anthropic släppte Claude Opus 5 den 24 juli och positionerade den som en modell som når nära prestandan hos Claude Fable 5, företagets mest kapabla version, till hälften av Fables pris på 10 dollar för inmatning och 50 dollar för utmatning. Opus 5 har samma prissättning som sin föregångare, Opus 4.8, nämligen 5 dollar för inmatning och 25 dollar för utmatning.

Claude X post screenshot.
Tillkännagivande av Claude Opus 5 via X.

Modellen levereras med ett kontextfönster på 1 miljon token, maximalt 128 000 utgångstoken och en justerbar inställning för resonemangsinsats som sträcker sig från låg till ett nytt xhigh-läge. Anthropic uppger att Opus 5 sätter nya rekord på Frontier-Bench och GDPval-AA, två utvärderingar av kodnings- och kunskapsarbete, även om den ligger efter den begränsade modellen Claude Mythos 5 när det gäller cybersäkerhetsuppgifter. Opus 5 är nu standardmodellen på Claude Max och det starkaste alternativet på Claude Pro.

OpenAI delar upp GPT-5.6 i tre nivåer

OpenAI gjorde GPT-5.6 allmänt tillgängligt den 9 juli efter en två veckor lång förhandsvisning begränsad till cirka 20 organisationer som granskats av den amerikanska regeringen, till följd av ett presidentdekret kopplat till säkerhetsgranskningen av frontlinjemodeller. Modellserien finns i tre nivåer: Sol, flaggskeppet, som kostar 5 dollar för inmatning och 30 dollar för utmatning per miljon tokens; Terra, en modell i mellanklassen till 2,50 dollar och 15 dollar som enligt OpenAI motsvarar GPT-5.5 till halva kostnaden; och Luna, en snabb och kostnadseffektiv nivå till 1 dollar och 6 dollar.

OpenAI X post screenshot.
Tillkännagivande av ChatGPT 5.6 Sol via X.

OpenAI rapporterar att Sol leder Artificial Analysis Coding Agent Index och uppnår 88,8 % på Terminal-Bench 2.1, vilket stiger till 91,9 % när modellen kör fyra underagenter parallellt i sitt nya ultraläge. Alla tre nivåerna har OpenAI:s högsta interna riskklassificering för potentiellt cyber- och biologiskt missbruk, vilket utlöste en extra granskning under den regeringskontrollerade förhandsvisningen.

Kimi K3 driver modeller med öppen vikt mot gränsen

Moonshot AI släppte Kimi K3 den 16 juli, en ”mixture of experts”-modell med 2,8 biljoner parametrar, totalt 896 experter och 16 aktiva per uppgift. Modellen har ett kontextfönster på 1 miljon token och inbyggd multimodal inmatning, med API-prissättning på 3 dollar för inmatning och 15 dollar för utmatning per miljon token. Moonshot har åtagit sig att publicera fullständiga öppna vikter senast den 27 juli.

Kimi Moonshot X post screenshot.
Tillkännagivande av Kimi K3 via X.

K3 är den största modellen med öppna vikter som hittills har släppts, ungefär 75 % större än den tidigare största allmänt använda öppna modellen. Oberoende utvärderare placerar K3 på fjärde plats bland de nuvarande banbrytande systemen, efter Claude Fable 5 och GPT-5.6 Sol men före Claude Opus 4.8.

Varför skillnaden mot äldre modeller spelar roll

Kontextfönster på under 200 000 tokens tvingade tidigare utvecklare att dela upp stora kodbaser eller forskningspaket i fragment. Varje modell i denna grupp körs nu med 500 000 tokens eller mer, varav tre av de fyra ligger på 1 miljon, vilket gör att en enda session kan rymma ett helt repository eller en stapel primärkällsdokument.

Även agenternas tillförlitlighet har förbättrats. System från perioden 2023 och 2024 tappade ofta bort sin plan efter ett fåtal verktygsanrop. De modeller som släpptes denna månad är byggda för att klara dussintals samordnade steg och återhämta sig när ett verktygsanrop returnerar felaktiga data, istället för att fastna.

För utvecklare innebär detta i praktiken en lägre kostnad per slutförd uppgift snarare än ett högre tak för enskilda prestandatester. Insatskontroller i Opus 5, differentierad prissättning i GPT-5.6 och effektivitetspåståendena bakom Grok 4.5 pekar mot samma mål: att låta teamen välja hur mycket beräkningskraft en uppgift förtjänar istället för att betala flaggskeppspriser för varje förfrågan.

För företag och beslutsfattare signalerar den regeringsstyrda lanseringen av GPT-5.6 att tillsyn nu är inbyggd i lanseringsscheman för de största modellerna, inte tillagd i efterhand. Anthropics kortvariga, regeringsstyrda avstängning av åtkomsten till Fable och Mythos i juni var en tidigare version av samma mönster.

Den här artikeln har översatts från engelska med hjälp av AI. Den engelska originalversionen är den auktoritativa källan; automatiska översättningar kan innehålla felaktigheter, särskilt i juridisk och regulatorisk terminologi.