Drevet af
Technology

AI-giganterne lancerer fire banebrydende modeller på tre uger, mens kapløbet går i overdrive

Fire førende laboratorier inden for kunstig intelligens (AI) offentliggjorde banebrydende sprogmodeller i løbet af en periode på tre uger i juli 2026, og forskellen mellem det, disse systemer kan udføre uden menneskelig indgriben, og det, der var tilfældet tidligere, er blevet markant mindre.

SKREVET AF
DEL
AI-giganterne lancerer fire banebrydende modeller på tre uger, mens kapløbet går i overdrive

Hovedpunkter

  • xAI lancerede Grok 4.5 den 8. juli til en pris på 2–6 dollar pr. million tokens, hvilket er over 60 % billigere end prisen på Opus 4.8.
  • Anthropic udgav Claude Opus 5 den 24. juli som den nye standardmodel for Claude Max-abonnementer.
  • Moonshot AI offentliggjorde Kimi K3, deres største model med 2,8 billioner parametre.

Grok 4.5 fra xAI, Claude Opus 5 fra Anthropic, GPT-5.6-familien fra OpenAI og Kimi K3 fra Moonshot AI er alle rettet mod det samme problem: at få et AI-system til at udføre en opgave, der strækker sig over flere timer – fra research til kodning til struktureret rapportering – uden at miste overblikket over planen.

Grok 4.5 trænes på ægte udviklersessioner

xAI udgav Grok 4.5 den 8. juli. Modellen kører på en base med 1,5 billioner parametre og er delvist trænet på reelle brugsdata fra Cursor, den kodningsplatform, som SpaceXAI erhvervede tidligere på året. Prisen ligger på 2 dollar pr. million input-tokens og 6 dollar pr. million output-tokens, med et kontekstvindue på 500.000 tokens.

Elon X post screenshot.
Elon diskuterer udgivelsen af Grok 4.5 den 8. juli 2026.

Elon Musk beskrev Grok 4.5 som en model i Opus-klassen, der kører hurtigere og til lavere omkostninger. Uafhængige trackere placerer den på fjerdepladsen på Artificial Analysis Intelligence Index, foran alle open-weight-modeller, til en pris, der er mere end 60 % lavere end Claude Opus 4.8 og GPT-5.5. I Terminal-Bench 2.1, en test der vurderer, hvor godt en model udfører kommandolinjeopgaver, scorede Grok 4.5 83,3 %.

Den største ændring er token-effektiviteten. xAI oplyser, at modellen kun kræver cirka en femtedel af de output-tokens, som Opus 4.8 krævede til sammenlignelige opgaver, hvilket sænker omkostningerne ved at køre lange agent-sessioner.

Claude Opus 5 holder fast i prisen

Anthropic udgav Claude Opus 5 den 24. juli og positionerede den som en model, der kommer tæt på ydeevnen af Claude Fable 5 – virksomhedens mest kapable udgivelse – til halvdelen af Fables pris på 10 $ for input og 50 $ for output. Opus 5 har selv de samme priser på 5 $ for input og 25 $ for output som sin forgænger, Opus 4.8.

Claude X post screenshot.
Annoncering af Claude Opus 5 via X.

Modellen leveres med et kontekstvindue på 1 million tokens, 128.000 maksimale output-tokens og en justerbar indstilling for ræsonneringsindsats, der spænder fra lav til en ny xhigh-tilstand. Anthropic siger, at Opus 5 sætter nye rekorder på Frontier-Bench og GDPval-AA, to evalueringer af kodning og videnarbejde, selvom den halter bagefter den begrænsede Claude Mythos 5-model i cybersikkerhedsopgaver. Opus 5 er nu standardmodellen på Claude Max og den stærkeste mulighed på Claude Pro.

OpenAI opdeler GPT-5.6 i tre niveauer

OpenAI gjorde GPT-5.6 generelt tilgængeligt den 9. juli efter en to-ugers forhåndsvisning, der var begrænset til ca. 20 organisationer, der var godkendt af den amerikanske regering, som følge af en bekendtgørelse knyttet til sikkerhedsvurderingen af frontier-modeller. Serien leveres i tre niveauer: Sol, flagskibet, til en pris på 5 $ for input og 30 $ for output pr. million tokens; Terra, en mellemklasse-model til 2,50 $ og 15 $, som ifølge OpenAI svarer til GPT-5.5 til halv pris; og Luna, et hurtigt og prisbilligt niveau til 1 $ og 6 $.

OpenAI X post screenshot.
ChatGPT 5.6 Sol-annoncering via X.

OpenAI rapporterer, at Sol fører an i Artificial Analysis Coding Agent Index og opnår 88,8 % på Terminal-Bench 2.1, hvilket stiger til 91,9 %, når modellen kører fire underagenter parallelt i sin nye ultra-tilstand. Alle tre niveauer har OpenAI’s højeste interne risikovurdering for potentialet for cyber- og biologisk misbrug, hvilket udløste en yderligere gennemgang under den regeringskontrollerede forhåndsvisning.

Kimi K3 skubber open-weight-modeller mod grænsen

Moonshot AI udgav den 16. juli Kimi K3, en »mixture of experts«-model med 2,8 billioner parametre, i alt 896 eksperter og 16 aktive pr. opgave. Modellen har et kontekstvindue på 1 million tokens og indbygget multimodal indtastning, med API-priser på 3 $ for indtastning og 15 $ for output pr. million tokens. Moonshot har forpligtet sig til at offentliggøre de fulde åbne vægte senest den 27. juli.

Kimi Moonshot X post screenshot.
Meddelelse om Kimi K3 via X.

K3 er den største model med åbne vægte, der er frigivet til dato, og er ca. 75 % større end den tidligere største, bredt anvendte åbne model. Uafhængige trackere placerer K3 på fjerdepladsen blandt de nuværende banebrydende systemer, bag Claude Fable 5 og GPT-5.6 Sol, men foran Claude Opus 4.8.

Hvorfor forskellen i forhold til ældre modeller er vigtig

Kontekstvinduer på under 200.000 tokens tvang tidligere udviklere til at opdele store kodebaser eller forskningspakker i fragmenter. Alle modeller i denne gruppe kører nu med 500.000 tokens eller mere, hvoraf tre af de fire ligger på 1 million, hvilket gør det muligt for en enkelt session at rumme et fuldt repository eller en stak primære kildedokumenter.

Agenternes pålidelighed har også udviklet sig. Systemer fra perioden 2023 og 2024 mistede ofte deres plan efter blot en håndfuld værktøjsopkald. De modeller, der er udgivet i denne måned, er bygget til at håndtere snesevis af koordinerede trin og genoprette sig, når et værktøjsopkald returnerer dårlige data, i stedet for at gå i stå.

For udviklere betyder det i praksis lavere omkostninger pr. afsluttet opgave frem for et højere loft for en enkelt benchmark. Indsatsstyring i Opus 5, differentieret prissætning i GPT-5.6 og effektivitetspåstandene bag Grok 4.5 peger mod det samme mål: at lade teams vælge, hvor meget regnekraft en opgave fortjener, i stedet for at betale flagskibspriser for hver eneste anmodning.

For virksomheder og politiske beslutningstagere signalerer den regeringsstyrede udrulning af GPT-5.6, at tilsyn nu er indbygget i udgivelsesplanerne for de største modeller og ikke tilføjes efterfølgende. Anthropics kortvarige, regeringsstyrede suspension af adgangen til Fable og Mythos i juni var en tidligere udgave af det samme mønster.

Denne artikel er oversat fra engelsk ved hjælp af kunstig intelligens. Den originale engelske version er den autoritative kilde; automatiske oversættelser kan indeholde unøjagtigheder, især i juridisk og lovgivningsmæssig terminologi.