Tarjoaa
Technology

Tekoälyn jättiläiset julkaisevat neljä uutta mallia kolmen viikon aikana, kun kilpailu kiihtyy täyteen vauhtiin

Neljä merkittävää tekoälylaboratoriota julkaisi heinäkuussa 2026 kolmen viikon aikana edistyksellisiä kielimalleja, ja ero näiden järjestelmien ilman ihmisen puuttumista tuottaman tuloksen ja aiempien järjestelmien välillä on kaventunut jyrkästi.

KIRJOITTAJA
JAA
Tekoälyn jättiläiset julkaisevat neljä uutta mallia kolmen viikon aikana, kun kilpailu kiihtyy täyteen vauhtiin

Tärkeimmät kohdat

  • xAI julkaisi Grok 4.5:n 8. heinäkuuta hintaan 2–6 dollaria miljoonaa tokenia kohti, mikä alitti Opus 4.8:n hinnan yli 60 prosentilla.
  • Anthropic julkaisi 24. heinäkuuta Claude Opus 5:n, joka on Claude Max -tilauksien uusi oletusmalli.
  • Moonshot AI julkaisi Kimi K3:n, joka on sen suurin malli 2,8 biljoonalla parametrilla.

xAI:n Grok 4.5, Anthropicin Claude Opus 5, OpenAI:n GPT-5.6-perhe ja Moonshot AI:n Kimi K3 kohdistuvat kaikki samaan ongelmaan: saada tekoälyjärjestelmä suorittamaan useita tunteja kestävä tehtävä, tutkimuksesta koodaamiseen ja jäsenneltyyn raportointiin, menettämättä suunnitelmaa silmistä.

Grok 4.5 on koulutettu todellisilla kehittäjäsessioilla

xAI julkaisi Grok 4.5:n 8. heinäkuuta. Malli perustuu 1,5 biljoonan parametrin pohjaan, ja se on koulutettu osittain todellisilla käyttötiedoilla Cursorista, koodausalustasta, jonka SpaceXAI osti aiemmin tänä vuonna. Hinta on 2 dollaria miljoonaa syöttötunnusta kohti ja 6 dollaria miljoonaa tulostunnusta kohti, ja konteksti-ikkuna on 500 000 tunnusta.

Elon X post screenshot.
Elon keskustelee Grok 4.5:n julkaisusta 8. heinäkuuta 2026.

Elon Musk kuvaili Grok 4.5:tä Opus-luokan malliksi, joka toimii nopeammin ja edullisemmin. Riippumattomien seurantapalvelujen mukaan se sijoittuu neljänneksi Artificial Analysis Intelligence Index -indeksissä, ohittaen kaikki avoimen painotuksen mallit, ja sen hinta on yli 60 % alhaisempi kuin Claude Opus 4.8:n ja GPT-5.5:n. Terminal-Bench 2.1 -testissä, jossa arvioidaan, kuinka hyvin malli suoriutuu komentorivipohjaisista insinööritöistä, Grok 4.5 sai tulokseksi 83,3 %.

Suurin muutos koskee tokenien tehokkuutta. xAI:n mukaan malli tarvitsee noin viidenneksen siitä tokenimäärästä, jonka Opus 4.8 tarvitsi vastaaviin tehtäviin, mikä alentaa pitkien agenttisessioiden käyttökustannuksia.

Claude Opus 5 pitää hintansa ennallaan

Anthropic julkaisi Claude Opus 5:n 24. heinäkuuta ja asetti sen malliksi, joka saavuttaa lähes yhtiön suorituskykyisimmän julkaisun, Claude Fable 5:n, suorituskyvyn puoleen hintaan Fablen 10 dollarin syöttö- ja 50 dollarin tulostushinnoista. Opus 5:n syöttöhinnat ovat samat kuin edeltäjänsä Opus 4.8:n, eli 5 dollaria, ja tulostushinnat 25 dollaria.

Claude X post screenshot.
Claude Opus 5:n julkistus X:n kautta.

Mallissa on 1 miljoonan tokenin konteksti-ikkuna, enintään 128 000 lähtötokenia sekä säädettävä päättelyvaatimuksen asetus, joka vaihtelee matalasta uuteen xhigh-tilaan. Anthropicin mukaan Opus 5 asettaa uudet ennätykset Frontier-Bench- ja GDPval-AA-arvioinneissa, jotka mittaavat koodaus- ja tietotyöskentelykykyä, vaikka se jääkin jälkeen rajoitetusta Claude Mythos 5 -mallista kyberturvallisuustehtävissä. Opus 5 on nyt Claude Maxin oletusmalli ja Claude Pron tehokkain vaihtoehto.

OpenAI jakaa GPT-5.6:n kolmeen tasoon

OpenAI toi GPT-5.6:n yleiseen käyttöön 9. heinäkuuta kahden viikon esikatseluvaiheen jälkeen, joka oli rajoitettu noin 20:een Yhdysvaltain hallituksen tarkastamaan organisaatioon. Tämä seurasi eturintaman mallien turvallisuuden arviointiin liittyvää presidentin määräystä. Tuoteperhe on jaettu kolmeen tasoon: lippulaivamalli Sol, jonka hinta on 5 dollaria syötettä ja 30 dollaria tulosta miljoonaa tokenia kohti; Terra, keskitason malli, jonka hinnat ovat 2,50 dollaria ja 15 dollaria ja joka OpenAI:n mukaan vastaa GPT-5.5:tä puoleen hintaan; sekä Luna, nopea ja edullinen taso, jonka hinnat ovat 1 dollari ja 6 dollaria.

OpenAI X post screenshot.
ChatGPT 5.6 Sol -ilmoitus X:n kautta.

OpenAI:n mukaan Sol johtaa Artificial Analysis Coding Agent -indeksiä ja saavuttaa 88,8 %:n tuloksen Terminal-Bench 2.1 -testissä, joka nousee 91,9 %:iin, kun malli käyttää neljää aliohjelmaa rinnakkain uudessa ultra-tilassaan. Kaikilla kolmella tasolla on OpenAI:n korkein sisäinen riskiluokitus kyber- ja biologisen väärinkäytön potentiaalin osalta, mikä johti lisätarkasteluun hallituksen valvoman esikatseluvaiheen aikana.

Kimi K3 vie avoimet painomallit kohti uusia rajoja

Moonshot AI julkaisi 16. heinäkuuta Kimi K3:n, 2,8 biljoonan parametrin ”mixture of experts” -mallin, jossa on yhteensä 896 asiantuntijaa ja 16 aktiivista tehtävää kohden. Mallissa on miljoonan tokenin konteksti-ikkuna ja natiivi multimodaalinen syöte, ja API:n hinnoittelu on 3 dollaria syötettä kohti ja 15 dollaria tulosta kohti miljoonaa tokenia kohden. Moonshot on sitoutunut julkaisemaan täydelliset avoimet painot 27. heinäkuuta mennessä.

Kimi Moonshot X post screenshot.
Kimi K3:n julkistus X:n kautta.

K3 on tähän mennessä julkaistu suurin avoimen painotuksen malli, joka on noin 75 % suurempi kuin aiemmin suurin laajasti käytetty avoin malli. Riippumattomien seurantapalvelujen mukaan K3 sijoittuu neljänneksi nykyisten edistyksellisimpien järjestelmien joukossa, Claude Fable 5:n ja GPT-5.6 Solin jälkeen mutta Claude Opus 4.8:n edellä.

Miksi ero vanhempiin malleihin on merkittävä

Alle 200 000 tokenin konteksti-ikkunat pakottivat aiemmin kehittäjät jakamaan suuret koodikannat tai tutkimuspaketit palasiksi. Jokainen tämän ryhmän malli toimii nyt vähintään 500 000 tokenilla, ja neljästä mallista kolme käsittelee miljoona tokenia, jolloin yksi istunto riittää koko koodivaraston tai joukon ensisijaisia lähdedokumentteja käsittelemiseen.

Myös agenttien luotettavuus on parantunut. Vuosien 2023 ja 2024 järjestelmät menettivät usein suunnitelmansa jo muutaman työkalukutsun jälkeen. Tänä kuussa julkaistut mallit on rakennettu kestämään kymmeniä koordinoituja vaiheita ja palautumaan, kun työkalukutsu palauttaa virheellisiä tietoja, sen sijaan että ne jumiutuisivat.

Kehittäjille käytännön vaikutuksena on pikemminkin alhaisemmat kustannukset valmiita tehtäviä kohti kuin yksittäisen vertailuarvon korkeampi yläraja. Opus 5:n työmäärän hallinta, GPT-5.6:n porrastettu hinnoittelu ja Grok 4.5:n tehokkuusväitteet viittaavat samaan tavoitteeseen: antaa tiimeille mahdollisuus valita, kuinka paljon laskentatehoa tehtävä ansaitsee, sen sijaan että jokaisesta pyynnöstä jouduttaisiin maksamaan lippulaivamallien hintoja.

Yrityksille ja päätöksentekijöille GPT-5.6:n hallituksen valvoma käyttöönotto osoittaa, että valvonta on nyt sisällytetty suurimpien mallien julkaisuaikatauluihin eikä lisätty jälkikäteen. Anthropicin lyhytaikainen, hallituksen määräämä Fable- ja Mythos-palveluiden käytön keskeyttäminen kesäkuussa oli aikaisempi versio samasta mallista.

Tämä artikkeli on käännetty englannista tekoälyn avulla. Alkuperäinen englanninkielinen versio on auktoritatiivinen lähde; automaattiset käännökset voivat sisältää epätarkkuuksia, erityisesti oikeudellisessa ja sääntelyyn liittyvässä terminologiassa.