W lipcu 2026 roku cztery renomowane laboratoria zajmujące się sztuczną inteligencją (AI) opublikowały przełomowe modele językowe w ciągu zaledwie trzech tygodni, a różnica między wynikami osiąganymi przez te systemy bez udziału człowieka a dotychczasowymi osiągnięciami znacznie się zmniejszyła.
Giganci branży sztucznej inteligencji wprowadzają na rynek 4 przełomowe modele w ciągu 3 tygodni, a rywalizacja nabiera tempa

Najważniejsze wnioski
- xAI wprowadziło na rynek Grok 4.5 8 lipca w cenie 2–6 USD za milion tokenów, podcinając cenę Opus 4.8 o ponad 60%.
- 24 lipca firma Anthropic udostępniła model Claude Opus 5 jako nowy domyślny model w ramach subskrypcji Claude Max.
- Moonshot AI opublikowało Kimi K3, swój największy model o 2,8 biliona parametrów.
Grok 4.5 od xAI, Claude Opus 5 od Anthropic, rodzina modeli GPT-5.6 od OpenAI oraz Kimi K3 od Moonshot AI mają na celu rozwiązanie tego samego problemu: sprawienie, by system AI mógł wykonywać wielogodzinne zadania – od badań, przez kodowanie, po tworzenie ustrukturyzowanych raportów – bez utraty orientacji w planie działania.
Grok 4.5 trenowany na prawdziwych sesjach programistów
Firma xAI wypuściła Grok 4.5 8 lipca. Model opiera się na bazie 1,5 biliona parametrów i został częściowo wyszkolony na rzeczywistych danych użytkowych pochodzących z Cursor – platformy do kodowania, którą SpaceXAI przejęła na początku tego roku. Ceny wynoszą 2 dolary za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych, przy oknie kontekstowym wynoszącym 500 000 tokenów.

Elon Musk opisał Grok 4.5 jako model klasy Opus, który działa szybciej i przy niższych kosztach. Niezależne serwisy rankingowe umieszczają go na czwartym miejscu w indeksie Artificial Analysis Intelligence Index, przed wszystkimi modelami o otwartej wadze, przy cenie o ponad 60% niższej od Claude Opus 4.8 i GPT-5.5. W teście Terminal-Bench 2.1, oceniającym, jak dobrze model wykonuje zadania inżynieryjne z wiersza poleceń, Grok 4.5 uzyskał wynik 83,3%.
Znaczącą zmianą jest wydajność tokenowa. xAI twierdzi, że model potrzebuje około jednej piątej tokenów wyjściowych, których wymagał Opus 4.8 do wykonania porównywalnych zadań, co obniża koszt prowadzenia długich sesji agenta.
Claude Opus 5 utrzymuje cenę na dotychczasowym poziomie
24 lipca firma Anthropic wypuściła model Claude Opus 5, pozycjonując go jako model osiągający wydajność zbliżoną do Claude Fable 5 – najwydajniejszego produktu firmy – przy cenie za dane wejściowe wynoszącej połowę ceny Fable (10 USD) oraz za dane wyjściowe wynoszącej połowę ceny Fable (50 USD). Sam model Opus 5 ma takie same ceny – 5 dolarów za dane wejściowe i 25 dolarów za dane wyjściowe – jak jego poprzednik, Opus 4.8.

Model jest wyposażony w okno kontekstowe o pojemności 1 miliona tokenów, maksymalną liczbę tokenów wyjściowych wynoszącą 128 000 oraz regulowane ustawienie nakładu wysiłku na rozumowanie, które obejmuje zakres od niskiego do nowego trybu xhigh. Anthropic twierdzi, że Opus 5 ustanawia nowe rekordy w testach Frontier-Bench i GDPval-AA – dwóch testach oceniających umiejętności kodowania i pracy z wiedzą – choć w zadaniach związanych z cyberbezpieczeństwem ustępuje ograniczonemu modelowi Claude Mythos 5. Opus 5 jest obecnie domyślnym modelem w usłudze Claude Max oraz najpotężniejszą opcją w usłudze Claude Pro.
OpenAI dzieli GPT-5.6 na trzy poziomy
9 lipca OpenAI udostępniło GPT-5.6 dla wszystkich użytkowników po dwutygodniowym okresie testów ograniczonym do około 20 organizacji zweryfikowanych przez rząd USA, zgodnie z rozporządzeniem wykonawczym dotyczącym przeglądu bezpieczeństwa modeli pionierskich. Rodzina modeli jest dostępna w trzech poziomach: Sol, model flagowy, w cenie 5 USD za milion tokenów wejściowych i 30 USD za milion tokenów wyjściowych; Terra – model średniej klasy w cenie 2,50 i 15 dolarów, który według OpenAI dorównuje GPT-5.5 przy połowie kosztów; oraz Luna – szybki, niedrogi poziom w cenie 1 i 6 dolarów.

OpenAI informuje, że Sol zajmuje czołowe miejsce w indeksie Artificial Analysis Coding Agent Index i osiąga wynik 88,8% w teście Terminal-Bench 2.1, który wzrasta do 91,9%, gdy model uruchamia równolegle cztery podagenty w nowym trybie „ultra”. Wszystkie trzy poziomy posiadają najwyższą wewnętrzną ocenę ryzyka OpenAI pod kątem potencjalnego niewłaściwego wykorzystania w celach cyberataków i zagrożeń biologicznych, co spowodowało konieczność przeprowadzenia dodatkowej weryfikacji podczas zamkniętej dla rządu wersji zapoznawczej.
Kimi K3 przesuwa modele typu „open weight” w kierunku najnowszych osiągnięć
16 lipca firma Moonshot AI wypuściła model Kimi K3 – model typu „mixture of experts” o 2,8 biliona parametrów, zawierający łącznie 896 ekspertów, z których 16 jest aktywnych na zadanie. Model posiada okno kontekstowe o długości 1 miliona tokenów oraz natywną obsługę danych wielomodalnych, a ceny API wynoszą 3 USD za dane wejściowe i 15 USD za dane wyjściowe na milion tokenów. Firma Moonshot zobowiązała się do opublikowania pełnych otwartych wag do 27 lipca.

K3 jest największym modelem o otwartych wagach wydanym do tej pory, o około 75% większym od poprzedniego największego, powszechnie stosowanego modelu otwartego. Niezależne serwisy śledzące plasują K3 na czwartym miejscu wśród obecnych systemów pionierskich, za Claude Fable 5 i GPT-5.6 Sol, ale przed Claude Opus 4.8.
Dlaczego różnica w stosunku do starszych modeli ma znaczenie
Okna kontekstowe poniżej 200 000 tokenów zmuszały kiedyś programistów do dzielenia dużych baz kodu lub pakietów badawczych na fragmenty. Każdy model z tej grupy działa obecnie z 500 000 tokenów lub więcej, a trzy z czterech osiągają 1 milion, co pozwala na przechowywanie w jednej sesji pełnego repozytorium lub stosu dokumentów źródłowych.
Zmieniła się również niezawodność agentów. Systemy z okresu 2023 i 2024 często traciły swój plan po kilku wywołaniach narzędzi. Modele wydane w tym miesiącu są zbudowane tak, aby wytrzymać dziesiątki skoordynowanych kroków i odzyskać sprawność, gdy wywołanie narzędzia zwraca nieprawidłowe dane, zamiast się zawieszać.
Dla programistów praktycznym efektem jest niższy koszt na jedno ukończone zadanie, a nie wyższy pułap w poszczególnych testach porównawczych. Kontrola nakładu pracy w Opus 5, wielopoziomowe ceny w GPT-5.6 oraz deklarowana wydajność Grok 4.5 wskazują na ten sam cel: umożliwienie zespołom wyboru, ile mocy obliczeniowej zasługuje dane zadanie, zamiast płacenia cen za flagowe modele za każde żądanie.
Dla przedsiębiorstw i decydentów rządowe wdrożenie GPT-5.6 sygnalizuje, że nadzór jest obecnie wbudowany w harmonogramy wydawania największych modeli, a nie dodawany po fakcie. Krótkie, nakazane przez rząd zawieszenie dostępu do Fable i Mythos przez firmę Anthropic w czerwcu było wcześniejszą wersją tego samego schematu.
Ten artykuł został przetłumaczony z języka angielskiego przy użyciu sztucznej inteligencji. Oryginalna wersja angielska jest źródłem autorytatywnym; tłumaczenia automatyczne mogą zawierać nieścisłości, zwłaszcza w terminologii prawnej i regulacyjnej.

















