В июле 2026 года в течение трёх недель четыре ведущие лаборатории в области искусственного интеллекта (ИИ) выпустили передовые языковые модели, и разрыв между тем, что эти системы способны выполнять без участия человека, и предыдущими достижениями резко сократился.
Гиганты в области ИИ за три недели представили четыре передовые модели — гонка набирает обороты

Ключевые выводы
- 8 июля xAI выпустила Grok 4.5 по цене 2–6 долларов за миллион токенов, что более чем на 60 % ниже цены на Opus 4.8.
- 24 июля компания Anthropic выпустила Claude Opus 5 в качестве новой модели по умолчанию для подписок на Claude Max.
- Moonshot AI представила Kimi K3 — свою самую крупную модель с 2,8 триллионами параметров.
Grok 4.5 от xAI, Claude Opus 5 от Anthropic, семейство GPT-5.6 от OpenAI и Kimi K3 от Moonshot AI нацелены на решение одной и той же задачи: обеспечить способность системы ИИ выполнять многочасовые задачи — от исследования до программирования и составления структурированных отчетов — без потери нити плана.
Grok 4.5 обучается на реальных сессиях разработчиков
8 июля компания xAI выпустила Grok 4.5. Модель работает на базе 1,5 триллиона параметров и была частично обучена на реальных данных использования платформы Cursor, которую SpaceXAI приобрела в начале этого года. Стоимость составляет 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов при контекстном окне в 500 000 токенов.

Илон Маск охарактеризовал Grok 4.5 как модель класса Opus, которая работает быстрее и с меньшими затратами. Независимые аналитики помещают её на четвёртое место в рейтинге Artificial Analysis Intelligence Index, опережая все модели с открытой весовой матрицей, при цене, более чем на 60 % ниже, чем у Claude Opus 4.8 и GPT-5.5. В тесте Terminal-Bench 2.1, оценивающем эффективность выполнения моделью инженерных задач в командной строке, Grok 4.5 набрала 83,3%.
Ещё более значительным изменением стала эффективность использования токенов. По данным xAI, модели требуется примерно пятая часть выходных токенов, которые были необходимы Opus 4.8 для выполнения сопоставимых задач, что снижает затраты на проведение длительных сеансов работы агента.
Claude Opus 5 сохраняет прежнюю ценовую политику
24 июля компания Anthropic выпустила Claude Opus 5, позиционируя его как модель, которая по производительности приближается к Claude Fable 5 — самой мощной версии компании — при цене, составляющей половину от цены Fable: 10 долларов за ввод и 50 долларов за вывод. Сама модель Opus 5 имеет ту же стоимость — 5 долларов за входные данные и 25 долларов за выходные — что и её предшественница, Opus 4.8.

Модель поставляется с контекстным окном объемом 1 миллион токенов, максимальным количеством выходных токенов 128 000 и настраиваемым уровнем затрат на рассуждения, варьирующимся от низкого до нового режима xhigh. По заявлению Anthropic, Opus 5 устанавливает новые рекорды в тестах Frontier-Bench и GDPval-AA — двух оценках навыков программирования и работы с информацией, — хотя по задачам кибербезопасности он уступает ограниченной модели Claude Mythos 5. Opus 5 теперь является моделью по умолчанию в Claude Max и самым мощным вариантом в Claude Pro.
OpenAI разделила GPT-5.6 на три уровня
9 июля OpenAI перевела GPT-5.6 в режим общедоступности после двухнедельного предварительного тестирования, ограниченного примерно 20 организациями, прошедшими проверку со стороны правительства США, в соответствии с исполнительным указом, связанным с проверкой безопасности передовых моделей. Семейство моделей представлено тремя уровнями: Sol — флагманская модель, стоимость которой составляет 5 долларов за ввод и 30 долларов за вывод на миллион токенов; Terra — модель среднего уровня по цене 2,50 и 15 долларов, которая, по заявлению OpenAI, соответствует GPT-5.5 при вдвое меньшей стоимости; и Luna — быстрый и недорогой уровень по цене 1 и 6 долларов.

OpenAI сообщает, что Sol лидирует в рейтинге Artificial Analysis Coding Agent Index и набирает 88,8 % в тесте Terminal-Bench 2.1, а этот показатель повышается до 91,9 %, когда модель запускает четыре субагента параллельно в новом режиме «ultra». Все три тарифные плана имеют наивысший внутренний рейтинг риска OpenAI в связи с потенциальным кибер- и биологическим злоупотреблением, что послужило поводом для дополнительной проверки во время закрытого для общественности предварительного тестирования.
Kimi K3 продвигает модели с открытым весом к новым рубежам
16 июля компания Moonshot AI выпустила Kimi K3 — модель «смеси экспертов» с 2,8 триллионами параметров, включающую в общей сложности 896 экспертов, из которых 16 задействуются для решения каждой задачи. Модель поддерживает контекстное окно объемом 1 миллион токенов и встроенный мультимодальный ввод; стоимость API составляет 3 доллара за ввод и 15 долларов за вывод на миллион токенов. Компания Moonshot обязалась опубликовать полные открытые веса к 27 июля.

K3 — крупнейшая на сегодняшний день модель с открытыми весами, примерно на 75 % превосходящая по размеру предыдущую крупнейшую широко используемую открытую модель. По оценкам независимых аналитиков, K3 занимает четвертое место среди современных передовых систем, уступая Claude Fable 5 и GPT-5.6 Sol, но опережая Claude Opus 4.8.
Почему важен разрыв с более старыми моделями
Контекстные окна объемом менее 200 000 токенов когда-то вынуждали разработчиков разбивать большие кодовые базы или исследовательские пакеты на фрагменты. Теперь каждая модель из этой группы работает с объемом 500 000 токенов и более, причем три из четырёх — с объемом в 1 миллион, что позволяет в рамках одной сессии обрабатывать полный репозиторий или набор первоисточников.
Надежность агентов также повысилась. Системы периода 2023–2024 годов часто теряли свой план после нескольких вызовов инструментов. Модели, выпущенные в этом месяце, созданы так, чтобы выдерживать десятки скоординированных шагов и восстанавливаться, когда вызов инструмента возвращает некорректные данные, вместо того чтобы зацикливаться.
Для разработчиков практическим результатом является снижение стоимости каждой завершённой задачи, а не повышение максимальных показателей по отдельным тестам. Механизмы регулирования затрат в Opus 5, многоуровневая ценовая политика в GPT-5.6 и заявления об эффективности Grok 4.5 указывают на одну и ту же цель: дать командам возможность выбирать, сколько вычислительных ресурсов требует та или иная задача, вместо того чтобы платить по флагманским ценам за каждый запрос.
Для предприятий и политиков внедрение GPT-5.6 под контролем правительства сигнализирует о том, что надзор теперь встроен в графики выпуска крупнейших моделей, а не добавляется задним числом. Кратковременная, инициированная правительством приостановка доступа к Fable и Mythos компанией Anthropic в июне стала ранней версией той же схемы.
Эта статья была переведена с английского языка с помощью искусственного интеллекта. Оригинальная версия на английском языке является авторитетным источником; автоматические переводы могут содержать неточности, особенно в юридической и нормативной терминологии.

















