2026年7月の3週間の間に、4つの著名な人工知能(AI)研究所が最先端の言語モデルを相次いで公開し、人間の介入なしにこれらのシステムが生成する結果と、従来のシステムとの差は劇的に縮まりました。
AI大手各社が3週間で4つの最先端モデルを相次いで発表し、競争がさらに激化しています。

主なポイント:
- xAIは7月8日、Grok 4.5を100万トークンあたり2ドル/6ドルで提供開始し、Opus 4.8の価格を60%以上下回りました。
- Anthropicは7月24日、Claude Maxサブスクリプションの新しいデフォルトモデルとして「Claude Opus 5」をリリースしました。
- Moonshot AIは、パラメータ数2.8兆という同社最大規模のモデル「Kimi K3」を公開しました。
xAIのGrok 4.5、AnthropicのClaude Opus 5、OpenAIのGPT-5.6ファミリー、Moonshot AIのKimi K3はいずれも同じ課題に取り組んでいます。それは、AIシステムに調査からコーディング、構造化されたレポート作成に至るまで、数時間にわたるタスクを計画を見失うことなく遂行させることです。
Grok 4.5は実際の開発者セッションで学習
xAIは7月8日にGrok 4.5をリリースしました。このモデルは1.5兆パラメータを基盤としており、今年初めにSpaceXAIが買収したコーディングプラットフォーム「Cursor」からの実際の利用データの一部を用いて学習が行われました。 料金体系は入力トークン100万あたり2ドル、出力トークン100万あたり6ドルで、コンテキストウィンドウは50万トークンです。

マスク氏はGrok 4.5を「Opusクラス」のモデルであり、より高速かつ低コストで動作すると説明しました。独立系トラッカーによる評価では、人工分析知能指数(Artificial Analysis Intelligence Index)で4位にランクインしており、すべてのオープンウェイトモデルを上回っています。価格はClaude Opus 4.8やGPT-5.5よりも60%以上安いです。 コマンドラインでのエンジニアリングタスクをモデルがどれだけ正確に遂行できるかを評価するテスト「Terminal-Bench 2.1」では、Grok 4.5は83.3%のスコアを記録しました。
より大きな変化はトークン効率にあります。xAIによると、同モデルは同等のタスクを実行するためにOpus 4.8が必要とした出力トークンの約5分の1しか必要とせず、これにより長時間のエージェントセッションの実行コストが削減されます。
Claude Opus 5は価格を維持
Anthropicは7月24日にClaude Opus 5をリリースし、同社で最も高性能なモデルであるClaude Fable 5に迫る性能を持ちながら、Fableの入力10ドル・出力50ドルという価格設定の半額で提供されるモデルとして位置づけています。 Opus 5自体の価格設定は、前バージョンのOpus 4.8と同様に、入力5ドル、出力25ドルです。

このモデルは100万トークンのコンテキストウィンドウ、最大12万8000トークンの出力、および「低」から新機能の「xhigh」モードまで調整可能な推論負荷設定を備えています。 Anthropicによると、Opus 5はコーディングおよび知識作業の評価指標である「Frontier-Bench」と「GDPval-AA」で新記録を樹立したが、サイバーセキュリティタスクにおいては利用制限のあるClaude Mythos 5モデルには及ばないという。Opus 5は現在、Claude Maxのデフォルトモデルであり、Claude Proにおける最上位オプションとなっている。
OpenAI、GPT-5.6を3つの階層に分割
OpenAIは、最先端モデルに関する大統領令に基づく安全性審査を受け、米国政府の審査を通過した約20の組織を対象に2週間のプレビュー期間を設けた後、7月9日にGPT-5.6の一般提供を開始しました。 このシリーズは3つのティアで提供されます。フラッグシップモデルの「Sol」は、入力100万トークンあたり5ドル、出力30ドルです。 中位モデルの「Terra」は入力100万トークンあたり2.50ドル、出力100万トークンあたり15ドルで、OpenAIによればGPT-5.5と同等の性能を半分のコストで実現している。そして高速かつ低コストな「Luna」は入力100万トークンあたり1ドル、出力100万トークンあたり6ドルとなっている。

OpenAIの報告によると、「Sol」は人工分析コーディングエージェント指数(AACA)で首位を占め、Terminal-Bench 2.1で88.8%を記録し、新しい「ウルトラモード」下で4つのサブエージェントを並列実行すると91.9%まで上昇します。 この3つのプランはいずれも、サイバーおよび生物学的悪用リスクについてOpenAIの内部評価で最高ランクを受けており、これが政府限定プレビュー期間中に追加審査が行われた要因となりました。
Kimi K3、オープンウェイトモデルの最先端へ
Moonshot AIは7月16日、パラメータ数2.8兆の「ミクスチャー・オブ・エキスパート(MOE)」モデル「Kimi K3」をリリースしました。このモデルは合計896のエキスパートを持ち、タスクごとに16のエキスパートがアクティブになります。 このモデルは100万トークンのコンテキストウィンドウとネイティブなマルチモーダル入力を備え、API料金は100万トークンあたり入力3ドル、出力15ドルです。Moonshotは7月27日までに完全なオープンウェイトを公開すると約束しています。

K3は現在公開されているオープンウェイトモデルとしては最大規模で、これまで広く使われていた最大規模のオープンモデルよりも約75%大きい。独立したトラッカーによると、K3は現在の最先端システムの中でClaude Fable 5やGPT-5.6 Solに次ぐ4位に位置付けられており、Claude Opus 4.8よりは上位にある。
旧来のモデルとの差が重要な理由
コンテキストウィンドウが20万トークン未満だった頃、開発者は大規模なコードベースや研究用データセットを断片に分割せざるを得ませんでした。現在、このグループのモデルはすべて50万トークン以上で動作しており、4つのうち3つは100万トークンに達しているため、1回のセッションでリポジトリ全体や一次資料の束を保持できるようになりました。
エージェントの信頼性も向上しました。2023年と2024年のシステムでは、数回のツール呼び出し後に計画が失われることが多かったです。今月リリースされたモデルは、数十の連携したステップを維持できるように設計されており、ツール呼び出しで不正なデータが返された場合でも処理が停止することなく回復できるようになっています。
開発者にとっての実用的な効果は、個々のベンチマークの上限値を引き上げるというよりも、完了したタスクあたりのコスト削減にあります。 Opus 5の「エフォート制御」、GPT-5.6の段階的価格設定、Grok 4.5の効率性に関する主張は、いずれもチームがリクエストごとに最上位モデルの料金を支払うのではなく、タスクに割り当てる計算リソース量を自ら選択できるようにするという同じ目標を指し示しています。
企業や政策立案者の視点では、GPT-5.6の政府主導による段階的な展開は、最大規模のモデルのリリーススケジュールに監督機能が最初から組み込まれており、事後的に追加されるものではないことを示唆しています。6月にAnthropicが政府の指示によりFableおよびMythosへのアクセスを一時停止した件は、このパターンの初期段階でした。
この記事はAIを使用して英語から翻訳されました。英語の原文が正式な情報源であり、自動翻訳には、特に法律および規制に関する用語において不正確な部分が含まれる場合があります。

















