2026年7月,四家备受瞩目的人工智能(AI)实验室在短短三周内相继发布了前沿语言模型,这些系统在无需人工干预的情况下所生成的内容与此前水平之间的差距已大幅缩小。
随着竞争进入白热化阶段,AI巨头们在3周内接连推出4款前沿模型

要点:
- xAI于7月8日发布了Grok 4.5,定价为每百万代币2美元/6美元,比Opus 4.8的定价低了60%以上。
- Anthropic于7月24日发布了Claude Opus 5,将其作为Claude Max订阅服务的新默认模型。
- Moonshot AI发布了其迄今为止参数规模最大的模型Kimi K3,参数总量达2.8万亿。
xAI的Grok 4.5、Anthropic的Claude Opus 5、OpenAI的GPT-5.6系列以及Moonshot AI的Kimi K3,均致力于解决同一个问题:让AI系统能够执行长达数小时的任务——从研究、编码到结构化报告——且不会偏离既定计划。
Grok 4.5 基于真实开发者会话进行训练
xAI 于 7 月 8 日发布了 Grok 4.5。该模型基于 1.5 万亿参数构建,部分训练数据来源于 Cursor——这是 SpaceXAI 今年早些时候收购的编程平台。 定价为每百万输入令牌 2 美元,每百万输出令牌 6 美元,上下文窗口为 50 万令牌。

埃隆·马斯克将Grok 4.5描述为一款运行速度更快、成本更低的Opus级模型。据独立追踪机构统计,该模型在“人工智能分析指数”中排名第四,领先于所有开源模型,且定价比Claude Opus 4.8和GPT-5.5低60%以上。 在Terminal-Bench 2.1测试中(该测试用于评估模型完成命令行工程任务的能力),Grok 4.5的得分达到83.3%。
更显著的变化在于令牌效率。xAI 表示,该模型在执行同类任务时所需的输出令牌量仅为 Opus 4.8 的五分之一左右,这降低了运行长时间代理会话的成本。
Claude Opus 5 价格保持不变
Anthropic 于 7 月 24 日发布了 Claude Opus 5,将其定位为一款性能接近该公司最强大版本 Claude Fable 5 的模型,但定价仅为 Fable 的一半——Fable 的输入定价为 10 美元,输出定价为 50 美元。 Opus 5 本身的定价与前代产品 Opus 4.8 相同,即输入 5 美元、输出 25 美元。

该模型配备100万令牌的上下文窗口、12.8万令牌的最大输出量,以及可调节的推理强度设置,范围从“低”到全新的“xhigh”模式。 Anthropic表示,Opus 5在Frontier-Bench和GDPval-AA这两项编码与知识工作评估中创下新纪录,但在网络安全任务上仍落后于受限版Claude Mythos 5模型。Opus 5现已成为Claude Max的默认模型,也是Claude Pro上的最强选项。
OpenAI 将 GPT-5.6 分为三个等级
在遵循一项与前沿模型安全审查相关的行政命令后,OpenAI于7月9日将GPT-5.6转为全面开放,此前该模型曾进行为期两周的预览,仅限约20家经美国政府审核的组织参与。 该系列分为三个等级:旗舰型号 Sol,每百万令牌的输入费用为 5 美元,输出费用为 30 美元; 中端型号“Terra”,输入和输出费用分别为每百万令牌2.50美元和15美元,OpenAI称其性能与GPT-5.5相当,但成本仅为后者的一半;以及快速、低成本的“Luna”型号,费用分别为1美元和6美元。

OpenAI报告称,Sol在“人工智能分析编码代理指数”(AACA指数)中名列前茅,在Terminal-Bench 2.1测试中达到88.8%,当该模型在其新的“超模式”下并行运行四个子代理时,该数值升至91.9%。 这三个层级均被OpenAI评定为网络和生物滥用风险等级最高,这导致在政府受限预览期间需进行额外审查。
Kimi K3 将开放式模型推向新前沿
Moonshot AI 于 7 月 16 日发布了 Kimi K3,这是一个拥有 2.8 万亿参数的专家混合模型,共包含 896 个专家,每个任务中活跃专家数量为 16 个。 该模型支持100万令牌的上下文窗口和原生多模态输入,API定价为每100万令牌输入3美元、输出15美元。Moonshot承诺将于7月27日前发布完整的开放权重数据。

K3是迄今为止发布的最大规模开放权重模型,其规模比此前最大且被广泛使用的开放模型大约大75%。据独立追踪机构统计,K3在当前前沿系统中排名第四,位列Claude Fable 5和GPT-5.6 Sol之后,但领先于Claude Opus 4.8。
与前代模型的差距为何重要
此前,少于20万令牌的上下文窗口曾迫使开发者将大型代码库或研究资料拆分为多个片段。如今,该组中的每个模型均可处理50万令牌或更长的上下文,其中四款中有三款可达100万令牌,这意味着单次会话即可容纳整个代码库或一沓原始文档。
代理的可靠性也得到了提升。2023年和2024年期间的系统在调用几次工具后往往会丢失计划。而本月发布的模型则设计为能够维持数十个协调步骤,并在工具调用返回错误数据时进行恢复,而非直接卡死。
对开发者而言,其实际效果在于降低每项完成任务的成本,而非单纯提高单个基准测试的上限。 Opus 5 中的工作量控制、GPT-5.6 的分级定价,以及 Grok 4.5 所宣称的效率提升,都指向同一个目标:让团队能够根据任务需求选择相应的计算资源,而非为每次请求都支付旗舰级价格。
对于企业和政策制定者而言,GPT-5.6由政府把关的发布方式表明,监管机制现已融入大型模型的发布计划之中,而非事后追加。Anthropic公司今年6月在政府指导下短暂暂停Fable和Mythos访问权限,正是这一模式的早期体现。
本文由人工智能从英文翻译而来。英文原版为权威来源;自动翻译可能存在不准确之处,尤其是在法律和监管术语方面。

















