跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.06.27 · 14 min

GPT-5.6 系列发布:Sol 超越 Claude Mythos,却因美国政府审查限量开放

OpenAI 发布 GPT-5.6 系列:旗舰 Sol 在 Terminal-Bench 超越 Claude Mythos 5,定价仅其一半。但应美国政府要求限量开放,约20家可信伙伴首批获权。OpenAI 公开表态'政府审批不应成为长期默认模式'。

前沿动态

2026 年 6 月 26 日,OpenAI 发布 GPT-5.6 系列。三个模型,三个定位,一个争议。

旗舰级 Sol 在 Terminal-Bench 2.1 上跑出了 91.9% 的成绩,超过 Claude Mythos 5 的 88.0%——这是 OpenAI 在 Agent 基准上首次明确超越 Anthropic 的旗舰。但就在同一天,OpenAI 宣布:应美国政府要求,Sol 仅向有限可信合作伙伴开放预览,首批约 20 家企业获权。

性能登顶和限量开放同时发生,这件事比任何跑分数字都更值得深入分析。

三档模型规格对比

GPT-5.6 系列首次采用三档命名策略:Sol(旗舰)、Terra(均衡)、Luna(轻量)。

维度 GPT-5.6 Sol GPT-5.6 Terra GPT-5.6 Luna
定位 旗舰级,复杂推理/科研/Agent 均衡型,日常开发 轻量快速,在线服务
输入定价 $5 / 百万 token 未公布(预计约 $2-3) 未公布(预计约 $0.5-1)
输出定价 $30 / 百万 token 未公布(预计约 $10-15) 未公布(预计约 $2-4)
vs 前代 新模型 性能接近 GPT-5.5,成本降约 50% 速度优先
Max 模式 更长时间思考 不支持 不支持
Ultra 模式 协调多个子 Agent 不支持 不支持
可用范围 仅限可信合作伙伴预览 预计全面开放 预计全面开放

关键信息:Sol 的定价约为 Claude Fable 5 的一半。 Claude Fable 5 的输入定价约 $10 / 百万 token,输出约 $60 / 百万 token。Sol 以 $5/$30 的价格提供更强的 Agent 能力——这是 OpenAI 在价格战中的明确信号。

Terminal-Bench 2.1:Sol 的里程碑成绩

Terminal-Bench 是目前最权威的 Agent 自主编程基准测试,评测模型在没有人类干预的情况下完成真实编程任务的能力。

模型 Terminal-Bench 2.1 成绩
GPT-5.6 Sol Ultra 91.9%
GPT-5.6 Sol 88.8%
Claude Mythos 5 88.0%
Claude Fable 5 84.3%
GPT-5.5 83.4%(Codex CLI harness)

Sol Ultra 的 91.9% 是当前最高分。 Ultra 模式让 Sol 协调多个子 Agent 完成复杂长期任务——这和 Anthropic 的 Dynamic Workflows(数百并行子 Agent)是同一个赛道上的竞争。

但需要注意:

  1. Ultra 模式是增强版,不是标准版。 88.8% 的标准 Sol 和 88.0% 的 Claude Mythos 5差距只有 0.8 个百分点——这个差距在统计上是否显著,取决于评测样本量。
  2. 评测 harness 不同。 OpenAI 的脚注提到 GPT-5.5 用的是 Codex CLI harness,而 Sol 和 Claude 用的是 Terminus-2 public harness。不同 harness 可能影响结果。
  3. Terminal-Bench 还在演化。 2.1 版本比 2.0 有调整,未来版本可能改变排名。

和前代 GPT-5.5 相比,Sol 的提升是实质性的——不只是跑分高了几个百分点,而是首次在 Agent 自主完成任务这个关键指标上超越了 Claude Opus 4.8 系列的旗舰。

ExploitBench:网络安全的新标杆

ExploitBench 是评估模型自主发现和利用软件漏洞能力的基准。这个领域特别敏感——能力强意味着模型可以被用来发现漏洞(好事),也可以被用来制造攻击(坏事)。

模型 ExploitBench 表现
GPT-5.6 Sol 约 Anthropic Mythos Preview 水平,但用约 1/3 输出 token
Anthropic Mythos Preview 基线水平
其他模型 未公布详细对比

Sol 用 1/3 的 token 达到了 Mythos Preview 水平。 这意味着 Sol 在网络安全任务上更高效——同样结果,成本更低。但这也正是 Sol 被限量开放的原因之一。

安全评估:未达最高风险等级,但已经足够危险

OpenAI 的安全评估报告(通常在 system card 中公布)显示:

安全维度 Sol 评估结果
漏洞发现 能识别 Chromium/Firefox 漏洞
漏洞利用 未自主生成完整利用链
生物研究风险 有提升但未全面超越前代
自主行动能力 显著提升(Ultra 模式)
最高风险等级 尚未达到

关键判断:Sol 能识别漏洞但未自主生成完整利用链。 这是 OpenAI 决定「限量开放而不是完全不开放」的依据——模型还不够危险到需要完全封锁,但已经足够危险到不能让任何人随便用。

这个判断是否合理?取决于你对「足够危险」的定义边界。能识别 Chromium 漏洞意味着模型可以帮安全研究员做好事,也意味着它可以帮攻击者定位目标。区别在于意图,而不在于能力。

美国政府审查:限量开放的深层含义

这是这次发布中最值得关注的部分。

OpenAI 在公告中明确写道:

At the direction of the US government, GPT-5.6 Sol is available only to a limited set of trusted partners for preview. Approximately 20 organizations have been granted initial access.

同时,OpenAI 也公开表态:

We believe that a government-approval process for AI models should not become the long-term default mode for the industry.

这两句话的矛盾是显而易见的:OpenAI 在执行政府审查的同时,公开反对政府审查成为长期模式。

这意味着什么?

  1. 政府审查已经在发生。 不是「可能发生」或「正在讨论」,而是「已经发生了,并且 OpenAI 在执行」。这是 AI 行业的重大转折点。
  2. OpenAI 不完全认同这个审查。 公开表态「不应成为长期默认」是一种政治姿态——既服从当前要求,又为未来争取更宽松的规则。
  3. 约 20 家企业首批获权。 这意味着绝大多数开发者和企业无法使用 Sol,至少在短期内。对依赖 OpenAI API 的团队来说,这是一个实质性的供应限制。

GPT-5.4 发布时的对比

GPT-5.4 发布时,没有政府审查限制。从 5.4 到 5.6,中间只隔了两代,但政策环境已经发生了根本变化。这说明 AI 模型的能力增长速度超过了政策制定速度——政府正在用「限量开放」作为临时措施,同时 longer-term 的监管框架还在制定中。

GeneBench 和 HealthBench:生物领域有进步但未全面超越

Sol 在生物领域的评估结果比较微妙:

基准 Sol 表现
GeneBench v1 有提升,但提升幅度不如 Agent 基准那么显著
HealthBench 有提升,但未全面超越前代

这符合预期。Agent 编程和网络安全是 Sol 的强项,生物研究不是。 一个模型的能力增长通常不是均匀的——Sol 在 Agent 自主行动方面投入了大量训练资源,在生物领域可能没有特别加强。

这也解释了为什么政府审查集中在 Sol 的网络安全和自主行动能力上——生物领域还没有达到让监管者紧张的水平。

Cerebras 硬件加速:750 token/秒

OpenAI 同时宣布,Cerebras 硬件将在 7 月部署 Sol,推理速度达到 750 token/秒

推理平台 Sol 推理速度
Cerebras(7 月部署) 750 token/秒
标准 GPU 推理 约 50-100 token/秒
Claude Mythos 5(标准) 约 60-80 token/秒

750 token/秒是什么概念?一个 1000 token 的回复,Cerebras 上约 1.3 秒完成。 在标准 GPU 上,同样的回复需要 10-20 秒。

但这只是推理速度,不是端到端响应时间。Ultra 模式需要协调多个子 Agent,每个子 Agent 的推理是串行的,总响应时间可能远超单次推理。

Gemini 3.5 的用户来说,Cerebras 加速后的 Sol 在速度上可能形成明显优势——但前提是你能获得 Sol 的访问权限。

与竞品的定位对比

维度 GPT-5.6 Sol Claude Mythos 5 Gemini 3.5 Pro Kimi K2-7 Code
Agent 基准 91.9%(最高) 88.0% 未公布详细 有成绩但较低
输入定价 $5/M ~$10/M ~$1.25/M 免费/低价
输出定价 $30/M ~$60/M ~$5/M 免费/低价
政府审查 限量开放 Project Glasswing 限量 无限制 无限制
子 Agent 协调 Ultra 模式 Dynamic Workflows 未明确 未明确
网络安全能力 强(限量原因之一) Mythos Preview 限量 一般 一般

Sol 的优势在 Agent 能力和价格,劣势在可用性。 你可以花一半的钱得到更强的 Agent 能力,但你可能根本拿不到访问权限。

行业影响:三重信号

信号一:Agent 基准成为新的竞争焦点

Terminal-Bench 和 ExploitBench 正在取代 MMLU 和 gsm8k 成为旗舰模型的关键指标。这说明行业正在从「模型能不能答对题」转向「模型能不能自主完成任务」。 OpenAI 和 Anthropic 都在 Agent 基准上投入了大量资源,这个趋势会持续加速。

信号二:政府审查成为新的变量

从 GPT-5.4 到 GPT-5.6,政府审查从零到有限制,只用了两代模型的时间。如果 Sol 的限量开放成为常态化,AI 行业将进入一个「许可证时代」——最强模型只有少数被审批的机构能用。 这对开源生态和中小企业都不是好消息。

信号三:定价战加速

Sol 的 $5/$30 定价是 OpenAI 在价格上的明确攻击——同样能力,Anthropic 收两倍。如果 Terra 和 Luna 的定价也保持低水平,OpenAI 可能通过价格战在全面开放的档位上抢夺市场份额,同时用 Sol 的限量开放维持旗舰叙事。

写在最后

GPT-5.6 系列发布,表面上是技术升级,实质上是行业格局的三重转折:Agent 基准登顶、政府审查介入、定价战升级。

Sol 在 Terminal-Bench 上超越 Claude Mythos 5 是事实,但「约 20 家企业首批获权」也是事实。最强模型限量开放,这意味着绝大多数开发者今天无法验证 OpenAI 的跑分声明——你只能相信公告里的数字,而不能自己跑一遍。

OpenAI 公开表态「政府审批不应成为长期默认」是一种姿态,但姿态和行动是两回事。真正的问题是:如果 Sol 的限量开放持续 6 个月、12 个月、甚至更久,这个「临时措施」是否已经事实上变成了「长期默认」?

OpenAI 官方公告:openai.com/blog/gpt-5-6

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板