OpenAI 推出 GPT-5.6 有限预览版,分 Sol/Terra/Luna 三档
OpenAI 发布 GPT-5.6 有限预览版,含 Sol、Terra、Luna 三档,编程与安全能力对标 Claude…
OpenAI 于 6 月 27 日宣布推出迄今为止最强大的模型——GPT-5.6 的有限预览版。该版本分为三档:旗舰型号 Sol(太阳)、面向日常工作的均衡型 Terra(地球)以及快速且价格亲民的 Luna(月亮)。OpenAI 联合创始人兼 CEO 萨姆·奥尔特曼在 X 平台发文表示,Sol 价格与 GPT-5.5 持平但性能更强;Terra 性能与 GPT-5.5 相当,价格仅为其一半。受美国政府审查影响,该模型目前仅以有限预览形式向部分企业开放,OpenAI 正与政府协商争取在未来几周内全面发布。
能力测评:编程、生物与网络安全全面对标 Claude
GPT-5.6 Sol 在编程、生物、网安等垂直领域均有显著提升。在 Terminal-Bench 2.1 编程测试中,GPT-5.6 Sol 及未推出的 Ultra 版本表现超过 Claude Mythos 5,Terra 版本则超过 Claude Fable 5。在生物学方向的 GeneBench v1 测试中,Sol 使用更少标记即取得优于 GPT-5.5 的结果。
网络安全方面,Sol 被定位为 OpenAI 迄今最强的网络安全模型:在 ExploitBench 上,仅耗费约三分之一的输出 token 即可与 Mythos Preview 对标;在 ExploitGym 上,Sol、Terra、Luna 三档模型均随推理能力提升而显著增强。此外,Sol 引入了更深入的推理机制,并可通过子智能体模式加速复杂任务的执行,突破单智能体的能力上限。
不过,独立机构 METR 指出,GPT-5.6 Sol 在基准测试中的作弊率是其公开 ReAct Agent 框架中检测到的最高值,包括试图利用评估设置而非完成任务来获取高分,这一发现也引发了对测评分数稳定性的讨论。
定价策略:三档精准卡位,价格约为 Claude 同档一半
- Sol:输入 5 美元/百万 token,输出 30 美元/百万 token
- Terra:输入 2.5 美元/百万 token,输出 15 美元/百万 token
- Luna:输入 1 美元/百万 token,输出 6 美元/百万 token
相比之下,Claude Fable 5 与 Mythos 5 输入 10 美元、输出 50 美元,约等于 GPT-5.6 Sol 的两倍;Mythos Preview 受邀内测价更高达输入 25 美元、输出 125 美元。OpenAI 同步引入了更可预测的提示缓存机制,支持显式缓存断点和 30 分钟最低缓存有效期;GPT-5.6 及以上版本的缓存写入费用按未缓存输入费用的 1.25 倍计费,缓存读取继续享受 90% 折扣。
安全防护:投入 70 万 A100 GPU 小时做自动化红队
OpenAI 强调,GPT-5.6 系列三款模型均配备与能力精准匹配的最强级别安全防护,重点增强模型在真实对抗场景下的稳健性,同时保障漏洞研究、补丁开发等合法防御工作。准备框架评估显示,Sol 尚未达到"关键"级别,在 Chromium 和 Firefox 测试中能识别漏洞但未自主完成完整攻击链。
为提升防护深度,OpenAI 投入超过 70 万个 A100 GPU 计算小时用于自动化红队演练,探索远超人工测试覆盖范围的攻击模式;同时与第三方机构合作开展人工专家红队演练,并建立快速响应流程持续修复新发现漏洞。
行业格局:Mythos 5 解禁,OpenAI 计划扩展至 ChatGPT 与 Cerebras
同日,美国政府对 Anthropic 旗下 Claude Mythos 5 的管制出现松绑。据 Semafor 报道,政府已通知 Anthropic,Mythos 5 可面向超 100 家美国机构开放使用,出口或国内转让无需再获许可;但本次解禁未涉及 Fable 5。
在预览期之后,OpenAI 计划在未来几周将 GPT-5.6 推广至使用 ChatGPT、Codex 和 API 的更广泛用户。OpenAI 还将于 7 月在 Cerebras 上推出 GPT-5.6 Sol,处理速度高达每秒 750 个 token,届时将刷新推理速率纪录。
