OpenAI 发布 GPT-5.6:三档分层,应美国政府要求先做有限预览
OpenAI 推出 GPT-5.6 Sol/Terra/Luna 三档模型,旗舰价格对齐上代标准版,引入 max rea…
OpenAI 正式推出新一代模型 GPT-5.6 系列,并首次采用 Sol(太阳)、Terra(地球)、Luna(月亮)三档命名,对应旗舰、均衡、轻量三层定位。官方表示,GPT-5.6 系列将在未来数周全面开放,但目前先应美国政府要求,在 Codex 和 API 中向一小群"值得信赖的合作伙伴"进行有限预览,参与名单已与美国政府共享。
三档定位:旗舰、均衡、轻量
GPT-5.6 沿用了大模型行业最常见的三层产品结构:
- Sol(旗舰):面向代码、生物研究、网络安全等复杂任务,强调持续推进、调用工具并自我验证的能力。
- Terra(均衡):面向日常工作,主打效果、速度与成本之间的平衡,定位接近 GPT-5.5 能力但价格更便宜。
- Luna(轻量):主打快速与低成本,适合批量摘要、文本分类、信息抽取、简单问答等高频轻量任务。
价格:旗舰对齐上代标准版
按照 OpenAI 公布的 API 价格(每 100 万 token 计费):
- Sol:输入 5 美元,输出 30 美元
- Terra:输入 2.5 美元,输出 15 美元
- Luna:输入 1 美元,输出 6 美元
值得注意的是,GPT-5.6 Sol 作为新一代旗舰,价格对齐的是 GPT-5.5 标准版,而非 GPT-5.5 Pro。Terra 价格为 GPT-5.5 的一半,Luna 仅为五分之一。GPT-5.5 Pro 仍为当前最贵档位,输入 30 美元、输出 180 美元,是标准版与 Sol 的 6 倍。
新机制:max reasoning effort 与 ultra mode
为支撑 Sol 处理更复杂的任务,OpenAI 引入了两个新机制:
- max reasoning effort(最大推理强度):允许模型花更长时间进行深度推理,适合无法靠第一反应解决的复杂任务。
- ultra mode(超强模式):允许多个子智能体协同参与复杂任务,类似"AI 经理"带多个小助手分头处理,加快复杂工作的推进。
基准测试:聚焦代码、生物与网络安全
GPT-5.6 公布的评测覆盖三个重点方向:
- 代码:Terminal-Bench 2.1 评估模型在命令行环境中完成真实开发流程的能力,Sol 取得 88.8% 的高分,ultra 模式下得分更高;Terra 取得 84.3%,与 Claude Fable 5 持平。
- 生物学:GeneBench v1 评估长周期基因组学与定量生物学分析任务,OpenAI 称 Sol 表现强于 GPT-5.5,且使用的 token 更少。
- 网络安全:OpenAI 称 Sol 是其目前最强的网络安全模型。
- 在 ExploitBench 上,Sol 的表现可与 Mythos Preview 媲美,但仅使用约三分之一的输出 token。
- 在由 UC Berkeley 研究人员与 OpenAI 等机构合作创建的 ExploitGym 上,Sol、Terra、Luna 三档模型均显示出明显提升,且推理强度越高表现越好。
有限预览:前沿模型首次出现政府介入痕迹
GPT-5.6 此次并未直接全面开放,而是以有限预览方式在 Codex 与 API 中向合作伙伴开放,名单已与美国政府共享。这一发布模式与近期美国政府对前沿 AI 模型的监管动向直接相关:
- 今年 6 月,美国政府发布 AI 网络安全相关行政令,提出建立自愿框架,让前沿模型开发者在模型更广泛发布前与政府进行接触和评估。
- 该框架虽非强制审批,但已搭建起政府参与模型发布前评估的制度基础。
OpenAI 内部将高风险能力分为 High 与 Critical 两级,并反复强调 GPT-5.6 Sol 未达到 Cyber Critical 门槛,意在说明模型虽强,但尚未具备自主完成最危险网络攻击链的能力。
OpenAI 也在公告中明确表态,不认为这种政府访问流程应成为长期默认机制,理由是:如果最强工具总是被推迟开放,用户、开发者、企业与网络防御者会更晚拿到最好的工具。
随着大模型能力集中到代码、生物、网络安全与智能体执行等领域,前沿模型的发布正在进入一个新阶段:当一项技术被视作可能影响现实世界安全时,其发布权将很难再完全留在公司手中。
