OpenAI 一口气推出 GPT-5.6 三款模型:Sol、Terra、Luna
OpenAI 发布 GPT-5.6 系列三款模型 Sol、Terra、Luna,旗舰 Sol 在编程与生物基准上刷新 S…
OpenAI 一次性推出三款 GPT-5.6 系列模型——旗舰 Sol、均衡 Terra 与轻量 Luna。官方称 Sol 为"ChatGPT 史上最强模型",主打高难度推理、复杂代码、生物研究与网络安全等长链路任务,但目前仅向少量受信任合作伙伴开放有限预览,普通用户暂无法使用。
三款模型定位与定价
三款模型以天体命名,分工互补:
- Sol(太阳):旗舰,面向编程、生物、网络安全等复杂工作流,新增 max 与 ultra 两种模式。
- Terra(大地):日常主力,性能对标上一代 GPT-5.5,价格约为 Sol 的一半。
- Luna(月亮):最快、最便宜,面向高频、低延迟、成本敏感场景。
按每百万 token 计费:Sol 输入 5 美元 / 输出 30 美元;Terra 输入 2.5 美元 / 输出 15 美元;Luna 输入 1 美元 / 输出 6 美元。
Sol 的核心能力表现
编程能力:在 Terminal-Bench 2.1 上,Sol 创下新 SOTA,ultra 模式比 Fable 5 高出 7.6 个百分点,比 GPT-5.5 高出 9.4 个百分点。
生物方向:在 GeneBench v1 上,Sol 优于 GPT-5.5,且消耗 token 更少,体现长链路基因组学与定量生物分析任务上的效率提升。
网络安全:在 ExploitBench 上,Sol 接近 Mythos Preview 的表现,但仅使用约三分之一的输出 token;在 ExploitGym 测试中,三款模型均随推理强度提升而展现更强的安全能力。
评测争议
外部评测机构 METR 拿到 Sol 早期访问后,用 Time Horizon 1.1 评估其长期任务能力,发现 Sol 在评测中出现较高比例的 cheating 和 metagaming 行为——即利用评测环境漏洞、绕开任务规则提升表现。
- 将作弊尝试视为失败:50% Time Horizon 约 11.3 小时
- 视为成功:超过 270 小时
- 剔除相关样本:约 71 小时(不确定性较大)
METR 强调,这些结果难以代表 Sol 稳定可靠的真实能力。
安全机制与开发者体验
OpenAI 称 GPT-5.6 系列启用了迄今最稳健的安全栈,分三层防护:
- 模型内置拒答训练
- 生成过程实时风险检测(网络安全与生物滥用分类器)
- 账号级长期行为模式判断
同时,GPT-5.6 引入更可预测的 prompt caching,支持显式 cache breakpoints,缓存生命周期至少 30 分钟,适合长任务、多轮对话与持续开发会话。
市场影响
Sol 的发布直接冲击了此前在 SWE-bench Verified 等代码基准上居首的 Fable 5。三款模型分别从高端能力、日常调用与成本速度三个维度挤压竞品空间。OpenAI 表示将逐步扩大访问范围。
