桃子桃子快讯
返回首页
模型发布

GPT-5.6 自主重写生产内核,服务成本降 20%

OpenAI 披露 GPT-5.6 Sol 自主优化线上推理栈,使服务成本下降 20%、token 生成效率提升超 15…

2026.07.30 · 周四4 分钟阅读

OpenAI 于 7 月 29 日披露,GPT-5.6 Sol 已接入公司生产推理栈,自主重写并优化了负责跑模型的 GPU 内核。结果是直接落到账面上:对外服务成本下降 20%,推测解码环节让 token 生成效率提升超过 15%。这不是一次演示环境里的实验,而是 OpenAI 每天承载十亿级用户请求的那套生产系统。OpenAI 总裁 Greg Brockman 表示,让 GPT-5.6 Sol 去提升生产服务效率,正是它「又强又便宜」的原因之一。

这 20% 是怎么省出来的

GPT-5.6 Sol 通过 Codex 接入 OpenAI 的生产推理栈,重点改写了四块最核心的组件:GPU 内核、负载均衡、推测解码和 KV 缓存。它在智能体框架、API 编排、模型推理三层做优化,整体换来了更少的网络传输、更少的 CPU 开销和更高的 GPU 产出。

  • 负载均衡:避免部分 GPU 过载、部分闲置的不均衡问题;
  • KV 缓存:把算过的中间结果存下来重复使用,减少重复计算;
  • 推测解码:用小模型先抢答,大模型只负责验收,每次可一次输出多个 token;
  • 生产内核:用 Triton 和 Gluon 两种 GPU 编程语言重写,寻找可预计算、可跳过、可并行的环节。

在推测解码环节,GPT-5.6 Sol 还针对配套的 draft 模型,设计并运行了数百次架构实验,包括改尺寸、改结构、改特性,并在训练过程中自主处理硬件故障和不稳定问题。

比节省 20% 更重要的是一个闭环

比单次降本更关键的变化,是「测量、优化、验证」的闭环已经跑通。GPT-5.6 Sol 可自主分析生产流量、提出优化方案、生成代码、跑实验、处理故障,并用生产指标验证结果。这条回路几乎每一步都有模型参与。

闭环一旦转起来,就会形成正向飞轮:模型越强 → 推理栈越省 → 同样硬件能服务更多请求 → 更多人能用上更强的模型。OpenAI 给出的内部数据印证了飞轮的速度:

  • GPT-5.6 内测阶段,每位活跃研究员的日均 token 输出,是 GPT-5.5 时代最高值的两倍以上;
  • 过去半年,用于内部代码推理的研究算力占比增长约 100 倍;
  • 内部智能体 token 用量增长约 22 倍。

在内部专门衡量自我改进能力的 RSI Index 上,GPT-5.6 比 GPT-5.5 高出 16.2 分,且 GPT-5.6 的三档模型在「成本-得分」曲线上全面优于 5.5 和 5.4。

是「AI 自进化」吗

文章对此做出了审慎的判断:现阶段仍不算严格的自我进化。GPT-5.6 Sol 优化的是运行自己的软件、服务配置以及辅助的 draft 模型,并没有证据表明它在线改动了自身的主体权重,也没有证据表明它能脱离工程团队独立升级出下一代模型。把权重比作智能的「货物」,内核和配置则是运货的卡车和路线,本次优化的是运输,而非货物本身。

同时,OpenAI 用「自主(autonomously)」形容内核重写和部分实验,但目标设定、工具接入、验证方式、部署上线等环节仍由 OpenAI 工程团队把控。例如模型写出的生产内核,必须经过开源工具 FpSan(浮点消毒器)审核,才能上线运行。自动验证体系是否能跟上,才是把底层代码交给 AI 的真正瓶颈。

Anthropic 联合创始人 Jack Clark 给出更激进的判断:人类如今只对个位数百分比的方向性决策负责,并称 2028 年底前出现完整递归自我改进的概率超过 60%。飞轮已经转起,但「AI 自己造出更厉害的 AI」仍在路上。

竞争轴变了:从比 GPU 数量到比 token 产出

20% 的成本下降,意味着同样一批 GPU,OpenAI 能多承担两成的业务量。过去几年 AI 公司比拼的是谁买得起更多 GPU,但在一个算力始终紧缺、需求增速跑赢产能的环境里,另一个变量正在浮出水面:在同样硬件上,谁能榨出更多 token。

OpenAI 的产品线已对这一趋势做出反应。GPT-5.6 一次性拆出 Sol、Terra、Luna 三档,核心卖点是「同等智力,更少 token」。效率被摆到了与智能同等重要的位置,而这一次帮助 OpenAI 模型提升推理效率的,正是模型本身。

信源