OpenAI披露GPT-5.6自优化技术:推理成本降20%,Token生成效率提升超15%
OpenAI公开GPT-5.6系列模型自我优化进展,通过内核优化与推测解码使推理成本降低20%、Token效率提升超15…
OpenAI于近日集中披露了旗下GPT-5.6系列模型在自我优化方面的多项技术进展,覆盖推理服务降本、智能体调度改进以及基准测试表现等多个维度。同期,公司还曝出核心人才动向、产品规模纪录与硬件研发信号,显示出其在模型、算力、人才层面的全线推进。
推理服务降本:GPT-5.6 Sol优化GPU内核与推测解码
GPT-5.6系列本月正式发布,旗舰版本GPT-5.6 Sol在Artificial Analysis编程智能体评测中表现优于Claude Fable 5,调用成本约为后者的2/3;均衡模型Terra对标GPT-5.5,费用仅为前者的1/2;轻量模型Luna定价较Sol降低80%。
OpenAI将效率提升拆解为两条技术路径:
- 推理服务体系:通过负载均衡、推测解码、缓存机制与内核算子优化,在硬件不变前提下提升有效输出量。
- 智能体调度基座:针对上下文膨胀、工具调用逻辑与重复计算冗余进行专项优化。
具体而言,GPT-5.6 Sol借助Codex分析线上真实流量,定位算力失衡并迭代路由规则;同时自主重新编写并优化了OpenAI核心计算代码,使端到端推理服务成本降低20%。在推测解码方面,GPT-5.6 Sol围绕配套预测模型开展数百组架构对比实验,并自主值守全流程训练,整体Token生成效率提升超过15%。
智能体调度:减少冗余、保留缓存前缀
Codex在单次交互中往往需要查看源代码、检索部署记录、查阅故障报告、编辑文件、运行测试等多步操作,每一步都需发起一次模型调用,耗时与算力消耗在数十次调用中不断累积。
OpenAI的优化思路围绕三种手段:
- 管控上下文膨胀:采用延迟加载检索机制,集成组件、MCP工具等仅在被实际调用时才载入上下文;工具返回输出默认限制在10000 Token以内。
- 保留提示缓存前缀:将模型可见的历史数据设为仅追加写入模式,新消息、工具返回、环境变更信息只接续在上下文末尾,避免插入修改破坏缓存命中。
- 复用已有计算成果:通过上下文压缩、推理记忆留存等技术减少重复计算。
ARC-AGI-3评测:API配置而非模型能力才是关键短板
GPT-5.6 Sol此前已攻克圈复覆盖猜想等数学难题,但在ARC-AGI-3二维解谜基准中正确率仅为7.8%(GPT-5.5仅0.4%)。OpenAI研究发现,这一表现并非模型本身缺陷,而是ARC-AGI-3配套的极简调度框架所致——该框架每步操作后清空私有推理思考过程,并采用滚动截断窗口机制,导致早期操作记录逐步丢失。
启用ChatGPT与Codex内部默认的两项API配置(推理记忆留存与上下文压缩)后,GPT-5.6 Sol在公开测试集上的得分提升至原来的3倍,输出Token消耗缩减为原来的1/6。基于自家Responses API重构调度框架后,GPT-5.6 Sol得分从7.8%提升至13.3%,若同时保留原有推理机制和压缩技术,分数可达38.3%。
OpenAI建议API开发者在评估不同模型时,选用能模拟ChatGPT与Codex实际应用场景的配置,以获得更客观的横向对比结果。
人才、用户与硬件三线推进
伴随技术披露,OpenAI同步传出三项重要动态:Thinking Machines Lab联合创始人翁荔(Lilian Weng)被曝将回归OpenAI,助其开展AI自进化研究;用户规模首次突破10亿人,服务企业达200万家;总裁格雷格·布罗克曼(Greg Brockman)透露OpenAI正在打造AI硬件,认为用户"绝大多数情况下"会选择与电脑对话的设备形态。
上述进展表明,大模型竞争已从单纯的参数比拼迈入全栈工程化优化阶段,低成本、高效率、可规模化的产业落地能力正成为各家厂商角力的核心方向。
