OpenAI公布GPT-5.6自进化秘籍,翁荔被曝回归
今天凌晨,OpenAI一口气放出了四个大消息,信息量不小。从模型自优化、核心人才动向,到硬件布局和用户规模,几乎每个维度都有新动静。
先快速过一下要点:
1、
GPT-5.6 Sol开始“自己优化自己”了
降了20%
提升了超过15%

2、
AI自进化研究可能迎来一位关键人物回归
翁荔(Lilian Weng)
3、
OpenAI的硬件研发有了新进展
4、
产品规模创下新纪录
10亿
200万家
模型性能、核心人才、用户体量全线突破,OpenAI这次集中放出的技术细节,也揭开了其最强模型GPT-5.6系列应用于自我优化的核心秘密。
GPT‑5.6 Sol出手,整体Token生成效率提升超15%
GPT‑5.6 Sol出手,整体Token生成效率提升超15%
如今,模型服务的需求增速已经超过了算力的扩容速度,效率自然成了所有系统设计的核心命题。OpenAI的首要目标,就是在相同的硬件条件下提供更多服务,同时保持用户所期望的智能性、响应速度、可用性和可靠性。
这个目标,需要
对整个系统进行优化

GPT-5.6全栈分层效率优化方案
本月初发布的GPT-5.6系列,旗舰版本GPT‑5.6 Sol在Artificial Analysis的编程智能体评测榜单中,性能优于Claude Fable 5,而调用成本只有后者的约2/3;均衡模型Terra对标GPT‑5.5,费用减半;快速且实惠的Luna,定价更是比Sol降低了八成。
这些效果的实现,核心在于改进技术栈的两大关键部分:
一是
推理服务体系
二是
智能体调度基座
而GPT‑5.6 Sol,已经凭借其自主运行能力,在上述成果中发力。
第一个例子:负载均衡。
在这个过程中,搭载于Codex的GPT‑5.6 Sol能够分析线上真实业务流量,定位曾被忽视的算力失衡问题,测试新的路由策略,然后迭代调度规则。
GPT‑5.6 Sol还被用于
优化模型的前向传播计算
最终,这些优化将整体端到端推理服务成本
降低了20%
第二种手段:推测解码。
GPT‑5.6 Sol针对配套的预测模型完成了迭代,围绕模型规模、网络结构、功能模块等开展了数百组架构对比实验。它还能自主启动并值守预测模型的全流程训练任务,遇到硬件故障、训练震荡等异常时自动介入处理。这使得整体Token生成效率
提升了15%以上
模型处理未缓存的输入Token时,会通过一次高算力消耗的计算流程构建KV缓存,然后在生成输出内容的阶段反复读取并持续扩充缓存内容。
批量处理、分片部署、KV缓存管控这类线上服务最优配置方案,会受到实际业务的提示词长度、输出文本长度、批处理规模、缓存命中率、查询请求属性等因素影响。但以往,这类配置的可选参数空间庞大,无法开展系统化调优,研发人员只能依靠通用经验规则进行粗略配置。
借助GPT‑5.6 Sol,研究人员可以解析真实线上业务负载、生成并比对各类备选配置方案,针对不同使用场景,对推理引擎与模型参数完成精细化超参优化。
更重要的是,推理优化本身也是一套可持续运转的闭环反馈体系:采集线上真实运行数据,定位系统最突出的性能短板,落地对应的优化方案,最后核验改动是否提升了整体系统表现。GPT‑5.6 Sol和Codex互相搭配,就能优化上述所有环境。
简化重复性工作流程,三大手段优化智能体调度基座
简化重复性工作流程,三大手段优化智能体调度基座
ChatGPT Work和Codex依靠连续的模型调用及工具调用链路,可以完成各种复杂任务。
在单次交互流程中,从用户下发指令到返回最终结果,Codex往往需要执行查看源代码、检索部署记录、查阅故障报告、编辑文件、运行测试等一系列操作,每一步都需要发起一次模型请求。上下文拼装、数据传输、推理运算、工具调用以及进程拉起等环节,都会产生耗时与算力消耗。如果一项任务需要发起30次模型调用,每次调用多一秒时延,累积损耗就会相当可观。

一个用户操作周期可以包含多个模型和工具的迭代过程
研究人员认为,要想让整体性能实现实质性提升,不能只单纯提速模型本身,还需要削减全系统范围内各类重复性计算与冗余操作。
他们的思路,是对智能体调度基座进行设计,包括
管控上下文膨胀、优化工具加载机制、复用已有计算成果
1、避免不必要的冗余信息
智能体可以调用更多工具、获得对话历史的访问权限等,上下文窗口很容易出现冗余膨胀,这会导致调用成本增高、干扰模型判断,甚至触发大量无效推理运算。
基于此,智能体调度框架依靠延迟加载检索机制削减了开销:各类集成组件、自定义MCP工具、功能模块与插件,仅在被实际调用时才会载入上下文。同时,该框架能够杜绝单一工具、MCP集成程序无节制占用上下文空间的问题,系统默认将工具返回输出内容限制在10000 Token以内,模型可根据业务需求申请调整上限。
2、保留用于提示缓存的确切前缀
前文提到,在单次交互周期的智能体任务循环中,相同指令、对话历史、工具定义以及过往运算结果会被多次重复推送至GPU进行计算,而提示词缓存机制能够复用已计算完成的提示词前缀对应的运算结果。
为了稳定保留这份前缀缓存内容,智能体调度框架会将模型可见的全部历史数据设置为仅追加写入模式:新增消息、工具返回数据、环境变更信息只会接续在上下文末尾,不会对前文的上下文内容进行插入修改。框架会以固定有序的格式向模型推送各类工具信息,例如权限审批规则这类运行时配置参数,也在任务执行阶段动态生效,而非固化写入工具定义文件内。

GPT‑5.6 Sol搞不定二维解秘题,问题出在API配置
GPT‑5.6 Sol搞不定二维解秘题,问题出在API配置
此前,GPT‑5.6 Sol已经攻克了圈复覆盖猜想等悬置已久的数学公开难题,但在二维解谜评测基准ARC-AGI-3中,它的正确率仅为7.8%,而上一代GPT‑5.5模型几乎无法完成该解谜任务,得分低至0.4%。
ARC-AGI-3配套使用了一套极简的
通用型智能体调度框架
在ARC-AGI-3案例中,当研究人员启用两项ChatGPT与Codex内部默认使用的API配置——推理记忆留存与上下文压缩后,模型在公开测试集上的评测分数提升至原先的3倍,输出Token消耗量直接缩减为原来的1/6。

使用官方框架后,GPT-5.6 Sol在ARC-AGI-3公开数据集上的得分达到了13.3%,如果保留原有的推理机制和压缩技术,其得分可提升至38.3%
OpenAI研究发现,出现这样的现象,并非模型本身的缺陷,而是
由智能体调度框架的各项参数配置所导致
首先,模型每执行一步解谜操作后,所有私有推理思考过程都会被直接清空,这就导致GPT‑5.6 Sol每一次操作都要从头分析解谜规则,无法留存上一轮的推演思路。模型虽然能够查看历史操作记录以及简短的附属备注,但无法调取产生这些操作背后的规划方案、规律认知与完整思考链路。
第二个问题在于,该调度框架采用滚动截断窗口机制,随着交互历史不断累积,早期的操作记录会被自动剔除、不再对模型可见。这样一来,GPT‑5.6 Sol不但无法留存过往的推理思路,就连自身执行过的历史操作记录也会逐步丢失。
当OpenAI通过优化,让智能体记住自己曾经做过的事情时,它们表现达到了最佳状态。
其模型在输出回答或是发起工具调用前,具备依托私有推理报文开展思考的训练范式,这类私有思考内容会被持久保存在对话历史当中。当对话上下文长度超限后,系统会对存量历史做摘要压缩,再接续后续交互流程。

GPT-5.6 Sol处理长任务的推理运行机制
OpenAI基于自家Responses API重构了ARC-AGI-3对应的调度框架,该API能够便捷管控上下文链路,GPT‑5.6只需传入上一轮应答ID,即可在多轮工具调用、多轮交互之间完整保留全部推理过程。
在开启推理内容持久留存功能后,他们观测到两项变化:GPT‑5.6 Sol每一步操作前的推演耗时明显下降,模型无需在每一轮交互中从零解析解谜规则与盘面信息;当模型能够调取过往的思考记录时,随任务进程不断习得解题规律、输出连贯可行的策略的能力会提升。
第二项优化方案,是借助Responses API自带的上下文压缩配置,替换掉原有的滚动截断机制。ARC-AGI-3原版调度框架依靠滚动截断机制处理上下文长度上限,一旦对话上下文总字符数超过17.5万,系统就会直接舍弃最早的一批消息内容。
研究人员在ARC-AGI-3测试环境中开启上下文压缩功能后,GPT‑5.6 Sol能够在更长的解谜流程里留存各个谜题的习得经验,最终以更少的输出Token开销拿到更高的评测分数。
下方动画演示了两种调度框架运行状态下,GPT‑5.6 Sol在解答一系列ARC-AGI-3谜题时,其17.5万字符上下文窗口的动态变化过程。

最后,OpenAI建议试图提升性能的API开发者,可以采用自己在产品中使用的相同设置,或者在比较不同的模型时,选择那些使用上述设置进行评估的模型,因为这些设置最能模拟ChatGPT和Codex在实际应用中的表现。
结语:大模型竞争,迈入全栈工程化比拼阶段
结语:大模型竞争,迈入全栈工程化比拼阶段
GPT‑5.6实现的各项效率提升,源于OpenAI多年来在算法研究、模型推理、智能体调度整套技术体系上层层迭代、累积叠加的优化成果。
OpenAI提到,该模型本身承载并落地了大量优化方案,也让其有理由相信后续的优化迭代速度会持续加快。未来,研究人员会持续深耕算子内核优化等方向,同步对整套底层技术架构进行基础性升级。
这也可以看出,AI行业已经进入全栈工程化优化竞赛,大模型厂商提供低成本、高效率、可规模化的产业落地能力,成为降低行业AI应用门槛、促进大模型规模化落地的关键。