成本砍20%、效率提升15%。
智东西7月30日消息,今日凌晨,OpenAI四个大消息被放出:
1、OpenAI放出GPT-5.6开始优化“自己”的新进展:用GPT-5.6 Sol优化生产环境GPU内核,推理服务部署成本大降20%;优化推测解码技术,让token生成效率涨超15%。

2、AI自进化研究上,OpenAI或再招揽回一员大将:刚离职的美国AI独角兽Thinking Machines Lab联合创始人翁荔(Lilian Weng)被曝将重新加入OpenAI,助其开展AI自进化研究。
3、倍受关注的OpenAI硬件研发曝新消息:OpenAI总裁格雷格·布罗克曼(Greg Brockman)剧透OpenAI正打造AI硬件,“用户可能很快见到”。谈及设备形态,他认为“绝大多数情况下”,人会都会选择与电脑进行对话。
4、OpenAI产品规模刷新纪录:用户规模首破10亿人,服务200万家企业。
伴随模型性能、核心人才、用户体量全线突破,OpenAI今日凌晨集中放出了多项细节,揭晓其最强模型GPT-5.6系列应用于自我优化的技术秘籍。
01.
GPT‑5.6 Sol出手
整体Token生成效率提升超15%
如今,模型服务需求的增速已经超越算力扩容速度,因此效率成为所有系统设计的核心。OpenAI的首要目标就是在相同的硬件条件下提供更多服务,同时保持用户所期望的智能性、响应速度、可用性和可靠性。
这就需要对整个系统进行优化,主要体现在流量路由(请求分发目标节点)、任务调度(请求的执行时机)、GPU内核程序(运行在显卡上的底层计算程序)、缓存机制(对已计算结果进行存储复用)以及模型代码实现(GPU指令的排布逻辑)。

▲GPT-5.6全栈分层效率优化方案
本月初,OpenAI GPT-5.6系列模型正式发布。旗舰版本GPT‑5.6 Sol在Artificial Analysis的编程智能体评测榜单中,性能优于Claude Fable 5,调用成本约为后者2/3;适用于日常工作的均衡模型Terra在各项智能基准测试中表现对标GPT‑5.5,费用仅为前者的1/2;快速且价格实惠Luna是GPT-5.6系列响应速度最快、性价比最高的模型,定价较Sol降低八成。
为实现上述效果,OpenAI的设计思路是改进了技术栈两大关键部分:
一是推理服务体系,通过优化负载均衡、推测解码、缓存机制、内核算子优化等流程,在硬件配置不变的前提下提升有效输出量;
二是智能体调度基座,针对性优化上下文膨胀、工具调用逻辑以及重复计算冗余问题。
GPT‑5.6 Sol已经依靠其自主运行能力,在上述成果中发力。
第一个例子是负载均衡,在全球层面,其会根据用户地理位置、剩余算力容量、芯片类型等要素完成请求路由分发;在单个集群内部,依据负载压力、上下文长度、缓存可用状态以及其他请求特征,将计算任务分发至各个模型实例;在每一个模型实例内部,还需要把计算任务高效拆分分配给加速芯片、模型子网络以及各个计算核心。
这一过程中,搭载于Codex的GPT‑5.6 Sol能够分析线上真实业务流量,定位曾被忽视的算力失衡问题,测试全新路由策略,然后迭代调度规则。
GPT‑5.6 Sol还被用于优化模型的前向传播计算,也就是将输入数据换算为下一个Token预测值。通过Codex,GPT-5.6 Sol自主重新编写并优化了OpenAI的核心代码,这些代码负责执行构成模型的数学运算。
这是因为研究人员已经训练过GPT-5.6,使其能够在Triton和Gluon这两种开源GPU编程语言中编写和优化核心代码。
上述优化最终将整体端到端推理服务成本降低了20%。
第二种手段是推测解码,该机制会同步部署一个体量更小的预测模型与主模型协同工作:由草稿模型先行预生成一串Token,交由主模型并行校验。若预生成内容校验通过,系统仅需执行一次主模型前向计算,便可一次性输出多个Token,以此削减串行计算开销。
GPT‑5.6 Sol针对配套预测模型完成迭代,围绕模型规模、网络结构、功能模块等开展了数百组架构对比实验。其还能自主启动并值守预测模型的全流程训练任务,遇到硬件故障、训练震荡等异常问题时自动介入处置。这使得整体Token生成效率提升15%以上。
模型处理未缓存的输入Token时,会通过一次高算力消耗的计算流程构建KV缓存,然后在生成输出内容的阶段反复读取并持续扩充缓存内容。
批量处理、分片部署、KV缓存管控这类线上服务最优配置方案,会受到实际业务的提示词长度、输出文本长度、批处理规模、缓存命中率、查询请求属性等影响。
但因为以往该类配置的可选参数空间庞大,无法开展系统化调优,研发人员只能依托通用经验规则完成粗略配置。
借助GPT‑5.6 Sol,研究人员可以解析真实线上业务负载、生成并比对各类备选配置方案,针对不同使用场景对推理引擎与模型参数完成精细化超参优化。
与此同时,推理优化也是一套可持续运转的闭环反馈体系:采集线上真实运行数据,定位系统最突出的性能短板,落地对应的优化方案,最后核验改动能够提升整套系统表现。
GPT‑5.6 Sol和Codex互相搭配,就能优化上述所有环境。
02.
简化重复性工作流程
三大手段优化智能体调度基座
ChatGPT Work和Codex依靠连续的模型调用及工具调用链路可以完成不同的复杂任务。
在单次交互流程中,从用户下发指令到返回最终结果,Codex往往需要执行查看源代码、检索部署记录、查阅故障报告、编辑文件、运行测试等一系列操作,上述每一步操作都需要发起一次模型请求。
上下文拼装、数据传输、推理运算、工具调用以及进程拉起等环节均会产生耗时与算力消耗,倘若一项任务需要发起30次模型调用,每次调用多出一秒时延,累积损耗就会更多。

▲一个用户操作周期可以包含多个模型和工具的迭代过程
研究人员认为,想要让整体性能实现实质性提升,不能只单纯提速模型本身,还需要削减全系统范围内各类重复性计算与冗余操作。
他们的思路就是对智能体调度基座进行设计,包括管控上下文膨胀、优化工具加载机制、复用已有计算成果三种手段,从而让冗余信息减少同时复用成果时更简单、准确。
1、避免不必要冗余信息
智能体可以调用更多工具、获得对话历史的访问权限等,上下文窗口很容易出现冗余膨胀,这会拉高调用成本、干扰模型判断,甚至触发大量无效推理运算。
基于此,智能体调度框架依靠延迟加载检索机制削减了开销:各类集成组件、自定义MCP工具、功能模块与插件仅在被实际调用时才会载入上下文。
同时,该框架能够杜绝单一工具、MCP集成程序无节制占用上下文空间的问题,系统默认将工具返回输出内容限制在10000 Token以内,模型可根据业务需求申请调整该上限值。
2、保留用于提示缓存的确切前缀
前文提到,在单次交互周期的智能体任务循环中,相同指令、对话历史、工具定义以及过往运算结果会被多次重复推送至GPU进行计算,而提示词缓存机制能够复用已计算完成的提示词前缀对应的运算结果。
为稳定保留这份前缀缓存内容,智能体调度框架会将模型可见的全部历史数据设置为仅追加写入模式:新增消息、工具返回数据、环境变更信息只会接续在上下文末尾,不会对前文的上下文内容进行插入修改。
框架会以固定有序的格式向模型推送各类工具信息,例如权限审批规则这类运行时配置参数,也在任务执行阶段动态生效,而非固化写入工具定义文件内。

03.
GPT‑5.6 Sol搞不定二维解秘题
是因为API配置
此前,GPT‑5.6 Sol已经攻克了圈复覆盖猜想等悬置已久的数学公开难题,但在二维解谜评测基准ARC-AGI-3中,GPT‑5.6 Sol正确率仅为7.8%,上一代GPT‑5.5模型几乎无法完成该解谜任务,得分低至0.4%。
ARC-AGI-3配套使用了一套极简通用型智能体调度框架,并未挂载任何工具与专属增强功能,其设计思路是采用轻量化调度框架,更直观地暴露模型本身的能力短板,也可让不同模型之间的横向对比更客观。
在ARC-AGI-3案例中,当研究人员启用两项ChatGPT与Codex内部默认使用的API配置推理记忆留存与上下文压缩后,模型在公开测试集上的评测分数提升至原先3倍,输出Token消耗量直接缩减为原来的1/6。

▲使用官方框架后,GPT-5.6 Sol在ARC-AGI-3公开数据集上的得分达到了13.3%,如果保留原有的推理机制和压缩技术,其得分可提升至38.3%
OpenAI研究发现,出现这样的现象,并非模型本身的缺陷,而是由智能体调度框架的各项参数配置所导致。
首先,模型每执行一步解谜操作后,所有私有推理思考过程都会被直接清空,这就导致GPT‑5.6 Sol每一次操作都要从头分析解谜规则,无法留存上一轮的推演思路。
模型虽然能够查看历史操作记录以及简短的附属备注,但无法调取产生这些操作背后的规划方案、规律认知与完整思考链路。
第二个问题在于,该调度框架采用滚动截断窗口机制,随着交互历史不断累积,早期的操作记录会被自动剔除、不再对模型可见。如此一来,GPT‑5.6 Sol不但无法留存过往的推理思路,就连自身执行过的历史操作记录也会逐步丢失。
OpenAI通过优化让智能体记住自己曾经做过的事情时,使他们表现达到了最佳状态。
其模型在输出回答或是发起工具调用前,具备依托私有推理报文开展思考的训练范式,这类私有思考内容会被持久保存在对话历史当中。当对话上下文长度超限后,系统会对存量历史做摘要压缩,再接续后续交互流程。

▲GPT-5.6 Sol处理长任务的推理运行机制
OpenAI基于自家Responses API重构了ARC-AGI-3对应的调度框架,该API能够便捷管控上下文链路,GPT‑5.6只需传入上一轮应答ID,即可在多轮工具调用、多轮交互之间完整保留全部推理过程。
在开启推理内容持久留存功能后,他们观测到两项变化,GPT‑5.6 Sol每一步操作前的推演耗时明显下降,模型无需在每一轮交互中从零解析解谜规则与盘面信息;当模型能够调取过往的思考记录时,随任务进程不断习得解题规律、输出连贯可行的策略的能力会提升。
第二项优化方案是借助Responses API自带的上下文压缩配置,替换掉原有的滚动截断机制。
ARC-AGI-3原版调度框架依靠滚动截断机制处理上下文长度上限,一旦对话上下文总字符数超过17.5万,系统就会直接舍弃最早的一批消息内容。
研究人员在ARC-AGI-3测试环境中开启上下文压缩功能后,GPT‑5.6 Sol能够在更长的解谜流程里留存各个谜题的习得经验,最终以更少的输出Token开销拿到更高的评测分数。
下方动画演示了两种调度框架运行状态下,GPT‑5.6 Sol在解答一系列ARC-AGI-3谜题时,其17.5万字符上下文窗口的动态变化过程。

最后,OpenAI建议试图提升性能的API开发者,可以采用自己在产品中使用的相同设置,或者在比较不同的模型时,选择那些使用上述设置进行评估的模型,因为这些设置最能模拟ChatGPT和Codex在实际应用中的表现。
04.
结语:大模型竞争
迈入全栈工程化比拼阶段
GPT‑5.6实现的各项效率提升,源于OpenAI多年来在算法研究、模型推理、智能体调度整套技术体系上层层迭代、累积叠加的优化成果。
OpenAI提到,该模型本身承载并落地了大量优化方案,也让其有理由相信后续的优化迭代速度会持续加快。未来,研究人员会持续深耕算子内核优化等方向,同步对整套底层技术架构进行基础性升级。
这也可以看出,AI行业已经进入全栈工程化优化竞赛,大模型厂商提供低成本、高效率、可规模化的产业落地能力,成为降低行业AI应用门槛、促进大模型规模化落地的关键。




津公网安备12011002023007号