🔬 模型 · 自进化
OpenAI 首次披露 GPT-5.6 自优化机制:模型改写自家 GPU 内核降本 20%,翁荔回归带队自进化
7 月 30 日凌晨,OpenAI 集中放出四条消息。核心一条:旗舰模型 GPT-5.6 Sol 已自主重写生产环境 GPU 内核代码,将端到端推理服务成本降低 20%、token 生成效率提升超 15%。同期,刚从 Thinking Machines Lab 离职的联合创始人翁荔被曝回归 OpenAI 主导 AI 自进化研究,ChatGPT 全球用户首破 10 亿、服务 200 万家企业。
来源:公开报道•
2026-07-30•
全文约 4 分钟读完
#OpenAI
#GPT-5.6
#AI自进化
#推理优化
20%
端到端推理服务成本降低
15%+
token 生成效率提升
10亿
ChatGPT 全球用户首破
⚡ 30 秒速览
- 自优化成果:GPT-5.6 Sol 自主重写 GPU 内核(Triton/Gluon 语言)、优化负载均衡与推测解码,推理成本降 20%、效率升 15%+。
- 人才动态:Thinking Machines Lab 联合创始人翁荔离职后回归 OpenAI,主导 AI 自进化研究。
- 硬件剧透:总裁布罗克曼称 OpenAI 硬件产品"用户可能很快见到",形态上"绝大多数情况"为语音对话。
- 规模里程碑:ChatGPT 用户首破 10 亿、服务 200 万家企业。
- 反直觉发现:GPT-5.6 Sol 能攻克数学公开难题,却在二维解谜 ARC-AGI-3 上仅 7.8% 正确率——症结不在模型,在调度框架配置。
01自优化怎么做的 五层全栈效率提升
OpenAI 的核心目标:在硬件不变的前提下提供更多服务,同时保持智能性、响应速度与可靠性。GPT-5.6 Sol 的优化覆盖五个技术层:
流量路由→任务调度→GPU 内核→缓存机制→模型代码
两个最具代表性的发力点:
🔧 负载均衡:三级分发策略成本降 20%
- 全球层面:按用户地理位置、剩余算力容量、芯片类型完成请求路由分发。
- 集群内部:依据负载压力、上下文长度、缓存可用状态将任务分发至各模型实例。
- 实例内部:将计算任务高效拆分给加速芯片、模型子网络与各计算核心。
- GPT-5.6 Sol 搭载于 Codex,分析线上真实业务流量,定位曾被忽视的算力失衡问题,测试新路由策略并迭代调度规则。
⚡ 推测解码:草稿模型先行预生成效率升 15%+
- 体量更小的预测模型先行预生成一串 Token,主模型并行校验;通过则一次前向计算输出多个 Token,削减串行开销。
- GPT-5.6 Sol 围绕预测模型的规模、网络结构、功能模块开展数百组架构对比实验,迭代配套预测模型。
- 还能自主启动并值守预测模型的全流程训练任务,遇到硬件故障、训练震荡等异常时自动介入处置。
此外,GPT-5.6 Sol 还被用于优化模型前向传播计算——它自主重新编写并优化了 OpenAI 负责执行模型数学运算的核心代码,这些代码用 Triton 和 Gluon 两种开源 GPU 编程语言写成。在 KV 缓存管控上,Sol 解析真实线上业务负载、生成并比对各类备选配置方案,针对不同使用场景完成精细化超参优化——以往这类配置因参数空间庞大只能靠通用经验规则粗略设置。整个推理优化形成可持续闭环:采集线上数据 → 定位性能短板 → 落地优化方案 → 核验系统表现提升。
02反直觉发现:能解数学难题,解不了二维谜题 症结在框架不在模型
GPT-5.6 Sol 已攻克圈复覆盖猜想等悬置已久的数学公开难题,但在二维解谜评测基准 ARC-AGI-3 上正确率仅 7.8%(上一代 GPT-5.5 仅 0.4%)。ARC-AGI-3 配套使用了一套极简通用调度框架,不挂载任何工具与增强功能,目的是暴露模型本身的能力短板。
但 OpenAI 研究人员发现,问题不在模型,在框架配置:
原版框架(通用极简)
每步操作后清空私有推理,模型每次从零分析规则;滚动截断窗口超 17.5 万字符直接舍弃最早消息,历史操作记录逐步丢失。
Responses API 框架
开启推理记忆留存与上下文压缩两项配置,推理思路持久保存,超限时摘要压缩而非截断;仅需传入上一轮应答 ID 即可在多轮间完整保留推理过程。
7.8%原框架正确率
38.3%开启配置后
3×得分提升倍数
1/6token 消耗缩减
注:原版框架 7.8% → 官方框架 13.3% → 保留推理机制与压缩技术后 38.3%(约 3 倍提升)。两项关键配置为「推理记忆留存」与「上下文压缩」,均为 ChatGPT 与 Codex 内部默认使用。OpenAI 建议 API 开发者采用产品中实际使用的相同设置进行评估。
OpenAI 在 ChatGPT Work 与 Codex 的智能体调度基座中已落地三大优化:延迟加载检索(工具、MCP 集成、插件仅在被实际调用时载入上下文,返回输出默认限制 10000 token 以内)、保留提示缓存前缀(全部历史数据设为仅追加写入模式,新增消息只接续在末尾)、复用已有计算成果。ARC-AGI-3 的原版框架恰恰缺少了前两项关键配置。
深层启示:当模型能记住自己曾经做过的事情时,表现达到最佳——每步推演耗时明显下降,模型无需在每轮交互中从零解析规则,且能随任务进程习得解题规律、输出连贯策略。
03为什么是 OpenAI 做出来了 人才回流 + 全栈积累
GPT-5.6 实现的各项效率提升,源于 OpenAI 多年来在算法研究、模型推理、智能体调度整套技术体系上的层层迭代与累积叠加。
人才层面,刚离职美国 AI 独角兽 Thinking Machines Lab 的联合创始人翁荔(Lilian Weng)被曝将重新加入 OpenAI,助其开展 AI 自进化研究。翁荔此前曾在 OpenAI 担任重要职务,此次回归被视为 OpenAI 加码自进化方向的关键信号。
硬件层面,总裁格雷格·布罗克曼(Greg Brockman)剧透 OpenAI 正打造 AI 硬件,"用户可能很快见到"。谈及设备形态,他认为"绝大多数情况下"人会选择与电脑进行对话。
这些细节拼出一个图景:模型本身承载并落地了大量优化方案,让 OpenAI 有理由相信后续优化迭代速度会持续加快。研究人员将持续深耕算子内核优化等方向,同步对整套底层技术架构进行基础性升级。
编辑视角
本篇各项效率数字(20% 成本降低、15%+ 效率提升、38.3% ARC-AGI-3 得分)均来自 OpenAI 官方披露,属单方数据,未见第三方独立复测。读者宜将其视为 OpenAI 展示自进化路径的技术叙事,而非中立基准评测结果。
值得留意的是,OpenAI 主动披露 GPT-5.6 Sol 在 ARC-AGI-3 上的低分与框架症结,这种自曝短板的诚意,比单纯报喜更有参考价值——它说明 OpenAI 清楚地知道:模型智能已不是瓶颈,系统工程才是。
当模型参数比拼接近天花板,"模型 + 推理系统 + 智能体框架"的协同工程能力,正在成为决定谁能率先跨越规模化落地门槛的分水岭。