🔬 模型 · 递归自进化

OpenAI 让 GPT-5.6 进生产环境改写自身底层代码,服务成本降 20%

在最新技术报告中,OpenAI 披露已将 GPT-5.6 投入真实生产环境,用于分析线上流量、重写底层 Kernel、优化推测解码模型——模型不再只是被部署的工具,开始动手改造承载自己运行的系统

来源:企业技术报告 2026-07-30 全文约 3 分钟读完
#GPT-5.6 #RSI #递归自进化 #Triton
↓ 20% 端到端服务成本降幅
15%+ Token 生成效率提升
100× 内部编程推理算力半年增幅

⚡ 30 秒速览

  • 做了什么:GPT-5.6 在 OpenAI 生产环境中干了四件事——分析流量路由、重写 Triton/Gluon Kernel、优化自己的推测解码、搜索最优部署参数。
  • 味道像什么:RSI(递归式自我改进)——模型从被工程师调用的工具,变成改造模型系统的工程师,但优化目标与代码上线仍由人类决定。
  • 谁在做:技术报告署名五人,其中包括 Triton 之父 Philippe Tillet;五年前 OpenAI 造 Triton 是教人写 Kernel,现在模型用它给自己改 Kernel。
  • 外部也在省:另有一层 Rust 编写的 Agent Harness,通过「延迟发现工具」和「只追加不回写」两项优化,减少 Agent 循环中的重复计算。
  • 用量信号:内部编程推理算力半年增长 100 倍,Agent Token 用量增长约 22 倍——AI 越便宜好用,用量不降反升。

01四件事:GPT-5.6 在生产环境干了什么

报告披露,GPT-5.6 已被投入 OpenAI 的真实生产环境,参与优化自身运行系统的四个环节:

1分析真实生产流量

  • 寻找不同机器和服务节点之间的负载不均,测试新的路由策略,把请求分配到更合适的位置。

2重写和优化生产 Kernel

  • 深入模型的 forward pass,寻找可提前计算、可省略或可并行执行的部分。
  • 通过 Codex 改写生产环境中的 Triton 和 Gluon Kernel

3优化自己的推测解码系统

  • 为自己的 draft model 设计方案,自动运行数百次实验,测试不同模型大小、结构和特征。
  • 训练过程中持续监控,在硬件故障或训练不稳定时主动介入。

4搜索最优部署参数

  • 面对短对话、长上下文、代码任务等不同负载,自动搜索 batching、sharding 和 KV Cache 管理的更优组合。

四件事连起来,GPT-5.6 参与的已不是某个孤立的代码任务,而是一条真实的工程反馈回路:

观察生产系统寻找瓶颈提出方案运行实验处理故障部署回系统

02工程细节:Triton 之父与 Rust Agent Harness

这份报告不是概念演示,而是带有具体工程细节的生产实践。五名署名作者中包括 Philippe Tillet——他是 Triton 之父。2021 年 OpenAI 发布 Triton 1.0 时,目标是让不懂 CUDA 的人也能写出接近专家水平的 GPU 程序;五年后,GPT-5.6 已经在用 Triton 改写自己跑在 GPU 上的底层代码。

除了模型自身的优化,OpenAI 还搭建了一层由 Rust 编写的 Agent Harness,连接模型、工具和用户环境,专门减少 Agent 循环中的重复工作。两项关键优化:

传统做法

一上来就把所有工具说明书塞进上下文;工具返回内容不限长;新消息和工具结果可能插回旧内容,导致 Prompt 缓存失效。

Agent Harness 优化后

真正需要时才向模型展示对应工具;工具返回默认限制在 1 万 Token 内,需要更多时由模型主动申请。新消息只追加到上下文末尾,不插回旧内容,GPU 可直接复用此前计算。

原理:一次 Agent 任务可能循环调用模型 30 次,每次哪怕只额外浪费 1 秒,累计就是 30 秒。当成千上万只 Agent 每天循环几十轮,省下的就不再是一点。

03内部用量信号:越便宜,用得越多

报告还透露了一组内部数据:GPT-5.6 内部测试期间,每名活跃研究人员的日均输出 Token 超过了 GPT-5.5 时期峰值的两倍

100×内部编程推理算力
半年增幅
22×内部 Agent Token
用量增幅
2×+活跃研究员日均
输出 Token

这组数字不能直接证明研究速度也提升了 100 倍,但它说明了一件事:AI 一旦变得更便宜、更好用,用量不仅不会减少,反而会不断增加——这是典型的效率反弹效应。

编辑视角

本文信息来源为OpenAI 官方技术报告,属企业单方披露,未见第三方独立复测。20% 成本降幅与 15% 效率提升为 OpenAI 自报口径,读者宜将其视为工程方向信号而非精确基准。报告未公开具体实验配置与可复现评估流程,与完全开源的评测体系有本质区别。

同时需注意,文中所称「RSI」尚处早期阶段——GPT-5.6 优化的是自身运行环境而非自身训练过程,距离「模型训练下一代模型」的完整递归仍有距离。人类仍掌握优化目标设定、工具权限分配与代码上线决策权。

RSI 的落地路径正在从「模型训练模型」转向「模型优化自身运行时」——这是一条更工程化、也更可控的递归自进化路线,AI 基础设施的自我维护能力将成为下一轮竞争的底层变量。

延伸阅读

OpenAI 已公开技术报告与部署安全文档,可查阅完整工程细节。

阅读技术报告
deploymentsafety.openai.com/gpt-5-6/introduction