OpenAI 让 GPT-5.6 进生产环境改写自身底层代码,服务成本降 20%
在最新技术报告中,OpenAI 披露已将 GPT-5.6 投入真实生产环境,用于分析线上流量、重写底层 Kernel、优化推测解码模型——模型不再只是被部署的工具,开始动手改造承载自己运行的系统。
在最新技术报告中,OpenAI 披露已将 GPT-5.6 投入真实生产环境,用于分析线上流量、重写底层 Kernel、优化推测解码模型——模型不再只是被部署的工具,开始动手改造承载自己运行的系统。
报告披露,GPT-5.6 已被投入 OpenAI 的真实生产环境,参与优化自身运行系统的四个环节:
四件事连起来,GPT-5.6 参与的已不是某个孤立的代码任务,而是一条真实的工程反馈回路:
这份报告不是概念演示,而是带有具体工程细节的生产实践。五名署名作者中包括 Philippe Tillet——他是 Triton 之父。2021 年 OpenAI 发布 Triton 1.0 时,目标是让不懂 CUDA 的人也能写出接近专家水平的 GPU 程序;五年后,GPT-5.6 已经在用 Triton 改写自己跑在 GPU 上的底层代码。
除了模型自身的优化,OpenAI 还搭建了一层由 Rust 编写的 Agent Harness,连接模型、工具和用户环境,专门减少 Agent 循环中的重复工作。两项关键优化:
一上来就把所有工具说明书塞进上下文;工具返回内容不限长;新消息和工具结果可能插回旧内容,导致 Prompt 缓存失效。
真正需要时才向模型展示对应工具;工具返回默认限制在 1 万 Token 内,需要更多时由模型主动申请。新消息只追加到上下文末尾,不插回旧内容,GPU 可直接复用此前计算。
原理:一次 Agent 任务可能循环调用模型 30 次,每次哪怕只额外浪费 1 秒,累计就是 30 秒。当成千上万只 Agent 每天循环几十轮,省下的就不再是一点。
报告还透露了一组内部数据:GPT-5.6 内部测试期间,每名活跃研究人员的日均输出 Token 超过了 GPT-5.5 时期峰值的两倍。
这组数字不能直接证明研究速度也提升了 100 倍,但它说明了一件事:AI 一旦变得更便宜、更好用,用量不仅不会减少,反而会不断增加——这是典型的效率反弹效应。
本文信息来源为OpenAI 官方技术报告,属企业单方披露,未见第三方独立复测。20% 成本降幅与 15% 效率提升为 OpenAI 自报口径,读者宜将其视为工程方向信号而非精确基准。报告未公开具体实验配置与可复现评估流程,与完全开源的评测体系有本质区别。
同时需注意,文中所称「RSI」尚处早期阶段——GPT-5.6 优化的是自身运行环境而非自身训练过程,距离「模型训练下一代模型」的完整递归仍有距离。人类仍掌握优化目标设定、工具权限分配与代码上线决策权。
OpenAI 已公开技术报告与部署安全文档,可查阅完整工程细节。
阅读技术报告 →