GPT-5.6 API 价格骤降 80%:AI 参与优化自身系统,降本飞轮启动
7 月 31 日,OpenAI 突然宣布 GPT-5.6 全线调价:入门款 Luna 最高降幅 80%,输入价格降至每百万 Token 0.2 美元,输出仅 1.2 美元;主力 Terra 降 20%;旗舰 Sol 保持原价,新增 Fast mode 加速不加价。降价直接原因是——GPT-5.6 Sol 参与优化了自身生产系统。
7 月 31 日,OpenAI 突然宣布 GPT-5.6 全线调价:入门款 Luna 最高降幅 80%,输入价格降至每百万 Token 0.2 美元,输出仅 1.2 美元;主力 Terra 降 20%;旗舰 Sol 保持原价,新增 Fast mode 加速不加价。降价直接原因是——GPT-5.6 Sol 参与优化了自身生产系统。
降价之后,GPT-5.6 三款模型的 API 定价形成清晰阶梯:
Luna:输入 $1 / 输出 $6
Terra:输入 $2.5 / 输出 $15
Sol:输入 $5 / 输出 $30
Luna:$0.2 / $1.2(-80%)
Terra:$2 / $12(-20%)
Sol:$5 / $30(新增 Fast mode)
Luna 输入价格已与上一代 GPT-5.4 nano 持平,输出甚至便宜 0.05 美元。但 nano 仅面向分类、抽取等简单任务,Luna 则支持工具调用与多步工作流。
Sol 的新增 Fast mode 值得单独说:速度最高为标准模式的 2.5 倍,价格为标准模式的 2 倍,智能水平不变。它取代了此前的 Priority Processing,原本使用 priority 标签的 API 请求可自动切换。
一个更直白的信号:支撑 Agent 干活的模型,正被卖到过去简单小模型的价位。
OpenAI 给出的理由直接且具体:GPT-5.6 Sol 参与了自身生产系统的优化。它重写并优化了部分生产环境 GPU Kernel,设计并运行数百次 Token 生成实验,还监控训练过程并在出现问题时介入。
这些优化带来了可量化的效果:
但这里有一个诚实的注脚:GPT-5.6 还远未实现完全自主升级。OpenAI 特意说明,模型可以写代码、跑实验、监控异常,但「怎么定目标、结果能不能用、代码是否进入生产环境」——依然需要人类决策。
模型提效 → 降价 → 更多使用 → 再提效。一套新的循环正在形成。
降价最狠的 Luna,定位非常明确——面向成本敏感型工作负载,可调用工具、执行多步任务。它不再是传统意义上只做分类和抽取的「小模型」,而是直接进入代码审查、后台监控等需要判断和工具调用的环节。
OpenAI 已经做了一个示范:ChatGPT 和 Codex CLI 里的 Auto-review 模型,从 GPT-5.4 换成了 GPT-5.6 Luna。Auto-review 负责在后台检查代码和修改结果,属于典型的高频 Agent 任务。结合模型升级和 Luna 降价,OpenAI 预计其成本将降至原来的约十分之一。
柱形图仅示意降价幅度相对比例,非绝对价格。Luna 降价 80% 与 Terra 降价 20% 幅度差异明显。
对于订阅用户,额度总量不变,但调用 Terra 和 Luna 时消耗的额度相应减少——同样一笔订阅费,可以让模型多干几次活。
真正值得关注的变化是:便宜模型不再只负责「杂活」,开始进入需要判断和工具的环节。
把「模型参与优化自己」这件事拆开看,其实是一套非常具体的技术链路:
GPU Kernel 是模型在 GPU 上执行具体计算任务的底层程序。模型本身不变,只要这些程序写得更高效,同一块 GPU 就能更快完成计算,处理更多请求,单次调用成本自然下降。
推测解码 则是在生成答案时,先批量「猜」出接下来可能出现的 Token,再交给主模型验证。猜得越准,需要逐个生成和等待的步骤就越少。
两项优化加在一起,让 GPT-5.6 的生产效率获得了可量化的飞跃。效率提升直接转化成了价格表上的数字变化。
但这里有一个关键限制:模型只是「参与者」,而非「决策者」。
OpenAI 强调,整个过程仍然由人类主导。模型可以写代码、跑实验、监控异常,但目标怎么定、结果能不能用、代码是否进入生产环境,依然需要 Human in the Loop。这不是 AI 自主升级自己的故事,而是人机协作提效的典型案例。
这次降价最值得关注的,不是价格数字本身,而是背后的逻辑循环:
模型参与提高运行效率 → 成本下降 → 价格降低 → 模型进入更多高频工作流 → 调用规模扩大 → 再推动下一轮效率优化。
OpenAI 这套「降价飞轮」已经雏形初现。Luna 降价 80% 不只是价格战,它意味着Agent 长期运行的门槛被大幅降低——原本因为成本太高而不能频繁执行的审查、验证和监控任务,有机会变成工作流里的常规步骤。
一个更宏观的视角:当模型开始参与优化自身运行效率,AI 产业的竞争维度正在从「谁的参数更大」转向「谁的效率更高」。这不是模型能力的直接比拼,而是系统工程与部署优化的综合较量。
降价不是终点,而是信号。AI 产业正在从「参数竞赛」进入「效率竞赛」——能持续降低运行成本的公司,将拥有更持久的竞争优势。
开发者可前往 OpenAI 官网查看最新 API 定价与 Fast mode 详情。
降价已即时生效,适用于 Codex、ChatGPT Work 及所有 API 调用。