AI·快讯
💰 定价 · 商业动态

GPT-5.6 API 价格骤降 80%:AI 参与优化自身系统,降本飞轮启动

7 月 31 日,OpenAI 突然宣布 GPT-5.6 全线调价:入门款 Luna 最高降幅 80%,输入价格降至每百万 Token 0.2 美元,输出仅 1.2 美元;主力 Terra 降 20%;旗舰 Sol 保持原价,新增 Fast mode 加速不加价。降价直接原因是——GPT-5.6 Sol 参与优化了自身生产系统

综合公开信息整理 2026-07-31 全文约 3 分钟读完
#OpenAI #GPT-5.6 #API降价 #AI成本 #降价飞轮
最高 -80% Luna 输入价格:$1 → $0.2 / 百万 token
三款定位 Luna 成本敏感 · Terra 日常主力 · Sol 旗舰
降本 20% GPU Kernel 优化,端到端服务成本下降

⚡ 30 秒速览

  • 降了多少:Luna 输入从 $1 降至 $0.2(-80%),输出从 $6 降至 $1.2;Terra 降 20%;Sol 原价新增 Fast mode,速度最高 2.5 倍。
  • 为什么能降:GPT-5.6 Sol 参与重写 GPU Kernel、优化推测解码,端到端服务成本下降 20%,Token 生成效率提升 15%+。
  • 定位变了:Luna 不再只是分类/抽取小模型,而是可调用工具、执行多步任务的 Agent 模型,卖到了过去小模型的价位。
  • Agent 成本骤降:Auto-review 模型从 GPT-5.4 换到 Luna 后,成本预计降至原来的约十分之一。
  • 降价飞轮成形:模型提效 → 降价 → 更多使用 → 再提效,AI 正参与优化自身运行效率。

01三款模型,两种降价,一种加速 新价格一览

降价之后,GPT-5.6 三款模型的 API 定价形成清晰阶梯:

降价前(旧价格)

Luna:输入 $1 / 输出 $6
Terra:输入 $2.5 / 输出 $15
Sol:输入 $5 / 输出 $30

降价后(新价格)

Luna:$0.2 / $1.2(-80%)
Terra:$2 / $12(-20%)
Sol:$5 / $30(新增 Fast mode)

$0.2Luna 输入
$1.2Luna 输出
$2Terra 输入
$12Terra 输出

Luna 输入价格已与上一代 GPT-5.4 nano 持平,输出甚至便宜 0.05 美元。但 nano 仅面向分类、抽取等简单任务,Luna 则支持工具调用与多步工作流。

Sol 的新增 Fast mode 值得单独说:速度最高为标准模式的 2.5 倍,价格为标准模式的 2 倍,智能水平不变。它取代了此前的 Priority Processing,原本使用 priority 标签的 API 请求可自动切换。

一个更直白的信号:支撑 Agent 干活的模型,正被卖到过去简单小模型的价位。

02为什么突然降价?模型在帮自己省钱

OpenAI 给出的理由直接且具体:GPT-5.6 Sol 参与了自身生产系统的优化。它重写并优化了部分生产环境 GPU Kernel,设计并运行数百次 Token 生成实验,还监控训练过程并在出现问题时介入。

这些优化带来了可量化的效果:

两项核心优化,直接降低运行成本模型能力不变

  • GPU Kernel 优化:重写底层计算程序,让同一块 GPU 更快完成计算,端到端服务成本下降 20%
  • 推测解码改进:批量「猜」出接下来可能出现的 Token,再交给主模型验证,Token 生成效率提升 15%+
两项优化均未降低模型能力,却让同一个模型跑得更快、更便宜。OpenAI 强调,整个过程仍由人类主导——目标设定、结果验证、生产部署仍需 Human in the Loop

但这里有一个诚实的注脚:GPT-5.6 还远未实现完全自主升级。OpenAI 特意说明,模型可以写代码、跑实验、监控异常,但「怎么定目标、结果能不能用、代码是否进入生产环境」——依然需要人类决策。

模型提效 → 降价 → 更多使用 → 再提效。一套新的循环正在形成。

03谁在受益?Agent 工作流首当其冲

降价最狠的 Luna,定位非常明确——面向成本敏感型工作负载,可调用工具、执行多步任务。它不再是传统意义上只做分类和抽取的「小模型」,而是直接进入代码审查、后台监控等需要判断和工具调用的环节。

OpenAI 已经做了一个示范:ChatGPT 和 Codex CLI 里的 Auto-review 模型,从 GPT-5.4 换成了 GPT-5.6 Luna。Auto-review 负责在后台检查代码和修改结果,属于典型的高频 Agent 任务。结合模型升级和 Luna 降价,OpenAI 预计其成本将降至原来的约十分之一

Auto-review 模型切换GPT-5.4 → GPT-5.6 Luna
-90%
Luna 降价幅度输入价格变化
-80%
Terra 降价幅度输入价格变化
-20%

柱形图仅示意降价幅度相对比例,非绝对价格。Luna 降价 80% 与 Terra 降价 20% 幅度差异明显。

对于订阅用户,额度总量不变,但调用 Terra 和 Luna 时消耗的额度相应减少——同样一笔订阅费,可以让模型多干几次活

真正值得关注的变化是:便宜模型不再只负责「杂活」,开始进入需要判断和工具的环节。

04技术链路:从 Kernel 到降价,中间发生了什么

把「模型参与优化自己」这件事拆开看,其实是一套非常具体的技术链路:

GPU Kernel 重写推测解码改进服务成本降 20%Token 效率 +15%价格下调

GPU Kernel 是模型在 GPU 上执行具体计算任务的底层程序。模型本身不变,只要这些程序写得更高效,同一块 GPU 就能更快完成计算,处理更多请求,单次调用成本自然下降。

推测解码 则是在生成答案时,先批量「猜」出接下来可能出现的 Token,再交给主模型验证。猜得越准,需要逐个生成和等待的步骤就越少。

两项优化加在一起,让 GPT-5.6 的生产效率获得了可量化的飞跃。效率提升直接转化成了价格表上的数字变化。

但这里有一个关键限制:模型只是「参与者」,而非「决策者」。

OpenAI 强调,整个过程仍然由人类主导。模型可以写代码、跑实验、监控异常,但目标怎么定、结果能不能用、代码是否进入生产环境,依然需要 Human in the Loop。这不是 AI 自主升级自己的故事,而是人机协作提效的典型案例

05降价飞轮:从成本竞争到效率竞争

这次降价最值得关注的,不是价格数字本身,而是背后的逻辑循环:

模型参与提高运行效率 → 成本下降 → 价格降低 → 模型进入更多高频工作流 → 调用规模扩大 → 再推动下一轮效率优化。

OpenAI 这套「降价飞轮」已经雏形初现。Luna 降价 80% 不只是价格战,它意味着Agent 长期运行的门槛被大幅降低——原本因为成本太高而不能频繁执行的审查、验证和监控任务,有机会变成工作流里的常规步骤。

一个更宏观的视角:当模型开始参与优化自身运行效率,AI 产业的竞争维度正在从「谁的参数更大」转向「谁的效率更高」。这不是模型能力的直接比拼,而是系统工程与部署优化的综合较量。

编辑核心判断

降价不是终点,而是信号。AI 产业正在从「参数竞赛」进入「效率竞赛」——能持续降低运行成本的公司,将拥有更持久的竞争优势。

了解更多

开发者可前往 OpenAI 官网查看最新 API 定价与 Fast mode 详情。
降价已即时生效,适用于 Codex、ChatGPT Work 及所有 API 调用。

OpenAI 官网 → 查看最新定价