大模型 API 定价告别"一刀切":DeepSeek 引入分时计费,开启精细化 Token 经济学
8 月 17 日,DeepSeek 新定价方案正式生效,引入峰谷分时窗口与缓存感知计费。以 V4 Pro 模型为例,高峰时段缓存命中输入价格为 0.3 元/百万 tokens,较此前公布的 0.025 元上涨 12 倍。过去两年"无差别降价抢量"的竞争逻辑,正在被一套更精细的定价体系取代。
8 月 17 日,DeepSeek 新定价方案正式生效,引入峰谷分时窗口与缓存感知计费。以 V4 Pro 模型为例,高峰时段缓存命中输入价格为 0.3 元/百万 tokens,较此前公布的 0.025 元上涨 12 倍。过去两年"无差别降价抢量"的竞争逻辑,正在被一套更精细的定价体系取代。
DeepSeek 在 8 月 17 日生效的新方案中,将 V4 Pro 的缓存未命中输入价从几天前公布的 3 元上调至高峰 9 元,输出价从 6 元上调至高峰 27 元。低谷时段统一执行高峰价的 50%。
注:旧价指 DeepSeek 几天前公开的同一模型报价;低谷时段所有价格统一为高峰的 50%。涨幅按相对比例计算,缓存命中输入因基数极低,相对涨幅最大。V4 Flash 模型执行类似结构,高峰价分别为 3 元 / 9 元 / 0.1 元。
但具体数字并非重点。
真正重要的是这套定价引入的结构:分时差价将非紧急任务推向低谷时段,提升固定算力的利用率;缓存感知定价奖励那些复用上下文而非重新处理的系统;旗舰与轻量模型分开定价,让高频简单任务跑在更低成本上。
过去两年,大模型 API 竞争的主要动作是持续压低每百万 Token 的单价。低价吸引开发者,建立使用份额,帮助模型成为应用内的默认选择。
那个阶段正在结束。
统一低价抢量,所有时段、所有场景一个价格,核心目标是成为开发者的默认选择。
分时费率、缓存折扣、模型分层、预付费套餐,甚至按业务结果挂钩——匹配真实需求与成本。
推动这一转变的力量来自多个方向。当模型嵌入 Agent 工作流后,单次用户请求可能触发漫长的中间步骤链、工具调用与修订。服务这些链条需要持续的算力、内存带宽和能耗投入,额外一个 Token 的边际成本不再微不足道。
与此同时,领先开源系统与闭源模型之间的性能差距正在收窄。当不同价位的替代品质量相近时,标价和总拥有成本对许多买家来说变得具有决定性。
国内外供应商正在测试一组类似的工具,从"每百万 Token 一个价"的简单模式,走向多维度的精细化定价。
高峰/低谷差异化定价,引导非紧急任务错峰,提升固定算力利用率
复用上下文而非重新处理,系统设计良好的调用获得更低单位成本
轻量模型处理高频简单任务,旗舰模型留给复杂推理,各取所需
基础包叠加超额按量,兼顾预算确定性与弹性需求
费用与节省工时、解决案例数等可量化业务结果绑定
注:以上趋势综合自国内外多家供应商公开的定价调整与商业测试。按结果挂钩仍属少数实验,标准化难度较高。
传统软件预算偏好固定许可证或席位数——资本支出或可预测的运营支出,适配年度规划周期。Token 计费引入的是变动成本,更难预测,也更难在团队间分摊。
市场整体呈现出价格双向移动的格局:曾经以低价竞争为主的供应商在上调价格,而守量的在位者在选择性降价。无差别超低价的时代正在终结。
取而代之的,是更精确地匹配价格与需求模式。
供应商的产品线也在调整:轻量模型处理高频常规任务,旗舰模型留给硬推理问题,缓存折扣与分时定价改善服务经济学。少数公司正在探索收入分成或商业许可结构,将对话从纯 Token 计数转向客户实际提取的经济价值。
核心商业问题因此改变:不再是谁贴出最低标价,而是给定模型在给定价格、延迟与可靠性水平下,是否产出足够可衡量的价值来证明其在 AI 预算中的位置。
大模型 API 定价正在从"抢量竞赛"转向"成本结构对齐"——当 Agent 工作流使推理成本不可忽视,按结果付费将成为下一阶段的真正战场,尽管它的标准化仍需时间。
DeepSeek 新定价方案已于 8 月 17 日生效,登录官方平台即可查看分时费率与缓存折扣详情。
platform.deepseek.com → 查看最新定价