大模型缓存价格最高涨 11 倍,长上下文开始支付“存储税”
8 月 17 日,DeepSeek V4 Pro API 调整输入缓存命中价格:高峰时段从 0.025 元 / 百万 Token 涨至 0.3 元 / 百万 Token。这不是一次普通涨价,而是长上下文应用开始为状态保存、数据搬运与资源调度付费。
8 月 17 日,DeepSeek V4 Pro API 调整输入缓存命中价格:高峰时段从 0.025 元 / 百万 Token 涨至 0.3 元 / 百万 Token。这不是一次普通涨价,而是长上下文应用开始为状态保存、数据搬运与资源调度付费。
这次调整最容易被忽略的地方,是涨价集中发生在“缓存命中”这一项。它原本几乎可以忽略不计,却被大量长上下文产品当作基础设施使用。
价格变化,首先发生在缓存层。
缓存命中价格涨幅
0.025 元 → 0.3 元 / 百万 Token
注:这里比较的是缓存命中输入价格,不是完整输入或输出价格;具体费用还取决于调用时段与 Token 用量。
对于代码助手、知识库 Agent、长文档分析等产品,这意味着原先依靠低价缓存建立的成本模型需要重新核算。涨价幅度看似仍小,但当每次请求都携带数十万乃至百万 Token 时,微小单价会被高频调用放大。
假设一个代码库智能 Agent 的核心上下文有 50 万 Token,开发者每天提问 50 轮。如果没有缓存,每一轮都要重新计算整份代码库,重复输入会迅速吞噬产品利润。
50 万 Token × 50 轮 = 2500 万 Token 重复输入。
仅输入成本就可能超过 75 元 / 天。
首轮支付完整预计算成本,后续上下文大部分直接复用。
输入成本可下降 90% 以上。
注:以上为原报道中的示例测算,用于展示缓存对成本的影响;实际价格会随模型、时段和请求结构变化。
长上下文场景的核心价值,不是让模型“记得更多”,而是让已经计算过的内容无需反复计算。
缓存命中可以省掉大量重复 FLOPs,但它并没有让数据消失。模型仍然需要保存状态、寻找状态,并把状态从存储介质搬回计算设备。
大模型处理长文本时,会生成对应的 KV Cache。上下文越长,这份记忆矩阵越大。DeepSeek V4 通过 CSA 与 HCA 两种注意力架构交错配置,将相邻 Token 压缩成更大的记忆块。
注:流程从左向右阅读;压缩发生在状态生成之后,缓存命中则跳过大部分重复计算。
高频访问的缓存留在 GPU 显存中,响应快,但容量和成本都更敏感。
由 CPU 内存承接部分状态,在容量与访问速度之间折中。
长期低频访问的压缩状态转移到 NVMe 固态硬盘,容量大、成本低,但搬运更慢。
报道给出的估算是:100 万 Token 的 KV 记忆状态可被压缩至约 10GB。以一块 15.36TB、均价约 6000 元的企业级 NVMe 硬盘计算,单份百万 Token 缓存的硬件分摊成本只有几分钱。
当高峰期同时涌入大量百万 Token 请求,GPU 显存会很快被占满。调度系统只能把暂时不活跃的缓存块从显存“踢”到 NVMe;新请求到来后,再把需要的状态搬回来。
注:示意条只表达“命中收益会被搬运开销侵蚀”,不代表官方性能比例。
严重时,昂贵的 GPU 集群不再主要进行推理计算,而是在显存和磁盘之间反复搬数据。算力在 I/O 堵塞中空转,集群的有效处理能力随之下降。
这就是所谓的“存储税”。
DeepSeek V4 的 CSA+HCA 混合架构,能将 100 万 Token 的 KV 缓存体积相较 V3 压缩约 90%;与传统 GQA 架构相比,体积约为其 2%。但压缩只能降低单份状态的重量,无法消除状态数量、访问频率与并发峰值。
负责首次理解和计算上下文。
负责保存大量 KV 状态。
负责定位、搬运和重新加载状态。
注:三项成本并非简单相加;在高并发长上下文场景中,I/O 与调度可能反过来限制算力利用率。
这也是其他厂商采用不同策略的原因:Anthropic 通过显式缓存断点和首次写入溢价,引导开发者只缓存高频前缀;OpenAI 则依靠更高的基础输入价格,配置更充裕的显存空间。低价策略吸引了更多长上下文需求,也让 DeepSeek 更早暴露出缓存基础设施的压力。
缓存命中的核心规则并不复杂:前缀必须完全匹配。但在实际 Agent 中,动态字段和工具结果很容易改变文本结构,让原本积累的长前缀缓存整体失效。
过去,开发者只要写好 Prompt、发出请求即可。现在,推理系统越来越像一套分布式存储系统,开发者需要同时管理缓存生命周期、冷热数据和上下文边界。
把全局共享、长期稳定的内容放在最前。
时间、身份和随机值不要污染公共前缀。
冷数据按需加载,不要一次性塞入全量文档。
注:这些做法不能保证缓存永不失效,但能减少无意的前缀变化和无效搬运。
对已经在 DeepSeek KV Cache 层形成稳定缓存池的公司来说,立刻更换模型未必划算。即便涨价,DeepSeek 的整体调用成本仍被报道为显著低于 Claude 等产品。
可能失去既有缓存池,还要重新适配上下文结构、工具链与调用策略。
提高命中率、减少冷数据、降低无效搬运,把新增成本部分省回来。
注:本文没有给出跨厂商的统一价格表;“更便宜”需结合模型能力、命中率、调用时段和迁移成本综合计算。
一个诚实的注脚:缓存命中率越高,并不意味着成本可以无限下降。当前端把所有内容都变成长时间驻留的状态,后端就必须为这些状态承担存储、带宽和调度压力。
大模型 API 正从“按 Token 买算力”转向“为可复用状态付费”;长上下文产品的竞争力,最终取决于谁能把缓存命中率、数据布局与并发调度做成一套成本工程。
继续使用 DeepSeek V4 Pro API 的团队,应优先检查 Prompt 前缀稳定性、缓存命中率与高峰期缓存驱逐情况。
价格与缓存规则以官方 API 控制台及产品公告为准。