实测 8 毛 8 修好生产 Bug:DeepSeek 的"低价斩杀线",被一纸涨价预告戳破
8 月 6 日,DeepSeek 在用户后台突然预告:全部 API 接口将整体提价,涨幅较大。距离 V4 Flash 正式版上线仅一周——这款刚在 OpenRouter 创下单周 7.1 万亿 Token 消耗纪录的模型,踩下了刹车。
8 月 6 日,DeepSeek 在用户后台突然预告:全部 API 接口将整体提价,涨幅较大。距离 V4 Flash 正式版上线仅一周——这款刚在 OpenRouter 创下单周 7.1 万亿 Token 消耗纪录的模型,踩下了刹车。
7 月 31 日,DeepSeek 在 API 文档更新了一条日志:DeepSeek-V4-Flash 正式版上线公测。架构与参数规模和 4 月 24 日开源的预览版完全一致——284B 总参数、13B 激活参数的 MoE 架构,唯一重做的东西,是后训练。
然而正是这唯一的改动,让整个行业惊掉了下巴。
284B / 13B MoE 架构,参数规模与正式版完全一致,后训练为旧版本。
唯一重做后训练,9 项 Agent 基准测试全面超过自家旗舰 V4-Pro 预览版,指令遵循能力呈跨代际提升。
更直接的动作是:首次原生支持 Responses API 格式,开发者可以直接在 ChatGPT 桌面端或 VS Code 插件里,将底层引擎无缝切换为 DeepSeek——剑指 OpenAI 的 Codex。
注:以上对比基于官方公布的 9 项 Agent 基准,覆盖指令遵循、工具调用与多步任务完成等维度;"跨代际提升"为官方口径。
跑分之外,真正的杀伤力在真实场景。测试机会来自一次偶然——一套自建舆情管理系统出了 bug:信源匹配数量断崖式下跌,前一天还能匹配出 1 万多条数据,当天只剩不到 2000 条。
发布后,"干翻 Claude"的说法铺天盖地。但先看一组诚实的跑分——据第三方评测机构的综合智能指数:
注:智能指数得分,V4 Flash 排第三,落后于两款国产模型。但真正的"斩杀线"不在跑分,而在价格。
输出定价(美元 / 百万 token):V4 Flash 为 0.28 美元;GLM-5.2 为 4.29 美元,是它的 15 倍;Anthropic 旗舰 Claude Fable 5 为 50 美元,是它的 178 倍。
注:柱形自 0 起线性缩放,V4 Flash 的条极短(0.6%),接近不可见——这正是"斩杀线"的图景。分差以标注数值为准。
按第三方评测口径估算,完成一项任务的平均成本:V4 Flash 约 0.03 美元,Kimi K3 约 0.86 美元,Claude Fable 5 约 3.15 美元。最贵与最便宜之间,差了 105 倍。
极低的价格引发全网开发者的疯狂接入。在 OpenRouter 榜单上,V4 Flash 创下单周 7.1 万亿 Token 的消耗量,高峰期的并发请求直接让服务器集群不堪重负。
在自建智算中心尚未完全交付的当下,通过价格杠杆筛选高价值客户、抑制低效高频消耗,成了防止服务器被挤爆的唯一自救手段。
梁文锋曾这样算过账:
"采购一批服务器,大约 10 个月通过 API 收入收回设备成本,在 DeepSeek 内部,这已经算合理利润。"——此前低价不是补贴烧出的战术,而是算法优化带来的结构性成本优势。
但算法的精妙可以压缩单位成本,却无法平抑硬件天花板与现金流压力。于是有了这组数字:
注:两轮合计超千亿元,超六成用于自建智算中心与国产芯片适配;另有一条一年前秘密启动的自研推理芯片产线,以及核心人才团队的扩充。
同一赛道,两条截然不同的路线正在对撞:
极致 API 定价,克制的产品形态,换取最大调用量。但 8 月 6 日的涨价预告,戳破了低价狂欢的滤镜。
Kimi K3 发布后,API 定价比上代涨 3-4 倍,输出达 100 元/百万 token。以 500 亿美元估值开启 Pre-IPO 轮,年内递表。
市场也已闻风而动:V4 Flash 上线前一天,OpenAI 宣布 GPT-5.6 入门款 Luna 降价 80%;8 月 1 日,智谱重新开放一度需要抢购的 GLM Coding Plan 订阅。虽然很难把所有降价都归因于 DeepSeek,但整个行业的价格锚点,正在被重塑。
"8 毛 8 修 Bug"的故事固然动听,但涨价预告证明:即便是最擅长成本控制的团队,也无法用算法无限平抑算力的物理成本。当价格战先锋也踩下刹车,行业将从"谁更便宜",转向"谁的商业模式更可持续"。
调价生效前,建议合理规划调用量与充值金额。具体细则与生效时间,以官方正式公告为准。
DeepSeek 开发者后台 → 查看调价细则