AI 大模型的“斩杀线”还在上移:DeepSeek V4 Flash 0731 重新定义性价比边界
7 月 31 日,DeepSeek 发布 V4 Flash 0731,在 Artificial Analysis Intelligence Index 上以 50 分、每任务成本约 0.09 美元 划出一条新的“斩杀线”——右下区域内,成本更高、能力更弱的模型面临一击即死的淘汰风险。
7 月 31 日,DeepSeek 发布 V4 Flash 0731,在 Artificial Analysis Intelligence Index 上以 50 分、每任务成本约 0.09 美元 划出一条新的“斩杀线”——右下区域内,成本更高、能力更弱的模型面临一击即死的淘汰风险。
两个来自游戏的词,同时在中文和英文 AI 圈流行:“斩杀线”和“Kill Zone”。它们指向同一件事:大模型竞争已惨烈到需要用生死来类比。
以 DeepSeek V4 Flash 0731 为起点,向右下方划出一片区域——区域内的模型成本更高、能力更弱。中文圈称这片区域为“斩杀线”,英文圈叫“Kill Zone”。
而斩杀线本身,正在不断上移。
注:纵轴为 Intelligence Index 能力得分,横轴为每任务成本。散点图示意,非精确位置。V4 Flash 0731 落在左上角,成本最低、能力领先,其右下区域即为“斩杀区”。
一个诚实的注脚:斩杀线并非静态阈值,而是动态曲线。每次模型迭代或价格调整,都可能将它重新定位。
Agent 改变了模型的使用方式——从一次对话变成一项任务。单次问答消耗数百 tokens,一项 Agent 任务的 tokens 消耗量高出 一千倍。
模型之间的单价差距不变,但最终支出差额随消耗量同步放大。
消耗数百至数千 tokens。Claude Opus 4.8 与 DeepSeek V4 Flash 的支出差额以美分计。
消耗数百万 tokens。同一对模型,Intelligence Index 任务支出差额接近1.7 美元。
注:数据来自 Artificial Analysis 与 CAISI 评测。支出差额基于相同任务集,具体数值因任务而异。
能力差距同样被放大。单轮问答准确率 95% 与 90% 相差 5 个百分点;二十步 Agent 任务后,成功率分别为 36% 与 12%——前者接近后者的三倍。
这就是 Agent 时代的残酷真相:能力和成本差距,都会被任务链条放大到不可忽视。
7 月,Reddit 上的一篇独立评测将 DeepSeek V4 Flash 接入四个不同的 Agent 框架,执行同一批 bug 修复任务。结果:能力得分落在重叠区间,但消耗的 tokens 和时间相差四倍。
斩杀线意味着斩杀彻底且迅速。一旦落入斩杀范围,模型在市场中直接失去竞争力。
原因很简单:大模型的切换成本极低。API 调用标准化,操作协议开放,开发者可以快速且低成本地切换模型。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集。
这不是飞轮,是跑步机。
2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 价格下调 80%。次日,DeepSeek 发布 V4 Flash 0731。只要有一家降本,其余厂商不跟进就得交出市场份额。
降下来的成本在价格竞争中无法转化为利润。DeepSeek 自研推理芯片、OpenAI 建算力,投入产出几乎线性,没有单位效率上的额外收益。
V4 Flash 0731 仅重做后训练,得分就提升 10 分。自研芯片、自建算力、系统工程——这些投入正在推动斩杀线继续向上。
斩杀线、毒圈、跑步机——这些词之所以能同时在中英文圈流行,说明行业竞争已经进入一个只能用生死类比来描述的阶段。
但数据驱使我们给出一个更诚实的结论:
Agent 时代,框架工程能力的重要性,正在超过单纯的模型参数比拼。下一轮洗牌的赢家,不是跑分最高的模型,而是能把任务成本压到最低、把完成率提到最高的系统。
DeepSeek V4 Flash 0731 已全面开放,登录官网即可体验新一代 Agent 任务能力。
platform.deepseek.com → 开始使用