⚔️ 模型竞赛 · 斩杀线

AI 大模型的“斩杀线”还在上移:DeepSeek V4 Flash 0731 重新定义性价比边界

7 月 31 日,DeepSeek 发布 V4 Flash 0731,在 Artificial Analysis Intelligence Index 上以 50 分、每任务成本约 0.09 美元 划出一条新的“斩杀线”——右下区域内,成本更高、能力更弱的模型面临一击即死的淘汰风险。

综合公开信息整理 2026-08-01 全文约 4 分钟读完
#DeepSeek #斩杀线 #AI Agent #模型竞赛
50 分 Intelligence Index · 能力得分
~0.09美元 每任务成本,V4 Flash 0731
10 分 较上一版 V4 Flash 提升

⚡ 30 秒速览

  • 新模型落地:DeepSeek V4 Flash 0731 发布,架构未变、仅重做后训练,Intelligence Index 得分从 40 升至 50,反超自家 V4 Pro (max)。
  • 斩杀线定义:以 V4 Flash 0731 为起点,向右下划出一片区域——成本更高、能力更弱的模型落入“斩杀区”,商业潜力快速归零。
  • Agent 放大差距:Agent 任务使 tokens 消耗量放大 1000 倍,模型间的单价差距不变,但最终支出差额从美分变成美元级。
  • 毒圈缩圈:模型进步与基础设施投入持续推高斩杀线,任何跟不上节奏的玩家将直接出局,中间没有过渡地带。
  • 止损线未至:价格战远未结束,成本仍在快速下降,自研芯片与系统工程成为维持优势的关键壁垒。

01斩杀线:毒圈正在缩圈 竞争从对话升级为任务

两个来自游戏的词,同时在中文和英文 AI 圈流行:“斩杀线”“Kill Zone”。它们指向同一件事:大模型竞争已惨烈到需要用生死来类比。

以 DeepSeek V4 Flash 0731 为起点,向右下方划出一片区域——区域内的模型成本更高、能力更弱。中文圈称这片区域为“斩杀线”,英文圈叫“Kill Zone”。

而斩杀线本身,正在不断上移。

🏆 V4 Flash 0731
50
~0.09 美元/任务
GPT-5.6 Luna (max)
51
下调 80% 后仍贵 ~60%
Claude Opus 4.8 (max)
56
1.78 美元/任务
DeepSeek V4 Pro (max)
44
0.04 美元/任务

注:纵轴为 Intelligence Index 能力得分,横轴为每任务成本。散点图示意,非精确位置。V4 Flash 0731 落在左上角,成本最低、能力领先,其右下区域即为“斩杀区”。

一个诚实的注脚:斩杀线并非静态阈值,而是动态曲线。每次模型迭代或价格调整,都可能将它重新定位。

02Agent 把差距放大到千倍

Agent 改变了模型的使用方式——从一次对话变成一项任务。单次问答消耗数百 tokens,一项 Agent 任务的 tokens 消耗量高出 一千倍

模型之间的单价差距不变,但最终支出差额随消耗量同步放大。

单轮问答

消耗数百至数千 tokens。Claude Opus 4.8 与 DeepSeek V4 Flash 的支出差额以美分计。

Agent 任务

消耗数百万 tokens。同一对模型,Intelligence Index 任务支出差额接近1.7 美元

1000×Agent 编码任务 tokens 消耗量
1.78$Claude Opus 4.8 每任务成本
~0.09$V4 Flash 0731 每任务成本
~40%Sonnet 5 max 输出 tokens 增幅

注:数据来自 Artificial Analysis 与 CAISI 评测。支出差额基于相同任务集,具体数值因任务而异。

能力差距同样被放大。单轮问答准确率 95% 与 90% 相差 5 个百分点;二十步 Agent 任务后,成功率分别为 36% 与 12%——前者接近后者的三倍。

这就是 Agent 时代的残酷真相:能力和成本差距,都会被任务链条放大到不可忽视。

03框架能力才是真正的分水岭 模型只是部件

7 月,Reddit 上的一篇独立评测将 DeepSeek V4 Flash 接入四个不同的 Agent 框架,执行同一批 bug 修复任务。结果:能力得分落在重叠区间,但消耗的 tokens 和时间相差四倍

🔧 同一模型 · 四个框架 · 差距四倍 框架工程

  • Pi / OpenCode / Claude Code / Nanocoder 四个 Agent 框架,复用同一结算标准。
  • 能力得分在重叠区间内,但输出 tokens 数实际耗时相差最大达 4 倍。
  • 结论:Agent 框架的工程差异,对最终任务表现的影响,可能超过模型本身。
评测来源:r/LocalLLaMA 独立测试,nqawhc.github.io 公开数据。框架工程能力正在成为决定性变量。

📊 Terminal-Bench 2.1:两种框架,两个分数 标准化差异

  • V4 Flash 0731 在 Terminal-Bench 2.1 上,Artificial Analysis 使用 Stirrup 测得 79%
  • DeepSeek 官方在自家 DeepSeek Harness 极简模式下测得 82.7%
  • 同一模型,因框架不同,得分相差 3.7 个百分点——说明评测本身也需标准化。
Artificial Analysis 已开源自建评测框架 Stirrup,致力于统一 Agent 评测基准。

04毒圈缩圈:没有二等奖

斩杀线意味着斩杀彻底且迅速。一旦落入斩杀范围,模型在市场中直接失去竞争力。

原因很简单:大模型的切换成本极低。API 调用标准化,操作协议开放,开发者可以快速且低成本地切换模型。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集。

这不是飞轮,是跑步机。

📉

价格战没有终点

2026 年 7 月 30 日,OpenAI 将 GPT-5.6 Luna 价格下调 80%。次日,DeepSeek 发布 V4 Flash 0731。只要有一家降本,其余厂商不跟进就得交出市场份额。

成本降了,但利润没来

降下来的成本在价格竞争中无法转化为利润。DeepSeek 自研推理芯片、OpenAI 建算力,投入产出几乎线性,没有单位效率上的额外收益。

📈

斩杀线还在上移

V4 Flash 0731 仅重做后训练,得分就提升 10 分。自研芯片、自建算力、系统工程——这些投入正在推动斩杀线继续向上。

🔓 模型迭代加速:V4 Flash 0731 架构与尺寸未变,仅后训练优化,Intelligence Index 得分从 40 升至 50,反超 V4 Pro (max) 的 44 分。模型进步远未触及天花板。

05编辑判断

斩杀线、毒圈、跑步机——这些词之所以能同时在中英文圈流行,说明行业竞争已经进入一个只能用生死类比来描述的阶段。

但数据驱使我们给出一个更诚实的结论:

编辑核心判断

Agent 时代,框架工程能力的重要性,正在超过单纯的模型参数比拼。下一轮洗牌的赢家,不是跑分最高的模型,而是能把任务成本压到最低、把完成率提到最高的系统。

现在就能体验

DeepSeek V4 Flash 0731 已全面开放,登录官网即可体验新一代 Agent 任务能力。

platform.deepseek.com → 开始使用