🏆 智能体 · 横向评测

Pi Harness 搭配 DeepSeek V4 Flash 跑赢 Claude Code,66.7% 成功率登顶智能体横向测试

8 月 11 日,Composio 公布一项公开横向测试:在 30 项高难度智能体任务中,Pi Harness 调用 DeepSeek V4 Flash 以 66.7% 的成功率拿下第一,跑赢 Claude Opus 4.8-fast、Codex 等知名方案。同一个模型,仅更换 Harness,成功率便从 46.7% 跃升至 66.7%——相差整整 20 个百分点

综合公开信息整理 2026-08-12 全文约 4 分钟读完
#Pi Harness #DeepSeek V4 Flash #Agent 评测 #Harness 乘数效应
🥇 66.7% Pi Agent 成功率 · 30 项任务通过 20 项
0.028$ 每成功任务成本 · 仅为 Claude Code 的 1/7
99.93% 缓存命中率 · 10 亿 Token 仅花 2.65 美元

⚡ 30 秒速览

  • 赢了多少:Pi 以 66.7% 成功率登顶,Claude Code 为 53.3%(16/30),Oh My Pi 以 56.7% 位列第二。
  • 成本碾压:Pi 每成功任务仅 0.028 美元,Claude Code 需 0.195 美元——接近 7 倍差距。
  • 核心概念:同一 DeepSeek V4 Flash 模型,在 8 种 Harness 中成功率从 46.7% 到 66.7% 不等,差距达 20 个百分点。这就是"Harness 乘数效应"。
  • 缓存奇迹:开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash,缓存命中率 99.93%,10 亿 Token 仅花费 2.65 美元(无缓存需 132 美元)。
  • 深层信号:轻量级、默认安装的 Harness 正在超越功能堆叠的重量级方案——路径越短,犯错越少。

01横向测试 Top 6 Pi Harness 位居榜首

🥇 Pi AgentPi Harness
66.7
Oh My PiPi Harness 衍生
56.7
Claude CodeAnthropic
53.3
CodexOpenAI
53.3
Deep Agents开源
53.3
OpenCode开源
46.7

注:柱形长度按相对比例展示,榜首 Pi 为 100% 基准。测试选用同一模型 DeepSeek V4 Flash,仅更换 Harness 层,共 30 项高难度任务,自动评分器 + LLM 评审双轨打分。

02Harness 乘数效应:同一个模型,不同的命运

Composio 的测试设计非常直接:固定底层模型,只更换 Harness。结果一目了然——DeepSeek V4 Flash 在 8 种 Harness 中的成功率从 46.7% 到 66.7% 不等,差距 20 个百分点。

这意味着什么?

传统思路:孤立评测模型

只关注模型本身的智能水平,忽略外围工具链对实际表现的放大或削弱作用。

Harness 乘数效应

模型 + Harness 的综合能力才是真实生产力。选对 Harness,同一个模型可以同时变得更可靠、更高效。

30高难度任务
8参评 Harness
20pp成功率差距
1底层模型

Composio 因此强调:如果一份 Agent 排行榜只写模型名称,没有交代使用了哪套 Harness,那么这个分数就是不完整的。

成本差距同样惊人。Pi 平均完成一项成功任务仅花费 0.028 美元,而 Claude Code 需要 0.195 美元——接近前者的 7 倍。Pi 的中位完成时间为 132.2 秒,虽略慢于 Claude Code 的 122.7 秒,但综合成功率、速度与成本,它交出了这轮测试中最突出的成绩。

03它到底能做什么?三个关键场景

💰 缓存降本:10 亿 Token 仅花 2.65 美元 命中率 99.93%

  • 开发者 0xEvan 用 Pi 调用 DeepSeek V4 Flash,处理近 10 亿输入 Token,缓存命中率 99.93%。
  • 最终花费仅 2.65 美元——若无缓存,同等用量预计需 132 美元,降幅达 98%。
  • 另一开发者 Shantanu Goel 证实:DeepSeek V4 Flash 在其他 Harness 中缓存命中率通常为 94%-97%,到了 Pi 中却能持续达到 99% 以上。
关键因素:Pi 保持上下文前缀稳定,避免动态内容导致缓存失效。

⚡ 横向测试:默认安装击败重量级配置 成功率 66.7%

  • Pi 采用全新、未经修改的默认安装,仅接入测试所需的 MCP 服务器插件,无任何自定义调优。
  • 反观 Prime Agent,部分会话消耗多达 350 万 Token,进行 33 次工具调用,却因会话规模过大导致评分器超时,6 次运行未被计入成绩。
  • 即使只看有效运行,Prime 通过的任务数量与 Hermes 相当,耗时却接近 Pi 的两倍。
结论:功能堆叠不等于效果更好——每增加一层,智能体就多了一个迷路的机会。

🧪 开发者生态:第三方缓存扩展已成熟 成本降幅 98%

  • 开源项目 Reasonix 围绕 DeepSeek 前缀缓存设计终端编程 Agent,缓存命中率稳定在 99.7%-99.9%。
  • 开发者将 Reasonix 的缓存优化方法移植到 Pi 中,推出 DeepPi,在调用 DeepSeek API 时同样达到 99.7%-99.9% 命中率。
  • 扩展 pi-deepseek-cache 将输入 Token 成本从每百万 0.14 美元降至 0.003 美元,降幅 98%。
核心设计:追加而非修改——保持上下文前端稳定,将变更成本降至最低。

04为什么是 Pi 赢了?

答案并不复杂:路径越短,走错方向的机会越少。

Pi 的制胜逻辑可以拆解为一条清晰的链路:

默认安装无额外配置上下文稳定缓存高命中低成本

而重量级 Harness 的路径则是:

大量配置动态上下文缓存失效高成本低效率

Composio 测试中有一个值得注意的细节:Pi 几乎没有添加额外配置,采用的是全新、未经修改的默认安装,只接入了测试所需的 MCP 服务器插件。正是这样一套接近开箱即用的方案,最终通过了最多的任务。

这组数据呈现出一个明显的反差:功能和会话最为庞杂的 Prime,最终被自身的运行负担拖慢;更加轻量的 Pi 则以较低开销通过了最多任务。增加更多层,并没有换来更好的结果。

这也对过去"配置越多,效果越好"的思路提出了挑战。人们通常会选择最大的模型,叠加每一个插件、每一个扩展以及各种复杂的功能层,默认功能越多,智能体就越强。这项测试提供了另一种思路:选择一款速度快、成本低的模型,把它放进干净、轻量的 Harness 中,再用真实任务检验两者的组合。

0599.9% 的缓存命中率是怎么做到的?

DeepSeek API 采用前缀缓存机制:如果请求开头的 Token 序列与上一次完全相同,服务端直接从缓存读取,以远低于普通输入的价格计费。关键在于,匹配需要从第一个 Token 开始,前缀一旦变化,后面大量 Token 就会被"连坐"失效。

Pi 本身并不是专门为 DeepSeek 设计的 Harness,但它提供了足够的可编程性:开发者可以修改系统提示词、筛选对话历史、自定义上下文压缩,甚至检查和改写最终载荷。这种开放性给缓存优化留下了巨大空间。

以 Reasonix 为代表的开源项目,将缓存优化做到了极致:

优化前(无缓存)
0.14$
每百万输入 Token
优化后(pi-deepseek-cache)
0.003$
每百万输入 Token · 降幅 98%

Reasonix 的核心设计原则只有一条:保持上下文前端稳定,采用追加而非修改的方式,将变更成本降至最低。具体来说:

  • 启动时注入稳定环境摘要——而非在每轮对话中重新生成,从根源上杜绝动态内容导致的缓存失效。
  • 过时的工具输出在压缩前被截断和清理——避免二十轮前的 cat 结果一直留在提示词前缀中。
  • 执行模型与规划模型分属独立会话——避免交错放入同一上下文破坏缓存稳定性。

社区扩展 pi-deepseek-cache 进一步将这些原则落地为可复用的工具包:通过 SHA-256 哈希对前缀进行诊断,追踪前缀何时发生变化,让开发者能及时发现缓存失效的根因。

一个诚实的注脚:这些优化都是第三方通过公开 API 实现的"逆向工程"。DeepSeek 官方 Harness 团队已于 8 月 11 日完成微信公众号注册,产品内测已启动,正式发布在即。官方团队能与模型训练团队背靠背协同,实现深度整合——这是任何第三方都做不到的。

编辑核心判断

Harness 的工程能力正在超过模型参数比拼,成为智能体实际表现的决定性变量。选对工具链,比选对模型更重要——而且成本可以相差 7 倍。

现在就能用

Pi Harness 已开源,开发者可直接在 GitHub 获取并接入 DeepSeek V4 Flash 体验。DeepSeek 官方 Harness 产品内测也已启动,正式发布在即。

pi.dev → 开始使用