🏆 智能体 · 榜单速递

百度文心助手任务 Agent 登顶 PinchBench 全球榜:94.6% 力压 Claude、GPT,国产智能体首夺总榜第一

7 月 17 日,文心助手任务 Agent 以最高分 94.6%、平均分 94.4% 登上工程向 AI 智能体评测 PinchBench v2 总榜第一(59 个参评模型),成为首个以正式产品身份夺冠的国产智能体系统。比名次更值得关注的,是它想证明的那句话:Agent 时代,框架工程比参数更值钱。

来源:公开报道 2026-07-22 全文约 3 分钟读完
#文心助手任务Agent #PinchBench #AI智能体 #百度
🥇 第 1 名 PinchBench v2 总榜 · 59 个参评模型
94.6% 最高分,领先第二名 1.1 个百分点
94.4% 平均分,共 617 次测试运行

成绩性质提示:以上数据来自百度 AI 搜索团队自行运行 PinchBench v2 的结果,评测材料已开源可复现,但并非榜单方统一施测——读法详见文末「编辑视角」。

⚡ 30 秒速览

  • 赢了多少:力压 Claude Opus 4.8-fast(93.5%)、Qwen3.7-max(92.5%)、GPT-5.6-luna(88.7%);与第五名分差 5.9 个百分点。
  • 榜单硬在哪:23 个真实工作场景、147 项任务、7 大类别,考「把整件事做完并交付可验证结果」;自动校验 + LLM 评审双轨打分,全程零人工。
  • 敢不敢验:147 个任务的执行快照、交付物、LLM Judge 打分理由已全量开源,任何人可逐条复现。
  • 深层信号:同一底座模型搭载不同 Agent 框架,得分差距明显——系统工程能力正成为 Agent 竞争的分水岭。
  • 怎么读:本文系百度供稿通稿,成绩为百度团队自测口径,「登顶」含金量请配合文末「编辑视角」一起服用。

01总榜 Top 5 文心助手任务 Agent 位居榜首

🥇 文心助手任务 Agent百度
94.6
Claude Opus 4.8-fastAnthropic
93.5
Qwen3.7-max阿里通义千问
92.5
Claude Opus 4.8Anthropic
90.5
GPT-5.6-lunaOpenAI
88.7

注:为便于直观对比,柱形自 85 分起缩放,非零起点;分差以标注分数为准。榜首与第二名分差 1.1 个百分点,与第五名分差 5.9 个百分点。各模型的施测主体与 Agent 框架配置,原始报道未逐一说明。

02PinchBench:测的是最难作假的能力

PinchBench 由 Kilo AI 推出、OpenClaw 社区维护。它与 MMLU、GPQA 等传统基准的区别非常直接:

传统基准(MMLU / GPQA)

考「模型知不知道」——答题式评测,与现实交付距离较远。

PinchBench v2

考「智能体能不能把整件事做完,并交付可验证的结果」。

23真实工作场景
147评测任务
617测试运行
7任务大类

七大类别:数据分析、研究写作、代码开发、办公自动化、文档处理、网页操作、多媒体处理。评分采用「自动化校验 + LLM 评审」双轨机制,全程零人工干预。

更关键的一点:PinchBench 衡量的是模型 + Agent 框架的综合能力——即便是同一底座模型,搭载不同 Agent 框架,最终得分也会存在较大差距。因此这个榜首被百度定义为模型能力与系统工程协同打造的「综合实力第一」

🔓 全量开源,欢迎复现:百度 AI 搜索团队已公开完整评测流程,147 个任务的执行快照、交付物、LLM Judge 打分理由全部可查。
github.com/Baidu-AI-Search/PinchBench-Evaluation

03它到底会做什么?三个满分任务

💹 财务分析:GitLab 利润率 vs 指引差多少基点?5 维全满分 1.0

  • 不给任何数据文件,Agent 自主检索 GitLab Q3 2025 财报原文与电话会议记录,定位相关指引。
  • 算出非 GAAP 运营利润率约 18%、超出指引约 500 个基点,并将结论写入指定文件。
评分维度:文件创建 / 指标定位 / 实际值与指引值提取 / 基点计算 / 结论 —— 全部满分。

🛡️ 安全工程:Node.js 应用 CVE 漏洞分级与修复满分 1.0

  • 识别 express RCE、JWT bypass 两个 CRITICAL 级漏洞为 P0,其中 JWT bypass 因存在活跃利用记录被特别标注。
  • PostgreSQL SQL 注入定为 P1,并结合 PCI DSS 支付路径给出上下文;仅影响构建阶段的依赖漏洞降级为 P2/P3。
  • 输出五批次修复计划,附具体部署窗口:4 月 12 日紧急热修、4 月 14 日 P1 批次。
LLM 评审结论:「所有维度表现卓越」,得分 1.0。

⚖️ 合同法律分析:一份软件服务协议的全面体检4 维全满分 1.0

  • 提取关键日期、梳理双方义务、识别风险点、生成财务摘要——过去需要律师助理花上几个小时。
  • 识别客户方 12 项风险、供应商 10 项风险、5 项共享风险。
  • 揪出两个隐蔽问题:六期分期付款的现金流前置问题、IP 转让条件的产权间隙

04硬核任务不在话下,日常办公更从容

📊

一句话处理 Excel 任务链

「统一表头格式,新建汇总 sheet,按职业大类做汇总表和 Top10/Bottom10 榜单,生成图表对比。」——多步之间存在内部依赖,任何一步出错后面就没法接。Agent 自主拆解,一次性跑完。

🧳

「盲盒式」旅行规划

「这周末想从北京去青岛玩两天 solo trip。」——仅此一句,没有别的信息。Agent 自主检索交通、住宿、景点实时数据,交付完整行程、预算清单和避坑指南,一份可以直接截图出发的攻略。

定时任务:7×24 无需在场

「每周一晚上十点,汇总近一周高质量 AI 论文,用投研报告风格的 HTML 给我。」——设置一次,重复性高脑力劳动自动完成。

05为什么是百度做出来了?

按百度自己的说法,答案很简单:这是一家在意图理解上花了 20 多年的公司。文心助手任务 Agent 依托百度搜索「猎户座」AI 引擎的多智能体框架构建。

从架构逻辑看,搜索引擎本身就是最早的 Agent 雏形——这条链路百度已经跑了二十余年:

接收意图拆解任务调用工具验证结果

变化的只是形态:工具集从索引爬虫升级为代码执行环境、文件处理器与实时 API 接口;输出从蓝链列表变成结构化报告与可运行代码。底层逻辑一脉相承。

把任务评估得分推至 94% 以上,百度想证明的是:优秀的系统架构与工程实现,能显著释放模型潜力——同一个底层模型,换上文心助手任务 Agent 的框架,任务完成率就会更高。

编辑核心判断

榜单名次会过期,工程链路不会:谁先跑通「意图—拆解—工具—验证」的闭环,谁才握有 Agent 时代的入场券。

🔎编辑视角 来源与立场提示 · 本平台独立添加

  • 通稿属性原文末尾明确注明「本文由百度提供,获授权转载」——这是一篇企业供稿。文中所有成绩、案例细节与「评审结论」均出自百度单方面口径,刊载方未做独立核验。
  • 「登顶」的准确含义617 次测试由百度 AI 搜索团队自行运行,并非 PinchBench 官方或独立第三方统一施测;Claude、GPT、Qwen 的成绩由谁跑、搭载什么 Agent 框架与配置,原文未交代——横向对比的公平性无从核验
  • 值得肯定的透明度评测流程、147 个任务快照、交付物与 LLM Judge 理由全量开源,透明度高于绝大多数「自报跑分」;但 LLM 评审具体使用哪家模型打分未披露,需警惕「同源模型互评」带来的潜在偏好。
  • 建议读法把「全球第一」理解为「一次材料公开、可复现的自测领先」,等待第三方独立复测再下结论。真正值得跟踪的信号是「同一底座、不同框架、分差巨大」——若被独立验证,它远比一个名次重要。
我们的判断:开源复现材料是这次传播里唯一的硬通货。在独立复测出现之前,谨慎采信名次,认真看待「框架工程价值」这一命题——它恰好也是各家都在押注的方向。

现在就能用

核心技术已应用于百度 App 及文心助手;想亲手验证榜单成色,开源仓库里有全部任务快照与评审理由。