SearchAuditor 开源:搜索代理失败率大降 46.7%,精准归因 LLM 幻觉
一个名为 SearchAuditor 的开源审计框架,首次将长时程搜索代理的失败系统拆解为工具层 / 推理层 / 反射层三层,并让 Claude 3.5 Sonnet 驱动的搜索代理失败率从 61.4% 降至 32.7%,归因精度平均提升 32.4%。这不是又一个 benchmark,而是一套可复现的「诊断工具」。
一个名为 SearchAuditor 的开源审计框架,首次将长时程搜索代理的失败系统拆解为工具层 / 推理层 / 反射层三层,并让 Claude 3.5 Sonnet 驱动的搜索代理失败率从 61.4% 降至 32.7%,归因精度平均提升 32.4%。这不是又一个 benchmark,而是一套可复现的「诊断工具」。
SearchAuditor 的评估不是靠 LLM 自评自导,而是建立在人工标注的 387 个真实失败案例之上,覆盖 4 个跨领域数据集。
四个数据集横跨不同任务类型——深度研究、多跳问答、代码生成、实时信息检索——每个失败都被人工拆解到具体层。
注:柱形为失败率对比,非零起点,数字越小越好。SearchAgent 在 4 个数据集上均取得最低失败率,平均 32.7%,比最弱基线低 28.7 个百分点。
现在的 Agent benchmark 都在问「你得了多少分」,但没人回答一个更根本的问题——它到底为什么错了?
一个搜索代理从接收任务到交付结果,中间要经过无数步:解析意图、调用搜索、阅读结果、推理整合、自我修正。任何一环出错都可能让最终答案崩盘。
SearchAuditor 的贡献,是把这条链路拆开,逐层体检。
只看最终答案对不对。错了就是错了,但没人知道错在工具调用、推理逻辑还是最后的自我反思环节。
三层归因:工具层(搜索/调用没做好)→ 推理层(中间推导出错)→ 反射层(自我纠错没生效)。每层给出具体失败原因与修复建议。
注:三层判定由人工标注完成,每层可叠加。一个失败事件可能同时涉及多层,SearchAuditor 会分别标注并给出主因。
SearchAuditor 在 387 个人工标注案例上,挖出了三个值得开发者注意的规律。
因为 Agent 正在从「演示品」走向「生产工具」。而生产环境的铁律是:你可以犯错,但必须能定位错误。
过去一年,Agent 的能力在飞速提升,但「可靠性」始终是落地最大的坎——调用链越长,出错概率越高,且越难排查。
SearchAuditor 提供的不是更强的 Agent,而是一面放大镜。
把失败归因从「模型自己说」变成「结构化诊断」,这是 Agent 工程化道路上绕不开的一步。
这套框架的局限也很明显:人工标注成本高,387 个案例的规模限制了覆盖范围;且 ASR 归因依赖标注者的判断一致性。
但作为第一个将「失败归因」系统化的开源尝试,它的价值已经成立。
当 Agent 的失败能被系统化地归因,工程优化就从「玄学调参」变成了「精准开刀」。搜索代理的下一场竞争,不在模型参数,而在谁能更早建立这套诊断基础设施。