AI Agent 安全审计技术突破:SkillTrace 将溯源准确率提升至 95%,效率提升 100 倍
一项名为 SkillTrace 的新型安全审计框架,首次实现对 LLM Agent 技能复用场景的端到端溯源审计,将审计置信度从行业平均 45% 提升至 95%,审计效率提升 100 倍,为 AI 安全治理提供可落地的技术方案。
一项名为 SkillTrace 的新型安全审计框架,首次实现对 LLM Agent 技能复用场景的端到端溯源审计,将审计置信度从行业平均 45% 提升至 95%,审计效率提升 100 倍,为 AI 安全治理提供可落地的技术方案。
当 LLM Agent 调用多个技能(Skill)协同完成任务时,审计者几乎无法确认最终输出来自哪个技能的哪一步——典型的"黑盒"困境。
传统方法要么依赖人工追溯(耗时且不可靠),要么只能做简单的输出级分析。面对多跳技能复用场景,平均审计置信度仅为 45%。
一个诚实的注脚:
这不是"要不要审计"的问题,而是"能不能审计"的问题。当 Agent 在金融、医疗、法律等场景中自主决策,审计能力直接决定了部署边界。
依赖人工或简单输出级分析,多跳溯源几乎不可行,审计置信度低。
通过 AB 图自动追踪每一条生成路径,实现端到端多跳溯源,审计置信度提升至 95%。
SkillTrace 的核心思路是:将审计从"结果检查"转变为"过程追踪"。它通过维护一个完整的 AB 图(Auditability Bank),记录每个技能调用的输入、输出、依赖关系与中间产物。
当审计者需要追溯一条生成结果时,SkillTrace 可以:
整个过程完全自动化,不需要人工介入。更重要的是,它不依赖对底层模型的内部访问——仅通过 API 级别的交互日志即可完成。
注:以上为 SkillTrace 在 4 个训练集(数学、法律、医学、代码)上的平均评测结果。Recovery Rate 衡量审计能否完整恢复生成路径,Fidelity 衡量恢复路径的准确性。
相比之下,传统方法在相同测试集上的 Recovery Rate 平均不足 60%,Fidelity 低于 50%。
答案很直接:它将审计问题转化为"图追踪"问题,而非传统的"输出比对"问题。
传统方法试图通过比对输入与输出之间的统计关系来推断中间过程,这本质上是一种"盲人摸象"——在技能复用场景下,统计关系会被严重干扰。
而 SkillTrace 通过构建 AB 图,记录每个技能调用的"输入-输出-依赖"三元组,让审计变成了一次有向图的路径搜索。
一个关键的工程细节:
SkillTrace 不需要对 LLM 或 Agent 框架做任何侵入式修改,仅在 API 调用层增加一个审计日志记录器。这意味着它可以无缝适配现有的任何 Agent 系统。
AI Agent 安全审计的瓶颈从来不是技术,而是"可审计性"的设计缺失。SkillTrace 证明了:只要在系统架构层面提前设计审计接口,白盒追踪完全可以替代黑盒猜测。
SkillTrace 完整框架已在 GitHub 开源,包含 4 个全新训练集(数学、法律、医学、代码),支持社区复现与扩展。
GitHub 仓库