🛡️ 安全审计 · 技术突破

AI Agent 安全审计技术突破:SkillTrace 将溯源准确率提升至 95%,效率提升 100 倍

一项名为 SkillTrace 的新型安全审计框架,首次实现对 LLM Agent 技能复用场景的端到端溯源审计,将审计置信度从行业平均 45% 提升至 95%,审计效率提升 100 倍,为 AI 安全治理提供可落地的技术方案。

综合公开信息整理 2026-07-23 全文约 3 分钟读完
#SkillTrace #AI Agent 安全 #溯源审计 #多跳追踪
95% 审计溯源准确率
100× 审计效率提升
45% 传统方法审计置信度基准

⚡ 30 秒速览

  • 核心突破:SkillTrace 首次实现多跳技能复用场景的 AB 图溯源审计,可追溯一条生成结果背后涉及的所有技能及中间产物。
  • 评测结果:在 4 个训练集、4000+ 生成项的测试中,平均 Recovery Rate 达 97.5%,Fidelity 达 95.2%,远超传统方法。
  • 开源与复现:完整框架已开源,包含 4 个全新训练集(含数学、法律、医学、代码领域),支持社区复现与扩展。
  • 深层信号:AI Agent 安全审计从"事后追责"走向"过程可审计",为合规与安全治理提供工程化基础。
  • 一句话总结:传统的"黑盒审计"正在被"白盒追踪"取代。

01为什么需要 SkillTrace?传统审计的困境

当 LLM Agent 调用多个技能(Skill)协同完成任务时,审计者几乎无法确认最终输出来自哪个技能的哪一步——典型的"黑盒"困境。

传统方法要么依赖人工追溯(耗时且不可靠),要么只能做简单的输出级分析。面对多跳技能复用场景,平均审计置信度仅为 45%

一个诚实的注脚:

这不是"要不要审计"的问题,而是"能不能审计"的问题。当 Agent 在金融、医疗、法律等场景中自主决策,审计能力直接决定了部署边界

传统审计方法

依赖人工或简单输出级分析,多跳溯源几乎不可行,审计置信度低。

SkillTrace 方案

通过 AB 图自动追踪每一条生成路径,实现端到端多跳溯源,审计置信度提升至 95%。

02SkillTrace 如何工作?一条"白盒追踪链"

SkillTrace 的核心思路是:将审计从"结果检查"转变为"过程追踪"。它通过维护一个完整的 AB 图(Auditability Bank),记录每个技能调用的输入、输出、依赖关系与中间产物。

当审计者需要追溯一条生成结果时,SkillTrace 可以:

定位来源技能追踪中间产物验证数据完整性

整个过程完全自动化,不需要人工介入。更重要的是,它不依赖对底层模型的内部访问——仅通过 API 级别的交互日志即可完成

97.5%Recovery Rate
95.2%Fidelity
4训练集领域
4000+测试生成项

注:以上为 SkillTrace 在 4 个训练集(数学、法律、医学、代码)上的平均评测结果。Recovery Rate 衡量审计能否完整恢复生成路径,Fidelity 衡量恢复路径的准确性。

相比之下,传统方法在相同测试集上的 Recovery Rate 平均不足 60%,Fidelity 低于 50%。

03它如何工作?三个典型场景的审计结果

📐 数学推导:多步公式的溯源审计Recovery 99.2%

  • Agent 调用"微积分规则"技能完成积分推导,再调用"代数化简"技能做结果整理。
  • SkillTrace 完整追踪到:积分结果来自技能 A 的第 3 步输出,化简操作来自技能 B 的输入预处理。
  • 审计结论:推导过程完整、无中间产物丢失
相比传统方法,SkillTrace 首次实现了对"多个技能间数据流动"的完整审计,而非仅检查最终答案。

⚖️ 法律分析:合同条款的引用审计Fidelity 96.8%

  • Agent 调用"法律条款检索"技能定位相关法条,再调用"合同分析"技能生成风险评估。
  • SkillTrace 追踪到:风险评估中的"隐蔽风险"项,引用了来自技能 A 检索到的第 3 条法条,以及技能 B 对合同第 7.2 节的解析。
  • 审计结论:引用来源可精确到具体条款与段落
法律场景对审计精度要求极高,传统方法因无法区分"直接引用"与"间接推断"而几乎不可用。

💊 医学诊断:多模态数据的交叉审计综合评分 94.1%

  • Agent 调用"影像分析"技能处理 CT 图像,再调用"临床指南"技能匹配治疗方案。
  • SkillTrace 追踪到:影像分析结果中的"异常区域"被下游技能正确引用,但治疗方案中的"用药剂量"存在一个引用偏差。
  • 审计结论:发现了传统方法无法捕捉的"数据传递误差"
医学场景中,审计不仅是合规要求,更是生命安全线。SkillTrace 在测试中成功识别出 3 例传统方法漏检的引用错误。

04为什么 SkillTrace 能突破?

答案很直接:它将审计问题转化为"图追踪"问题,而非传统的"输出比对"问题。

传统方法试图通过比对输入与输出之间的统计关系来推断中间过程,这本质上是一种"盲人摸象"——在技能复用场景下,统计关系会被严重干扰。

而 SkillTrace 通过构建 AB 图,记录每个技能调用的"输入-输出-依赖"三元组,让审计变成了一次有向图的路径搜索

一个关键的工程细节:

SkillTrace 不需要对 LLM 或 Agent 框架做任何侵入式修改,仅在 API 调用层增加一个审计日志记录器。这意味着它可以无缝适配现有的任何 Agent 系统。

编辑核心判断

AI Agent 安全审计的瓶颈从来不是技术,而是"可审计性"的设计缺失。SkillTrace 证明了:只要在系统架构层面提前设计审计接口,白盒追踪完全可以替代黑盒猜测。

开源与复现

SkillTrace 完整框架已在 GitHub 开源,包含 4 个全新训练集(数学、法律、医学、代码),支持社区复现与扩展。

GitHub 仓库