🔬 模型技术 · 临床 AI
GxP-Agent 用 Process-DAG 拓扑让 LLM 在临床试验编程中达到 99.2% 可靠率,超越人类专家
新框架将 LLM Agent 的任务规划显式建模为有向无环图,在 GxP 合规的临床试验编程评测中,任务完成率 99.2%,规则违规率降至 0.8%,全面超越 GPT-4 与人类编程员。
来源:arXiv 预印本•
2026-07-24•
全文约 3 分钟读完
#GxP-Agent
#Process-DAG
#临床试验编程
#LLM Agent
99.2%
任务完成率 · 590 项测试
0.8%
规则违规率 · 仅 4 项违规
+3.7%
较 GPT-4o 提升幅度
⚡ 30 秒速览
- 核心技术:将 LLM Agent 的任务执行过程显式建模为 Process-DAG,每个节点是原子操作,边是依赖关系,确保可追溯、可复现、可验证。
- 评测结果:在包含 590 个临床试验编程任务的 GxP 合规测试中,GxP-Agent 以 99.2% 的通过率大幅领先 GPT-4o(95.5%)、Claude 3.5 Sonnet(94.8%)和人类编程员(91.3%)。
- 为什么可靠:DAG 结构天然防止循环依赖和死锁,每一步都记录执行日志与输出快照,审计追踪可直接用于 GxP 合规审查。
- 实际意义:临床试验编程是 GxP 最严格的领域之一,LLM 以往的“黑箱”输出无法通过审计,GxP-Agent 首次让 AI 满足制药行业合规要求。
- 开源状态:论文已公开,完整代码及评测数据集将随正式发表释放。
01GxP 合规评测 Top 5 临床编程任务通过率排名
🥇 GxP-AgentProcess-DAG 拓扑
99.2
Claude 3.5 SonnetAnthropic
94.8
Gemini 1.5 ProGoogle
88.1
注:柱形自 85 分起缩放,非零起点;分差以标注分数为准。GxP-Agent 比第二名高 3.7 个百分点,比人类中位数高 7.9 个百分点。
02Process-DAG:让 Agent 的每一步都经得起审计
临床试验编程必须遵守 GxP(Good Practice)规范,每一步操作都需要有明确的逻辑、可追溯的输入输出。传统 LLM Agent 的“自由发挥”模式在这里行不通。
GxP-Agent 的核心创新是用有向无环图(DAG)显式定义 Agent 的执行拓扑:
传统 Agent 架构
LLM 自主决定下一步操作,可能产生循环依赖、死锁或不可解释的输出。审计人员无法确认每一步为何做出。
GxP-Agent(Process-DAG)
每个节点是原子操作(数据提取、转换、验证、写入),边定义依赖关系。LLM 只在节点内部做决策,整体流程固定且可复现。
590测试任务数
7任务大类
23原子操作类型
100%可追溯执行日志
七大任务类别:SDTM 映射、ADaM 编程、TLF 生成、数据验证、差异分析、文档生成、合规检查。每个任务输出完整的执行 DAG 快照。
更关键的是,这种架构让 LLM 的幻觉问题被有效隔离——即使节点内部 LLM 输出有误,DAG 的拓扑约束也能防止错误扩散到下游。错误被限制在单个节点内,且可以被自动检测并要求重试。
03它到底能做什么?三个真实任务
💊 SDTM 域映射:从非结构化 CRF 到标准数据集GxP 合规
- 输入:一份 PDF 格式的病例报告表(CRF)和对应的 SDTM 定义文件。
- Agent 自动识别所有变量,按 Domain → Variable → Mapping → Validation 四步 DAG 完成映射。
- 输出:完整的 SDTM 数据集及映射说明文档,附带每个变量的溯源路径。
审计追踪:所有映射决策均记录 LLM 推理理由,可逐条回溯至原始 CRF 字段。
📊 TFL 生成:由 ADaM 数据集自动生成统计图表无人工干预
- 输入:ADaM 数据集和统计分析计划(SAP)的 PDF。
- Agent 按 解析 SAP → 生成表格框架 → 计算统计量 → 绘制图表 → 验证格式 五步 DAG 执行。
- 输出:RTF 格式的表格、PNG 格式的森林图,全部符合 CDISC 标准。
测试中,该任务以 100% 通过率完成,且所有图表编号与 SAP 一致。
🔍 差异分析:两版数据集之间的自动比对全自动
- 输入:两版 SDTM 数据集(如 baseline 与 update)。
- Agent 按 变量对齐 → 逐行比对 → 差异分类 → 生成报告 四步 DAG 执行。
- 输出:差异分析报告,包含变量级差异统计、分类(新增/删除/修改/异常)和影响评估。
处理 200 变量 × 5000 条记录仅需 45 秒,人工需要 2 小时。
04为什么是 DAG 解决了「合规」难题?
临床试验编程不同于一般编程,它要求每一步操作都有完整的前置条件、后置条件和审计线索。传统 LLM 的“自由生成”模式天然无法满足 GxP 审计——因为审计人员无法接受“模型自己决定下一步做什么”作为理由。
Process-DAG 的解决方案简洁而直接:
固定拓扑→原子操作→可追溯日志→自动验证→合规输出
每一环都产生可审计的工件。GxP-Agent 的论文中展示了完整的执行 DAG 快照,包含每个节点的输入哈希、输出哈希、LLM 调用的原始 prompt 与 response 记录。审计人员可以逐节点验证。
一个诚实的注脚:这种架构并非万能——它牺牲了 Agent 的灵活性来换取可靠性。对于需要高度创造性探索的任务(如研究假设生成),DAG 的刚性可能成为限制。但在 GxP 合规场景下,这个权衡是值得的。
编辑核心判断
GxP-Agent 证明了一个关键命题:在严格合规领域,不是让 LLM 更“聪明”,而是为 LLM 戴上“拓扑的笼头”——用结构化的 DAG 约束释放安全可控的智能。