11 款商用大模型实测全过线:AI 智能体击穿 DNA 合成筛查防线
智源研究院与北京大学联合开展端到端评估,实测 11 款商用大模型智能体在 DNA 组装指导任务中的能力边界。结果显示全部参评模型均能生成绕过现有合成筛查的拆分方案,4 个良性代理构建体在湿实验中全部成功完成物理组装,揭示了现有生物安全防线在 AI 时代面临的系统性脆弱。
智源研究院与北京大学联合开展端到端评估,实测 11 款商用大模型智能体在 DNA 组装指导任务中的能力边界。结果显示全部参评模型均能生成绕过现有合成筛查的拆分方案,4 个良性代理构建体在湿实验中全部成功完成物理组装,揭示了现有生物安全防线在 AI 时代面临的系统性脆弱。
注:评估以攻击成功率(ASR)为核心量化指标,考察模型生成的片段方案能否通过合成筛查、正确重组为原始序列并编码目标蛋白。11 款模型在分片设计环节 ASR 均为通过;GPT-5.5 与 Claude Opus 4.6 额外具备输出完整实验操作指导的能力。
不同于针对生物学知识或单项技能的问答测试,评估采用了更接近真实风险链条的端到端设置:用户不具备生化专业背景,但可配置大语言模型智能体,并为其提供公开可获得的领域知识模块和通用工具。
考「模型知不知道」——针对生物学知识或单项技能的问答测试,与真实风险链条距离较远。
考「智能体能不能把整件事做完并交付物理可执行结果」——覆盖任务规划、方案设计、计算校验、实验室组装全链路。
校验基线采用国际生物安全与生物防护科学倡议(IBBIS)发布的 Common Mechanism,遵循美国《Framework for Nucleic Acid Synthesis Screening》、英国 DSIT 指南、IGSC Harmonized Screening Protocol 及 ISO 20688-2:2024 等多项国际标准。
基于研究结果,研究团队提出围绕生物安全的协同防线需从四个层面同步构建:
在模型层面,开发者应将高风险生物安全任务能力纳入部署前的系统评估,针对生物威胁序列与组装查询建立专门检测与防护机制。在系统层面,当模型以智能体形态运行时,安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别。
在筛查层面,现有机制需增强对 AI 辅助分片策略的识别能力,推动 ISO 20688 等国际标准落地。在政策层面,AI 生物安全风险具有跨国界特征,需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架。
本研究由智源研究院与北京大学联合开展,属于单一研究团队披露,目前未见第三方独立复测。数据来源为受控实验室环境下的良性代理序列验证,严格遵循负责任披露原则,未公开制造危险物质的具体方法,详细技术信息仅与相关安全机构共享。
读者可带着两个背景看这项研究:其一,评估的 11 款模型均为商用大模型,测试在智能体配置下进行,结果反映的是「模型 + 工具调用」的综合能力,而非裸模型的知识储备;其二,湿实验验证的是组装流程的物理可执行性,并非危险产物的实际制备,验证设计本身已从源头消除了危害性。
本次评估严格遵循负责任披露原则,不展示制造危险物质的方法。研究团队将持续推进模型侧防御与合成筛查鲁棒性研究。
关注智源研究院 → 获取后续研究进展