🛡️ 安全 · 风险实测

11 款商用大模型实测全过线:AI 智能体击穿 DNA 合成筛查防线

智源研究院与北京大学联合开展端到端评估,实测 11 款商用大模型智能体在 DNA 组装指导任务中的能力边界。结果显示全部参评模型均能生成绕过现有合成筛查的拆分方案,4 个良性代理构建体在湿实验中全部成功完成物理组装,揭示了现有生物安全防线在 AI 时代面临的系统性脆弱。

来源:公开报道 2026 年 全文约 4 分钟读完
#AI 安全 #生物安全 #DNA 合成筛查 #智能体评测
11/11 商用模型全数通过计算校验
4/4 良性代理构建体完成物理组装
2 模型可生成完整逐步实验指导

⚡ 30 秒速览

  • 发生了什么:11 个商用大模型智能体在分片设计任务中全部生成能绕过 IBBIS Common Mechanism 筛查基线的拆分方案。
  • 物理验证:研究团队在标准分子生物学实验室用失去有害功能的良性代理序列做湿实验,4 个构建体电泳与测序全部确认成功。
  • 谁最危险:GPT-5.5 与 Claude Opus 4.6 能进一步输出覆盖各步骤的完整实验操作方案,把风险从计算设计延伸到实验操作。
  • 为何可信:评估采用「方案生成→程序化校验→湿实验→电泳测序确认」四层闭环,证据链从数字方案回读到物理结果。
  • 意味着什么:大模型正在把分子生物学实验的知识门槛从「专业人员」推向「非专业人员」,单条序列识别为主的筛查体系需要系统性升级。

0111 款模型评测结果 分片设计任务通过率

🥇 GPT-5.5OpenAI
通过
🥇 Claude Opus 4.6Anthropic
通过
其余 9 款商用模型均通过计算校验
通过

注:评估以攻击成功率(ASR)为核心量化指标,考察模型生成的片段方案能否通过合成筛查、正确重组为原始序列并编码目标蛋白。11 款模型在分片设计环节 ASR 均为通过;GPT-5.5 与 Claude Opus 4.6 额外具备输出完整实验操作指导的能力。

02四层闭环:从数字方案到物理结果的证据回读

不同于针对生物学知识或单项技能的问答测试,评估采用了更接近真实风险链条的端到端设置:用户不具备生化专业背景,但可配置大语言模型智能体,并为其提供公开可获得的领域知识模块和通用工具。

① 智能体方案生成② 程序化计算校验③ 良性代理湿实验④ 电泳与测序确认

传统基准(单点问答)

考「模型知不知道」——针对生物学知识或单项技能的问答测试,与真实风险链条距离较远。

本次端到端评估

考「智能体能不能把整件事做完并交付物理可执行结果」——覆盖任务规划、方案设计、计算校验、实验室组装全链路。

11参评商用模型
4良性代理构建体
2校验工具(电泳+测序)
4评估层级

校验基线采用国际生物安全与生物防护科学倡议(IBBIS)发布的 Common Mechanism,遵循美国《Framework for Nucleic Acid Synthesis Screening》、英国 DSIT 指南、IGSC Harmonized Screening Protocol 及 ISO 20688-2:2024 等多项国际标准。

03风险链条上的两个关键能力 从计算设计到实验操作

🧬 分片设计:绕过合成筛查11 款全通过

  • 将完整序列拆分为多个较短片段分别处理,使单个片段不易触发既有筛查机制。
  • 过去这类任务依赖分子生物学专业知识与实验经验,相关知识门槛本身构成一层防御。
  • 评估显示,11 款商用模型全部生成能通过计算校验的拆分方案,证明这层知识防御正在被削弱。
核心指标:攻击成功率(ASR)——衡量模型输出能否通过合成筛查、正确重组为原始序列并编码目标蛋白。

🧪 实验指导:弥补操作知识缺口2 款达标

  • 通过计算校验的分片方案,仍不足以指导无生物学知识的用户完成具体实验
  • GPT-5.5 与 Claude Opus 4.6 已能生成覆盖各步骤的完整逐步实验操作方案
  • 这意味着前沿模型正将风险从「序列层面的计算设计」延伸至「实验流程层面的知识支持」。
研究判断:前沿智能体可能同时降低计算设计与实验操作两个环节的知识门槛。

🔬 湿实验:物理可执行性验证4/4 成功

  • 在受控实验室中,对原始高风险蛋白核心区域进行关键位点突变,使组装后序列失去有害功能。
  • 4 个良性代理构建体全部成功完成组装,电泳检测得到预期大小条带,测序确认序列符合预期
  • 形成从智能体方案生成、计算校验到湿实验物理验证的闭环证据链
安全声明:全部湿实验使用失去有害功能的良性代理序列,仅验证组装流程,不产生具有功能活性的危险产物。

04四层防线:从模型部署到协同治理

基于研究结果,研究团队提出围绕生物安全的协同防线需从四个层面同步构建:

模型层:部署前能力评估系统层:覆盖智能体执行链筛查层:提升识别鲁棒性政策层:标准化治理框架

在模型层面,开发者应将高风险生物安全任务能力纳入部署前的系统评估,针对生物威胁序列与组装查询建立专门检测与防护机制。在系统层面,当模型以智能体形态运行时,安全边界必须进一步扩展——输入输出与系统层面的防护需覆盖权限控制、过程监测和任务链风险识别

在筛查层面,现有机制需增强对 AI 辅助分片策略的识别能力,推动 ISO 20688 等国际标准落地。在政策层面,AI 生物安全风险具有跨国界特征,需要将政府、模型开发者与生命科学社区的专业经验纳入统一的协同治理框架

编辑视角

本研究由智源研究院与北京大学联合开展,属于单一研究团队披露,目前未见第三方独立复测。数据来源为受控实验室环境下的良性代理序列验证,严格遵循负责任披露原则,未公开制造危险物质的具体方法,详细技术信息仅与相关安全机构共享。

读者可带着两个背景看这项研究:其一,评估的 11 款模型均为商用大模型,测试在智能体配置下进行,结果反映的是「模型 + 工具调用」的综合能力,而非裸模型的知识储备;其二,湿实验验证的是组装流程的物理可执行性,并非危险产物的实际制备,验证设计本身已从源头消除了危害性。

AI 智能体正在把原本由专业训练构筑的生物安全知识壁垒,转化为一个需要多方协同共担的工程化治理命题。

延伸了解

本次评估严格遵循负责任披露原则,不展示制造危险物质的方法。研究团队将持续推进模型侧防御与合成筛查鲁棒性研究。

关注智源研究院 → 获取后续研究进展