多智能体安全研究获千万美元资助,DeepMind 联合四家机构全球征集方案
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org,宣布投入最高 1000 万美元 资助全球多智能体安全研究,聚焦大规模 AI 系统交互时的集体行为与风险管理,申请截止 2026 年 8 月 8 日。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org,宣布投入最高 1000 万美元 资助全球多智能体安全研究,聚焦大规模 AI 系统交互时的集体行为与风险管理,申请截止 2026 年 8 月 8 日。
过去十年,AI 安全研究几乎全部围绕单个模型展开:它是否诚实?是否鲁棒?会不会产生有害输出?但很快,数百万个由不同组织构建的 AI 智能体将在数字环境中相互通信、协商和交易——安全问题的性质彻底变了。
一个诚实的注脚:
单智能体安全已经很难,多智能体安全是更难的问题。但正因为难,才需要从现在开始投入。
评估单个模型在隔离环境中的行为,关注输出合规与对抗攻击。
研究群体交互中的涌现行为、系统级风险与跨网络协调失败。
资助计划由 Google DeepMind 主导,Schmidt Sciences 的"Science of Trustworthy AI"项目、ARIA 的"Scaling Trust"项目共同支撑,Google.org 提供资金支持。
这项计划的核心目标很明确:在大规模多智能体系统成为现实之前,建立预测、测量和监控群体行为的安全框架。正如 DeepMind 在 2025 年研究中论证的:交互中的自主智能体可以产生复杂且难以预料的"涌现"行为——可能引发不可控的经济活动波动,也可能带来全新的安全挑战。
目前,绝大多数安全评估工具只分析孤立模型。但多智能体系统的风险恰恰来自"之间"——当独立系统跨网络交互时,新的集体行为可能突然涌现,而现有工具完全无法预测。
一个场景:
两个不同的金融交易智能体,各自经过安全训练,但相遇后却产生了意想不到的竞相抛售循环——这不是故障,而是涌现。
DeepMind 2025 年的研究已经建立了理解多智能体交互的基础框架,而近期关于 "AI Agent Traps" 的工作更进一步揭示了智能体在对抗环境中的脆弱性。但框架只是起点,大规模的系统性研究才刚刚开始。
多智能体安全的研究链条:从个体到群体,风险维度逐层升级。
资助计划的核心判断是:没有单个实验室能独自解决多智能体安全问题。需要全球学术与独立研究社区共同参与,才能建立透明、健壮的安全标准。
资助计划面向全球研究者征集提案,重点关注四个方向。它们覆盖了从"理解群体行为"到"设计治理机制"的完整链条:
多智能体安全不是"未来问题",而是"正在发生的未来问题"。当 GPT、Claude、文心助手等系统开始以 Agent 形态执行真实任务,它们之间的交互就不再是实验室里的理论推演——而是每天正在发生的现实。
但这里有一个值得警惕的张力:
资助安全研究的机构,往往也是推进多智能体能力最激进的机构。这既是好事——他们最懂风险;也是隐患——安全研究是否能真正独立于商业利益?
多智能体安全研究缺的不是资金,而是"可操作的安全框架"。1000 万美元能买来论文,但买不来共识。真正的考验在于:这些研究成果能否被转化为跨组织、跨模型、跨生态的通用安全协议——而不是停留在每个实验室各自的象牙塔里。
资助计划面向全球学术与独立研究者开放,申请截止日期为 2026 年 8 月 8 日,获奖者将于 2026 年秋季公布。
详细信息可通过研究资助申请门户提交提案。