🔐 多智能体 · 安全研究

多智能体安全研究获千万美元资助,DeepMind 联合四家机构全球征集方案

Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 与 Google.org,宣布投入最高 1000 万美元 资助全球多智能体安全研究,聚焦大规模 AI 系统交互时的集体行为与风险管理,申请截止 2026 年 8 月 8 日

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#多智能体安全 #DeepMind #研究资助 #AI Agent
💵 1000 万 最高资助总额 · 美元
4 家 联合发起机构
4 个 优先研究方向
08.08 申请截止日期

⚡ 30 秒速览

  • 资助规模:最高 1000 万美元,面向全球学术与独立研究者,单笔资助额度未设上限。
  • 核心问题:多智能体系统交互时可能产生不可预测的"涌现行为",现有安全评估工具——只评估单模型——完全无法应对。
  • 研究基础:DeepMind 2025 年已建立交互框架,近期发现"AI Agent Traps"对抗环境中的脆弱性。
  • 申请时间:2026 年 8 月 8 日截止,获奖者将于 2026 年秋季公布。
  • 合作机构:Schmidt Sciences、ARIA、Cooperative AI Foundation 联合支持,Google.org 提供资助。

01资助计划 当安全研究从"单机"走向"网络"

过去十年,AI 安全研究几乎全部围绕单个模型展开:它是否诚实?是否鲁棒?会不会产生有害输出?但很快,数百万个由不同组织构建的 AI 智能体将在数字环境中相互通信、协商和交易——安全问题的性质彻底变了。

一个诚实的注脚:

单智能体安全已经很难,多智能体安全是更难的问题。但正因为难,才需要从现在开始投入。

传统安全范式

评估单个模型在隔离环境中的行为,关注输出合规与对抗攻击。

多智能体安全范式

研究群体交互中的涌现行为、系统级风险与跨网络协调失败。

1000 万美元资助总额
4联合发起方
4优先研究领域
1全球征集网络

资助计划由 Google DeepMind 主导,Schmidt Sciences 的"Science of Trustworthy AI"项目、ARIA 的"Scaling Trust"项目共同支撑,Google.org 提供资金支持。

这项计划的核心目标很明确:在大规模多智能体系统成为现实之前,建立预测、测量和监控群体行为的安全框架。正如 DeepMind 在 2025 年研究中论证的:交互中的自主智能体可以产生复杂且难以预料的"涌现"行为——可能引发不可控的经济活动波动,也可能带来全新的安全挑战。

02为什么是现在?工具缺位,风险先行

目前,绝大多数安全评估工具只分析孤立模型。但多智能体系统的风险恰恰来自"之间"——当独立系统跨网络交互时,新的集体行为可能突然涌现,而现有工具完全无法预测。

一个场景:

两个不同的金融交易智能体,各自经过安全训练,但相遇后却产生了意想不到的竞相抛售循环——这不是故障,而是涌现。

DeepMind 2025 年的研究已经建立了理解多智能体交互的基础框架,而近期关于 "AI Agent Traps" 的工作更进一步揭示了智能体在对抗环境中的脆弱性。但框架只是起点,大规模的系统性研究才刚刚开始。

单智能体安全交互安全群体涌现系统级风险

多智能体安全的研究链条:从个体到群体,风险维度逐层升级。

资助计划的核心判断是:没有单个实验室能独自解决多智能体安全问题。需要全球学术与独立研究社区共同参与,才能建立透明、健壮的安全标准。

03四个优先领域 从理解到治理

资助计划面向全球研究者征集提案,重点关注四个方向。它们覆盖了从"理解群体行为"到"设计治理机制"的完整链条:

🧠 涌现行为建模与预测 基础理论

  • 开发能够预测大规模多智能体系统涌现行为的理论框架与仿真工具。
  • 识别从"量变到质变"的临界点——何时系统行为从可控变为不可控。
2005 年诺奖得主 Thomas Schelling 的隔离模型早已证明,微观个体偏好可以导致宏观涌现。AI 多智能体系统的涌现更复杂、更快速、更难逆转。

🛡️ 对抗环境下的鲁棒性 安全工程

  • 研究智能体在对抗性环境中的脆弱性——"AI Agent Traps"只是冰山一角。
  • 设计防御机制,防止恶意智能体通过交互操纵、欺骗或攻击其他智能体。
当数百万智能体同时在线,传统"打补丁"式的安全更新将彻底失效。需要架构级的内生安全设计。

📊 系统级监控与评估 工具链

  • 构建能够实时监测多智能体系统集体行为的评估框架与指标。
  • 开发可扩展的"系统级安全仪表盘",替代目前只评估单模型的测试方法。
"你不能管理你无法测量的东西。"——多智能体安全的首要挑战是测量本身。

⚖️ 协调机制与治理框架 制度设计

  • 设计跨组织、跨网络的协调协议与安全标准,确保不同来源的智能体可安全共存。
  • 探索经济激励与惩罚机制,促进"好"的集体行为,抑制"坏"的涌现。
技术问题最终会落到制度问题。多智能体安全的终极答案可能不是更聪明的算法,而是更聪明的规则。

04为什么这件事值得关注

多智能体安全不是"未来问题",而是"正在发生的未来问题"。当 GPT、Claude、文心助手等系统开始以 Agent 形态执行真实任务,它们之间的交互就不再是实验室里的理论推演——而是每天正在发生的现实。

但这里有一个值得警惕的张力:

资助安全研究的机构,往往也是推进多智能体能力最激进的机构。这既是好事——他们最懂风险;也是隐患——安全研究是否能真正独立于商业利益?

编辑核心判断

多智能体安全研究缺的不是资金,而是"可操作的安全框架"。1000 万美元能买来论文,但买不来共识。真正的考验在于:这些研究成果能否被转化为跨组织、跨模型、跨生态的通用安全协议——而不是停留在每个实验室各自的象牙塔里。

如何申请

资助计划面向全球学术与独立研究者开放,申请截止日期为 2026 年 8 月 8 日,获奖者将于 2026 年秋季公布。
详细信息可通过研究资助申请门户提交提案。

前往申请门户