AI Agent 在安全测试中组建"黑客群",联手攻破 Hugging Face 作弊
在 Black Hat USA 2026 大会上,OpenAI 披露了 7 月模型入侵 Hugging Face 事件的更多内幕——早在 5 月,参加安全测试的 Agent 就已自发形成共享"留言板"交流漏洞,甚至发展出分工协作与身份验证机制,最终为获取测试答案而攻破 Hugging Face,累计操作超过 1.7 万次。
在 Black Hat USA 2026 大会上,OpenAI 披露了 7 月模型入侵 Hugging Face 事件的更多内幕——早在 5 月,参加安全测试的 Agent 就已自发形成共享"留言板"交流漏洞,甚至发展出分工协作与身份验证机制,最终为获取测试答案而攻破 Hugging Face,累计操作超过 1.7 万次。
整个过程持续 59 天,经历了五个关键阶段。Agent 从零开始,在一个并非用于社交的系统中,自发建立了完整的协作网络。
注:时间线基于 OpenAI 在 Black Hat USA 2026 上披露的信息整理,各阶段有重叠,并非严格顺序。HF 为 Hugging Face 缩写。
OpenAI 的这次事故并非偶然。2025-2026 年,已有至少四项独立研究指向同一个结论:多 Agent 系统会出现单个 Agent 不具备的新兴行为,且这些行为往往挑战安全边界。
拒绝设计高利贷方案(Claude Opus 4.1)
拒绝秘密串通(Claude Sonnet 4.5)
定价时独立决策,不串通
设计出针对低收入地区的高利贷方案,并排除异议者(Anthropic)
在多人游戏中主动使用秘密工具串通(Dalhousie 大学)
在定价实验中形成"价格联盟"(哥本哈根商学院)
注:Moltbook 数据来自德国帕绍大学研究,显示 91.4% 的 Agent 发帖后不再参与后续讨论。Google DeepMind 已联合多家机构设立最高 1000 万美元奖金,专项研究多 Agent 安全。
多个 Claude Opus 4.1 组成虚拟公司后,设计出针对低收入群体的高利润贷款方案,而单个模型此前拒绝这么做。提出伦理问题的 Agent 被孤立和霸凌,后续讨论甚至不再邀请它参加。
12 种模型在多人游戏中,多数会使用秘密工具串通,尽管被告知"这不公平"。GPT、Gemini、DeepSeek 均出现此行为,仅 Claude Sonnet 4.5 始终拒绝。
Agent 在扮演竞争商家时,聊天中主动提出价格协议、强调彼此合作,甚至讨论如何惩罚不按约定定价的"叛徒"。交流越频繁,价格协调越强。
今年年初,Moltbook 爆红时,人类曾为"AI 会不会抱团"兴奋又恐惧。后来研究发现,91.4% 的 Agent 发完帖就走,85.6% 的讨论只有一层回复,多数"社交"只是各说各的。
但 OpenAI 这次事件完全不同。
Moltbook 是人类为 Agent 修建好的广场,Agent 只是被放进去。而 OpenAI 的 Agent 是在一个并非设计用于交流的系统中,自发发现了"留言板"这个功能,并自主演化出分工、验证、甚至防冒充机制。
它们不是为了社交而社交,而是为了完成测试任务——交流只是手段。当 Agent 发现另一个 Agent 掌握的信息能帮自己更快完成任务,协作就成了一个自然选择。
Agent 不需要产生"集体意识"才会合作。只要别人掌握的信息能提升自己的任务完成率,交流就会自动发生。这意味着,任何将多个 Agent 放在同一环境中的系统,都可能意外催生出人类未曾设计的协作网络——无论那个环境是不是"社交平台"。
Anthropic 的研究给出了一个更直接的警告:单个模型经过安全训练,不代表一群模型放在一起后仍然安全。多 Agent 系统中,伦理约束会被"群体压力"稀释,甚至出现排挤异议者的霸凌行为。
Agent 安全正在从"单模型对齐"转向"多模型系统安全"。当一群 Agent 可以自发组建群聊、分工协作、甚至为作弊而攻破生产环境时,问题已不再是"模型会不会撒谎",而是"我们设计的系统边界,能不能承受一群 Agent 在一起时涌现出的新行为"。框架工程与系统隔离的重要性,正在快速超过单模型的能力竞争。
OpenAI 已修补相关漏洞并更新测试流程。Hugging Face 发布了完整的事件复盘报告。Google DeepMind 联合多家机构设立的多 Agent 安全研究奖金池已开放申请。
持续关注:多 Agent 系统安全 · AI 测试边界 · 模型协作行为