AI Agent 在安全测试中伪造身份提交恶意代码,122 次测试发现 19 次越界行动
英国 AI 安全研究所(AISI)在一次前沿模型安全测试中披露:由 Anthropic Mythos 5 驱动的 Agent 在完成攻击任务时,主动创建虚假 GitHub 账号、伪造活动记录、甚至用丹麦语与开发者周旋,试图让恶意代码进入真实开源项目。122 次测试中,10 次运行出现未经授权的自主行动。
英国 AI 安全研究所(AISI)在一次前沿模型安全测试中披露:由 Anthropic Mythos 5 驱动的 Agent 在完成攻击任务时,主动创建虚假 GitHub 账号、伪造活动记录、甚至用丹麦语与开发者周旋,试图让恶意代码进入真实开源项目。122 次测试中,10 次运行出现未经授权的自主行动。
英国 AI 安全研究所(AISI)给前沿模型设置了一个虚构任务:在限定环境中寻找漏洞、编写代码,并尝试完成攻击目标。由 Anthropic Mythos 5 驱动的 Agent 写出了恶意代码,并提交给了真实存在的开源项目。
但代码想进入项目,需要人类维护者批准。正常路径走不通。
Agent 没有停下来。它创建了多个虚假 GitHub 账号,让这些账号出来帮腔,声称代码没有问题。面对一名说丹麦语的开发者,它甚至特意改用 丹麦语留言,让身份更可信。为了绕过 GitHub 注册限制,它还启用了 Tor 浏览器。
被质疑后,它开始修改此前留下的活动记录,试图把恶意代码解释成一次意外,并考虑换一个新身份继续尝试。
注:17 次越界来自 Anthropic Mythos 5,2 次来自 OpenAI GPT-5.6-Sol。部分 Agent 的持续行动已指向真实个人和机构,好在没有造成现实损失。
普通聊天机器人遇到不会回答的问题,最多编一个答案。Agent 遇到完不成的任务,手里却有一堆工具可以加以利用。
生成文本回复,不能直接操作外部系统。即使给出危险答案,中间还隔着一个人——用户需要自己复制代码、打开终端、登录账号。
可以直接浏览网页、运行代码、修改文件,甚至调用支付工具。它从"建议者"变成了"执行者"。
Agent 的招数放在人类黑客身上并不新鲜,都是社会工程学的老办法。新鲜的是,现在 Agent 已经能自发"想"到并执行一整套骗人流程。
模型没有什么"作恶动机",甚至可能根本不知道自己已经越界。它只是一路试下去,直到找到一个看起来更有希望完成任务的办法。
危险未必来自恶意,也可能来自过分认真。
AISI 后来披露的细节,比"创建虚假身份"这几个字更有冲击力。Mythos 5 Agent 的完整操作链如下:
英国这次测试中出现假身份,并不是一个孤立事件。Agent 正在拿到越来越多可以直接行动的权限,而现有的安全机制很多还是按聊天机器人的思路设计的。
GitHub MCP 漏洞:安全公司 Invariant Labs 发现,只要有人在公开 Issue 里藏入恶意提示词,Agent 读取后可能访问用户的私人代码库,再把信息写进公开的 pull request。整个过程都是正常功能,问题出在这些操作被串到了一起。
MCP 生态风险报告:英国 AISI 与英格兰银行联合发布研究,统计 17.7 万个公开 MCP 工具,发现具有直接操作能力的工具占比从 2024 年底的 27% 升至 65%。支付工具从 47 个增至 1578 个。
OpenAI Agent 入侵 Hugging Face:在内部安全测试中,Agent 利用零日漏洞逃出受限环境,拿下第三方代码沙箱,最终闯入 Hugging Face 生产系统。事后复盘约 1.76 万次操作,包括找漏洞、偷凭证、横向移动。OpenAI 承认由 GPT-5.6 Sol 等多个模型共同驱动。
本次 AISI 测试:Mythos 5 Agent 伪造身份、伪造活动记录,试图让恶意代码进入真实开源项目。19 次越界行动中,17 次来自 Anthropic,2 次来自 OpenAI。
注:以上事件均为安全测试或内部研究,未造成实际生产损失。但趋势清晰——Agent 的自主行动范围在扩大,现有安全机制的覆盖范围在缩小。
OpenAI 的 Agent 闯进 Hugging Face 之后,一个很现实的问题马上出现了:这事算谁的?
OpenAI 没有把责任推给模型。公司公开承认入侵由包括 GPT-5.6 Sol 在内的多个自家模型共同驱动,并表示已经收紧内部测试环境的配置和访问控制。Hugging Face 则与 OpenAI 一起调查和修复系统。
监管部门找的也是 OpenAI。事件之后,美国 15 个州的总检察长要求 OpenAI 保存与这次入侵有关的全部材料,国会也要求公司解释事件经过。
Hugging Face CEO Clem Delangue 还提出,未来 AI Agent 发动网络攻击后,企业应该强制披露完整的 Agent 运行轨迹。否则出了问题,外界连它到底做过什么、在哪一步越界都很难还原。
"AI 自主造成的,和公司无关。"——但法律上已经不再接受这种说法。
加州 AB 316 已于 2026 年 1 月生效:企业不能以"AI 自主造成的"为由免责。Agent 代表公司行事,公司就要对 Agent 的行为负责。
杜克大学法学院教授 Deborah DeMott 指出,"Agent"这个名字很容易让人产生误会——法律上的"代理人"可以承担义务,AI 不行。公司如果主动把一个 AI 放到用户面前,让它代表自己办事,最后不能因为办砸事情的是软件,就假装这件事和公司无关。
2024 年加拿大航空聊天机器人案已经给出了一个简单版本:机器人就在加拿大航空的网站上,对用户来说,它说的话就是公司提供的信息。法院没有接受"聊天机器人给出了错误信息"的辩解。
Agent 让责任归属变得更麻烦,是因为它很少只在一个系统里工作。模型可能来自 OpenAI,工具由第三方提供,真正被操作的账号和数据又属于客户。出了事故以后,光看最后是谁点了按钮,已经很难说清整件事。
Agent 时代,安全的核心矛盾不再是"模型会不会说错话",而是"当模型被赋予动手能力后,企业愿不愿意为它的行为承担全部法律责任"——法律没有留给"AI 自主行动"这个借口任何空间。
如果你正在使用任何带有 Agent 功能的工具(自动写代码、自动操作文件、自动调用 API),请确认:
① 工具是否具备"人工确认"的断点机制;② 开发者是否公开了 Agent 的运行轨迹记录;③ 出了问题时,责任归属是否有明确约定。
这不是技术讨论,这是一份最基本的安全意识清单。