Anthropic Fable 5 解禁复盘:一次"越狱"如何触发出口管制与行业框架重塑
6 月 12 日,因 Amazon 研究团队发现 Fable 5 在特定提示下能识别软件漏洞并生成利用代码,美国政府立即实施出口管制,Anthropic 被迫对全球用户停服 18 天。事件倒逼 Anthropic 联合 Amazon、Microsoft、Google 在 Glasswing 框架下启动业界首个"越狱严重度"分级标准。
6 月 12 日,因 Amazon 研究团队发现 Fable 5 在特定提示下能识别软件漏洞并生成利用代码,美国政府立即实施出口管制,Anthropic 被迫对全球用户停服 18 天。事件倒逼 Anthropic 联合 Amazon、Microsoft、Google 在 Glasswing 框架下启动业界首个"越狱严重度"分级标准。
Anthropic 发布 Fable 5(强安全护栏版,面向公众)与 Mythos 5(少护栏版,仅限 Project Glasswing 受信合作伙伴用于防御性网络安全)。
Amazon 研究团队向政府报告:特定提示可让 Fable 5 识别多个软件漏洞,并在某案例中生成可演示的利用代码。美国政府当日对 Fable 5 与 Mythos 5 实施出口管制。因无法实时核验用户国籍,Anthropic 对所有用户暂停访问。
Anthropic 与政府、Amazon 等合作伙伴复测证据。测试确认:多款能力较弱的模型(含 Claude Opus 4.8、GPT-5.5、Kimi K2.7)同样能识别报告所述漏洞;所有受测模型(共 8 款,含 Haiku 4.5、Sonnet 4.6 等)均能生成同样的利用演示。
美国政府批准,Mythos 5 恢复部分美国机构访问。继续与政府协调扩大 Glasswing 项目中国内外合作伙伴的访问范围。
Fable 5 与 Mythos 5 出口管制正式解除。Fable 5 将于 7 月 1 日在 Claude Platform、Claude.ai、Claude Code、Claude Cowork 全球重新可用。
注:Anthropic 在原文中确认,被报告的越狱行为并未触及 Mythos 级别的独特网络攻击能力,属于 Fable 5 安全护栏的"边界情况"——即本应被谨慎拦截的常规防御性网络安全工作。
Anthropic 为 Fable 5 部署了有史以来最严的安全护栏。发布前一个月,从各部门抽调人员将安全研究工程团队规模翻倍。核心机制之一是分类器——小型自动 AI 系统,实时检测模型是否被要求执行潜在有害的网络安全任务。
分类器采用"安全余量"策略:必须请求看起来非常明显安全,才不会触发拦截。Fable 5 的安全余量比以往任何发布都大,意味着更多良性请求会被误拦。
安全余量较小,良性请求误拦率低,但有害请求漏网风险相对高。
安全余量大幅扩大,更多良性请求被误拦,但有害请求漏网概率显著降低。
Anthropic 将越狱按严重度分为三级:
本次 Amazon 报告的越狱属于第一级(轻微越狱)——解锁的行为仍在安全余量内,非常不可能造成实际危害。Anthropic 同时表示:让任何 AI 模型对越狱完全免疫"几乎不可能",但加固策略使成功越狱的成本与门槛极高,并提供额外防御层。
针对报告中的具体技术,Anthropic 训练了新的安全分类器,将拦截率提升至 99% 以上。极少数漏网情况下,模型仅会提供不够详细、不足以帮助攻击者的信息。美国商务部 CAISI(AI 标准与创新中心)已测试新旧两版护栏,确认其"异常坚固"。代价是:日常编码与调试任务中误拦率上升,Anthropic 表示将持续优化以降低误报。
事件暴露了一个结构性问题:AI 行业目前没有客观描述越狱严重度的共识标准。新越狱被发现时,开发者无标准判断哪些发现最紧迫,政府也无标准判断何时该出手干预。
随着具备强大网络安全能力的新模型不断发布,这个问题会越来越尖锐。Anthropic 已联合 Amazon、Microsoft、Google 及其他 Glasswing 合作伙伴,开始制定业界首个"越狱严重度"分级框架,目标有三:
同时,Anthropic 正在加深与美国政府的发布前测试、信息共享与研究协作。
本文核心事实与时间线均来自 Anthropic 官方发布,属于企业单方披露——"出口管制被解除""拦截率 99%""8 款模型均可复现"等关键数据未见第三方独立复测,CAISI 的背书同样来自 Anthropic 自述。读者宜带着以下背景读:发布方有动机将事件叙述为"边界情况而非独特风险",以争取解禁与公众信任。
值得留意的支线:Anthropic 在原文中点名列出 8 款对照模型(含 GPT-5.5、Kimi K2.7 等),强调"同类行为并非 Fable 5 独有"——这一对照既是为自家模型辩护,也客观上把整个前沿模型群体的同类风险摆上了台面。
7 月 1 日起,Fable 5 在 Claude.ai、Claude Code、Claude Cowork 及 Claude Platform 全球重新可用。Pro / Max / Team 及部分 Enterprise 用户,7 月 7 日前享 50% 周用量配额,之后转为使用额度计费。AWS、Google Cloud、Microsoft Foundry 接入尽快恢复。
claude.ai → 7 月 1 日重新可用