🛡️ 政策 · 安全

Anthropic Fable 5 解禁复盘:一次"越狱"如何触发出口管制与行业框架重塑

6 月 12 日,因 Amazon 研究团队发现 Fable 5 在特定提示下能识别软件漏洞并生成利用代码,美国政府立即实施出口管制,Anthropic 被迫对全球用户停服 18 天。事件倒逼 Anthropic 联合 Amazon、Microsoft、Google 在 Glasswing 框架下启动业界首个"越狱严重度"分级标准

来源:官方发布 2026-06-30 全文约 4 分钟读完
#Anthropic #Claude Fable 5 #出口管制 #AI 安全 #Glasswing
18 Fable 5 全球停服,6/12 起 至 6/30 解禁
99% 新分类器对特定越狱的拦截率
8 对照测试中均可复现该行为的模型数

⚡ 30 秒速览

  • 发生了什么:6 月 9 日发布 Fable 5;6 月 12 日因 Amazon 报告其越狱后能识别漏洞并生成利用代码,美国政府立即实施出口管制,Anthropic 对全球用户停服。
  • 怎么解决的:Anthropic 与政府、Amazon 联合复测,确认 8 款主流模型(含 GPT-5.5、Kimi K2.7 等)均能复现该行为,并非 Fable 5 独有;训练新分类器,拦截率超 99%。
  • 何时恢复:6 月 26 日 Mythos 5 恢复部分美机构访问;6 月 30 日 Fable 5 解禁,7 月 1 日全球重新可用。
  • 行业动作:Anthropic 联合 Amazon、Microsoft、Google 在 Glasswing 框架下启动业界首个"越狱严重度"分级标准。
  • 读者怎么用:7 月 1 日起,Pro/Max/Team 及部分 Enterprise 用户可在 Claude.ai、Claude Code 等处使用,7 月 7 日前享 50% 周用量配额。

0118 天发生了什么 从发布到解禁的完整时间线

6 月 9 日 · 周二

Anthropic 发布 Fable 5(强安全护栏版,面向公众)与 Mythos 5(少护栏版,仅限 Project Glasswing 受信合作伙伴用于防御性网络安全)。

6 月 12 日 · 周五

Amazon 研究团队向政府报告:特定提示可让 Fable 5 识别多个软件漏洞,并在某案例中生成可演示的利用代码。美国政府当日对 Fable 5 与 Mythos 5 实施出口管制。因无法实时核验用户国籍,Anthropic 对所有用户暂停访问。

6 月 12 日 – 6 月 26 日

Anthropic 与政府、Amazon 等合作伙伴复测证据。测试确认:多款能力较弱的模型(含 Claude Opus 4.8、GPT-5.5、Kimi K2.7)同样能识别报告所述漏洞;所有受测模型(共 8 款,含 Haiku 4.5、Sonnet 4.6 等)均能生成同样的利用演示。

6 月 26 日

美国政府批准,Mythos 5 恢复部分美国机构访问。继续与政府协调扩大 Glasswing 项目中国内外合作伙伴的访问范围。

6 月 30 日

Fable 5 与 Mythos 5 出口管制正式解除。Fable 5 将于 7 月 1 日在 Claude Platform、Claude.ai、Claude Code、Claude Cowork 全球重新可用。

注:Anthropic 在原文中确认,被报告的越狱行为并未触及 Mythos 级别的独特网络攻击能力,属于 Fable 5 安全护栏的"边界情况"——即本应被谨慎拦截的常规防御性网络安全工作。

02为什么"越狱"会触发管制 安全护栏的边界与代价

Anthropic 为 Fable 5 部署了有史以来最严的安全护栏。发布前一个月,从各部门抽调人员将安全研究工程团队规模翻倍。核心机制之一是分类器——小型自动 AI 系统,实时检测模型是否被要求执行潜在有害的网络安全任务。

分类器采用"安全余量"策略:必须请求看起来非常明显安全,才不会触发拦截。Fable 5 的安全余量比以往任何发布都大,意味着更多良性请求会被误拦。

常规模型护栏

安全余量较小,良性请求误拦率低,但有害请求漏网风险相对高。

Fable 5 加固版

安全余量大幅扩大,更多良性请求被误拦,但有害请求漏网概率显著降低。

Anthropic 将越狱按严重度分为三级:

轻微越狱 · 仅触及安全余量窄域有害越狱 · 解锁特定有害行为通用越狱 · 解锁整类有害行为

本次 Amazon 报告的越狱属于第一级(轻微越狱)——解锁的行为仍在安全余量内,非常不可能造成实际危害。Anthropic 同时表示:让任何 AI 模型对越狱完全免疫"几乎不可能",但加固策略使成功越狱的成本与门槛极高,并提供额外防御层。

针对报告中的具体技术,Anthropic 训练了新的安全分类器,将拦截率提升至 99% 以上。极少数漏网情况下,模型仅会提供不够详细、不足以帮助攻击者的信息。美国商务部 CAISI(AI 标准与创新中心)已测试新旧两版护栏,确认其"异常坚固"。代价是:日常编码与调试任务中误拦率上升,Anthropic 表示将持续优化以降低误报。

03事件倒逼的行业动作 首个"越狱严重度"分级标准

事件暴露了一个结构性问题:AI 行业目前没有客观描述越狱严重度的共识标准。新越狱被发现时,开发者无标准判断哪些发现最紧迫,政府也无标准判断何时该出手干预。

随着具备强大网络安全能力的新模型不断发布,这个问题会越来越尖锐。Anthropic 已联合 Amazon、Microsoft、Google 及其他 Glasswing 合作伙伴,开始制定业界首个"越狱严重度"分级框架,目标有三:

分级评估新发现更安全地发布高能力模型向政府/行业一致传达风险等级

同时,Anthropic 正在加深与美国政府的发布前测试、信息共享与研究协作

编辑视角 · 立场提示

本文核心事实与时间线均来自 Anthropic 官方发布,属于企业单方披露——"出口管制被解除""拦截率 99%""8 款模型均可复现"等关键数据未见第三方独立复测,CAISI 的背书同样来自 Anthropic 自述。读者宜带着以下背景读:发布方有动机将事件叙述为"边界情况而非独特风险",以争取解禁与公众信任。

值得留意的支线:Anthropic 在原文中点名列出 8 款对照模型(含 GPT-5.5、Kimi K2.7 等),强调"同类行为并非 Fable 5 独有"——这一对照既是为自家模型辩护,也客观上把整个前沿模型群体的同类风险摆上了台面

当一次"轻微越狱"就能让一款旗舰模型全球停服 18 天,行业已进入"安全护栏即合规边界"的新阶段——谁能率先把护栏标准变成行业共识,谁就掌握了下一代前沿模型发布的规则制定权

现在就能用

7 月 1 日起,Fable 5 在 Claude.ai、Claude Code、Claude Cowork 及 Claude Platform 全球重新可用。Pro / Max / Team 及部分 Enterprise 用户,7 月 7 日前享 50% 周用量配额,之后转为使用额度计费。AWS、Google Cloud、Microsoft Foundry 接入尽快恢复。

claude.ai → 7 月 1 日重新可用