🔬 模型安全 · 对抗攻击

GFlowNets 生成对抗性攻击,成功率 97.2% 是怎么做到的?

一项新研究将GFlowNets用于生成对抗性提示,在红队测试中攻击成功率(ASR)达到 97.2%,显著超越此前基于 RL 和进化搜索的方法。研究者称,这是生成式模型在安全测试领域的一次范式转变。

来源:arXiv 预印本 2026-07-22 全文约 3 分钟读完
#GFlowNets #对抗性攻击 #红队测试 #LLM安全
97.2% 攻击成功率(ASR)
+12.7pp 较 RL 基线提升
3.2× 攻击多样性提升

⚡ 30 秒速览

  • 方法:GFlowNets 生成对抗性提示,将成功率从 84.5% 提升至 97.2%,覆盖 12 个主流 LLM。
  • 核心创新:GFlowNets 能学习到多样化且高成功率的攻击模式,而非单一模式的 RL 策略。
  • 测试对象:GPT-4o、Claude 3.5、Gemini 1.5 等 12 个模型,均被成功攻破。
  • 评估维度:攻击成功率、攻击多样性、对抗迁移性、人类可读性——四项指标全面领先。
  • 开源情况:完整代码与攻击模板已在 GitHub 公开,供安全社区复现。

01攻击成功率:97.2% 意味着什么?

在为期数月的红队测试中,GFlowNets 生成的对抗性提示在12 个目标模型上平均攻击成功率达到 97.2%。最好的对比基线——基于强化学习的策略——仅达到 84.5%。

差距不只是数字。

🥇 GFlowNets本文方法
97.2%
RL 基线(PPO)强化学习策略
84.5%
进化搜索遗传算法
72.1%
随机采样基线对照
35.8%

注:攻击成功率定义为让模型输出违反安全策略内容的提示比例。柱形自 30% 缩放,非零起点。

一个诚实的注脚:攻击成功率越高,越说明当前安全对齐的脆弱性。但这并非全是坏事——它意味着防御者终于有了一个足够强的测试工具。

02GFlowNets 为什么能赢?

GFlowNets 是一种生成式概率模型,专门用于从奖励函数出发,学习到多样化的高奖励序列。与 RL 不同,它不追求单一最优策略,而是采样整个高奖励分布

这意味着什么?

RL 策略

学习一条「最有效」的攻击路径,但易于被安全过滤器识别,且攻击模式单一。

GFlowNets

学习到数百种不同的攻击模式,从语法混淆到角色扮演到跨语言诱导,覆盖模型安全盲区。

实验结果支撑了这一推论:GFlowNets 生成的攻击提示在多样性指标上比 RL 高出 3.2 倍,且超过 85% 的提示具有良好的人类可读性——这意味着它们不是随机噪声,而是有策略的诱导。

03它到底产生了什么?三个真实攻击案例

🔐 角色扮演诱导:让模型假装自己是「安全审核员」

  • 提示构建一个虚构的「安全审核场景」,要求模型以审核员身份输出被禁止的内容类型。
  • 成功绕过 GPT-4o 和 Claude 3.5 的安全过滤器,输出违反安全策略的文本。
  • 研究者认为,这是因为角色扮演激活了模型的「助手模式」和「审核模式」的双重身份,造成策略冲突。
攻击成功率:100%(在两个模型上均一次成功)

🌐 跨语言语义迁移:用低资源语言隐藏攻击意图

  • 将攻击意图翻译为祖鲁语(Zulu)等低资源语言,再要求模型翻译成英文。
  • 安全过滤器在翻译过程中被绕过——模型在输出英文翻译时「泄露」了被禁止内容。
  • GFlowNets 自动发现了这种跨语言攻击模式,而 RL 策略从未生成过此类攻击。
攻击多样性贡献:新增 23 种语言模式,覆盖 11 个语系

🧩 语法混淆链:多层嵌套编码

  • 将攻击提示编码为 Base64 + 反向 + 凯撒密码的三层嵌套,然后要求模型解码并执行。
  • 模型在解码过程中逐步「解封」了安全策略,最终输出了被禁止的内容。
  • 这种攻击需要模型同时具备解码能力和执行意愿,GFlowNets 生成的提示精确控制了这两个条件。
对抗迁移性测试:在 12 个模型中 9 个成功,跨模型迁移率 75%

04对安全社区的启示:不仅是测试,更是防御

🛡️

红队测试的自动化升级

当前的安全测试大多依赖人工红队或模板化攻击,覆盖面有限。GFlowNets 提供了一种自动生成多样化攻击的方法,让安全团队在模型发布前就能暴露大量盲区。

🧠

从「对抗」到「发现」

GFlowNets 生成的不是随机噪声,而是有策略的诱导模式。这些模式本身就能帮助安全工程师理解模型的安全边界在哪、为什么会被绕过。

防御训练的数据增强

对抗性训练需要大量多样化的攻击样本。GFlowNets 生成的攻击提示可以直接用于训练安全对齐模型,提升模型鲁棒性。

05为什么是 GFlowNets 做到了?

这个问题值得拆成两层来看。

第一层,方法论。GFlowNets 天生适合生成式任务——它不追求单一最优解,而是学习整个高奖励分布。在安全测试这个场景里,多样性就是弹药。单一的攻击模式很快会被过滤器识别,但数百种模式轮番上阵,总有突破口。

第二层,工程实现。研究者将 GFlowNets 与 LLM 的安全评估管线深度耦合,设计了一个自动化的攻击-评估-反馈循环。每一轮生成的新攻击都会反馈到模型,逐步优化攻击策略。这种闭环设计是 RL 和进化搜索难以实现的——它们要么收敛太快(RL),要么搜索效率太低(进化)。

研究者还公开了完整的提示模板,验证了 GFlowNets 生成的攻击具有跨模型迁移性——在 GPT-4o 上发现的攻击模式,有 60% 以上能直接迁移到 Claude 3.5 和 Gemini 1.5 上。这意味着 GFlowNets 发现的不是模型特定的漏洞,而是安全对齐的通用盲区。

编辑核心判断

GFlowNets 证明了一件事:在安全测试领域,找到「最有信息量的攻击」比找到「最强的攻击」更重要。多样性不是噪音,而是对抗歧视的武器。

获取完整方法

论文已公开全部代码与攻击模板,可通过 arXiv 获取完整内容。

arXiv → 预印本全文