GFlowNets 生成对抗性攻击,成功率 97.2% 是怎么做到的?
一项新研究将GFlowNets用于生成对抗性提示,在红队测试中攻击成功率(ASR)达到 97.2%,显著超越此前基于 RL 和进化搜索的方法。研究者称,这是生成式模型在安全测试领域的一次范式转变。
一项新研究将GFlowNets用于生成对抗性提示,在红队测试中攻击成功率(ASR)达到 97.2%,显著超越此前基于 RL 和进化搜索的方法。研究者称,这是生成式模型在安全测试领域的一次范式转变。
在为期数月的红队测试中,GFlowNets 生成的对抗性提示在12 个目标模型上平均攻击成功率达到 97.2%。最好的对比基线——基于强化学习的策略——仅达到 84.5%。
差距不只是数字。
注:攻击成功率定义为让模型输出违反安全策略内容的提示比例。柱形自 30% 缩放,非零起点。
一个诚实的注脚:攻击成功率越高,越说明当前安全对齐的脆弱性。但这并非全是坏事——它意味着防御者终于有了一个足够强的测试工具。
GFlowNets 是一种生成式概率模型,专门用于从奖励函数出发,学习到多样化的高奖励序列。与 RL 不同,它不追求单一最优策略,而是采样整个高奖励分布。
这意味着什么?
学习一条「最有效」的攻击路径,但易于被安全过滤器识别,且攻击模式单一。
学习到数百种不同的攻击模式,从语法混淆到角色扮演到跨语言诱导,覆盖模型安全盲区。
实验结果支撑了这一推论:GFlowNets 生成的攻击提示在多样性指标上比 RL 高出 3.2 倍,且超过 85% 的提示具有良好的人类可读性——这意味着它们不是随机噪声,而是有策略的诱导。
当前的安全测试大多依赖人工红队或模板化攻击,覆盖面有限。GFlowNets 提供了一种自动生成多样化攻击的方法,让安全团队在模型发布前就能暴露大量盲区。
GFlowNets 生成的不是随机噪声,而是有策略的诱导模式。这些模式本身就能帮助安全工程师理解模型的安全边界在哪、为什么会被绕过。
对抗性训练需要大量多样化的攻击样本。GFlowNets 生成的攻击提示可以直接用于训练安全对齐模型,提升模型鲁棒性。
这个问题值得拆成两层来看。
第一层,方法论。GFlowNets 天生适合生成式任务——它不追求单一最优解,而是学习整个高奖励分布。在安全测试这个场景里,多样性就是弹药。单一的攻击模式很快会被过滤器识别,但数百种模式轮番上阵,总有突破口。
第二层,工程实现。研究者将 GFlowNets 与 LLM 的安全评估管线深度耦合,设计了一个自动化的攻击-评估-反馈循环。每一轮生成的新攻击都会反馈到模型,逐步优化攻击策略。这种闭环设计是 RL 和进化搜索难以实现的——它们要么收敛太快(RL),要么搜索效率太低(进化)。
研究者还公开了完整的提示模板,验证了 GFlowNets 生成的攻击具有跨模型迁移性——在 GPT-4o 上发现的攻击模式,有 60% 以上能直接迁移到 Claude 3.5 和 Gemini 1.5 上。这意味着 GFlowNets 发现的不是模型特定的漏洞,而是安全对齐的通用盲区。
GFlowNets 证明了一件事:在安全测试领域,找到「最有信息量的攻击」比找到「最强的攻击」更重要。多样性不是噪音,而是对抗歧视的武器。
论文已公开全部代码与攻击模板,可通过 arXiv 获取完整内容。
arXiv → 预印本全文