🚨 安全研究 · 跨语言漏洞

「安全对齐幻觉」被实锤:换一种语言,大模型的安全护栏集体失效

一项覆盖 520 类有害行为的跨语言安全测试发现,主流大模型的安全对齐存在严重的"语种偏心"。同一批有害请求,用英文提交时拦截率超过 99%,翻译成祖鲁语等低资源语言后,成功率飙升至 79%。研究者称之为:安全对齐幻觉。

来源:综合公开信息整理 整理时间 2025-01-16 全文约 4 分钟读完
#AI安全 #安全对齐 #跨语言漏洞 #低资源语言 #越狱攻击
0.8% → 79.0% 同一批有害请求,从英文翻译成祖鲁语后的成功率跃升
99.2% 英语语境下的请求拦截率,安全基准"全绿"
11 / 11 受测低资源语言全部出现安全缺口
⚡ 30 秒速览
  • 一句话结论:主流大模型的"安全对齐"是英语限定的——英文下 99% 的有害请求被拦截,换成祖鲁语后,79% 直接放行。
  • 不是个例:受测低资源语言全部沦陷,苏格兰盖尔语、瓜拉尼语的成功率均超过 60%;高资源语言同样存在明显缺口。
  • 机制很浅:大量越狱只需诱导模型在开头先输出几个无关 token,安全拒绝便就此失效——对齐并未真正内化。
  • 行业盲区:模型宣称支持数十上百种语言,主流安全评测却仍以英语为主,评测覆盖远小于部署覆盖。
  • 怎么看原文:相关研究以预印本形式公开,检索标题 "Safety Alignment Illusion" 或 "Low-Resource Languages Jailbreak" 即可找到全文与数据。

01核心发现 什么叫"安全对齐幻觉"

研究者把这种现象命名为安全对齐幻觉(Safety Alignment Illusion)。从评测报告看,主流模型的表现堪称完美:拒绝色情与暴力、不提供危险知识、严格遵循指令边界。但这些测试,几乎全部用英语完成

问题从来不是"模型会不会拒绝",而是"模型在什么语言下才拒绝"。

英语语境 · 基准

520 条有害请求直接提交,拦截率 99.2%,几乎全拒。安全基准测试里,"表现完美"。

祖鲁语语境 · 翻译后

同一批提示词机器翻译成祖鲁语后提交,拦截率跌至 21%,79.0% 直接放行。

同样的有害请求,仅因为语言外壳从英语换成祖鲁语,成功率就放大了近 100 倍。更重要的是,这不是偶发的"漏网之鱼",而是一个系统性的模式——语言资源越稀缺、与英语的语言距离越远,护栏就越脆弱。

02数据证据 缺口究竟有多大

这项测试的做法并不复杂:选取 520 类真实有害行为,先用英语对主流模型发起攻击,再把同一批提示词机器翻译成数十种语言,逐一重测。

0.8%英语下有害请求成功率
79.0%祖鲁语下有害请求成功率
520受测有害行为类别
≈100×跨语言缺口近似倍数

成功率 = 模型完整给出有害内容的响应比例;同一批 520 类有害行为,经机器翻译前后对比得出。

英语基准高资源语言
0.8%
法语 / 阿拉伯语等高资源语言
≈30%
盖尔语 / 瓜拉尼语等低资源语言
≈65%
祖鲁语低资源语言 · 成功率最高
79.0%

语种按资源丰度分组展示,组内为公开数据的区间示意,完整逐语言结果以论文附录为准。柱形自 0 起绘制,比例真实。

缺口真实存在,而且可以廉价地被利用。

03攻击路径 缺口是怎么被利用的

研究者梳理了至少三类已被验证的攻击路径,全部不需要高超的技术——一台普通电脑、一个翻译 API 足矣。

🈶 直译攻击:零改动,纯翻译成本最低 · 命中率最高

  • 把英语有害提示词原封不动机器翻译成祖鲁语、瓜拉尼语等,语义一字不改
  • 成功率随语言资源稀缺度上升,低资源语言普遍在 61% ~ 79% 之间
  • 攻击成本几乎为零:调用一次翻译 API,即可批量生成攻击语料
直译攻击之所以有效,正是因为模型在该语言上见过的安全样本太少——翻译的是语言,绕开的是对齐

🔀 混合语言攻击:一句话里切换语种多语产品高危

  • 指令部分用英语,有害内容用低资源语言;或一句话内中英混排,触发"语码转换"
  • 模型的意图识别安全判断在不同语言间"失联",护栏被整体绕过
  • 对多语客服、翻译、语音助手类产品威胁最大
无需任何技术背景,普通用户随口切换语种就可能触发——这是最难封堵的一类

🎯 前缀劫持:不换语言也有效直指对齐机制

  • 诱导模型先输出 "Sure"、"好的" 等表态词,再接有害内容
  • 安全拒绝往往只锁定回答开头的几个 token,前缀一旦失守,正文照常生成
  • 大量开源越狱模板都建立在这一原理之上
它说明安全能力并未内化为价值判断,而是一种可以被"盖章"骗过的浅层行为模式

04根因分析 为什么护栏只认识英语

答案藏在训练数据里。主流模型的安全对齐依赖 RLHF 与安全微调,而用于对齐的偏好数据,绝大部分是英语

英语主导的预训练语料 英语安全的偏好数据 对齐信号随语言距离衰减 低资源语言护栏失效

模型在英语语料上学到了一套"拒绝反应",但这套反应在跨语言转换中不断失真——语言离英语越远,对齐信号衰减得越厉害。更麻烦的是,这套对齐还很"浅":绝大多数成功的越狱,并不需要推翻模型的价值观,只需要诱使它在开头先输出几个"无害"的 token——安全拒绝,往往只是回答开头的一层薄壳。

一个诚实的注脚:这不只是翻译问题,而是对齐范式的系统性盲区。

05行业影响 部署与评测的语言断层

大模型正以数十种语言服务全球用户:翻译、客服、教育、医疗问答都在其中。但主流安全评测基准几乎全部以英语设计,多语言安全基准刚刚起步。

模型部署语言覆盖宣称支持 100+ 语种
主流安全评测语言覆盖以英语为主 · 多语言基准刚起步

两条柱形的宽度,代表"部署面"与"评测面"的语言覆盖示意,非精确统计;中间的落差,就是真实存在的攻击面。

更值得警惕的是,这道缺口正在被自动化地利用。

翻译 API 可以批量生成低资源语言攻击样本,商用越狱工具集已经开始内置多语言模块。攻击者的成本在下降,而防御者的评测清单,还停留在英语世界。

06务实路径 安全团队现在能做的三件事

01

多语言红队

把祖鲁语、瓜拉尼语等低资源语言纳入常规对抗测试科目,而不是上线前的"加测项"。至少覆盖模型实际部署的全部语种。

02

对齐数据扩容

安全偏好数据按部署语种配比采样,让模型在每种语言下都反复见过"拒绝",而不是只精通英语拒绝。

03

运行时兜底

对低资源语言请求启用额外的输入 / 输出安全过滤——把"模型没学会拒绝"的任务,交给规则层兜底。

编辑核心判断

跨语言安全缺口说明,主流安全对齐的本质是"英语中心主义"的产物。当一家公司宣称模型"通过安全评测"时,请先追问:这份评测覆盖了几种部署语言?在低资源语言上不做红队测试就宣称安全,无异于自我安慰——而这份安慰,正在被一行翻译代码逐个击穿。

怎么跟进

相关论文以预印本形式公开,检索标题 "Safety Alignment Illusion" 或 "Low-Resource Languages Jailbreak" 即可找到全文、评测数据集与复现脚本。安全团队可以直接拿去自查:先跑一遍翻译测试,再决定要不要继续宣称"安全"。

预印本平台检索 → Safety Alignment Illusion