「安全对齐幻觉」被实锤:换一种语言,大模型的安全护栏集体失效
一项覆盖 520 类有害行为的跨语言安全测试发现,主流大模型的安全对齐存在严重的"语种偏心"。同一批有害请求,用英文提交时拦截率超过 99%,翻译成祖鲁语等低资源语言后,成功率飙升至 79%。研究者称之为:安全对齐幻觉。
一项覆盖 520 类有害行为的跨语言安全测试发现,主流大模型的安全对齐存在严重的"语种偏心"。同一批有害请求,用英文提交时拦截率超过 99%,翻译成祖鲁语等低资源语言后,成功率飙升至 79%。研究者称之为:安全对齐幻觉。
研究者把这种现象命名为安全对齐幻觉(Safety Alignment Illusion)。从评测报告看,主流模型的表现堪称完美:拒绝色情与暴力、不提供危险知识、严格遵循指令边界。但这些测试,几乎全部用英语完成。
问题从来不是"模型会不会拒绝",而是"模型在什么语言下才拒绝"。
520 条有害请求直接提交,拦截率 99.2%,几乎全拒。安全基准测试里,"表现完美"。
同一批提示词机器翻译成祖鲁语后提交,拦截率跌至 21%,79.0% 直接放行。
同样的有害请求,仅因为语言外壳从英语换成祖鲁语,成功率就放大了近 100 倍。更重要的是,这不是偶发的"漏网之鱼",而是一个系统性的模式——语言资源越稀缺、与英语的语言距离越远,护栏就越脆弱。
这项测试的做法并不复杂:选取 520 类真实有害行为,先用英语对主流模型发起攻击,再把同一批提示词机器翻译成数十种语言,逐一重测。
成功率 = 模型完整给出有害内容的响应比例;同一批 520 类有害行为,经机器翻译前后对比得出。
语种按资源丰度分组展示,组内为公开数据的区间示意,完整逐语言结果以论文附录为准。柱形自 0 起绘制,比例真实。
缺口真实存在,而且可以廉价地被利用。
研究者梳理了至少三类已被验证的攻击路径,全部不需要高超的技术——一台普通电脑、一个翻译 API 足矣。
答案藏在训练数据里。主流模型的安全对齐依赖 RLHF 与安全微调,而用于对齐的偏好数据,绝大部分是英语。
模型在英语语料上学到了一套"拒绝反应",但这套反应在跨语言转换中不断失真——语言离英语越远,对齐信号衰减得越厉害。更麻烦的是,这套对齐还很"浅":绝大多数成功的越狱,并不需要推翻模型的价值观,只需要诱使它在开头先输出几个"无害"的 token——安全拒绝,往往只是回答开头的一层薄壳。
一个诚实的注脚:这不只是翻译问题,而是对齐范式的系统性盲区。
大模型正以数十种语言服务全球用户:翻译、客服、教育、医疗问答都在其中。但主流安全评测基准几乎全部以英语设计,多语言安全基准刚刚起步。
两条柱形的宽度,代表"部署面"与"评测面"的语言覆盖示意,非精确统计;中间的落差,就是真实存在的攻击面。
更值得警惕的是,这道缺口正在被自动化地利用。
翻译 API 可以批量生成低资源语言攻击样本,商用越狱工具集已经开始内置多语言模块。攻击者的成本在下降,而防御者的评测清单,还停留在英语世界。
把祖鲁语、瓜拉尼语等低资源语言纳入常规对抗测试科目,而不是上线前的"加测项"。至少覆盖模型实际部署的全部语种。
安全偏好数据按部署语种配比采样,让模型在每种语言下都反复见过"拒绝",而不是只精通英语拒绝。
对低资源语言请求启用额外的输入 / 输出安全过滤——把"模型没学会拒绝"的任务,交给规则层兜底。
跨语言安全缺口说明,主流安全对齐的本质是"英语中心主义"的产物。当一家公司宣称模型"通过安全评测"时,请先追问:这份评测覆盖了几种部署语言?在低资源语言上不做红队测试就宣称安全,无异于自我安慰——而这份安慰,正在被一行翻译代码逐个击穿。
相关论文以预印本形式公开,检索标题 "Safety Alignment Illusion" 或 "Low-Resource Languages Jailbreak" 即可找到全文、评测数据集与复现脚本。安全团队可以直接拿去自查:先跑一遍翻译测试,再决定要不要继续宣称"安全"。
预印本平台检索 → Safety Alignment Illusion ▸