🛡️ 安全 · 模型发布

Qwen3Guard 发布:实时安全逐词检测,三级风险分类覆盖 119 种语言

通义千问推出首款专用安全护栏模型 Qwen3Guard,基于 Qwen3 架构微调,首次实现流式逐词安全检测,并引入「安全 / 争议性 / 不安全」三级分类,在多项主流安全评测中位居行业领先水平。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#Qwen3Guard #安全护栏 #流式检测 #通义千问 #三级分类
2 个版本 Gen 生成式版 + Stream 流式检测版
3 种规模 0.6B / 4B / 8B 参数,适配全场景
119 种 支持语言及方言,全球部署

⚡ 30 秒速览

  • 核心创新:Qwen3Guard-Stream 首次实现生成阶段逐词实时安全检测,在 Transformer 末层附加两个轻量分类头,延迟极低。
  • 三级分类:新增「争议性」标签,可在严格 / 宽松模式间灵活切换,覆盖 9 大风险类别(暴力、违法、色情、PII、自杀自残、不道德行为、政治敏感、版权违规、越狱)。
  • 多语言覆盖:支持 119 种语言及方言,涵盖印欧、汉藏、亚非、南岛、突厥等主要语系,中英文场景表现尤为突出。
  • 两大应用:可作为安全 RL 奖励信号(Gen 版),也可在线实时拦截风险内容(Stream 版),均无需重新训练模型。

01两大版本,定义安全护栏新范式 Gen vs Stream

Qwen3Guard 提供两个专业版本,覆盖从离线标注到在线拦截的全链路需求。它们的核心差异在于检测时机部署场景

Qwen3Guard-Gen(生成式版)

对完整 Prompt 和 Response 进行安全分类,适用于离线数据集标注、过滤,以及作为 RLHF 阶段的安全奖励信号。

Qwen3Guard-Stream(流式检测版)

在模型逐词生成过程中实时审核,每输出一个 Token 即判定一次安全性,实现贯穿生成全程的细粒度防护。

但数据只是故事的一部分。真正的突破在于分类粒度的重构。

传统护栏模型仅输出「安全 / 不安全」二元标签,而 Qwen3Guard 引入「安全 ✅ / 争议性 ⚠️ / 不安全 ❌」三级分类。其中「争议性」标签为行业首创,允许应用根据场景动态调整审核严格度——在严格模式下争议内容被判为不安全,在宽松模式下则视为安全,一套模型适配多种安全策略。

✅ 安全 ⚠️ 争议性 • 灵活重分类 ❌ 不安全

注:三级分类覆盖 9 大风险类别:暴力、违法行为、色情内容、个人身份信息、自杀自残、不道德行为、政治敏感话题、版权违规、越狱提示。每个类别均可独立配置阈值。

02119 种语言 从英语到粤语,从冰岛语到斯瓦希里语

Qwen3Guard 支持 119 种语言及方言,覆盖全球主要语系。这使其在跨国部署、多语言内容审核场景中具备天然优势,无需为每个语言区单独训练模型。

印欧语系 65+ 种 汉藏语系 中、缅等 亚非语系 阿拉伯、希伯来等 南岛语系 印尼、马来等 德拉威语 泰米尔、泰卢固等 突厥语系 土耳其、哈萨克等 壮侗语系 泰、老挝等 乌拉尔语系 芬兰、匈牙利等 南亚语系 越南、高棉等 其他 日、韩、格鲁吉亚等

注:各语系下包含方言变体,如中文涵盖简体、繁体及粤语;阿拉伯语覆盖标准语及 6 种地域变体。完整语言列表见官方技术报告。

一个诚实的注脚:多语言覆盖的广度令人印象深刻,但长尾语言的真实表现仍需更多实测验证。

03它能做什么?两个已经验证的实战场景

Qwen3Guard 的两大版本对应两种截然不同的应用路径——一个用于训练阶段的安全对齐,一个用于推理阶段的实时防护

🧪 安全强化学习(Safety RL)Gen 版

  • 将 Qwen3Guard-Gen 的输出作为安全奖励信号,融入 RLHF 训练流程。
  • 在不损害模型整体有用性的前提下,显著提升模型的内在安全性——拒绝有害请求的比率大幅提高,而正常对话质量几乎不受影响。
  • 适用于需要从源头降低风险的高合规场景,如金融、医疗、教育等领域的对话系统。
关键价值:安全与有用性不必二选一——三级分类的「争议性」标签为策略调优保留了弹性空间。

⚡ 实时动态干预 Stream 版

  • 在模型生成回复的逐词过程中即时判定风险,无需等待完整输出。
  • 一旦检测到风险内容,可立即中断生成或替换安全回复,响应延迟控制在毫秒级。
  • 特别适合面向公众的在线服务,如社交平台内容审核、客服机器人、教育辅导等需要低延迟安全把关的场景。
技术亮点:不重新训练模型——Stream 版通过架构扩展实现防护,与主模型解耦,部署灵活。
编辑核心判断

AI 安全正从「事后审核」走向「实时介入」,但护栏模型的真正价值不在于拦截多少风险,而在于如何在安全与可用性之间找到动态平衡——三级分类和流式检测的方向正确,但长尾语言和边缘场景的鲁棒性才是真正的护城河。

现在就能用

Qwen3Guard 已上线主流开源平台,提供 0.6B、4B、8B 三种参数规模;企业级用户可通过云安全护栏服务一键接入。

开源模型下载 → Hugging Face / ModelScope

详细技术报告与代码示例见官方 GitHub 仓库 · 阿里云 AI 安全护栏服务同步上线