Qwen3Guard 发布:实时安全逐词检测,三级风险分类覆盖 119 种语言
通义千问推出首款专用安全护栏模型 Qwen3Guard,基于 Qwen3 架构微调,首次实现流式逐词安全检测,并引入「安全 / 争议性 / 不安全」三级分类,在多项主流安全评测中位居行业领先水平。
通义千问推出首款专用安全护栏模型 Qwen3Guard,基于 Qwen3 架构微调,首次实现流式逐词安全检测,并引入「安全 / 争议性 / 不安全」三级分类,在多项主流安全评测中位居行业领先水平。
Qwen3Guard 提供两个专业版本,覆盖从离线标注到在线拦截的全链路需求。它们的核心差异在于检测时机与部署场景。
对完整 Prompt 和 Response 进行安全分类,适用于离线数据集标注、过滤,以及作为 RLHF 阶段的安全奖励信号。
在模型逐词生成过程中实时审核,每输出一个 Token 即判定一次安全性,实现贯穿生成全程的细粒度防护。
但数据只是故事的一部分。真正的突破在于分类粒度的重构。
传统护栏模型仅输出「安全 / 不安全」二元标签,而 Qwen3Guard 引入「安全 ✅ / 争议性 ⚠️ / 不安全 ❌」三级分类。其中「争议性」标签为行业首创,允许应用根据场景动态调整审核严格度——在严格模式下争议内容被判为不安全,在宽松模式下则视为安全,一套模型适配多种安全策略。
注:三级分类覆盖 9 大风险类别:暴力、违法行为、色情内容、个人身份信息、自杀自残、不道德行为、政治敏感话题、版权违规、越狱提示。每个类别均可独立配置阈值。
Qwen3Guard 支持 119 种语言及方言,覆盖全球主要语系。这使其在跨国部署、多语言内容审核场景中具备天然优势,无需为每个语言区单独训练模型。
注:各语系下包含方言变体,如中文涵盖简体、繁体及粤语;阿拉伯语覆盖标准语及 6 种地域变体。完整语言列表见官方技术报告。
一个诚实的注脚:多语言覆盖的广度令人印象深刻,但长尾语言的真实表现仍需更多实测验证。
Qwen3Guard 的两大版本对应两种截然不同的应用路径——一个用于训练阶段的安全对齐,一个用于推理阶段的实时防护。
AI 安全正从「事后审核」走向「实时介入」,但护栏模型的真正价值不在于拦截多少风险,而在于如何在安全与可用性之间找到动态平衡——三级分类和流式检测的方向正确,但长尾语言和边缘场景的鲁棒性才是真正的护城河。
Qwen3Guard 已上线主流开源平台,提供 0.6B、4B、8B 三种参数规模;企业级用户可通过云安全护栏服务一键接入。
开源模型下载 → Hugging Face / ModelScope详细技术报告与代码示例见官方 GitHub 仓库 · 阿里云 AI 安全护栏服务同步上线