通义千问发布 Qwen3 系列:235B MoE 开源,4B 小模型超越 72B 前代
4 月 30 日,通义千问正式发布 Qwen3 系列大语言模型,包含旗舰 MoE 模型 Qwen3-235B-A22B 及 8 款开源模型。旗舰模型在代码、数学、通用能力上对标 DeepSeek‑R1、o1 等顶级模型;最小的 4B 模型以 4B 参数达到前代 72B 模型的性能水平,参数效率提升 18 倍。
4 月 30 日,通义千问正式发布 Qwen3 系列大语言模型,包含旗舰 MoE 模型 Qwen3-235B-A22B 及 8 款开源模型。旗舰模型在代码、数学、通用能力上对标 DeepSeek‑R1、o1 等顶级模型;最小的 4B 模型以 4B 参数达到前代 72B 模型的性能水平,参数效率提升 18 倍。
Qwen3 最令人意外的不是旗舰模型的对标能力,而是小模型展现出的惊人效率。整个系列中,最小的 4B 模型直接追平了前代 72B 模型的性能——这意味着用户可以用更低的算力成本,获得过去需要大模型才能实现的效果。
前代旗舰级 Dense 模型
性能持平,参数减少 18 倍
注:Qwen3‑30B‑A3B 总参数 30B,激活参数仅 3B,约为 QwQ‑32B 激活参数的 10%,但多项基准测试表现更优。Qwen3‑235B‑A22B 以 22B 激活参数与 37B 激活参数的 DeepSeek‑R1 同场竞技。
全系列共 8 款模型:2 个 MoE(235B‑A22B、30B‑A3B)和 6 个 Dense 模型(32B、14B、8B、4B、1.7B、0.6B),覆盖从端侧到云端的所有场景。其中 0.6B 模型仅为 28 层、16 头,却已超越 Qwen2.5‑3B 的基座性能。
Qwen3 支持两种推理模式,且可在同一轮对话中通过 /think 和 /no_think 指令动态切换。这不是一个"开关",而是一个连续的思考预算控制——用户可以根据任务复杂度,自由分配推理深度。
快速响应,适合简单问题、日常查询、对延迟敏感的场景。模型直接输出答案,不展示推理过程。
逐步推理,展示完整思维链。适合数学、代码、逻辑推理、复杂决策等需要深度思考的任务。
这种设计让用户不再被迫在"速度"和"深度"之间二选一。简单问题用非思考模式秒回,复杂问题用思考模式深挖——同一个模型,两套行为,且推理预算可量化调控。
Qwen3 的预训练数据包含了 119 种语言和方言,覆盖印欧、汉藏、亚非、南岛、德拉威、突厥、壮侗、乌拉尔、南亚等主要语系。这不是简单的"翻译能力",而是模型在预训练阶段就吸纳了这些语言的语料。
注:上下文长度因模型而异——Dense 模型中 0.6B/1.7B/4B 为 32K,8B 及以上为 128K;MoE 模型均为 128K。预训练数据量约为 Qwen2.5 的 2 倍。
多语言覆盖意味着 Qwen3 可以服务全球用户,从英语、中文到小众语言如西里西亚语、巴什基尔语、卡布维尔迪亚努语。对于出海应用、跨国企业、多语言内容生产场景,一个模型即可替代过去需要多个专用模型才能完成的任务。
一个诚实的注脚:覆盖 119 种语言不等于每种语言都达到同等质量。模型在数据量丰富的语言(英、中、法、阿等)上表现更稳定,小众语言的实用性有待社区进一步验证。
Qwen3 的预训练数据量是 Qwen2.5 的将近两倍——从 18 万亿 token 扩展到 36 万亿 token。数据来源不仅是网页,还包括从 PDF 中提取的文档(使用 Qwen2.5‑VL 做 OCR 提取),以及用 Qwen2.5‑Math 和 Qwen2.5‑Coder 合成的教科书、问答对与代码片段。
但真正让模型同时具备"深度推理"和"快速响应"能力的,是其后训练阶段的四阶段流程:
这种"先教推理,再教切换,最后全面优化"的路径,使得 Qwen3 不是简单的"能思考"或"能快答",而是能在同一个模型中灵活切换两种认知模式,且不损失任何一方的质量。
Qwen3 证明了"参数效率"比"参数规模"更值得追求——4B 追平 72B 不是特例,而是系统性的架构与训练方法胜利。当开源模型能用 1/18 的参数量达到同等水平,整个行业对"多大才算够"的认知需要重新校准。Agent 时代,效率才是真正的护城河。
Qwen3 全系列模型已在 Hugging Face、ModelScope、Kaggle 开放下载。可使用 SGLang、vLLM 部署,或用 Ollama、LM Studio 本地运行。在线体验请访问 Qwen Chat。
chat.qwen.ai → 切换 Qwen3