🧠 模型 · 开源发布

通义千问发布 Qwen3 系列:235B MoE 开源,4B 小模型超越 72B 前代

4 月 30 日,通义千问正式发布 Qwen3 系列大语言模型,包含旗舰 MoE 模型 Qwen3-235B-A22B 及 8 款开源模型。旗舰模型在代码、数学、通用能力上对标 DeepSeek‑R1、o1 等顶级模型;最小的 4B 模型以 4B 参数达到前代 72B 模型的性能水平,参数效率提升 18 倍。

综合公开信息整理 2026-04-30 全文约 3 分钟读完
#Qwen3 #通义千问 #MoE #开源模型 #参数效率
235B / 22B 旗舰 MoE 总参数 / 激活参数
36万亿 预训练 token 总量
119 支持语言与方言

⚡ 30 秒速览

  • 旗舰对标:Qwen3‑235B‑A22B 在代码、数学、通用能力上与 DeepSeek‑R1、o1、Grok‑3 等顶级模型竞争,激活参数仅 22B。
  • 效率跃迁:Qwen3‑4B 以 4B 参数达到 Qwen2.5‑72B‑Instruct 性能,参数效率提升 18 倍;Qwen3‑30B‑A3B 仅用 QwQ‑32B 10% 激活参数,表现更优。
  • 双模思考:支持「思考模式」(深度推理)与「非思考模式」(快速响应),用户可逐轮控制推理预算,成本与质量灵活平衡。
  • 全栈开源:2 个 MoE 模型 + 6 个 Dense 模型,从 0.6B 到 235B 全覆盖,Apache 2.0 许可,Hugging Face / ModelScope 可获取。

01参数效率的革命 小模型,大能力

Qwen3 最令人意外的不是旗舰模型的对标能力,而是小模型展现出的惊人效率。整个系列中,最小的 4B 模型直接追平了前代 72B 模型的性能——这意味着用户可以用更低的算力成本,获得过去需要大模型才能实现的效果。

Qwen2.5-72B-Instruct

前代旗舰级 Dense 模型

72B
总参数

Qwen3-4B

性能持平,参数减少 18 倍

4B
总参数 · 性能 ≈ Qwen2.5-72B
3B 激活
Qwen3-30B-A3B 激活参数
性能 > QwQ-32B
22B 激活
Qwen3-235B-A22B 激活参数
对标 DeepSeek-R1 / o1
0.6B → 32B
Dense 模型全覆盖
Apache 2.0 开源

注:Qwen3‑30B‑A3B 总参数 30B,激活参数仅 3B,约为 QwQ‑32B 激活参数的 10%,但多项基准测试表现更优。Qwen3‑235B‑A22B 以 22B 激活参数与 37B 激活参数的 DeepSeek‑R1 同场竞技。

全系列共 8 款模型:2 个 MoE(235B‑A22B、30B‑A3B)和 6 个 Dense 模型(32B、14B、8B、4B、1.7B、0.6B),覆盖从端侧到云端的所有场景。其中 0.6B 模型仅为 28 层、16 头,却已超越 Qwen2.5‑3B 的基座性能。

02想深想浅,你说了算 思考模式 vs 非思考模式

Qwen3 支持两种推理模式,且可在同一轮对话中通过 /think/no_think 指令动态切换。这不是一个"开关",而是一个连续的思考预算控制——用户可以根据任务复杂度,自由分配推理深度。

💨 非思考模式

快速响应,适合简单问题、日常查询、对延迟敏感的场景。模型直接输出答案,不展示推理过程。

典型场景:信息查询、翻译、格式化输出

🧠 思考模式

逐步推理,展示完整思维链。适合数学、代码、逻辑推理、复杂决策等需要深度思考的任务。

典型场景:竞赛题、漏洞分析、合同审查

🍓 同一问题,两种回答 现场演示

  • 用户问:「strawberries 里有几个 r?」
  • 思考模式:先拆解单词 s‑t‑r‑a‑w‑b‑e‑r‑r‑i‑e‑s,逐字母计数,定位第 3、8、9 位为 r,输出 3 个,并展示完整推理过程。
  • 非思考模式:直接回答 3 个,无推理过程,响应时间缩短 60% 以上。
两种模式可在对话中通过 /think/no_think 逐轮切换,模型始终遵循最近的指令。默认开启思考模式。

这种设计让用户不再被迫在"速度"和"深度"之间二选一。简单问题用非思考模式秒回,复杂问题用思考模式深挖——同一个模型,两套行为,且推理预算可量化调控。

03119 种语言,一个模型 真正的全球覆盖

Qwen3 的预训练数据包含了 119 种语言和方言,覆盖印欧、汉藏、亚非、南岛、德拉威、突厥、壮侗、乌拉尔、南亚等主要语系。这不是简单的"翻译能力",而是模型在预训练阶段就吸纳了这些语言的语料。

119语言与方言
7+主要语系
36万亿预训练 token
128K最长上下文

注:上下文长度因模型而异——Dense 模型中 0.6B/1.7B/4B 为 32K,8B 及以上为 128K;MoE 模型均为 128K。预训练数据量约为 Qwen2.5 的 2 倍。

多语言覆盖意味着 Qwen3 可以服务全球用户,从英语、中文到小众语言如西里西亚语、巴什基尔语、卡布维尔迪亚努语。对于出海应用、跨国企业、多语言内容生产场景,一个模型即可替代过去需要多个专用模型才能完成的任务。

一个诚实的注脚:覆盖 119 种语言不等于每种语言都达到同等质量。模型在数据量丰富的语言(英、中、法、阿等)上表现更稳定,小众语言的实用性有待社区进一步验证。

04训练兵法:36 万亿 token 与四阶段后训练

Qwen3 的预训练数据量是 Qwen2.5 的将近两倍——从 18 万亿 token 扩展到 36 万亿 token。数据来源不仅是网页,还包括从 PDF 中提取的文档(使用 Qwen2.5‑VL 做 OCR 提取),以及用 Qwen2.5‑Math 和 Qwen2.5‑Coder 合成的教科书、问答对与代码片段。

但真正让模型同时具备"深度推理"和"快速响应"能力的,是其后训练阶段的四阶段流程

① 长思维链冷启动 ② 长思维链强化学习 ③ 思维模式融合 ④ 通用强化学习
第一阶段用数学、代码、逻辑推理等长思维链数据微调,赋予模型基本推理能力。
第二阶段通过大规模基于规则的强化学习,增强模型探索与深度钻研能力。
第三阶段将非思考模式数据与长思维链数据混合微调,实现两种模式的无缝融合。
第四阶段在指令遵循、格式遵循、Agent 能力等 20+ 通用领域继续强化学习,纠正不良行为。

这种"先教推理,再教切换,最后全面优化"的路径,使得 Qwen3 不是简单的"能思考"或"能快答",而是能在同一个模型中灵活切换两种认知模式,且不损失任何一方的质量。

编辑核心判断

Qwen3 证明了"参数效率"比"参数规模"更值得追求——4B 追平 72B 不是特例,而是系统性的架构与训练方法胜利。当开源模型能用 1/18 的参数量达到同等水平,整个行业对"多大才算够"的认知需要重新校准。Agent 时代,效率才是真正的护城河。

立刻体验

Qwen3 全系列模型已在 Hugging Face、ModelScope、Kaggle 开放下载。可使用 SGLang、vLLM 部署,或用 Ollama、LM Studio 本地运行。在线体验请访问 Qwen Chat。

chat.qwen.ai → 切换 Qwen3