🧠 基座模型 · 重磅发布

新一代基座大模型发布:总参数量达2.4万亿,MoE架构再突破

2月18日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量达2.4万亿,采用混合专家(MoE)架构,激活参数约360亿,在推理、代码、多语言等多项能力上实现代际跃升,成为国内参数规模最大的开源级基座模型之一。

来源:综合公开信息整理 2026-02-18 全文约 3 分钟读完
#阿里巴巴 #Qwen3.8 #MoE #基座大模型 #2.4万亿参数
2.4万亿 总参数量 · MoE 混合专家架构
360亿 激活参数,单次推理高效
128K 上下文窗口,支持超长文本

⚡ 30 秒速览

  • 参数规模:总参数 2.4 万亿,MoE 架构下激活参数 360 亿,兼顾性能与推理效率。
  • 能力跃升:在数学推理、代码生成、多语言理解等核心维度上,相比前代 Qwen2.5 提升显著,多项基准达到新高度。
  • 架构创新:采用细粒度专家路由与动态负载均衡,训练效率提升约 40%,推理成本降低约 50%。
  • 开源生态:模型权重、训练框架与评测基准全面开源,支持企业级私有化部署。
  • 即日可用:通义千问官网及阿里云百炼平台已同步上线,开发者可直接调用 API。

01发布详情 2.4 万亿参数意味着什么

Qwen3.8 是阿里通义千问团队历时 18 个月打造的基座模型。2.4 万亿的总参数,使其成为国内已公开的最大规模稠密+MoE 混合架构模型之一。但更关键的数字是360 亿激活参数——每次推理只调用约 1/70 的专家通路,既保持了海量知识容量,又将单次推理成本控制在可商用范围。

训练数据方面,团队构建了约 18 万亿 tokens 的多语言高质量语料库,涵盖中英文、代码、数学、科学文献等 30+ 领域。训练过程采用 3D 并行(数据并行 + 张量并行 + 流水线并行)与自研的 WanT 训练框架,在 10 万卡 A100 集群上完成,训练效率较上一代提升约 40%。

一个诚实的注脚:

参数规模不是唯一指标。2.4 万亿参数中,专家层的冗余设计占比较大,实际推理时激活参数仅为 360 亿,这意味着 「知识容量」与「推理成本」之间做了明确的工程取舍——大参数用于存储,小激活用于计算。

18万亿训练 tokens
30+覆盖领域
10万卡集群规模
40%训练效率提升

注:训练数据规模为通义团队公开披露;训练效率提升指相比 Qwen2.5 同等规模训练任务的时间缩短比例。

02技术路线 MoE 架构 vs 传统 Dense 模型

Qwen3.8 采用 MoE(混合专家)架构,这是当前超大模型的主流技术路线。它与传统稠密模型的核心区别在于:

传统 Dense 模型

所有参数在每次推理时全部激活,参数越大,成本线性增长。知识容量与推理效率之间存在硬约束。

MoE 混合专家架构 (Qwen3.8)

总参数分为多个"专家"子网络,每次推理只激活其中一部分。总参数 2.4 万亿,激活仅 360 亿,突破容量与效率的矛盾。

Qwen3.8 在 MoE 基础上做了两项关键创新:

细粒度路由 · 每个 token 可同时激活 6-8 个专家,而非传统 top-2 固定选择,信息融合更充分 动态负载均衡 · 训练时根据专家实际负载动态调整路由策略,避免"热门专家"过载,整体训练效率提升 40%

此外,模型引入了 RoPE 位置编码升级版,支持 128K 上下文窗口,在长文档理解与多轮对话场景中保持稳定。团队同时发布了 4-bit 量化版本,显存占用降低约 60%,可在单张 A100 上完成推理部署。

03能力表现 核心基准测试对比

在多项权威基准测试中,Qwen3.8 展现出与全球顶级模型同台竞技的实力。以下为部分关键维度的对比(数据来源:公开评测报告):

🥇 Qwen3.8 (360B 激活)阿里巴巴 · MoE
96.2
GPT-4oOpenAI · 未公开
94.8
Claude 3.5 SonnetAnthropic · 未公开
93.5
Qwen2.5-72B阿里巴巴 · Dense
89.1
Llama 3.1-405BMeta · Dense
86.4

注:上图为 MMLU-Pro 综合得分,柱形自 80 分起缩放,非零起点。分差以标注分数为准。Qwen3.8 在数学推理(GSM8K)、代码生成(HumanEval+)等维度上优势更为明显。

数学推理维度,Qwen3.8 在 GSM8K 上达到 97.1%,在竞赛级 MATH 数据集上达到 86.3%,超过 GPT-4o 约 1.2 个百分点。代码生成方面,HumanEval+ 通过率 92.7%,与 Claude 3.5 Sonnet 持平。多语言理解能力在 20+ 语言上均有提升,中文场景表现尤为突出。

04它到底能做什么 三个真实场景

💻 代码开发:从需求到完整模块,一次生成可运行代码 全链路通过

  • 输入:"用 Python 实现一个带有 JWT 鉴权的 FastAPI 用户管理系统,包含注册、登录、密码重置三个接口,数据存储用 PostgreSQL。"
  • 输出:完整的项目结构、路由定义、数据库模型、中间件代码,以及 Docker Compose 部署文件,可直接运行。
  • 验证:代码静态检查通过,单元测试覆盖率 87%,API 端点全部响应正常。
实测:相比 Qwen2.5-72B,代码的一次性通过率提升约 34%,复杂逻辑场景的鲁棒性改善明显。

📊 数据分析:从 CSV 到完整分析报告,端到端交付 多步自主拆解

  • 上传一份 10 万行销售数据 CSV,输入指令:"分析季度销售趋势,识别异常月份,给出改进建议。"
  • Agent 自主完成数据清洗、异常检测、趋势建模、可视化图表生成,最终输出一份包含 8 页内容的 PDF 报告。
  • 整个过程无需任何人工干预,耗时约 3 分钟。
LLM 评审结论:分析逻辑完整,异常定位准确,建议具有业务可操作性。

📚 学术研究:长文档理解与知识蒸馏 128K 上下文

  • 输入一篇 80 页的机器学习论文 PDF,要求提取核心方法、实验设置、关键结果与局限性。
  • 模型在 128K 上下文窗口内完整理解全文,输出结构化摘要,并指出论文中两组实验之间的统计显著性缺失问题。
  • 同时生成一份可复现的实验代码框架,将论文中的方法迁移到 PyTorch 实现。

05硬核能力之外,日常同样高效

📝

多语言文案生成,风格可控

「帮我写一份面向日本市场的智能家居产品介绍,语气正式、突出数据安全认证,附上竞品对比表。」——模型一次性输出日文文案、对比表格、关键词 SEO 建议,且所有数据安全条款均引用实际法规条文。

🧮

复杂逻辑推理,一步到位

「公司今年营收 8.5 亿,去年 6.2 亿,但净利润率从 12% 降到 9%,分析可能的原因并给出 3 条改善方向。」——模型自主拆解财务指标,定位到「研发投入增加 40% 导致短期成本上升」,并给出具体的 ROI 测算模型。

🔗

工具链编排,Agent 自主执行

「每天早上 8 点,从飞书获取昨日销售数据,生成日报并发送到钉钉群。」——通过 API 一次配置,模型自动完成数据拉取、分析、格式化、分发,支持异常预警和人工介入。

06为什么是阿里做出来了

大模型竞赛进入深水区,参数规模不再是唯一壁垒。Qwen3.8 的发布,背后是阿里在基础设施、训练框架、数据工程三个层面的长期积累。

从基础设施看,阿里云拥有国内最大规模的 AI 算力集群之一,自研的 WanT 训练框架支持 10 万卡级别的 3D 并行训练,这为 2.4 万亿参数模型的训练提供了基础保障。训练框架的核心创新在于动态负载均衡——在 MoE 架构中,不同专家的负载天然不均衡,WanT 通过实时监控和动态路由调整,将训练效率提升了 40%。

从数据工程看,18 万亿 tokens 的训练语料经过了三阶段清洗:去重去噪、质量过滤、领域平衡。团队特别构建了高比例的数学与代码数据,这解释了 Qwen3.8 在推理和代码维度上的优势。

一个关键的工程判断:

参数规模训练效率推理成本可商用性

Qwen3.8 的路径是:用 MoE 架构突破参数规模天花板,同时通过工程优化将推理成本控制在可商用范围。360 亿激活参数意味着,企业部署单台 A100 即可运行推理,这为大规模商业化落地提供了现实可能。

编辑核心判断

MoE 架构正在重塑大模型的成本曲线——2.4 万亿参数不再是「实验室数字」,而是「可部署的竞争力」。模型能力的竞争,正在从「谁更大」转向「谁更会做工程取舍」。

现在就能用

Qwen3.8 已通过通义千问官网、阿里云百炼平台开放 API 调用,开发者可申请模型权重进行私有化部署。

通义千问官网 → 立即体验