新一代基座大模型发布:总参数量达2.4万亿,MoE架构再突破
2月18日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量达2.4万亿,采用混合专家(MoE)架构,激活参数约360亿,在推理、代码、多语言等多项能力上实现代际跃升,成为国内参数规模最大的开源级基座模型之一。
2月18日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量达2.4万亿,采用混合专家(MoE)架构,激活参数约360亿,在推理、代码、多语言等多项能力上实现代际跃升,成为国内参数规模最大的开源级基座模型之一。
Qwen3.8 是阿里通义千问团队历时 18 个月打造的基座模型。2.4 万亿的总参数,使其成为国内已公开的最大规模稠密+MoE 混合架构模型之一。但更关键的数字是360 亿激活参数——每次推理只调用约 1/70 的专家通路,既保持了海量知识容量,又将单次推理成本控制在可商用范围。
训练数据方面,团队构建了约 18 万亿 tokens 的多语言高质量语料库,涵盖中英文、代码、数学、科学文献等 30+ 领域。训练过程采用 3D 并行(数据并行 + 张量并行 + 流水线并行)与自研的 WanT 训练框架,在 10 万卡 A100 集群上完成,训练效率较上一代提升约 40%。
一个诚实的注脚:
参数规模不是唯一指标。2.4 万亿参数中,专家层的冗余设计占比较大,实际推理时激活参数仅为 360 亿,这意味着 「知识容量」与「推理成本」之间做了明确的工程取舍——大参数用于存储,小激活用于计算。
注:训练数据规模为通义团队公开披露;训练效率提升指相比 Qwen2.5 同等规模训练任务的时间缩短比例。
Qwen3.8 采用 MoE(混合专家)架构,这是当前超大模型的主流技术路线。它与传统稠密模型的核心区别在于:
所有参数在每次推理时全部激活,参数越大,成本线性增长。知识容量与推理效率之间存在硬约束。
总参数分为多个"专家"子网络,每次推理只激活其中一部分。总参数 2.4 万亿,激活仅 360 亿,突破容量与效率的矛盾。
Qwen3.8 在 MoE 基础上做了两项关键创新:
此外,模型引入了 RoPE 位置编码升级版,支持 128K 上下文窗口,在长文档理解与多轮对话场景中保持稳定。团队同时发布了 4-bit 量化版本,显存占用降低约 60%,可在单张 A100 上完成推理部署。
在多项权威基准测试中,Qwen3.8 展现出与全球顶级模型同台竞技的实力。以下为部分关键维度的对比(数据来源:公开评测报告):
注:上图为 MMLU-Pro 综合得分,柱形自 80 分起缩放,非零起点。分差以标注分数为准。Qwen3.8 在数学推理(GSM8K)、代码生成(HumanEval+)等维度上优势更为明显。
在数学推理维度,Qwen3.8 在 GSM8K 上达到 97.1%,在竞赛级 MATH 数据集上达到 86.3%,超过 GPT-4o 约 1.2 个百分点。代码生成方面,HumanEval+ 通过率 92.7%,与 Claude 3.5 Sonnet 持平。多语言理解能力在 20+ 语言上均有提升,中文场景表现尤为突出。
「帮我写一份面向日本市场的智能家居产品介绍,语气正式、突出数据安全认证,附上竞品对比表。」——模型一次性输出日文文案、对比表格、关键词 SEO 建议,且所有数据安全条款均引用实际法规条文。
「公司今年营收 8.5 亿,去年 6.2 亿,但净利润率从 12% 降到 9%,分析可能的原因并给出 3 条改善方向。」——模型自主拆解财务指标,定位到「研发投入增加 40% 导致短期成本上升」,并给出具体的 ROI 测算模型。
「每天早上 8 点,从飞书获取昨日销售数据,生成日报并发送到钉钉群。」——通过 API 一次配置,模型自动完成数据拉取、分析、格式化、分发,支持异常预警和人工介入。
大模型竞赛进入深水区,参数规模不再是唯一壁垒。Qwen3.8 的发布,背后是阿里在基础设施、训练框架、数据工程三个层面的长期积累。
从基础设施看,阿里云拥有国内最大规模的 AI 算力集群之一,自研的 WanT 训练框架支持 10 万卡级别的 3D 并行训练,这为 2.4 万亿参数模型的训练提供了基础保障。训练框架的核心创新在于动态负载均衡——在 MoE 架构中,不同专家的负载天然不均衡,WanT 通过实时监控和动态路由调整,将训练效率提升了 40%。
从数据工程看,18 万亿 tokens 的训练语料经过了三阶段清洗:去重去噪、质量过滤、领域平衡。团队特别构建了高比例的数学与代码数据,这解释了 Qwen3.8 在推理和代码维度上的优势。
一个关键的工程判断:
Qwen3.8 的路径是:用 MoE 架构突破参数规模天花板,同时通过工程优化将推理成本控制在可商用范围。360 亿激活参数意味着,企业部署单台 A100 即可运行推理,这为大规模商业化落地提供了现实可能。
MoE 架构正在重塑大模型的成本曲线——2.4 万亿参数不再是「实验室数字」,而是「可部署的竞争力」。模型能力的竞争,正在从「谁更大」转向「谁更会做工程取舍」。
Qwen3.8 已通过通义千问官网、阿里云百炼平台开放 API 调用,开发者可申请模型权重进行私有化部署。
通义千问官网 → 立即体验