🔖 模型开源 · 华为盘古
5050亿参数、512K上下文:华为开源openPangu-2.0-Pro,余承东的"世界第一"目标还有多远
7月31日,华为正式开源基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro,总参数规模5050亿,激活参数180亿,支持512K上下文长度,训练数据34T tokens。这是余承东6月喊话"要做世界第一"后的首次重磅发布。
综合公开信息整理•
2026-07-31•
全文约 4 分钟读完
#华为盘古
#openPangu
#MoE
#昇腾
#模型开源
5050亿
总参数规模 · MoE 架构
180亿
激活参数,推理高效
512K
上下文长度,长程任务
34T
tokens 预训练语料
⚡ 30 秒速览
- 开源了什么:openPangu-2.0-Pro,5050亿参数MoE,512K上下文,专为长上下文智能体任务打造,模型权重+推理代码+技术报告全量公开。
- 架构核心创新:DSA+SWA分层混合注意力、4支流mHC超连接架构、3头MTP自投机模块、Muon优化器——推理效率与训练收敛速度双提升。
- 诚实的差距:技术报告未披露第三方对比,且在复杂现实世界软件工程任务中坦承与顶尖模型存在明显差距。
- 战略定位:面向端侧智能体生态,目标成为智能设备、汽车等领域的核心竞争力,而非停留在静态基准测试。
- 开源渠道:Hugging Face 与 AtomGit 同步上线,同时开放技术报告,支持社区复现验证。
01核心参数 从旗舰到轻量,三款模型覆盖不同场景
此次开源的 openPangu-2.0-Pro 是系列中的旗舰型号,与此前6月开源的 openPangu-2.0-Flash(92亿参数,6亿激活)形成高低搭配。此外,华为还规划了一款30亿参数(2亿激活)的轻量模型,专为资源受限环境优化。
5050亿
Pro 总参数
180亿
Pro 激活参数
512K
上下文长度
34T
预训练 tokens
三款模型均基于 昇腾NPU 训练,采用MoE架构。Pro版本在保持180亿激活参数的同时,通过 DSA+SWA分层混合注意力 等创新,实现了512K超长上下文的高效处理。
注:激活参数决定推理时的计算开销,总参数反映模型容量。180亿激活参数在同类MoE模型中处于领先水平,但实际推理效率还取决于架构设计与硬件协同。
02架构创新 四项关键升级,全面重构计算范式
openPangu-2.0-Pro 的架构设计围绕一个核心目标:在超长上下文下实现高效推理。传统注意力机制在序列长度超过100K时,计算与显存开销呈二次增长,华为的解决方案是 —— 分层解耦。
传统注意力机制
全局注意力计算量与序列长度平方成正比,长上下文下推理延迟高、显存占用大,难以支撑智能体类多轮交互任务。
openPangu 分层混合注意力
SWA 负责局部窗口建模,DSA 负责全局稀疏聚合,二者独立分层,1:2层配比,在保持精度的同时显著降低计算与显存开销。
但这只是冰山一角。华为在架构层面同步落地了四项关键升级:
🧩
DSA+SWA 分层混合注意力
滑动窗口(SWA)处理稠密局部上下文,深度稀疏注意力(DSA)检索全局信息,层配比1:2,长序列推理效率提升明显。
🔗
mHC 4支流超连接架构
将传统残差连接升级为4支流流形约束超连接,提升表征多样性与泛化能力,训练更稳定。
⚡
MTP 三头自投机模块
一次额外预测3个token,大幅提升推理速度,尤其适合长上下文场景下的生成任务。
📈
Muon 优化器
训练中采用Muon优化器,获得更快收敛速度,在固定数据投入量下提升模型性能。
注:以上四项创新协同工作,其中DSA+SWA是降低长上下文计算复杂度的核心,MTP主要服务于推理加速,mHC与Muon则聚焦训练效率与稳定性。
03性能与差距 通用能力扎实,复杂工程任务仍有短板
技术报告披露了 openPangu-2.0 系列在多个主流基准上的表现,但有一个值得注意的细节:报告未公开与第三方模型的横向对比数据。华为在文中以"具备出众的对标实力"概括,但未给出具体排名或分数差。
通用能力方面,表现扎实。
📊 通用能力与推理测试
- 上下文学习、指令遵循、多轮理解 等维度表现优异,Pro版本显著优于Flash版本。
- 世界知识与事实可靠性 测试中,Pro版本凭借更大参数容量,得分远超轻量版。
- 华为内部实验发现:底层基础推理能力越强,越能支撑复杂智能体行为;而智能体训练又会反向迭代提升模型的多阶任务规划能力。
综合表现:通用能力具备竞争力,但缺乏第三方横向数据支撑。
但一个诚实的注脚:
⚠️ 复杂软件工程任务 与顶尖存在差距
- 技术报告坦承:在处理复杂现实世界软件工程任务时,openPangu-2.0 仍与顶尖模型存在明显差距。
- 报告未具体说明"顶尖模型"指代哪些系统,也未量化差距幅度。
- 华为将此归因于"智能体训练数据与真实工程场景的分布偏移",并计划在后续迭代中重点攻克。
诚实披露差距值得肯定,但"无明显第三方对比"使得竞争力评估缺少客观标尺。
注:技术报告全文已在Hugging Face公开,读者可自行查阅各维度得分与评估方法。华为同时开源了评测流程,支持社区复现。
04训练与推理 三阶段预训练 + 全栈推理加速
openPangu-2.0-Pro 的预训练并非"一口吃成胖子",而是分三个阶段逐步构建能力,每个阶段都有明确的数据策略:
通用领域25T tokens→
推理能力8T tokens→
退火处理1.4T tokens
第三阶段特意保留了较长文档与复杂轨迹数据,以最大限度提升模型的自主任务处理能力。后训练则采用三级流水线:监督微调(SFT)→ 并行强化学习专家训练 → 多专家在线策略蒸馏(OPD),四组专家分别针对逻辑推理、通用问答、智能体交互、代码生成四大领域优化。
推理加速方面,华为交出了一份实打实的成绩单:
openPangu-2.0-Flash
5.63 ms
最低 TPOT 时延(128K上下文)
openPangu-2.0-Flash
1846 token/s
单卡 NPU 吞吐(TPOT 15ms)
openPangu-2.0-Pro
9.55 ms
最低 TPOT 时延(128K上下文)
openPangu-2.0-Pro
1326 token/s
单卡 NPU 吞吐(TPOT 20ms)
这些数据基于 昇腾原生推理框架 实现,该框架自研了面向推理场景的融合算子、专用集合通信原语,并搭配了 Felix上下文并行、混合KV缓存管理、自动前缀缓存等技术。华为强调,这是"硬件执行逻辑与模型运行时动态行为的深度耦合"。
注:TPOT(Time Per Output Token)是衡量大模型推理延迟的关键指标,数值越低越好。128K上下文下的测试数据反映了模型在长序列场景中的实际推理能力。
编辑核心判断
5050亿参数的开源发布令人瞩目,但技术报告回避了第三方横向对比,且在关键软件工程任务上坦承与顶尖存在差距。参数竞赛的下一程,比拼的不再是规模,而是谁能真正让模型在真实场景中可靠地解决问题——工程落地能力,比参数数字更值得关注。
▶获取模型
模型权重、推理代码及技术报告已正式开源,支持社区下载与复现验证。
技术报告同步公开,涵盖完整评测方法与数据。