🔧 硬科技 · 通信优化

盘古模型通信优化实战:AllToAll 提速 10%+,超长上下文 TTFT 再降 10%+

华为 2012 实验室专家李柏潮首次系统披露盘古模型在昇腾 950 上的通信优化实践——MoE 场景 AllToAll 通信性能提升 10% 以上,1M 超长上下文场景下 KV Cache 卸载使 TTFT 降低 10% 以上。相关成果将在 AICon 深圳大会完整呈现。

综合公开信息整理 2026-08-05 全文约 3 分钟读完
#华为盘古 #昇腾平台 #通信优化 #MoE #KV Cache
10%+ AllToAll 通信性能提升
10%+ TTFT 首 token 延迟降低
1M 超长上下文场景

⚡ 30 秒速览

  • 核心瓶颈:MoE 模型 AllToAll 通信占总端到端时间 30% 以上;1M 超长上下文下,Host to Device 的 KV Cache 传输延迟成为 TTFT 新 "拦路虎"。
  • 优化路径:深度亲和昇腾 950 硬件——拓扑亲和(适配网络拓扑)、算力亲和(发挥 CCU 通信加速引擎)、模型亲和(自定义通信算子)。
  • 关键成果:盘古模型 EP 通信域 AllToAll 性能提升 10%+;Omni Cache 实现高效 KV Cache 卸载,TTFT 提升 10%+。
  • 诚实代价:针对昇腾 950 的优化策略在 910A2/A3、NVIDIA H20 等平台上会失效甚至性能劣化——普适性与极致性能不可兼得。

01通信瓶颈 两个 "拦路虎" 拖慢大模型

大模型训练与推理中,通信开销正在成为最突出的性能短板。尤其当模型规模突破千亿、上下文长度迈向百万级,传统通信方案已经力不从心。

一个关键事实:MoE 模型中 AllToAll 通信占总端到端时间的 30% 以上——这意味着每跑三次训练,就有将近一次的时间花在通信上。

而超长上下文场景带来了新的挑战:

传统瓶颈:AllToAll 通信

MoE 模型 Expert Parallelism 域内,AllToAll 集体通信长期占据 30%+ 端到端时间,是持续多年的优化重点。

新瓶颈:H2D KV Cache 传输

1M 超长上下文场景下,Host to Device 的 KV Cache 传输延迟,成为推理 TTFT 的 "新拦路虎"。

30%+AllToAll 耗时占比
1M超长上下文长度
2核心瓶颈类型
950昇腾平台型号

注:AllToAll 是 MoE 模型 Expert Parallelism 中的关键集体通信操作;H2D 指 Host to Device 数据传输,TTFT 为首 token 生成时间。

02两路突破 AllToAll + KV Cache 双线优化

华为团队围绕昇腾 950 硬件特性,从两个方向同时发力。每个方向都融合了硬件适配与软件创新的双重手段。

📡 方向一:EP 域 AllToAll 加速 10%+ 提升

  • 拓扑亲和:针对昇腾 950 网络拓扑结构深度适配,避免 DeepEP 等通用方案因不兼容 910A3 而失效。
  • 算力亲和:充分发挥昇腾 950 专门通信加速引擎 CCU 的最大效用,将硬件算力转化为实际性能。
  • 模型亲和:使用自定义通信算子实现灵活的集合通信新语义,贴合盘古模型的并行策略。
成果:盘古模型 EP 通信域 AllToAll 性能提升 10% 以上,通信时间占比显著下降。

💾 方向二:超长上下文 KV Cache 卸载 10%+ TTFT 降低

  • 硬件优化:昇腾 950 为每个 NPU 提供专用的 H2D 通路,大幅提升 Host to Device 传输带宽。
  • 软件优化:自研 Omni Cache 实现高效的 KV Cache 卸载策略,将 H2D 和 D2H 通信延迟最小化。
成果:1M 超长上下文场景下,TTFT 提升 10% 以上,推理响应速度明显改善。

两个方向共同指向一个目标:让通信不再成为暴露在训练/推理端到端时延中的短板

03亲和昇腾:三条路径,同一个原则

所谓 "亲和",不是简单的适配,而是深度理解硬件特性后,让模型与平台之间形成协同共振。盘古团队在昇腾 950 上实践了三条路径:

🧠

拓扑亲和

适配昇腾 950 的网络拓扑结构,避免通用方案(如 DeepEP)在 910A3 上不兼容的问题,让通信路径与硬件互联完全对齐。

算力亲和

发挥昇腾 950 专门通信加速引擎 CCU 的最大效用,将硬件算力潜能转化为模型训练/推理的实际性能提升。

🔧

模型亲和

使用自定义通信算子实现灵活的集合通信新语义,让盘古模型的并行策略与昇腾硬件深度契合。

注:三条路径的核心逻辑是 "让硬件特性成为优化的一部分,而非外挂适配"——这是性能提升 10%+ 的根本原因。

04诚实的代价 普适性与极致性能不可兼得

所有优化都有代价。盘古团队的这次实践,在取得显著成果的同时,也暴露了一个无法回避的局限:

  • 针对昇腾 950 硬件平台进行的通信优化,牺牲了普适性,换取了性能提升。
  • 同样的优化策略用到其他平台上(如昇腾 910A2/A3、NVIDIA H20)会失效,甚至带来性能劣化
  • 这意味着:深度硬件亲和是一把双刃剑——榨取极致性能的同时,也绑定了特定平台。

一个诚实的注脚:在 AI 基础设施走向分化的今天,没有 "一次优化,到处适用" 的银弹。盘古团队的选择是——在昇腾生态内做到极致,而非在所有平台上做到平庸

编辑核心判断

通信优化正在从 "通用方案" 走向 "硬件亲和" 时代。深度绑定特定平台虽然能榨取极致性能,但也带来了可迁移性的根本挑战——这预示着未来 AI 基础设施将走向更加分化、更加专业化的道路,而 "亲和力" 将成为衡量工程能力的新标尺。

现场聆听

华为 2012 实验室专家李柏潮将在 AICon 深圳大会完整分享盘古模型通信优化的全部细节,包括昇腾 950 硬件特性适配、CCU 通信加速引擎调用、Omni Cache 实现方案等。

AICon 深圳 · 8 月 21-22 日 → 现已开放报名