盘古模型通信优化实战:AllToAll 提速 10%+,超长上下文 TTFT 再降 10%+
华为 2012 实验室专家李柏潮首次系统披露盘古模型在昇腾 950 上的通信优化实践——MoE 场景 AllToAll 通信性能提升 10% 以上,1M 超长上下文场景下 KV Cache 卸载使 TTFT 降低 10% 以上。相关成果将在 AICon 深圳大会完整呈现。
华为 2012 实验室专家李柏潮首次系统披露盘古模型在昇腾 950 上的通信优化实践——MoE 场景 AllToAll 通信性能提升 10% 以上,1M 超长上下文场景下 KV Cache 卸载使 TTFT 降低 10% 以上。相关成果将在 AICon 深圳大会完整呈现。
大模型训练与推理中,通信开销正在成为最突出的性能短板。尤其当模型规模突破千亿、上下文长度迈向百万级,传统通信方案已经力不从心。
一个关键事实:MoE 模型中 AllToAll 通信占总端到端时间的 30% 以上——这意味着每跑三次训练,就有将近一次的时间花在通信上。
而超长上下文场景带来了新的挑战:
MoE 模型 Expert Parallelism 域内,AllToAll 集体通信长期占据 30%+ 端到端时间,是持续多年的优化重点。
1M 超长上下文场景下,Host to Device 的 KV Cache 传输延迟,成为推理 TTFT 的 "新拦路虎"。
注:AllToAll 是 MoE 模型 Expert Parallelism 中的关键集体通信操作;H2D 指 Host to Device 数据传输,TTFT 为首 token 生成时间。
华为团队围绕昇腾 950 硬件特性,从两个方向同时发力。每个方向都融合了硬件适配与软件创新的双重手段。
两个方向共同指向一个目标:让通信不再成为暴露在训练/推理端到端时延中的短板。
所谓 "亲和",不是简单的适配,而是深度理解硬件特性后,让模型与平台之间形成协同共振。盘古团队在昇腾 950 上实践了三条路径:
适配昇腾 950 的网络拓扑结构,避免通用方案(如 DeepEP)在 910A3 上不兼容的问题,让通信路径与硬件互联完全对齐。
发挥昇腾 950 专门通信加速引擎 CCU 的最大效用,将硬件算力潜能转化为模型训练/推理的实际性能提升。
使用自定义通信算子实现灵活的集合通信新语义,让盘古模型的并行策略与昇腾硬件深度契合。
注:三条路径的核心逻辑是 "让硬件特性成为优化的一部分,而非外挂适配"——这是性能提升 10%+ 的根本原因。
所有优化都有代价。盘古团队的这次实践,在取得显著成果的同时,也暴露了一个无法回避的局限:
一个诚实的注脚:在 AI 基础设施走向分化的今天,没有 "一次优化,到处适用" 的银弹。盘古团队的选择是——在昇腾生态内做到极致,而非在所有平台上做到平庸。
通信优化正在从 "通用方案" 走向 "硬件亲和" 时代。深度绑定特定平台虽然能榨取极致性能,但也带来了可迁移性的根本挑战——这预示着未来 AI 基础设施将走向更加分化、更加专业化的道路,而 "亲和力" 将成为衡量工程能力的新标尺。
华为 2012 实验室专家李柏潮将在 AICon 深圳大会完整分享盘古模型通信优化的全部细节,包括昇腾 950 硬件特性适配、CCU 通信加速引擎调用、Omni Cache 实现方案等。
AICon 深圳 · 8 月 21-22 日 → 现已开放报名