超节点绕行英伟达:国产算力换了一条赛道

华为昇腾950超节点性能达GB200 NVL72的1.7倍

国产算力产业通过超节点系统级方案,绕开英伟达单卡性能优势,在互联效率和集群调度上重新定义算力供给规则。

推荐在64卡及以上超节点配置中部署。

—— Kimi K3官方部署文档 · 技术报告

模型规模 首次列为硬性门槛

2.8万亿参数 / 896专家

MoE架构下通信量极大,超节点成为性能保障的必要条件。

供给端 阿里云真武M890
需求端 Kimi / 通义

互相拉动,行业集体转向超节点

算力瓶颈从单卡转向系统互联

单颗国产AI芯片 ≈ 1/3 英伟达Blackwell

先进制程受限,单卡差距短期难以弥补

昇腾950超节点 · 1024卡 1.7倍 GB200 NVL72

单卡不如但系统胜出,换赛道竞争

超节点通过高速互联将成百上千颗芯片绑成统一集群,解决数据供不上、传不动的瓶颈,避开英伟达CUDA生态的主场优势。

三条技术路线:规模、介质、成本

01 规模碾压 华为 / 中科曙光

华为1024卡(满配8192卡),中科曙光十万卡集群落地郑州国家超算核心节点,考验系统架构与工程极限。

02 传输介质变革 壁仞科技

NPO光互连替代铜线,单节点扩展至1024卡,GPU与交换机物理分离,突破铜缆3米衰减限制。

03 低成本门槛 中兴 / 中科曙光

开放解耦兼容多芯片,无线缆箱式设计,40卡标准19英寸机箱,部署分钟级,面向中小企业。

从万卡到十万卡,乘以10这件事本身不难,难的是乘完10之后,性能还能不能跟着乘10。

—— 李斌 · 中科曙光高级副总裁

路径颠倒:英伟达先芯片后系统,国产先系统后芯片

英伟达路径

先升级GPU架构 → 再升级NVLink互联 → 最后以NVL72形态打包

国产算力路径

先做超节点系统方案 → 再倒逼芯片设计

制程追不上就不追了,在系统层面重新定规矩。一旦系统级效率成为新标准,单卡性能差距不再致命,相当于绕开英伟达的正门,从侧面撕开缺口。

编辑判断

国产算力产业赌的是不跟英伟达打单卡战争,而是在其尚未建立绝对优势的系统工程领域抢先布局。超节点作为绕开CUDA护城河的突破口,正在重塑算力竞争格局。

结论

换道超车的关键路径

超节点代表国产算力换道超车的关键路径,从系统层面定义算力供给新范式。但大规模集群的工程稳定性、互联效率及实际落地效果仍需持续验证,这条新赛道的胜负尚在早期