超节点绕行英伟达:国产算力换了一条赛道
华为昇腾950超节点性能达GB200 NVL72的1.7倍
国产算力产业通过超节点系统级方案,绕开英伟达单卡性能优势,在互联效率和集群调度上重新定义算力供给规则。
推荐在64卡及以上超节点配置中部署。
—— Kimi K3官方部署文档 · 技术报告
模型规模
首次列为硬性门槛
2.8万亿参数 / 896专家
MoE架构下通信量极大,超节点成为性能保障的必要条件。
供给端
阿里云真武M890
需求端
Kimi / 通义
互相拉动,行业集体转向超节点
算力瓶颈从单卡转向系统互联
单颗国产AI芯片
≈ 1/3
英伟达Blackwell
先进制程受限,单卡差距短期难以弥补
昇腾950超节点 · 1024卡
1.7倍
GB200 NVL72
单卡不如但系统胜出,换赛道竞争
超节点通过高速互联将成百上千颗芯片绑成统一集群,解决数据供不上、传不动的瓶颈,避开英伟达CUDA生态的主场优势。
三条技术路线:规模、介质、成本
01
规模碾压
华为 / 中科曙光
华为1024卡(满配8192卡),中科曙光十万卡集群落地郑州国家超算核心节点,考验系统架构与工程极限。
02
传输介质变革
壁仞科技
NPO光互连替代铜线,单节点扩展至1024卡,GPU与交换机物理分离,突破铜缆3米衰减限制。
03
低成本门槛
中兴 / 中科曙光
开放解耦兼容多芯片,无线缆箱式设计,40卡标准19英寸机箱,部署分钟级,面向中小企业。
从万卡到十万卡,乘以10这件事本身不难,难的是乘完10之后,性能还能不能跟着乘10。
—— 李斌 · 中科曙光高级副总裁
路径颠倒:英伟达先芯片后系统,国产先系统后芯片
英伟达路径
先升级GPU架构 → 再升级NVLink互联 → 最后以NVL72形态打包
国产算力路径
先做超节点系统方案 → 再倒逼芯片设计
制程追不上就不追了,在系统层面重新定规矩。一旦系统级效率成为新标准,单卡性能差距不再致命,相当于绕开英伟达的正门,从侧面撕开缺口。
编辑判断
国产算力产业赌的是不跟英伟达打单卡战争,而是在其尚未建立绝对优势的系统工程领域抢先布局。超节点作为绕开CUDA护城河的突破口,正在重塑算力竞争格局。
结论
换道超车的关键路径
超节点代表国产算力换道超车的关键路径,从系统层面定义算力供给新范式。但大规模集群的工程稳定性、互联效率及实际落地效果仍需持续验证,这条新赛道的胜负尚在早期。