大模型集群迈向十万卡,算力竞赛的真正瓶颈变成了网络
当 GPU 集群从千卡迈向十万卡,单卡算力已不再是唯一标尺。数据显示,大模型训练中 GPU 真正用于计算的时间仅占 20% 左右,而 21% 的训练任务因网络问题中断——网络,正在卡住 AI 算力的脖子。
当 GPU 集群从千卡迈向十万卡,单卡算力已不再是唯一标尺。数据显示,大模型训练中 GPU 真正用于计算的时间仅占 20% 左右,而 21% 的训练任务因网络问题中断——网络,正在卡住 AI 算力的脖子。
过去几年,人们习惯用单颗 GPU 的算力指标来衡量 AI 基础设施的先进程度。但在 2026 年,算力竞赛的底层逻辑已经被改写。当大模型训练集群从千卡迈向万卡甚至十万卡,真正的瓶颈早已不是芯片算力,而是网络。
就像一条高速公路,车道修得再宽,如果收费站堵死了,车还是跑不起来。
是德科技网络与数据中心副总裁 Joachim Peerlings 给出了一组令人深思的数字:在计算机视觉模型训练中,GPU 有超过 60% 的时间花费在数据移动和通信上,真正用于计算的时间仅占 20% 左右。
注:以上为计算机视觉模型训练场景的时间分布估算,不同模型架构与集群规模下比例会有浮动。斜纹区域代表非计算开销。
这还不是最糟糕的。在资源最密集的大语言模型训练任务中,因网络问题导致的训练失败率高达 21%。每五次训练就有一次因网络中断,而一次中断可能意味着数小时甚至数天的计算成果付诸东流。
一块昂贵的 GPU,大部分时间不是在"算",而是在"等"。
面对网络瓶颈,最本能的反应是堆硬件——更高速的光模块、更大端口的交换机、更粗的铜缆。从 400G 到 800G 再到 1.6T,接口速率每隔一两年就翻一倍。但这条看似最直接的路,正越走越窄。
为人与人通信设计,流量随机且不着急,丢几个包大不了重传。承载可预测流量,偶尔抖动无伤大雅。
机器与机器的对话,周期性极强、同步要求极高。任何一个慢节点都会拖垮整个集群,一个丢包可能引发连锁反应。
更棘手的是,传统网络的负载均衡算法依然停留在"逐流 ECMP"时代——通过哈希算法将每条数据流分配到某条链路。但 AI 训练需要成千上万个 GPU 同时发起通信,流量像潮水一样涌来,哈希算法根本来不及反应,结果就是部分端口满载、部分端口闲置的资源错配。
一位互联网大厂基础设施负责人曾透露:设备采购花了几个亿,实际跑起来发现,三分之一的算力都损耗在网络等待上——相当于每三台 GPU 就有一台在空转。
你可以把带宽修到 800G,但如果流量调度依然靠"蛮力",大部分带宽依旧是被浪费的。
在此背景下,行业开始从堆硬件转向通过协议、软件等方式让数据流跑得更顺畅。LLR 与 CBFC 这两项原本不受关注的技术,开始被 AIDC 运营方高度重视。
把重传机制下沉到链路层,让交换机自己发现丢包、自己重传,不等上层发号施令。恢复时间从毫秒压到微秒级,解决了传统网络中因单包丢失引发的重传延迟。
发送端在发数据之前,先确认接收端有足够缓存空间再发,避免数据发过去对方装不下只能丢弃。在成百上千个发送端同时汇聚流量时,协调精度直接决定网络通畅程度。
今年 3 月,是德科技与 Broadcom 在 OFC 2026 上完成了业界首个基于超以太网联盟规范、在 800GE 线速下实现 LLR 和 CBFC 的公开互操作性演示。这标志着两项技术正式从实验室协议走向真实互联互通。
但从协议到大规模现网部署,还有很多路要走。不同厂商设备、不同网络拓扑、不同工作负载,都需要精细化参数调优。相比传统 ECMP 方案,新的端到端负载均衡方法可将网络带宽利用率提升最高 38%,训练任务时长缩短超过 3%。
在十万卡集群里,3% 意味着节省数百万美元的电力成本和数周的研发周期。
服务器买回来了,交换机上架了,线也插好了,标准测试跑了一遍——带宽达标、延迟正常,一切看起来完美。但一跑大模型训练,问题就来了:频繁掉线、速度上不去、莫名其妙卡住。
问题出在了验证环节。
是德科技从三个维度拆解了 AI 网络验证的挑战。其中,最容易被企业忽视的恰恰是 Scale-Up 环节——它发生在机柜内部,距离短、看起来技术含量不高,但承载着最密集、最频繁的数据交换。
机柜内部互联。距离虽短,却承载 GPU 间每一次参数同步与梯度聚合。一旦出问题,整个集群性能打折扣。
大量交换机间互联,拓扑复杂、路径繁多。传统验证方式无法覆盖真实负载下的性能表现。
跨数据中心长距离协同训练。延迟与可靠性面临物理极限——光速本身都成了限制因素。
注:三大维度按网络覆盖范围递进。Scale-Up 指机柜内 GPU 互联,Scale-Out 指机柜间互联,Scale-Across 指跨数据中心互联。
是德科技的一项调查显示,95% 的运营商认为真实工作负载测试对 AI 网络验证至关重要。但现实是,很多企业仍在用传统数据中心的测试方法——跑几个标准 benchmark,测一下带宽和延迟,就认为没问题了。
传统网络承载的是可预测流量,但 AI 网络的流量模式突发性强、东西向流量巨大、对丢包和延迟极度敏感。未来五年,AI 集群的东西向流量将增长 10 倍或更多,等 GPU 到位再测试网络的旧模式根本无法扩展。
过去的大模型推理,用户提交一个任务,等十几秒出结果,大家都能接受。但现在,AI 正在嵌入对话系统、实时翻译、自动驾驶、金融高频交易等场景——都要求毫秒级响应。
传统网络可以容忍偶尔的抖动——视频卡一下、文件下载慢几秒,不会太影响体验。但在实时推理场景下,每一次抖动都会直接转化为用户感知到的"卡顿"。
网络不仅要快,还要稳。
当十万卡集群成为标配,实时推理渗透进每一个日常应用,网络就不再只是传输流量的管道,而是决定 AI 算力能否真正释放的命门。
一个诚实的注脚:LLR 与 CBFC 从协议到大规模现网部署仍有长路。不同厂商设备的互操作性、真实生产环境下的参数调优、跨拓扑的负载适配——每一步都可能影响网络性能的成败。协议写好了、标准通过了,不等于现网跑得顺。
但方向已经清晰:AI 网络的竞争,正在从"堆硬件"转向"拼系统工程"。那些只买最贵设备却不投入流量调度与验证能力的企业,终将发现三分之一的算力在空转。
AI 基础设施的下半场,比拼的不再是谁能堆出更高的带宽,而是谁能把每一比特带宽用到极致——网络系统工程能力,将成为算力变现的决定性变量。