🌐 产业观察 · AI 基础设施

大模型集群迈向十万卡,算力竞赛的真正瓶颈变成了网络

当 GPU 集群从千卡迈向十万卡,单卡算力已不再是唯一标尺。数据显示,大模型训练中 GPU 真正用于计算的时间仅占 20% 左右,而 21% 的训练任务因网络问题中断——网络,正在卡住 AI 算力的脖子

综合公开信息整理 2026 产业观察 全文约 4 分钟读完
#AI数据中心 #网络瓶颈 #十万卡集群 #AIDC
20% GPU 真正用于计算的时间占比
21% 大语言模型训练因网络中断的失败率
10-20× 单节点网络硬件用量较传统 CPU 集群增幅

⚡ 30 秒速览

  • 核心矛盾:GPU 算力增长远超数据在芯片间的搬运速度,网络成为制约 AI 集群发展的命门。
  • 触目代价:大模型训练中 GPU 有 60% 以上时间花在数据移动与通信上;每五次训练就有一次因网络中断而失败。
  • 堆硬件失灵:带宽从 400G 到 1.6T 仍在翻倍,但流量调度若靠"蛮力",三分之一算力仍会损耗在等待中。
  • 技术破局:LLR(链路层重传)与 CBFC(网络红绿灯)开始从实验室走向 800GE 线速现网演示。
  • 验证盲区:95% 运营商认为真实负载测试至关重要,但多数企业仍在用传统 benchmark 蒙混过关。

01GPU 在等数据 算力浪费的真相

过去几年,人们习惯用单颗 GPU 的算力指标来衡量 AI 基础设施的先进程度。但在 2026 年,算力竞赛的底层逻辑已经被改写。当大模型训练集群从千卡迈向万卡甚至十万卡,真正的瓶颈早已不是芯片算力,而是网络。

就像一条高速公路,车道修得再宽,如果收费站堵死了,车还是跑不起来。

是德科技网络与数据中心副总裁 Joachim Peerlings 给出了一组令人深思的数字:在计算机视觉模型训练中,GPU 有超过 60% 的时间花费在数据移动和通信上,真正用于计算的时间仅占 20% 左右

数据移动与通信
60%+
实际计算
~20%
其他开销
~20%
计算时间 等待与数据移动

注:以上为计算机视觉模型训练场景的时间分布估算,不同模型架构与集群规模下比例会有浮动。斜纹区域代表非计算开销。

这还不是最糟糕的。在资源最密集的大语言模型训练任务中,因网络问题导致的训练失败率高达 21%。每五次训练就有一次因网络中断,而一次中断可能意味着数小时甚至数天的计算成果付诸东流。

一块昂贵的 GPU,大部分时间不是在"算",而是在"等"。

02堆硬件为何失灵 带宽翻倍追不上模型翻倍

面对网络瓶颈,最本能的反应是堆硬件——更高速的光模块、更大端口的交换机、更粗的铜缆。从 400G 到 800G 再到 1.6T,接口速率每隔一两年就翻一倍。但这条看似最直接的路,正越走越窄。

传统数据中心网络

为人与人通信设计,流量随机且不着急,丢几个包大不了重传。承载可预测流量,偶尔抖动无伤大雅。

AI 集群网络

机器与机器的对话,周期性极强、同步要求极高。任何一个慢节点都会拖垮整个集群,一个丢包可能引发连锁反应。

更棘手的是,传统网络的负载均衡算法依然停留在"逐流 ECMP"时代——通过哈希算法将每条数据流分配到某条链路。但 AI 训练需要成千上万个 GPU 同时发起通信,流量像潮水一样涌来,哈希算法根本来不及反应,结果就是部分端口满载、部分端口闲置的资源错配。

一位互联网大厂基础设施负责人曾透露:设备采购花了几个亿,实际跑起来发现,三分之一的算力都损耗在网络等待上——相当于每三台 GPU 就有一台在空转。

你可以把带宽修到 800G,但如果流量调度依然靠"蛮力",大部分带宽依旧是被浪费的。

03两个被重新发现的技术 LLR 与 CBFC

在此背景下,行业开始从堆硬件转向通过协议、软件等方式让数据流跑得更顺畅。LLR 与 CBFC 这两项原本不受关注的技术,开始被 AIDC 运营方高度重视。

🛰️

LLR · 链路层重传

把重传机制下沉到链路层,让交换机自己发现丢包、自己重传,不等上层发号施令。恢复时间从毫秒压到微秒级,解决了传统网络中因单包丢失引发的重传延迟。

🚦

CBFC · 网络红绿灯

发送端在发数据之前,先确认接收端有足够缓存空间再发,避免数据发过去对方装不下只能丢弃。在成百上千个发送端同时汇聚流量时,协调精度直接决定网络通畅程度

今年 3 月,是德科技与 Broadcom 在 OFC 2026 上完成了业界首个基于超以太网联盟规范、在 800GE 线速下实现 LLR 和 CBFC 的公开互操作性演示。这标志着两项技术正式从实验室协议走向真实互联互通。

但从协议到大规模现网部署,还有很多路要走。不同厂商设备、不同网络拓扑、不同工作负载,都需要精细化参数调优。相比传统 ECMP 方案,新的端到端负载均衡方法可将网络带宽利用率提升最高 38%,训练任务时长缩短超过 3%

在十万卡集群里,3% 意味着节省数百万美元的电力成本和数周的研发周期。

04测通非真通 最容易被忽视的验证盲区

服务器买回来了,交换机上架了,线也插好了,标准测试跑了一遍——带宽达标、延迟正常,一切看起来完美。但一跑大模型训练,问题就来了:频繁掉线、速度上不去、莫名其妙卡住。

问题出在了验证环节。

是德科技从三个维度拆解了 AI 网络验证的挑战。其中,最容易被企业忽视的恰恰是 Scale-Up 环节——它发生在机柜内部,距离短、看起来技术含量不高,但承载着最密集、最频繁的数据交换。

Scale-Up 易忽视

机柜内部互联。距离虽短,却承载 GPU 间每一次参数同步与梯度聚合。一旦出问题,整个集群性能打折扣。

Scale-Out 复杂

大量交换机间互联,拓扑复杂、路径繁多。传统验证方式无法覆盖真实负载下的性能表现。

Scale-Across 受限

跨数据中心长距离协同训练。延迟与可靠性面临物理极限——光速本身都成了限制因素。

注:三大维度按网络覆盖范围递进。Scale-Up 指机柜内 GPU 互联,Scale-Out 指机柜间互联,Scale-Across 指跨数据中心互联。

是德科技的一项调查显示,95% 的运营商认为真实工作负载测试对 AI 网络验证至关重要。但现实是,很多企业仍在用传统数据中心的测试方法——跑几个标准 benchmark,测一下带宽和延迟,就认为没问题了。

传统网络承载的是可预测流量,但 AI 网络的流量模式突发性强、东西向流量巨大、对丢包和延迟极度敏感。未来五年,AI 集群的东西向流量将增长 10 倍或更多,等 GPU 到位再测试网络的旧模式根本无法扩展。

05推理场景的时延考验 网络不仅要快,还要稳

过去的大模型推理,用户提交一个任务,等十几秒出结果,大家都能接受。但现在,AI 正在嵌入对话系统、实时翻译、自动驾驶、金融高频交易等场景——都要求毫秒级响应

⏱️ 两个决定用户体验的关键时延指标实时推理

  • 首 Token 时延:用户发出请求到收到第一个输出 Token 的时间。决定了用户有没有"反应过来"的感知。
  • Token 间时延:后续 Token 之间的间隔。决定了整个交互过程的流畅度,一旦不稳定,对话体验瞬间崩塌。
这意味着网络验证的目标,已从"能不能跑到标称速率",变成了"在最恶劣的流量冲击下,时延和抖动能不能稳定在承诺范围内"

传统网络可以容忍偶尔的抖动——视频卡一下、文件下载慢几秒,不会太影响体验。但在实时推理场景下,每一次抖动都会直接转化为用户感知到的"卡顿"

网络不仅要快,还要稳。

06核心判断 网络是 AI 算力释放的命门

当十万卡集群成为标配,实时推理渗透进每一个日常应用,网络就不再只是传输流量的管道,而是决定 AI 算力能否真正释放的命门。

一个诚实的注脚:LLR 与 CBFC 从协议到大规模现网部署仍有长路。不同厂商设备的互操作性、真实生产环境下的参数调优、跨拓扑的负载适配——每一步都可能影响网络性能的成败。协议写好了、标准通过了,不等于现网跑得顺。

但方向已经清晰:AI 网络的竞争,正在从"堆硬件"转向"拼系统工程"。那些只买最贵设备却不投入流量调度与验证能力的企业,终将发现三分之一的算力在空转。

编辑核心判断

AI 基础设施的下半场,比拼的不再是谁能堆出更高的带宽,而是谁能把每一比特带宽用到极致——网络系统工程能力,将成为算力变现的决定性变量。