⚡ AI Infra · 技术深潜

GPU 近 20% 时间在空转:AI Infra 的千亿级机会

CMU 对 756 块 GPU 的 31 天细粒度监测发现,近 20% 的执行时间和约 11% 的能耗被浪费在空转等待上。Azure Code 负载甚至高达 65%。当硬件成本以百万美元计,软件层的每一次优化都变成了直接的商业问题。

综合公开信息整理 2026-07-24 全文约 5 分钟读完
#AI Infra #GPU 利用率 #SGLang #RadixArk #推理引擎
近 20% GPU 执行时间空转 · 756 块 GPU 实测
65% Azure Code 负载能耗空转
400 万美元 一台 GB200 NVL72 机柜成本

⚡ 30 秒速览

  • GPU 空转有多严重:CMU 实测集群中近 20% 执行时间、约 11% 能耗浪费在等待。推理场景更糟,Azure Code 负载 65% 能耗空转,OpenAI Chat 类请求达 52%。
  • 问题出在哪:AI Infra 分四层——能源、硬件、系统软件、服务编排。前两层是"硬问题"改造周期以年计,后两层是"软问题"优化空间最大。
  • 怎么优化:SGLang 围绕四个方向——计算复用(KV Cache 共享)、等待消除(连续批处理)、算力跑满(低精度+投机采样)、资源协同(PD 分离)。
  • 谁在押注:RadixArk 从 SGLang 孵化,种子轮超 1 亿美元,英伟达、AMD、联发科、Databricks 全数到齐,个人投资者包括博通 CEO、英特尔 CEO 等。
  • 更大的图景:推理框架正成为 AI 时代的"操作系统"——连接模型与芯片,让任何团队都能快速部署前沿模型。

01一个被忽视的真相:GPU 并不忙

卡内基梅隆大学今年 4 月发布的一项研究,对一个大型学术 AI 集群里的 756 块 GPU 做了 31 天细粒度遥测,覆盖 A6000 到 B200 共六种型号。结果发现一个令人不安的事实:

GPU 大量时间处于"执行时空转"状态——看似繁忙,实则等待。

近 20%执行时间空转
约 11%能耗浪费在等待
65%Azure Code 空转能耗
52%Chat 类请求空转能耗

数据来源:CMU 对 756 块 GPU 的 31 天遥测。横轴为不同负载类型,柱高代表执行时间中空转的占比。

为什么 GPU 跑不满?答案藏在 AI Infra 的 四层架构 里。每一层都可能成为瓶颈:

能源基础设施电力 · 散热 · 稳定性
硬问题
计算硬件GPU · HBM · NVLink · CPU
硬问题
系统软件CUDA · 编译器 · 算子库
软问题
服务编排调度器 · 推理引擎 · 资源管理
软问题

注:柱形示意各层当前可优化的空间相对大小。"硬问题"改造周期以年为单位,"软问题"通过算法和工程优化可带来数倍性能提升。

前两层是"硬问题"——电力、散热、芯片的改造周期以年计,优化空间正在见顶。后两层是"软问题"——本质上是工程和算法问题,优化后能带来数倍的性能提升。

行业的注意力正在快速向这两层"软问题"上移。

02为什么软件层才是真正的杠杆

一台 NVIDIA GB200 NVL72 机柜,采购成本约 400 万美元。如果软件栈没有做好调度和优化,GPU 实际利用率可能只有 50%——相当于 200 万美元以电费、折旧和机会成本的形式被白白烧掉。

反过来,把利用率从 50% 推到 90% 以上,效果相当于凭空多出一台机柜。

硬问题(能源 / 硬件)

改造周期长,优化空间见顶。电力扩容、芯片迭代都以年为单位,且边际成本越来越高。

软问题(系统软件 / 服务编排)

工程与算法问题,优化空间巨大。调度策略、缓存复用、计算分离等技术,能带来数倍性能提升。

这就是为什么 Anthropic 内部 AI Infra 团队已超过 200 人,并且直接贡献了公司从 infra 极度不稳定到实现盈利的关键转折。也解释了为什么 SGLang 和 vLLM 这两个开源推理引擎,种子轮融资都超过 1 亿美元,背后几乎聚齐了 AI 产业里所有顶级玩家。

03优化四问:哪些计算不用重做?SGLang 的实践

目前所有的优化工作,都可以归结为对四个问题的回答。SGLang 在这四个方向上都给出了自己的答案。

🧠 计算复用:KV Cache 的极致共享 RadixAttention

  • 大模型推理中,同一段文字被反复喂给模型时,每次都要从头计算。Agent 工作流里工具描述可能被调用几十次,业界称为"推理税"
  • SGLang 用 Radix Tree(基数树) 组织海量请求的 KV Cache,共享前缀的请求共用同一段枝干,分叉时才长出新的树枝。
  • 缓存感知调度(Cache-aware scheduling)让前缀相似的请求靠近处理,把顺序从"麻辣香锅、寿司、牛排"重新排成"3 份麻辣香锅、2 份寿司",缓存命中率大幅提升。
  • 分布式缓存感知负载均衡:把请求发到"已经有笔记"的 GPU 上,避免跨卡重复计算。
效果:Anthropic 曾通过类似优化将成本砍掉 90%。SGLang 的 RadixAttention 跨请求、跨机器共享 KV Cache,将缓存从"一次性"变成"全局可复用"。

⏱️ 等待消除:让 GPU 不再干等 Continuous Batching

  • 早期推理引擎是"排队制",一个算完再算下一个。后来演进到"批处理",但凑批也要等,短的算完要等长的。
  • 现在主流做法是 Continuous Batching(连续批处理)——像一辆随时上下客的公交车,新请求随时上车,算完的随时下车,GPU 始终保持满载。
  • 更进一步的 Prefill/Decode 分离:把"读入"和"生成"拆到不同 GPU 上,各自用最适合的硬件配置,通过高速网络传递中间结果。
效果:Continuous Batching 让 GPU 实际吞吐量提升 2–4 倍。PD 分离已成为推理引擎最重要的架构演进之一,DeepSeek、英伟达 Dynamo 均采用此方案。

🔧 算力跑满:低精度与投机采样 Speculative Decoding

  • GPU 大量时间花在数据搬运上,又受限于串行解码,计算能力无法充分释放。
  • 低精度计算:模型权重、中间激活值、KV Cache 三部分精度可独立设置,用更小的数据格式存储和运算,可多释放出一倍的算力空间。
  • 投机采样:小模型先"猜"几个字,大模型一次性验证。就像助教先写草稿,老师一次性批改,最佳情况下生成速度提升 2–3 倍。
效果:推理引擎将这些新能力第一时间集成到系统中,与芯片厂商深度联合调优,在硬件发布当天即完成 day-0 支持,把硅的性能压到极致。

注:以上三个案例均基于 SGLang 推理引擎的实际技术路线。SGLang 已从开源项目孵化出商业化公司 RadixArk,种子轮融资超 1 亿美元。

04为什么是 SGLang 做出来了?

答案不复杂:SGLang 从一开始就押注了"系统级优化"这条最难但壁垒最高的路。当大多数团队还在比拼模型参数时,SGLang 选择在推理引擎层做深做透,把模型、芯片、框架三者之间的协同效率推到极致。

这种战略眼光得到了产业界的一致认可。RadixArk 从 SGLang 孵化出来进行融资时,投资阵容堪称豪华:

英伟达 AMD 联发科 Databricks 陈立武(英特尔 CEO) 陈福阳(博通 CEO) John Schulman(OpenAI 联合创始人) Soumith Chintala(PyTorch 之父)

对英伟达、AMD 来说,投资 RadixArk 是一种战略下注——他们需要一个连接算力与应用的基础设施入口,把更多模型、企业应用和 Agent 汇聚到自己的算力生态中。对个人投资者来说,这意味着 AI Infra 正在成为整个行业的基础设施层。

推理框架正越来越像 AI 时代的"操作系统"——连接模型与芯片的关键一层。

编辑核心判断

AI Infra 能力的公共化,正在让"前沿实验室"这个词变得过时。当任何团队都能借助开源推理引擎获得与巨头同级别的部署能力时,模型参数竞赛的意义将被重新定义——真正的壁垒,不在模型本身,而在让模型高效运转的系统工程能力。

当 AI Infra 能力从少数前沿模型巨头的独家资源,变成任何一家创业公司都能直接调用的公共品,从事 AI 工作的门槛会被显著降低。而这,或许才是"榨出硅的极限"这件事最重要的意义。