⚡ AI Infra · 技术深潜
GPU 近 20% 时间在空转:AI Infra 的千亿级机会
CMU 对 756 块 GPU 的 31 天细粒度监测发现,近 20% 的执行时间和约 11% 的能耗被浪费在空转等待上。Azure Code 负载甚至高达 65%。当硬件成本以百万美元计,软件层的每一次优化都变成了直接的商业问题。
综合公开信息整理•
2026-07-24•
全文约 5 分钟读完
#AI Infra
#GPU 利用率
#SGLang
#RadixArk
#推理引擎
近 20%
GPU 执行时间空转 · 756 块 GPU 实测
65%
Azure Code 负载能耗空转
400 万美元
一台 GB200 NVL72 机柜成本
⚡ 30 秒速览
- GPU 空转有多严重:CMU 实测集群中近 20% 执行时间、约 11% 能耗浪费在等待。推理场景更糟,Azure Code 负载 65% 能耗空转,OpenAI Chat 类请求达 52%。
- 问题出在哪:AI Infra 分四层——能源、硬件、系统软件、服务编排。前两层是"硬问题"改造周期以年计,后两层是"软问题"优化空间最大。
- 怎么优化:SGLang 围绕四个方向——计算复用(KV Cache 共享)、等待消除(连续批处理)、算力跑满(低精度+投机采样)、资源协同(PD 分离)。
- 谁在押注:RadixArk 从 SGLang 孵化,种子轮超 1 亿美元,英伟达、AMD、联发科、Databricks 全数到齐,个人投资者包括博通 CEO、英特尔 CEO 等。
- 更大的图景:推理框架正成为 AI 时代的"操作系统"——连接模型与芯片,让任何团队都能快速部署前沿模型。
01一个被忽视的真相:GPU 并不忙
卡内基梅隆大学今年 4 月发布的一项研究,对一个大型学术 AI 集群里的 756 块 GPU 做了 31 天细粒度遥测,覆盖 A6000 到 B200 共六种型号。结果发现一个令人不安的事实:
GPU 大量时间处于"执行时空转"状态——看似繁忙,实则等待。
近 20%执行时间空转
约 11%能耗浪费在等待
65%Azure Code 空转能耗
52%Chat 类请求空转能耗
数据来源:CMU 对 756 块 GPU 的 31 天遥测。横轴为不同负载类型,柱高代表执行时间中空转的占比。
为什么 GPU 跑不满?答案藏在 AI Infra 的 四层架构 里。每一层都可能成为瓶颈:
计算硬件GPU · HBM · NVLink · CPU
硬问题
服务编排调度器 · 推理引擎 · 资源管理
软问题
注:柱形示意各层当前可优化的空间相对大小。"硬问题"改造周期以年为单位,"软问题"通过算法和工程优化可带来数倍性能提升。
前两层是"硬问题"——电力、散热、芯片的改造周期以年计,优化空间正在见顶。后两层是"软问题"——本质上是工程和算法问题,优化后能带来数倍的性能提升。
行业的注意力正在快速向这两层"软问题"上移。
02为什么软件层才是真正的杠杆
一台 NVIDIA GB200 NVL72 机柜,采购成本约 400 万美元。如果软件栈没有做好调度和优化,GPU 实际利用率可能只有 50%——相当于 200 万美元以电费、折旧和机会成本的形式被白白烧掉。
反过来,把利用率从 50% 推到 90% 以上,效果相当于凭空多出一台机柜。
硬问题(能源 / 硬件)
改造周期长,优化空间见顶。电力扩容、芯片迭代都以年为单位,且边际成本越来越高。
软问题(系统软件 / 服务编排)
工程与算法问题,优化空间巨大。调度策略、缓存复用、计算分离等技术,能带来数倍性能提升。
这就是为什么 Anthropic 内部 AI Infra 团队已超过 200 人,并且直接贡献了公司从 infra 极度不稳定到实现盈利的关键转折。也解释了为什么 SGLang 和 vLLM 这两个开源推理引擎,种子轮融资都超过 1 亿美元,背后几乎聚齐了 AI 产业里所有顶级玩家。
03优化四问:哪些计算不用重做?SGLang 的实践
目前所有的优化工作,都可以归结为对四个问题的回答。SGLang 在这四个方向上都给出了自己的答案。
🧠 计算复用:KV Cache 的极致共享 RadixAttention
- 大模型推理中,同一段文字被反复喂给模型时,每次都要从头计算。Agent 工作流里工具描述可能被调用几十次,业界称为"推理税"。
- SGLang 用 Radix Tree(基数树) 组织海量请求的 KV Cache,共享前缀的请求共用同一段枝干,分叉时才长出新的树枝。
- 缓存感知调度(Cache-aware scheduling)让前缀相似的请求靠近处理,把顺序从"麻辣香锅、寿司、牛排"重新排成"3 份麻辣香锅、2 份寿司",缓存命中率大幅提升。
- 分布式缓存感知负载均衡:把请求发到"已经有笔记"的 GPU 上,避免跨卡重复计算。
效果:Anthropic 曾通过类似优化将成本砍掉 90%。SGLang 的 RadixAttention 跨请求、跨机器共享 KV Cache,将缓存从"一次性"变成"全局可复用"。
⏱️ 等待消除:让 GPU 不再干等 Continuous Batching
- 早期推理引擎是"排队制",一个算完再算下一个。后来演进到"批处理",但凑批也要等,短的算完要等长的。
- 现在主流做法是 Continuous Batching(连续批处理)——像一辆随时上下客的公交车,新请求随时上车,算完的随时下车,GPU 始终保持满载。
- 更进一步的 Prefill/Decode 分离:把"读入"和"生成"拆到不同 GPU 上,各自用最适合的硬件配置,通过高速网络传递中间结果。
效果:Continuous Batching 让 GPU 实际吞吐量提升 2–4 倍。PD 分离已成为推理引擎最重要的架构演进之一,DeepSeek、英伟达 Dynamo 均采用此方案。
🔧 算力跑满:低精度与投机采样 Speculative Decoding
- GPU 大量时间花在数据搬运上,又受限于串行解码,计算能力无法充分释放。
- 低精度计算:模型权重、中间激活值、KV Cache 三部分精度可独立设置,用更小的数据格式存储和运算,可多释放出一倍的算力空间。
- 投机采样:小模型先"猜"几个字,大模型一次性验证。就像助教先写草稿,老师一次性批改,最佳情况下生成速度提升 2–3 倍。
效果:推理引擎将这些新能力第一时间集成到系统中,与芯片厂商深度联合调优,在硬件发布当天即完成 day-0 支持,把硅的性能压到极致。
注:以上三个案例均基于 SGLang 推理引擎的实际技术路线。SGLang 已从开源项目孵化出商业化公司 RadixArk,种子轮融资超 1 亿美元。
04为什么是 SGLang 做出来了?
答案不复杂:SGLang 从一开始就押注了"系统级优化"这条最难但壁垒最高的路。当大多数团队还在比拼模型参数时,SGLang 选择在推理引擎层做深做透,把模型、芯片、框架三者之间的协同效率推到极致。
这种战略眼光得到了产业界的一致认可。RadixArk 从 SGLang 孵化出来进行融资时,投资阵容堪称豪华:
英伟达
AMD
联发科
Databricks
陈立武(英特尔 CEO)
陈福阳(博通 CEO)
John Schulman(OpenAI 联合创始人)
Soumith Chintala(PyTorch 之父)
对英伟达、AMD 来说,投资 RadixArk 是一种战略下注——他们需要一个连接算力与应用的基础设施入口,把更多模型、企业应用和 Agent 汇聚到自己的算力生态中。对个人投资者来说,这意味着 AI Infra 正在成为整个行业的基础设施层。
推理框架正越来越像 AI 时代的"操作系统"——连接模型与芯片的关键一层。
编辑核心判断
AI Infra 能力的公共化,正在让"前沿实验室"这个词变得过时。当任何团队都能借助开源推理引擎获得与巨头同级别的部署能力时,模型参数竞赛的意义将被重新定义——真正的壁垒,不在模型本身,而在让模型高效运转的系统工程能力。
当 AI Infra 能力从少数前沿模型巨头的独家资源,变成任何一家创业公司都能直接调用的公共品,从事 AI 工作的门槛会被显著降低。而这,或许才是"榨出硅的极限"这件事最重要的意义。