🧱 AI 基础设施 · 技术对谈

模型膨胀倒逼 Infra 重构,vLLM 与范式智能揭秘推理工程新战局

DeepSeek V4 花了大半年做 kernel 适配,千问 Omni 把 AR 与 Codec 解耦跑异步调度,范式智能在生产集群里同时调度着五家以上国产芯片——当模型架构以超出工具链进化的速度膨胀,AI Infra 的核心挑战正从「能不能跑」转向「能不能高效可规模化」。

来源:公开报道 2026-07 全文约 4 分钟读完
#AI Infra #异构计算 #多模态推理 #vLLM
大半年 vLLM 团队适配 DeepSeek V4 架构耗时
20% 千问 Omni 优化后仍剩的性能空间
10 AI 模型一晚优化 CI/CD 的性能提升

⚡ 30 秒速览

  • 模型在变复杂:从 LLaMA 的纯 Transformer+MLP,到 DeepSeek V4 的复杂 Index、Cosmos V 的全模态输入输出,推理框架的适配速度跟不上模型架构膨胀。
  • 异构成必答题:范式智能集群同时跑英伟达、昇腾、寒武纪、昆仑芯、沐曦等多种卡,曾遇某国产卡在特定 shape 下 tensor 输出错误,只能 offload 到 CPU 绕过。
  • 瓶颈反噬 CPU:多模态 RL 传 embedding 和 state 的通信量巨大,进程间传输把 CPU 打满,GPU 反而跑不满。
  • Agent 治理双刃剑:vLLM 用 Agent 起草框架提速明显,但机器人十分钟刷四十多条 PR,社区只能靠「活人验证」机制拦截。
  • Infra 终局推演:范式智能专家判断,未来 Infra 工程师将从「写代码」走向「定 SLA、SLO 与成本预算」的高阶 SRE 视角。

01模型膨胀速度,正在碾压工具链

vLLM committer 莫梓峰的切身体验是:以前做 LLaMA 无非一个 dense model,transformer 加 MLP 就搞定。后来 DeepSeek 出了 MoE,V1、V2 做 MoE,V3 开始又搞了 index;到了 V4,团队花了快大半年去适配,光是 transformer 里 compress 那部分的 kernel 就写了几个月。

多模态的演进更陡峭。两年前 LLaVA 只有图片输入,千问三模态收音频、视频、图片,到今年 Cosmos V 直接变成全模态——什么模态进来都能收,还能输出图片、视频,甚至机器人机械臂的 action。这种模型已不是单纯的 AR 模型,而是 AR 加 DiT 加各种辅助模型。vLLM 团队为此新开了 VLM Omni 仓,专门处理多模态输出。

「至少 transformer 跟 MoE 这块是越来越复杂,整个模型的流水线都开始复杂化了。」 —— 莫梓峰,Inferact vLLM committer

02异构计算:从可选项到必答题

范式智能系统研发专家杨守仁的关注点不在推理细节,而在工作负载与算力的调度。他所在的集群同时跑着英伟达、昇腾、寒武纪、昆仑芯、天数、沐曦等多种卡,每家都不一样。

以前的挑战

把传统工作负载往国产卡上迁,关注单卡兼容性。

现在的挑战

小模型也往国产卡迁;客户至少面对两到三种卡的调度,PD 分离时国产卡通信不如 NV 丝滑,需手动设部署策略。

🪲 一个真实生产事故特定 shape 翻车

  • 某国产厂 GPU,在某个特定 shape 下把 tensor 丢过去,输出就是错的——只有那个 shape 有问题。
  • 最终通过 offload 到 CPU 的方式绕过;如果出错层在中间频繁切换,则无解。
  • 异构第一大挑战是一致性:英伟达有标准 kernel,国产卡能否保证大部分情况下一致?验证极费劲,曾靠人工一个一个 batch size 试上去才定位偶发 bug。

在 K8s 生态里,DRA(Dynamic Resource Allocation)去年下半年进入 GA 阶段。范式智能在 GA 之前就开发了英伟达的 DRA driver,但杨守仁坦言:DRA 表达能力没想象中那么好,高阶特性靠 ResourceClaim 中 attribute 的 key-value 描述,更高级的动态能力还做不到。HAMi 项目从 GPU 虚拟化切入,通过 scheduler 扩展让用户用多个 resource name 描述一块 GPU 的资源配置,但仍未脱离 device plugin 体系。

「新特性加入得越多,大家越不敢在生产上测试和使用;测试越少,反馈越少;反馈越少,到 Beta 到 Stable 就越慢——这是一个恶性循环。」 —— 杨守仁,范式智能系统研发专家

03多模态推理:异步叠加异步的「地狱模式」

千问 3 三个部分——AR 部分、把 AR 文字输出转成 hidden states 的部分、再把 hidden states 转到 codec wave 输出音频的部分——每个部分对资源的需求完全不一样。AR 需要 KV cache,其他部分需求不同,每个部分有不同的最优方案。

vLLM Omni 框架的设计原则是充分解耦:既能在 codec wave 输出的同时做异步调度,不能 AR 在跑时其余闲着,也不能其余在跑时 AR 不接收输入。第一版框架重构了好几次,最后做到了一定优化,但仍有约 20% 的性能空间没打满,profile 时在 P2P 通信环节还有 bubble。

AR 跑 KV cache异步调度 CodecP2P 传 hidden states输出音频

把 Diffusion 跟 Omni 放在一起的好处,在 Cosmos-3 出来时显现了:接入 diffusion 模型做得非常顺畅。如果 diffusion 一个仓、Omni 一个仓、action 和 VLA 又一个仓,面对全模态模型要四处开战。但剥离也有技术债——每次 vLLM 更新版本,Omni 这边要跟着刷新接口,一次改几千行代码,后来接了 agent 来刷这种机械化任务。

多模态 RL 比纯文本 RL 更麻烦:要传多模态 embedding 和一帧 state,通信量比传统 text RL 大很多。异步叠加异步,被莫梓峰形容为「太地狱了」。更反直觉的是,瓶颈反噬到了 CPU——进程间传输量太大,GPU 反而跑不满,有需求是把 processor 处理好的图片直接塞进去,跳过 processor 这一步。

04Agent 涌入开源社区:提速与治理的两面

vLLM 搭框架时用了不少 agent 起草雏形,纯靠人手写迭代速度会很慢。但开源社区治理上,agent 带来的最大问题是:很多人提 PR,agent 写完不看,description 也是 agent 写的,几十行几百行一看就没耐心。

🤖 莫梓峰的「活人验证」机制实操方案

  • 留通信邮箱,用工作或学校邮箱发邮件证明是活人,优先看活人的 PR
  • 先提几个初始评论,秒回或隔几分钟回的一眼是机器人,要么直接 close,要么顺手帮他修
  • 曾见机器人十分钟刷了四十多条 PR,看都不看直接 close。

Agent 对存储的压力也在上升。杨守仁观察到,Agent 产生的数据量特别大,共享存储读写压力一下就上来,因为任务什么时候读写根本控制不住。起 Claude Code 时单台服务器能起的量很有限,用 ACP 模式扩很多 sub agent 再去调 Claude Code,内存一下就不够用了。Sandbox 开销叠上运行时开销,能否撑起大规模使用是个问题。

05Infra 会被 AI 接管吗?

杨守仁的判断很直接:Infra 迟早要被 AI 接管。Infra 的课题没多复杂,就是细节多;这些细节模型要是学会了,可能比人做得更好,而且很多地方其实是人过度设计了。

「代码现在没那么值钱了。我们将来可能就是站在一个更高阶的 SRE 视角:定好 SLA、SLO、成本预算,剩下交给模型,那时候做 Infra 可能就轻松多了。」 —— 杨守仁,范式智能系统研发专家

一个佐证:有同学用 Fable 5 优化 CI/CD 慢的问题,一个晚上下来性能直接提了 10 倍——因为很多细节他们没配好,第二天看监控整个优化过程非常稳定,没有中断。

但开源生态不会因此消亡,反而会强化。杨守仁提出了一个「脚手架 + 马太效应」的判断:

  • 大型开源项目变成脚手架:用的人多,后训练阶段一定会强化对这个工具的使用能力。模型对大型开源项目的亲和度、适配性会非常好。
  • PR 流程被收入训练数据:vLLM 这种社区的 PR 整个流程已被收入训练流程,agent 可能很知道 review 风格是什么,改完更容易回馈社区。
  • 小众工具加速边缘化:API 不符合直觉的工具,模型泛化不出调用能力,用的人越少越没人用。

莫梓峰也观察到,很多企业以前是魔改 vLLM 的,但 vLLM 迭代速度太快,闭门造轮子不如开源出去让人帮忙维护——这倒逼闭源也开源,像滚雪球一样

编辑视角

本文内容整理自一场技术大会的直播对谈,嘉宾分别来自 vLLM 开源社区与范式智能(第四范式),属于企业技术专家的单方分享,未见第三方独立复测数据。读者宜将其视为一线实践者的经验切片,而非行业全景结论——其中关于异构算力一致性的痛点、Agent 治理机制的描述,带有具体的踩坑细节,参考价值较高;关于「Infra 将被 AI 接管」的终局推演,则属于个人前瞻判断,需结合自身业务规模审慎对待。

值得留意的一个支线信号:杨守仁提到 Fable 5 一晚将某创业公司 CI/CD 性能提了 10 倍,这个数字来自第三方转述而非亲自验证,但其指向的现象——大量中小团队的基建配置长期处于次优状态,模型恰好能补上这个缺口——与异构算力管理中「靠人工一个一个 batch size 试上去定位 bug」的笨办法形成呼应。

当模型架构的膨胀速度超过工具链进化速度,Infra 工程师的价值锚点正从「写代码实现」上移到「定约束、验一致性、做决策」——这条上移路径,比「Infra 会不会被取代」的二元争论更值得行业提前布局。

延伸了解

本文对谈源于 AICon 2026 深圳站【AI Infra、推理工程与异构计算】专题前瞻,完整直播回放与大会日程可至官方渠道查看。

查看大会日程 → 专题详情