模型膨胀倒逼 Infra 重构,vLLM 与范式智能揭秘推理工程新战局
DeepSeek V4 花了大半年做 kernel 适配,千问 Omni 把 AR 与 Codec 解耦跑异步调度,范式智能在生产集群里同时调度着五家以上国产芯片——当模型架构以超出工具链进化的速度膨胀,AI Infra 的核心挑战正从「能不能跑」转向「能不能高效可规模化」。
DeepSeek V4 花了大半年做 kernel 适配,千问 Omni 把 AR 与 Codec 解耦跑异步调度,范式智能在生产集群里同时调度着五家以上国产芯片——当模型架构以超出工具链进化的速度膨胀,AI Infra 的核心挑战正从「能不能跑」转向「能不能高效可规模化」。
vLLM committer 莫梓峰的切身体验是:以前做 LLaMA 无非一个 dense model,transformer 加 MLP 就搞定。后来 DeepSeek 出了 MoE,V1、V2 做 MoE,V3 开始又搞了 index;到了 V4,团队花了快大半年去适配,光是 transformer 里 compress 那部分的 kernel 就写了几个月。
多模态的演进更陡峭。两年前 LLaVA 只有图片输入,千问三模态收音频、视频、图片,到今年 Cosmos V 直接变成全模态——什么模态进来都能收,还能输出图片、视频,甚至机器人机械臂的 action。这种模型已不是单纯的 AR 模型,而是 AR 加 DiT 加各种辅助模型。vLLM 团队为此新开了 VLM Omni 仓,专门处理多模态输出。
范式智能系统研发专家杨守仁的关注点不在推理细节,而在工作负载与算力的调度。他所在的集群同时跑着英伟达、昇腾、寒武纪、昆仑芯、天数、沐曦等多种卡,每家都不一样。
把传统工作负载往国产卡上迁,关注单卡兼容性。
小模型也往国产卡迁;客户至少面对两到三种卡的调度,PD 分离时国产卡通信不如 NV 丝滑,需手动设部署策略。
在 K8s 生态里,DRA(Dynamic Resource Allocation)去年下半年进入 GA 阶段。范式智能在 GA 之前就开发了英伟达的 DRA driver,但杨守仁坦言:DRA 表达能力没想象中那么好,高阶特性靠 ResourceClaim 中 attribute 的 key-value 描述,更高级的动态能力还做不到。HAMi 项目从 GPU 虚拟化切入,通过 scheduler 扩展让用户用多个 resource name 描述一块 GPU 的资源配置,但仍未脱离 device plugin 体系。
千问 3 三个部分——AR 部分、把 AR 文字输出转成 hidden states 的部分、再把 hidden states 转到 codec wave 输出音频的部分——每个部分对资源的需求完全不一样。AR 需要 KV cache,其他部分需求不同,每个部分有不同的最优方案。
vLLM Omni 框架的设计原则是充分解耦:既能在 codec wave 输出的同时做异步调度,不能 AR 在跑时其余闲着,也不能其余在跑时 AR 不接收输入。第一版框架重构了好几次,最后做到了一定优化,但仍有约 20% 的性能空间没打满,profile 时在 P2P 通信环节还有 bubble。
把 Diffusion 跟 Omni 放在一起的好处,在 Cosmos-3 出来时显现了:接入 diffusion 模型做得非常顺畅。如果 diffusion 一个仓、Omni 一个仓、action 和 VLA 又一个仓,面对全模态模型要四处开战。但剥离也有技术债——每次 vLLM 更新版本,Omni 这边要跟着刷新接口,一次改几千行代码,后来接了 agent 来刷这种机械化任务。
多模态 RL 比纯文本 RL 更麻烦:要传多模态 embedding 和一帧 state,通信量比传统 text RL 大很多。异步叠加异步,被莫梓峰形容为「太地狱了」。更反直觉的是,瓶颈反噬到了 CPU——进程间传输量太大,GPU 反而跑不满,有需求是把 processor 处理好的图片直接塞进去,跳过 processor 这一步。
vLLM 搭框架时用了不少 agent 起草雏形,纯靠人手写迭代速度会很慢。但开源社区治理上,agent 带来的最大问题是:很多人提 PR,agent 写完不看,description 也是 agent 写的,几十行几百行一看就没耐心。
Agent 对存储的压力也在上升。杨守仁观察到,Agent 产生的数据量特别大,共享存储读写压力一下就上来,因为任务什么时候读写根本控制不住。起 Claude Code 时单台服务器能起的量很有限,用 ACP 模式扩很多 sub agent 再去调 Claude Code,内存一下就不够用了。Sandbox 开销叠上运行时开销,能否撑起大规模使用是个问题。
杨守仁的判断很直接:Infra 迟早要被 AI 接管。Infra 的课题没多复杂,就是细节多;这些细节模型要是学会了,可能比人做得更好,而且很多地方其实是人过度设计了。
一个佐证:有同学用 Fable 5 优化 CI/CD 慢的问题,一个晚上下来性能直接提了 10 倍——因为很多细节他们没配好,第二天看监控整个优化过程非常稳定,没有中断。
但开源生态不会因此消亡,反而会强化。杨守仁提出了一个「脚手架 + 马太效应」的判断:
莫梓峰也观察到,很多企业以前是魔改 vLLM 的,但 vLLM 迭代速度太快,闭门造轮子不如开源出去让人帮忙维护——这倒逼闭源也开源,像滚雪球一样。
本文内容整理自一场技术大会的直播对谈,嘉宾分别来自 vLLM 开源社区与范式智能(第四范式),属于企业技术专家的单方分享,未见第三方独立复测数据。读者宜将其视为一线实践者的经验切片,而非行业全景结论——其中关于异构算力一致性的痛点、Agent 治理机制的描述,带有具体的踩坑细节,参考价值较高;关于「Infra 将被 AI 接管」的终局推演,则属于个人前瞻判断,需结合自身业务规模审慎对待。
值得留意的一个支线信号:杨守仁提到 Fable 5 一晚将某创业公司 CI/CD 性能提了 10 倍,这个数字来自第三方转述而非亲自验证,但其指向的现象——大量中小团队的基建配置长期处于次优状态,模型恰好能补上这个缺口——与异构算力管理中「靠人工一个一个 batch size 试上去定位 bug」的笨办法形成呼应。
本文对谈源于 AICon 2026 深圳站【AI Infra、推理工程与异构计算】专题前瞻,完整直播回放与大会日程可至官方渠道查看。
查看大会日程 → 专题详情