🧠 智能驾驶 · 技术路线

世界模型 vs VLA 路线之争:七篇论文拆解头部车企智驾技术分歧

华为、理想、小鹏、小米——四家头部车企,七篇公开论文,两条技术路线。但论文中的相互批评揭示了一个更真实的图景:大方向正在靠拢,真正的分歧藏在细节里

综合公开信息整理 全文约 4 分钟读完
#世界模型 #VLA #端到端智驾 #技术路线之争
4 家 头部车企入局
7 篇 核心论文互相点名
2 条 技术路线标签
1 个 核心分歧:未来表征精细度

⚡ 30 秒速览

  • 舆论标签 vs 实际布局:小鹏对外讲 VLA,内部两支团队在做世界模型;理想在世界模型论文中明确绕开 BEV 路线。
  • 论文互相点名:小米批评华为和小鹏的生成与规划存在 gap;华为批评视觉思维链算力冗余;小鹏批评世界模型串接带来车端时延。
  • 核心分歧:"预演未来"需要多少细节?从高度抽象(96 词元表达 12 帧)到完整视频生成,四家公司给出四个答案。
  • 实际问题:导航理解尚未真正打通——复旦实验显示删除导航信息后规划成绩几乎不变,模型更多依赖视觉惯性。
  • 深层瓶颈:大模型上车的内存带宽需求是 CNN 的 8-70 倍;世界模型在闭环仿真中路线完成率最高仅 13.51%。

01舆论标签 vs 实际布局 阵营比你想的更模糊

中文舆论场将车企简单分为两派:世界模型派(华为、蔚来)与 VLA 派(小鹏、理想)。但论文署名和内部团队划分暴露了更复杂的真相。

一家对外讲 VLA 的公司,内部同时有两支团队在做世界模型。

舆论标签

华为 → 世界模型派
蔚来 → 世界模型派
小鹏 → VLA 派
理想 → VLA 派

实际技术布局

小鹏 arXiv 论文来自预测式世界模型、生成式世界模型、基座模型等四支团队
理想 SparseWorld-TC 研究世界模型,却绕开 BEV 中间表征
华为 DynVLA 将动力学拆成两份建模

简单地把这种现象归因于"命名混乱"可能有点草率。准确地说,这些技术之间的边界,本来就没有舆论叙事那样分得那么清楚。

注:以上对比基于各公司 2026 年上半年在 arXiv 及 CVPR/ICLR 等会议发表的公开论文,不涉及未公开的内部研发信息。

02论文里的互相点名 批评的是做法,不是方向

如果把几家公司 2026 年的论文放在一起,会发现学术交锋比发布会上能看到的要热闹得多。但一个关键细节是:没有一家否定"预测未来"这件事本身

小米 DriveLaW 点名华为 & 小鹏「生成与规划拆开训练,在视觉想象和动作选择之间留下 gap」
华为 DynVLA 批评小鹏「视觉思维链因像素级生成带来大量冗余和算力开销」
小鹏 X-Mind 回击华为「把世界模型串在策略模型之前会带来难以接受的车端时延」
理想 SparseWorld-TC 绕开小鹏「BEV 的显式几何约束会限制时空特征的灵活交互」

X-Mind 甚至直言,把预测式世界模型整合进自动驾驶,已经成为行业共识

注:以上引用均来自各公司 2026 年公开论文原文,表述经过压缩提炼。完整上下文可查阅 arXiv 预印本。

03真正的分歧:预演未来,要多少细节?

人开车时也会在脑子里先"想"一遍——看到右前方一辆车压线,快速判断它要是并过来该怎么办。但人不会把想象的画面渲染成 4K 视频。

让机器做相似的事情,核心问题是:这个生成的"念头"该保留多少细节?

小鹏 高度抽象

「世界表征应保持高度抽象;隐空间中过多视觉细节会稀释模型的结构化世界理解能力。」未来 12 帧压缩成 96 个词元。

底板:BEV 布局

小米 完整生成

「视频生成器内部表征本身就有价值,规划器应该直接使用这些表征。」主张生成与规划共享同一隐空间。

方向:弥合生成与规划的 gap

理想 隐空间预测

「直接生成未来真实图像计算成本太高,选择在 latent space 中进行预测。」管这叫"多模态思考"。

底板:无 BEV,绕开几何约束

华为 压缩拆分

用专门分词器把未来演化压进一组离散词元,并将自车动力学和环境动力学拆成两份分别建模。

方法:动力学思维链

在"预测未来"这件事上,四家公司给出了四个答案。这种技术路径上的分歧,可能比"VLA 还是世界模型"的二元论更能让大家看清头部公司在下一代智驾技术架构上的理论底座差异。

注:以上四象限对比基于各公司 2026 年公开论文中的技术主张提炼,实际量产方案可能有所不同。

04会开车,却走错了路 导航理解:一个共同的盲区

2026 年 4 月,复旦大学联合清华 AIR、中科院自动化所和滴滴做了一组实验:删除端到端模型收到的正确导航信息,甚至换成随机的转向指令——综合规划成绩几乎没有下降,有时还略有提高

导航虽然接进去了,却没有真正影响规划。

🧭 导航理解实验复旦等联合研究

  • 被测模型更多依赖眼前的道路结构、摄像头画面和训练数据里的常见驾驶模式
  • 原因:端到端模型拿到的只是"左转、直行、右转"这类离散指令,导航与驾驶动作之间的因果关系断了
  • 人类司机知道几百米后要右转,会提前向右选道;模型此刻收到的指令却仍可能是"直行"。
结论:导航理解尚未真正打通——模型学会了"看路开车",但没学会"看导航开车"。

🚗 媒体实测中的导航失误

  • 某方案在主辅路切换时系统没找准路口,开错了路
  • 另一系统先向左变道,发现路线不对后又连续跨越两条实线变回。
  • 理想 VLA 测试中也记录过相似问题
各家公司争的是"如何预测世界",但量产产品被同一个导航难题绊倒了。

注:实验数据来自 arXiv:2604.12208,媒体实测案例综合多家公开报道,不指向单一品牌。

05模型之外,还有两道更难解的题

第一道题:大模型能不能在车上高效运行。蔚来智能驾驶负责人任少卿给出的判断是:同等计算量下,Transformer 对内存带宽的需求是 CNN 的 8 到 70 倍

500+蔚来神玑 NX9031
单颗带宽 GB/s
273理想 M100 芯片
峰值带宽 GB/s
8-70×Transformer 内存带宽需求
vs CNN

这两个数字不能简单判断芯片强弱,但说明同一件事:竞争已经从"能算多少"转向"能不能把数据及时送到该去的地方"

第二道题:能力能不能被外界验证。世界模型在各家叙事里承担着"闭环仿真与强化学习引擎"的关键角色。但今年 CVPR 的基准 WorldLens 测出的数字是:

开环表现预训练规划器在生成世界中驾驶
71-79%
闭环路线完成率因碰撞/驶出路面/超时终止前完成比例
4.8-13.5%

论文原话是"所有方法在闭环条件下都崩了"。但需声明:WorldLens 测的全是开源学术模型,不含任何一家的生产级模型。

一个诚实的注脚:目前没有看到哪家量产模型提交过公开、可横向比较的闭环评测。外界看到的,仍主要是各家公司自己的数据集和指标。

注:WorldLens 数据来自 CVPR 2026 Oral 论文 arXiv:2512.10958。带宽数据来自蔚来、理想公开技术披露。

编辑核心判断

技术路线之争尚未分出胜负,但一个更紧迫的问题已经浮现:当世界模型在闭环仿真中路线完成率不到 14%,当导航理解尚未真正打通,当内存带宽成为新的瓶颈——下一道题的解法,可能根本不在算法里。最终决定胜负的,是车能不能把路走对。

这些技术路线已在各车企的量产车型中逐步落地。世界模型与 VLA 的争论还将继续,但真正值得关注的,是下一批实测中谁能率先解决导航理解与闭环验证这两个实际问题。

相关技术论文可在 arXiv 检索,评测细节以官方公开信息为准。