世界模型 vs VLA 路线之争:七篇论文拆解头部车企智驾技术分歧
华为、理想、小鹏、小米——四家头部车企,七篇公开论文,两条技术路线。但论文中的相互批评揭示了一个更真实的图景:大方向正在靠拢,真正的分歧藏在细节里。
华为、理想、小鹏、小米——四家头部车企,七篇公开论文,两条技术路线。但论文中的相互批评揭示了一个更真实的图景:大方向正在靠拢,真正的分歧藏在细节里。
中文舆论场将车企简单分为两派:世界模型派(华为、蔚来)与 VLA 派(小鹏、理想)。但论文署名和内部团队划分暴露了更复杂的真相。
一家对外讲 VLA 的公司,内部同时有两支团队在做世界模型。
华为 → 世界模型派
蔚来 → 世界模型派
小鹏 → VLA 派
理想 → VLA 派
小鹏 arXiv 论文来自预测式世界模型、生成式世界模型、基座模型等四支团队
理想 SparseWorld-TC 研究世界模型,却绕开 BEV 中间表征
华为 DynVLA 将动力学拆成两份建模
简单地把这种现象归因于"命名混乱"可能有点草率。准确地说,这些技术之间的边界,本来就没有舆论叙事那样分得那么清楚。
注:以上对比基于各公司 2026 年上半年在 arXiv 及 CVPR/ICLR 等会议发表的公开论文,不涉及未公开的内部研发信息。
如果把几家公司 2026 年的论文放在一起,会发现学术交锋比发布会上能看到的要热闹得多。但一个关键细节是:没有一家否定"预测未来"这件事本身。
X-Mind 甚至直言,把预测式世界模型整合进自动驾驶,已经成为行业共识。
注:以上引用均来自各公司 2026 年公开论文原文,表述经过压缩提炼。完整上下文可查阅 arXiv 预印本。
人开车时也会在脑子里先"想"一遍——看到右前方一辆车压线,快速判断它要是并过来该怎么办。但人不会把想象的画面渲染成 4K 视频。
让机器做相似的事情,核心问题是:这个生成的"念头"该保留多少细节?
「世界表征应保持高度抽象;隐空间中过多视觉细节会稀释模型的结构化世界理解能力。」未来 12 帧压缩成 96 个词元。
「视频生成器内部表征本身就有价值,规划器应该直接使用这些表征。」主张生成与规划共享同一隐空间。
「直接生成未来真实图像计算成本太高,选择在 latent space 中进行预测。」管这叫"多模态思考"。
用专门分词器把未来演化压进一组离散词元,并将自车动力学和环境动力学拆成两份分别建模。
在"预测未来"这件事上,四家公司给出了四个答案。这种技术路径上的分歧,可能比"VLA 还是世界模型"的二元论更能让大家看清头部公司在下一代智驾技术架构上的理论底座差异。
注:以上四象限对比基于各公司 2026 年公开论文中的技术主张提炼,实际量产方案可能有所不同。
2026 年 4 月,复旦大学联合清华 AIR、中科院自动化所和滴滴做了一组实验:删除端到端模型收到的正确导航信息,甚至换成随机的转向指令——综合规划成绩几乎没有下降,有时还略有提高。
导航虽然接进去了,却没有真正影响规划。
注:实验数据来自 arXiv:2604.12208,媒体实测案例综合多家公开报道,不指向单一品牌。
第一道题:大模型能不能在车上高效运行。蔚来智能驾驶负责人任少卿给出的判断是:同等计算量下,Transformer 对内存带宽的需求是 CNN 的 8 到 70 倍。
这两个数字不能简单判断芯片强弱,但说明同一件事:竞争已经从"能算多少"转向"能不能把数据及时送到该去的地方"。
第二道题:能力能不能被外界验证。世界模型在各家叙事里承担着"闭环仿真与强化学习引擎"的关键角色。但今年 CVPR 的基准 WorldLens 测出的数字是:
论文原话是"所有方法在闭环条件下都崩了"。但需声明:WorldLens 测的全是开源学术模型,不含任何一家的生产级模型。
一个诚实的注脚:目前没有看到哪家量产模型提交过公开、可横向比较的闭环评测。外界看到的,仍主要是各家公司自己的数据集和指标。
注:WorldLens 数据来自 CVPR 2026 Oral 论文 arXiv:2512.10958。带宽数据来自蔚来、理想公开技术披露。
技术路线之争尚未分出胜负,但一个更紧迫的问题已经浮现:当世界模型在闭环仿真中路线完成率不到 14%,当导航理解尚未真正打通,当内存带宽成为新的瓶颈——下一道题的解法,可能根本不在算法里。最终决定胜负的,是车能不能把路走对。
这些技术路线已在各车企的量产车型中逐步落地。世界模型与 VLA 的争论还将继续,但真正值得关注的,是下一批实测中谁能率先解决导航理解与闭环验证这两个实际问题。
相关技术论文可在 arXiv 检索,评测细节以官方公开信息为准。