🤖 物理AI · 智驾演进

物理AI重塑智驾:VLA+世界模型融合方案跑通,2026年技术路线终局浮现

从“看见什么做什么”到“想象未来再行动”,物理AI浪潮正在改写智能驾驶的底层逻辑。VLA增强理解,世界模型强化预测,两者从对立走向融合——2026年成为技术路线收敛的关键之年。

综合公开信息整理 2026-07-22 全文约 3 分钟读完
#物理AI #智能驾驶 #VLA #世界模型 #端到端
100 亿英里 FSD 车队累计行驶里程 · 全球第一
3,000TOPS 小鹏 Robotaxi 车端算力峰值
700亿元 华为乾崑智驾 5 年算力投资计划

⚡ 30 秒速览

  • 技术路线终局浮现:从模块化割裂到端到端融合,再到 VLA+世界模型双引擎,2026 年行业共识已形成。
  • VLA 解决“理解当下”,世界模型解决“预测未来”:二者并非二选一,深度融合才是终极方案。
  • 全行业转向融合架构:特斯拉 FSD V14 集成 Grok 与世界模型;小鹏 X-Mind 内嵌预测性世界模型;华为 WEWA 2.0 引入多智能体博弈。
  • 竞争逻辑从“堆配置”转向“建底座”:激光雷达数量与芯片算力不再是护城河,物理世界理解能力才是。
  • 算力竞赛全面升级:特斯拉约 23 万张 H100 等效算力,华为 5 年 700 亿元投入,小鹏 3000 TOPS 车端算力。

01技术演进 从模块割裂到端到端融合,再到因果推理

智能驾驶的历史,本质是从“规则驱动”向“数据驱动”再向“因果推理”跃迁的过程。2024 年特斯拉 FSD V12 移除了 30 万行手写代码,用单一神经网络替代模块化架构,开启了端到端时代。但早期端到端是“黑箱”——决策逻辑不可追溯,事故后难以定位问题。

行业随即转向 VLA(视觉-语言-行动模型),通过融合计算机视觉与自然语言处理,构建可解释的决策大脑。然而,VLA 的语义优先级高于驾驶,被批评为“好钢没用在刀刃上”。

转折点出现在 2026 年。

特斯拉 FSD V14 改变了行业认知:大模型能力不是在 VLA 和世界模型之间二选一,而是两者的深度融合。VLA 解决理解当下的问题,世界模型解决预测未来的难题——两条路线合流,成为全行业共识。

1925

世界首辆自动驾驶汽车出现在纽约街头,概念萌芽。

2004

DARPA 大挑战赛——首届无人完赛,但最远者走了全程的 5%,开启现代智驾探索。

2024

特斯拉 FSD V12 推送,“Photon In, Control Out”,端到端神经网络取代模块化架构。

2025

比亚迪发动全民智驾,价格下沉推动技术普及;一段式端到端成为主流。

2026

物理AI元年。FSD V14 集成 Grok 与世界模型;VLA+世界模型融合方案全行业铺开。

时间线仅标注关键里程碑节点,非完整产业史。2026 年被多家机构定义为“物理AI元年”,技术路线从分化走向收敛。

02VLA vs 世界模型 理解当下 vs 预测未来

技术路线之争,本质是对“智能”本质的不同理解。VLA 试图让车学会“看和说”,世界模型试图让车学会“想和推”。

VLA(视觉-语言-行动模型)

通过语言大模型将视觉信息转化为文本 token 再做决策。增强可解释性,但语义优先级高于驾驶,被指像“背题库的学生”,在复杂或突发场景容易失效。

世界模型(World Model)

跳过语言中间层,直接利用多源感知构建理解因果逻辑的模型。模拟物理世界运行规律,预测未来,但研发难度更大,对数据量与算力要求极高。

Momenta CEO 曹旭东直言:“VLA 对自动驾驶是锦上添花,很难雪中送炭。”华为车 BU CEO 靳玉志则认为,VLA 看似捷径,实则无法真正理解物理世界。但进入 2026 年,行业迅速形成新共识:不是二选一,而是融合。

对比基于公开观点整理,双方技术路线均有持续迭代,此处仅呈现 2025-2026 年阶段的代表性立场。

03融合方案全面铺开 六家头部玩家的共同选择

VLA 解决理解,世界模型解决预测——两者融合构成“物理世界基座模型”的双支柱。以下是 2026 年上半年主要玩家的布局:

🚗 特斯拉 · FSD V14融合先锋

  • 集成 xAI 的 Grok 大模型,同时利用世界模型进行数据生成与闭环仿真
  • 同一基础模型驱动 FSD、Optimus 机器人及智能体,实现技术底座统一。
关键信号:全球最大智驾车队(100亿英里)率先跑通融合架构,验证了工程可行性。

🧠 小鹏 · X-MindVLA+世界模型

  • 将预测性世界模型内嵌为 VLA 模型的视觉思维链,输出动作前先完成时空推演。
  • 搭载 4 颗图灵 AI 芯片,车端算力 3000 TOPS,定位 L4 级 Robotaxi。
关键信号:从“坚持 VLA”到“VLA+世界模型双支柱”,路线调整具有行业风向标意义。

🌐 华为 · WEWA 2.0多智能体博弈

  • ADS 5.0 搭载 WEWA 2.0,云端引入 Multi-Agent 群体博弈,AI 驾驶者互相博弈学习。
  • 2026 年乾崑智驾研发投入超 180 亿元,5 年计划再投 700 亿元用于算力提升。
关键信号:华为选择 WA(世界-动作)路径,跳过语言中间层,直接构建因果推理能力。

⚡ 其他玩家 · 全线跟进

  • 蔚来:NWM 中国首个智驾世界模型,1 月已将世界模型+闭环强化学习架构推送至数十万辆车。
  • 地平线:HSD V2.0 采用世界模型+端到端强化学习的双引擎方案。
  • Momenta:R7 世界模型已实现量产首发,被称为“物理AI第一股”。
关键信号:融合方案从头部先行扩散至全行业,成为 2026 年智驾技术路线的最大公约数。

04竞争升维 从“堆配置”到“建底座”

物理AI浪潮下,竞争逻辑正在发生根本性转变。过去汽车行业的竞争是“堆配置”——激光雷达数量、芯片算力、续航里程,比拼的是参数堆叠。而在物理AI时代,竞争变为“建底座”——谁掌握物理世界的理解与行动能力,谁就掌握价值链主导权。

世界模型让智驾、座舱、机器人和一切智能终端走向技术融合。特斯拉用同一个基础模型驱动 FSD、Optimus 和智能体;理想已将基座模型与 VLA 研发团队合并,统一支撑智能驾驶、智能座舱及人形机器人三大业务线;高通把汽车与机器人放进同一个事业群。

一个诚实的注脚:目前所有智驾系统距离真正的物理AI终极形态还相去甚远。

截至 2026 年 5 月,FSD 车队累计行驶突破 100 亿英里,位居全球第一;而其他新势力品牌由于车辆数较少,累计里程均在数十亿公里量级。世界模型需要巨量的真实世界数据,这是当前最核心的制约因素。

100亿FSD 累计里程(英里)
21倍华为算力 29 个月增长
23万特斯拉 H100 等效算力
700亿华为 5 年算力投资(元)

数据为公开报道整理,算力规模与投资额均为规划或估算值,实际执行可能存在差异。

物理AI 基模之战 世界模型 端到端融合 VLA 因果推理 多智能体 具身智能 算力竞赛

05算力竞赛 物理AI的入场券

物理AI对算力的需求远超数字AI。世界模型需要海量真实世界数据训练,高算力芯片和大规模模型训练成为入场券。头部玩家已展开军备竞赛:

特斯拉约 23 万张 H100 等效算力
23万
华为乾崑智驾5 年 700 亿元,算力 21 倍增长
700亿
小鹏 Robotaxi4 颗图灵 AI 芯片,3000 TOPS
3000T
蔚来世界模型 + 闭环强化学习架构已推送
地平线HSD V2.0 双引擎方案

注:柱形宽度为相对值,非精确比例。特斯拉算力数据为行业估算,华为投资额为公开计划。右侧标注为各家的核心算力指标,单位不同,仅作定性对比。

随着头部智驾企业全面迈入物理AI赛道,算力竞赛还将进一步升级。靳玉志此前表示,华为算力规模在 29 个月周期里实现了 21 倍增长——但这可能只是开始。

编辑核心判断

物理AI时代,智驾竞争已从“参数堆叠”转向“基模之战”。掌握物理世界理解与行动能力的企业,将定义下一个十年的价值链格局——但数据量与算力的双重鸿沟,可能让这场竞赛从一开始就呈现分化态势。

📖 写在最后 · 莫拉维克悖论

1988 年,莫拉维克在其著作中阐述了一个观点:对人类来说很难的任务(逻辑推理、下棋),AI 反而容易完成;而对人类来说很简单的事(走路、抓取物体),AI 却极难实现。这一问题后来被称为“莫拉维克悖论”。

现有智驾正卡在这一环节——看似智能,却缺乏最基本的物理直觉。这也是许多人不敢完全放手的核心原因。2026 年被称为“物理AI元年”,但距离真正的智能驾驶终极形态,还有相当长的距离。