🔬 前沿 · 行业观察

世界模型六家头部在 WAIC 激辩技术路线,行业红利被指正在非共识里

7 月 19 日,WAIC「世界模型六小龙」论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人的技术负责人同台。在概念、路线、训练、数据、评测全未收敛的当下,六人对"什么能力重要""什么将率先收敛"给出了截然不同的答案——分歧本身,被主持人陶大程定义为"当下的红利"。

来源:公开报道 2026-07-24 全文约 4 分钟读完
#世界模型 #WAIC 2026 #具身智能 #技术路线之争
6 家 头部世界模型公司同台激辩
3 派 技术路线:像素生成 / 隐空间 / 融合
≈ 1 小时 圆桌全程,信息密度极高

⚡ 30 秒速览

  • 路线分三派:极佳视界走像素生成;无界动力押隐空间(JEPA);大晓、蚂蚁灵波、自变量、智元走融合路线。
  • 物理理解之争:无界动力要求几何、运动、力的预测精度;蚂蚁灵波认为"物理合理性"比"物理精度"更重要——机器人不必先成为物理学家。
  • 长时一致性 vs 时效:智元视其为仿真器生命线;自变量直言长程推演是"伪需求",推理慢到错过决策窗口再完整也没用。
  • 什么先收敛:统一表征、多路线融合、触觉模态、横向评测标尺——四人给出四个答案。
  • 部署才是真考验:能力从 90% 到 99.9% 成本非线性增长;端侧几十到几百毫秒决策窗口,云端世界模型无法永远等待。

01三派路线,一把尺子量不出共识

按"模型在什么空间里推演世界"这把尺子,六家公司可归为三派。路线不同,对焦点问题的立场自然分叉:

像素生成派

极佳视界 · 朱政

在像素空间生成未来画面,学到的天然是"看起来合理",因此只承诺物理合理性,不承诺物理精度。

隐空间(JEPA)派

无界动力 · 夏中谱

在隐空间直接回归物理量,因此敢要求几何、运动、力的预测精度,评价世界模型要看这些状态的预测准不准。

融合派

大晓机器人 / 蚂蚁灵波 / 自变量 / 智元

理解生成预测一体化、多路线全家桶、视频+隐空间+3D 显式建模拼接——各取所长,押注新架构融合

路线之争背后,每家捍卫的其实是自家模型擅长的能力:隐空间派敢要求物理精度,是因为它本就能回归物理量;像素派只承诺物理合理性,因为它学到的是画面合理。这不是哲学分歧,是技术路线决定的能力边界。

02两个最尖锐的分歧

分歧一:世界模型该对物理世界理解到什么程度?

无界动力 · 夏中谱

评价世界模型要看它对几何、运动、力等状态的预测精度——尽可能接近物理模拟器。

"机器人需要算清每一条轨迹、复现每一个物理参数。"

蚂蚁灵波 · 沈宇军

物理合理性比物理精度更重要。机器人只需明白同样重量的铁比棉花掉得快,但到底快多少,不需要知道。

"机器人不必先成为物理学家,只需知道哪些差异会影响眼前的动作。"

分歧二:长时一致性是不是伪需求?

智元 · 任广辉

推理的长时物理一致性是评价世界模型能力必不可少的指标——因为智元的世界模型有一大用途是当仿真器,长程推演正是仿真器的生命线。

自变量 · 王昊

长程推演是"伪需求"。自变量把世界模型与 VLA 整合进同一端到端框架,预测是动作生成的前置步骤,预测铺得越长,推理越慢,占掉的决策时间越多。

立场提示:每位嘉宾的论点都对应其公司技术路线的天然能力边界,并非纯粹学术判断。

03下一阶段,什么会率先收敛?四人四个答案

世界模型眼下连"token"都还没找到。视觉、语言、动作这些模态如何对齐进同一表征,尚无定论。四人给出了四个不同的收敛押注:

统一表征·多路线融合·触觉模态·横向评测标尺

"就像深度学习的爆发,不是神经网络在论战里说服了特征工程派,而是 ImageNet 把所有方法拉到同一把尺子下。标尺统一了,收敛自然就会发生。"

— 陶大程 · 大晓机器人首席科学家

论坛期间,大晓机器人发布了 PHYSICAL IQ,定位为首个具身原生、面向多场景、多本体、多任务的物理智能评测基准平台,试图成为这把"横向标尺"。蚂蚁灵波则在另一条路上押注:开发具身原生的世界模型,从控制执行需求出发、基于自回归架构从头预训练,让模型为"边预测、边行动"而非为"生成好看的画面"而设计。

"触觉数据一旦突破,物理世界和数字世界的世界模型,将分道扬镳。"

— 沈宇军 · 蚂蚁灵波首席科学家

04从 Demo 到 Deployment真正的考验在能力下限

Demo 稳定完成任务并不难——为一个 Demo 可以不计成本。真正难的是在真实世界中规模化部署。六人对"最终评价标准"的表述殊途同归:

决策有效性夏中谱的定义
policy 指标任广辉的表述
真机成功率朱政的定义
90→99.9%成本非线性增长

王昊分享了一条规律:模型能力从 90% 提升到 99%,再从 99% 提升到 99.9%,投入的成本并不是线性增长。实验环境里看似微小的错误率,落到部署现场就是一次次人工接管、一次次返工,最后变成一笔算不过来的账。

沈宇军举了商超里的例子:机器人要找一包蔬菜,顾客却可能顺手把它放进了牛奶柜——单起是偶发,对每天面对不同顾客的机器人来说就是日常。对随机和突发情况的应对能力,是机器人走出实验室后必须补上的短板。

"最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时。很多世界模型跑在云端,但机器人留给自己做判断的时间可能只有几十毫秒到几百毫秒。网络不能永远在线,云端也不能总在等待。"

— 陶大程 · 大晓机器人

一句话:Demo 展示的是能力上限,部署考验的是能力下限。端侧能力,是部署绕不开的门槛。

05两年后回望,什么做对了、什么做错了

世界模型今年上半年才真正火起来。如果两年后回看,眼下的什么会被证明做对了?

沈宇军 · 做对了的

模型架构能力做的工作——泛化效率、可交互性等内在属性;为数据链路做的准备。

沈宇军 · 不好说的

过于追求模型展现出来的能力(生成效果这类外在呈现);当下积累的数据最终是否会被用到、是否会被更新迭代。

朱政的判断更直接:在基模尚未收敛的时候,就去探索非常多的商业化场景,大概率不会成功。任广辉则认为,两年后世界模型会走向更加"具身原生",需要更大规模的具身原生数据和为具身而生的原生架构。

编辑视角

本文素材来自一场行业论坛的圆桌讨论,本质是六家利益相关方的同台陈述——每位嘉宾捍卫的论点,都精准对应其公司押注的技术路线与产品形态:隐空间派敢谈物理精度,像素派只承诺物理合理性,仿真器路线力挺长时一致性,端到端路线则视其为伪需求。读者宜带着"立场即能力边界"的前提去理解这些分歧。

论坛同期发布的 PHYSICAL IQ 评测基准,由主持方大晓机器人推出,未见第三方独立复测数据,其"首个"定位与公平性尚待行业验证。触觉模态、具身原生数据等判断,目前也属单方押注。

世界模型正处于"路线分叉、标尺缺位"的前共识期——谁先把统一表征或评测标尺做出来,谁就拿到下一阶段的定义权;眼下的分歧不是问题,是这扇窗口期的全部红利。

延伸关注

PHYSICAL IQ 物理智能评测基准平台已在 WAIC 期间发布,可关注大晓机器人官方渠道获取后续开放计划。

关注 PHYSICAL IQ 后续开放