世界模型六家头部在 WAIC 激辩技术路线,行业红利被指正在非共识里
7 月 19 日,WAIC「世界模型六小龙」论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人的技术负责人同台。在概念、路线、训练、数据、评测全未收敛的当下,六人对"什么能力重要""什么将率先收敛"给出了截然不同的答案——分歧本身,被主持人陶大程定义为"当下的红利"。
7 月 19 日,WAIC「世界模型六小龙」论坛上,大晓机器人、蚂蚁灵波、极佳视界、无界动力、智元机器人、自变量机器人的技术负责人同台。在概念、路线、训练、数据、评测全未收敛的当下,六人对"什么能力重要""什么将率先收敛"给出了截然不同的答案——分歧本身,被主持人陶大程定义为"当下的红利"。
按"模型在什么空间里推演世界"这把尺子,六家公司可归为三派。路线不同,对焦点问题的立场自然分叉:
在像素空间生成未来画面,学到的天然是"看起来合理",因此只承诺物理合理性,不承诺物理精度。
在隐空间直接回归物理量,因此敢要求几何、运动、力的预测精度,评价世界模型要看这些状态的预测准不准。
理解生成预测一体化、多路线全家桶、视频+隐空间+3D 显式建模拼接——各取所长,押注新架构融合。
路线之争背后,每家捍卫的其实是自家模型擅长的能力:隐空间派敢要求物理精度,是因为它本就能回归物理量;像素派只承诺物理合理性,因为它学到的是画面合理。这不是哲学分歧,是技术路线决定的能力边界。
分歧一:世界模型该对物理世界理解到什么程度?
评价世界模型要看它对几何、运动、力等状态的预测精度——尽可能接近物理模拟器。
"机器人需要算清每一条轨迹、复现每一个物理参数。"物理合理性比物理精度更重要。机器人只需明白同样重量的铁比棉花掉得快,但到底快多少,不需要知道。
"机器人不必先成为物理学家,只需知道哪些差异会影响眼前的动作。"分歧二:长时一致性是不是伪需求?
推理的长时物理一致性是评价世界模型能力必不可少的指标——因为智元的世界模型有一大用途是当仿真器,长程推演正是仿真器的生命线。
长程推演是"伪需求"。自变量把世界模型与 VLA 整合进同一端到端框架,预测是动作生成的前置步骤,预测铺得越长,推理越慢,占掉的决策时间越多。
立场提示:每位嘉宾的论点都对应其公司技术路线的天然能力边界,并非纯粹学术判断。
世界模型眼下连"token"都还没找到。视觉、语言、动作这些模态如何对齐进同一表征,尚无定论。四人给出了四个不同的收敛押注:
"就像深度学习的爆发,不是神经网络在论战里说服了特征工程派,而是 ImageNet 把所有方法拉到同一把尺子下。标尺统一了,收敛自然就会发生。"
— 陶大程 · 大晓机器人首席科学家论坛期间,大晓机器人发布了 PHYSICAL IQ,定位为首个具身原生、面向多场景、多本体、多任务的物理智能评测基准平台,试图成为这把"横向标尺"。蚂蚁灵波则在另一条路上押注:开发具身原生的世界模型,从控制执行需求出发、基于自回归架构从头预训练,让模型为"边预测、边行动"而非为"生成好看的画面"而设计。
"触觉数据一旦突破,物理世界和数字世界的世界模型,将分道扬镳。"
— 沈宇军 · 蚂蚁灵波首席科学家Demo 稳定完成任务并不难——为一个 Demo 可以不计成本。真正难的是在真实世界中规模化部署。六人对"最终评价标准"的表述殊途同归:
王昊分享了一条规律:模型能力从 90% 提升到 99%,再从 99% 提升到 99.9%,投入的成本并不是线性增长。实验环境里看似微小的错误率,落到部署现场就是一次次人工接管、一次次返工,最后变成一笔算不过来的账。
沈宇军举了商超里的例子:机器人要找一包蔬菜,顾客却可能顺手把它放进了牛奶柜——单起是偶发,对每天面对不同顾客的机器人来说就是日常。对随机和突发情况的应对能力,是机器人走出实验室后必须补上的短板。
"最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时。很多世界模型跑在云端,但机器人留给自己做判断的时间可能只有几十毫秒到几百毫秒。网络不能永远在线,云端也不能总在等待。"
— 陶大程 · 大晓机器人一句话:Demo 展示的是能力上限,部署考验的是能力下限。端侧能力,是部署绕不开的门槛。
世界模型今年上半年才真正火起来。如果两年后回看,眼下的什么会被证明做对了?
为模型架构能力做的工作——泛化效率、可交互性等内在属性;为数据链路做的准备。
过于追求模型展现出来的能力(生成效果这类外在呈现);当下积累的数据最终是否会被用到、是否会被更新迭代。
朱政的判断更直接:在基模尚未收敛的时候,就去探索非常多的商业化场景,大概率不会成功。任广辉则认为,两年后世界模型会走向更加"具身原生",需要更大规模的具身原生数据和为具身而生的原生架构。
本文素材来自一场行业论坛的圆桌讨论,本质是六家利益相关方的同台陈述——每位嘉宾捍卫的论点,都精准对应其公司押注的技术路线与产品形态:隐空间派敢谈物理精度,像素派只承诺物理合理性,仿真器路线力挺长时一致性,端到端路线则视其为伪需求。读者宜带着"立场即能力边界"的前提去理解这些分歧。
论坛同期发布的 PHYSICAL IQ 评测基准,由主持方大晓机器人推出,未见第三方独立复测数据,其"首个"定位与公平性尚待行业验证。触觉模态、具身原生数据等判断,目前也属单方押注。
世界模型正处于"路线分叉、标尺缺位"的前共识期——谁先把统一表征或评测标尺做出来,谁就拿到下一阶段的定义权;眼下的分歧不是问题,是这扇窗口期的全部红利。
PHYSICAL IQ 物理智能评测基准平台已在 WAIC 期间发布,可关注大晓机器人官方渠道获取后续开放计划。
关注 PHYSICAL IQ 后续开放 →