当 Scaling Law 撞上「物理之墙」:RSS 2026 现场,机器人正从「死记硬背」走向「举一反三」
7 月的悉尼,RSS 2026 的 "Robot World Models" Workshop 给出一个明确信号:靠海量数据「喂」出来的动作模仿,正在触及天花板。机器人的下一个关键能力,是在行动之前,先在脑海里把世界跑一遍——学界管这叫「世界模型」。
7 月的悉尼,RSS 2026 的 "Robot World Models" Workshop 给出一个明确信号:靠海量数据「喂」出来的动作模仿,正在触及天花板。机器人的下一个关键能力,是在行动之前,先在脑海里把世界跑一遍——学界管这叫「世界模型」。
2026 年 7 月的悉尼,RSS 会场内弥漫着一种复杂的情绪:一半是火焰,一半是海水。火焰来自大模型在云端的持续狂飙;海水来自具身智能在现实落地中的「物理阵痛」。
过去几年,全球 AI 行业笃信一套「暴力美学」的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。它在文本、图像乃至视频生成上无往不利。但当这套逻辑被直接「平移」到机器人身上时,一道无形却坚硬的墙出现了。
数据可以被无限复制和合成,Scaling Law 一路奏效。
每一次抓取、每一步行走,都受限于时间的线性与空间的约束。
注:左右对比的是同一套「大力出奇迹」逻辑在两种介质里的表现——数字世界与物理世界,对数据密度的容忍度完全不同。
于是,那个在数字世界里几乎无所不能的 Scaling Law,在拧开一颗生锈的螺丝钉时,表现出了令人沮丧的笨拙。
在 "Robot World Models" 主题 Workshop 上,这种判断从个例上升为共识:世界模型不再被视为「视频生成器」,而是被重新定义为机器人的逻辑中枢与虚拟沙盒。一年前,议题还是「生成的视频有多逼真」;今天,议题只剩一个——如何让机器人摆脱死记硬背,学会举一反三。
机器人需要在行动前,先让未来在脑海里发生一次。
读法:这是世界模型介入后的决策链路——预测与评估都发生在物理执行之前,「试错」被搬进了虚拟沙盒。
在沙盒里,机器人可以追问:如果我伸出这只手,杯子会碎吗?如果我推开这扇门,后面会坍塌吗?只有当这种视觉推演与因果校准成为行动的前置条件,智能才不再是飘在空中的 Token 组合,而是真正扎根于大地的物理生存能力。
上半场的三场演讲,正是这场集体转身的三个切面。
从 Pi 的零样本泛化,到 OpenDrive Lab 的组合式逻辑,再到英伟达的全模态底座——三支团队选择了三条路,反对的却是同一种路径依赖:单纯靠「喂数据」来模拟动作。
三种尺度,同一个转向:一种证明数据依赖可以被想象力替代;一种证明安全不必用真实碰撞来换取;一种证明智能不必背着服务器奔跑。
当天 Spotlight 环节的几项硬核技术,展示了机器人底层基建的另类进化——不卷参数,卷「成本」与「寿命」。
机器人可以在一个完全虚拟但物理一致的「世界」里「活」上很久。研究者在 0 真实数据训练下,让机器人直接在现实环境中稳健完成绳索理顺与杯子抓取。
用声音在空腔中的反射感知碰撞与压力,替代昂贵脆弱的视触觉传感器。「形态学计算」的奇思妙想,让触觉感知的成本下降了几个数量级。
注:左侧是「仿真寿命」的量级跃升,右侧是触觉感知的硬件成本骤降——两条曲线指向同一件事:具身实验的门槛正在被拉低。
把三场演讲与 Spotlight 放在一起,2026 年的行业轨迹已经清晰:机器人正在从「死记硬背」动作的机器,进化为拥有「预判与想象」能力的智能体。世界模型不再是实验室里的视频 Demo,它正在变成机器人的「大脑皮层」。
当机器人开始学会举一反三,当英伟达把大脑塞进边缘设备,当仿真与现实的边界彻底模糊——具身智能才算真正跨过那个名为「通用性」的门槛。
但一个诚实的注脚,必须写在这里。
「想象力」正在成为具身智能的第一生产力,但它今天依然高度依赖人类示范视频与仿真环境。真正的护城河,将从数据与算力的堆叠,迁移到世界模型的预测精度与评估质量——谁让机器人在行动前想得对、想得快,谁就握住通用性的钥匙。
RSS 2026 的论文与 Workshop 录像已在会议官网陆续公开;Cosmos 3 全套模型与代码已开放下载。
关注 RSS 2026 官网与 Cosmos 3 开源仓库 →