🤖 具身智能 · 顶会实录

当 Scaling Law 撞上「物理之墙」:RSS 2026 现场,机器人正从「死记硬背」走向「举一反三」

7 月的悉尼,RSS 2026 的 "Robot World Models" Workshop 给出一个明确信号:靠海量数据「喂」出来的动作模仿,正在触及天花板。机器人的下一个关键能力,是在行动之前,先在脑海里把世界跑一遍——学界管这叫「世界模型」。

来源:综合公开信息整理 2026-07 全文约 3 分钟读完
#RSS2026 #具身智能 #世界模型 #Cosmos 3 #物理AI
3 场 Workshop 上半场主旨演讲,指向同一转向
4B / 16B / 64B Cosmos 3 端侧到服务器的三档模型规模
10 分钟+ 物理一致仿真持续时长 @ 15 FPS

⚡ 30 秒速览

  • 一句话总结:RSS 2026 达成新共识——世界模型不再是「视频生成器」,而是机器人的逻辑中枢虚拟沙盒
  • Pi 团队:零遥操作数据,机器人看一段人类炸红薯的视频,就学会了操作空气炸锅。
  • OpenDrive Lab:组合式世界模型 RISE 把「预测」与「评估」解耦,让机器人在虚拟空间里安全地犯错。
  • 英伟达:全模态底座 Cosmos 3 三档模型全量开源,端侧 4B 模型终结「背着服务器跑」。
  • Spotlight:10 分钟+ 物理一致仿真、几毛钱麦克风替代昂贵触觉传感器——底层基建正在变便宜。

01当 Scaling Law 撞上「物理之墙」 数字世界的神话,止步于真实世界

2026 年 7 月的悉尼,RSS 会场内弥漫着一种复杂的情绪:一半是火焰,一半是海水。火焰来自大模型在云端的持续狂飙;海水来自具身智能在现实落地中的「物理阵痛」。

过去几年,全球 AI 行业笃信一套「暴力美学」的成功公式:巨大的参数量 + 几乎无穷的互联网数据 = 涌现的智能。它在文本、图像乃至视频生成上无往不利。但当这套逻辑被直接「平移」到机器人身上时,一道无形却坚硬的墙出现了。

云端世界

数据可以被无限复制和合成,Scaling Law 一路奏效。

物理世界

每一次抓取、每一步行走,都受限于时间的线性与空间的约束。

注:左右对比的是同一套「大力出奇迹」逻辑在两种介质里的表现——数字世界与物理世界,对数据密度的容忍度完全不同。

于是,那个在数字世界里几乎无所不能的 Scaling Law,在拧开一颗生锈的螺丝钉时,表现出了令人沮丧的笨拙。

问题不在模型不够大,而在它缺少一个在行动之前「想象」的环节。

02「世界模型」:从视频生成器到逻辑中枢 共识在 Workshop 上达到顶峰

在 "Robot World Models" 主题 Workshop 上,这种判断从个例上升为共识:世界模型不再被视为「视频生成器」,而是被重新定义为机器人的逻辑中枢虚拟沙盒。一年前,议题还是「生成的视频有多逼真」;今天,议题只剩一个——如何让机器人摆脱死记硬背,学会举一反三

机器人需要在行动前,先让未来在脑海里发生一次。

想象未来因果校验评估价值执行行动

读法:这是世界模型介入后的决策链路——预测与评估都发生在物理执行之前,「试错」被搬进了虚拟沙盒。

在沙盒里,机器人可以追问:如果我伸出这只手,杯子会碎吗?如果我推开这扇门,后面会坍塌吗?只有当这种视觉推演因果校准成为行动的前置条件,智能才不再是飘在空中的 Token 组合,而是真正扎根于大地的物理生存能力。

上半场的三场演讲,正是这场集体转身的三个切面。

03三场演讲,三个切面 从零样本泛化到全模态底座

从 Pi 的零样本泛化,到 OpenDrive Lab 的组合式逻辑,再到英伟达的全模态底座——三支团队选择了三条路,反对的却是同一种路径依赖:单纯靠「喂数据」来模拟动作

🎯 Pi 团队 Laura Smith:先「脑补」终态,再动手零遥操作数据

  • 一台从未学习过「操作空气炸锅」的机器人,在没有任何遥操作数据的前提下,仅凭看了一段人类炸红薯的视频就成功完成任务。
  • 机制在于:世界模型不负责「拍电影」,它提供目标图像(Goal Image)——机器人把人类视频中的常识与自身基础技能做「逻辑插值」。
  • 跨身体迁移:只要世界模型给出「衣服被叠好后的样子」,叠衣服技能就能从一款机器人迁移到形态完全不同的 UR5 机械臂
意义:视觉推理提供了一条不依赖动作标签的学习路径——「想象力」成了跨越长尾任务、降低数据依赖的武器。

🧩 OpenDrive Lab 陈立:把「预测」与「评估」拆开RISE 框架

  • 全像素生成路径有一个隐形瓶颈:模型很难同时兼顾生成质量评估准确性
  • 解法是拆开——RISE 框架中,动力学组件负责「想象未来」,价值组件负责判断未来是否安全、是否贴合任务目标。
  • 红利直接落在安全与数据效率上:机器人在虚拟空间里大量模拟「失败路径」,不必在真实世界撞 100 次车,也能学会敬畏物理法则。
意义:资源受限的团队不必训练全能的「上帝模型」——专业模块各司其职,也能跑通具身闭环。

🌌 英伟达 Max Li:全模态底座 Cosmos 3,押注「安卓式」生态全模态 · 全量开源

  • 全球首个在统一 MoE Transformer 架构下打通文本、视觉、音频与动作的全模态世界基础模型。
  • 「推理器 + 生成器」协同,把逆动力学反推与状态转移机制深度结合,让状态理解自然转化为行动策略。
  • 三档模型全部开源:端侧 Cosmos Edge(4B)可在 Jetson 上实时推理,与服务器级 Nano(16B)、Super(64B)纵向呼应——机器人不必再「背着服务器跑」。
野心:从算力垄断走向生态主宰——英伟达正用开源底层底座,抢占物理 AI 时代的「安卓位」。

三种尺度,同一个转向:一种证明数据依赖可以被想象力替代;一种证明安全不必用真实碰撞来换取;一种证明智能不必背着服务器奔跑。

04Spotlight:让仿真变久,让触觉变便宜 2026 年机器人底层基建的两个飞跃

当天 Spotlight 环节的几项硬核技术,展示了机器人底层基建的另类进化——不卷参数,卷「成本」与「寿命」。

10 分钟+物理一致视频预测 @ 15 FPS

Interactive World Simulator

机器人可以在一个完全虚拟但物理一致的「世界」里「活」上很久。研究者在 0 真实数据训练下,让机器人直接在现实环境中稳健完成绳索理顺与杯子抓取。

几毛钱微型扬声器 + 麦克风

声学触觉:让机器人「听见」压力

用声音在空腔中的反射感知碰撞与压力,替代昂贵脆弱的视触觉传感器。「形态学计算」的奇思妙想,让触觉感知的成本下降了几个数量级。

注:左侧是「仿真寿命」的量级跃升,右侧是触觉感知的硬件成本骤降——两条曲线指向同一件事:具身实验的门槛正在被拉低。

052026:从「大力砖飞」到「想象力驱动」 一个转折点的注脚

把三场演讲与 Spotlight 放在一起,2026 年的行业轨迹已经清晰:机器人正在从「死记硬背」动作的机器,进化为拥有「预判与想象」能力的智能体。世界模型不再是实验室里的视频 Demo,它正在变成机器人的「大脑皮层」。

当机器人开始学会举一反三,当英伟达把大脑塞进边缘设备,当仿真与现实的边界彻底模糊——具身智能才算真正跨过那个名为「通用性」的门槛。

但一个诚实的注脚,必须写在这里。

编辑核心判断

「想象力」正在成为具身智能的第一生产力,但它今天依然高度依赖人类示范视频与仿真环境。真正的护城河,将从数据与算力的堆叠,迁移到世界模型的预测精度与评估质量——谁让机器人在行动前想得对、想得快,谁就握住通用性的钥匙。

想跟进完整议程?

RSS 2026 的论文与 Workshop 录像已在会议官网陆续公开;Cosmos 3 全套模型与代码已开放下载。

关注 RSS 2026 官网与 Cosmos 3 开源仓库