🌐 现场观察 · RSS 2026

RSS 2026 现场:具身智能没有"中国版",中国硬件率先出海

在悉尼举办的机器人顶会 RSS 2026 上,来自 Physical Intelligence 团队的多位受访者给出一个意外判断:包括 PI 在内,北美头部具身公司离成熟都还有不短距离。与此同时,宇树、智元、Seeed 等中国厂商占据展厅主角,硬件出海进度已明显领先美国

来源:公开报道 2026-07-25 全文约 5 分钟读完
#RSS2026 #具身智能 #VLA #世界模型 #机器人出海
5.5 个月 顶会审稿周期,论文滞后于行业迭代
4.8万条 VLK 自动合成轨迹,无需人类示范
690亿 人脑小脑神经元数,是大脑皮层 4 倍

⚡ 30 秒速览

  • 顶会时差:RSS 2026 论文从截稿到线下开会相隔 5.5 个月,会场内容是"过去的技术切片",而非"行业热搜"。
  • 路线之争:国内热炒"VLA 已死,世界模型当立",但顶会上 VLA 与模仿学习仍占绝对多数;PI 团队明确表示两者不矛盾,可以全都要。
  • 数据真相:相比堆数据量,Curation(清洗、筛选、配比)更决定效果;π0 训练规模约 1 万小时,仅作参照而非已验证的 Scaling Law。
  • 硬件出海:中国公司在供应链、价格、交付上领先,RSS 展台问询者仍以高校为主,矿区巡检等能算清投入产出的场景最先落地。
  • PI 的判断:美国具身同样未成熟,中国真正领先的恰恰是硬件——"中国公司何必急着自称中国版 XX"。

01国内喊"VLA 已死",顶会为何还在讨论 VLA?

国内"VLA 已死,世界模型当立"的说法已传了好几轮,但凡有融资新闻的具身公司,基本都在做世界模型。但在 RSS 2026 现场,模仿学习与 VLA 相关报告塞满整整半个下午,世界模型反而与"记忆"挤在同一场 Session。

这种"时差"的根源在审稿周期:

1.30 截稿4.27 公布录用7.13 线下开会

从截稿到开会相隔近 5.5 个月,算上论文从 idea 到实验写作的时间,会场成果往往在大半年甚至一年前就已启动。顶会论文是过去的技术切片,很难反映过去几周的行业热搜。

更关键的是,来自 Physical Intelligence 的两位博士生给出了一个与国内叙事截然不同的判断:VLA 和世界模型并不矛盾,甚至可以同时推进——π0.7 本身就包含一个世界模型组件。

"你真的见过一个部署了世界模型的机器人,说'这个动作我做了可能有问题,我不该这样做'吗?"

— PI 实习生,被问及世界模型能否预测动作后果时的反问

佐治亚理工学院博士 Simar Kareer 给出更具体的解释:现阶段视频预测或许能生成视觉合理的未来状态,却未必知道机器人的手有多大、要抓取的物体有多大。缺少这些与真实动作相关的信息,预测再逼真也难以转化为可靠操作。

国内流行叙事

VLA 直接输出动作;世界模型预测未来状态、辅助规划与避险——后者是前者的替代。

顶会研究共识

两者不矛盾。视频预测负责"想象未来",动作预测负责"落地执行",可联合学习。

香港大学陈立博士在 Robot World Models 研讨会上补充:"预测会发生什么"和"评估这对我是否有用"必须解耦。他的 RISE 框架中,动力学模型负责生成未来状态,价值模型判断状态是否符合任务目标,机器人在模型生成的未来中先试错,再迁移到真实世界。

02数据量重要,但 Curation 更重要

数据已是具身领域最重要的话题,但论文里最显眼的仍是模型。Simar Kareer 在 EgoVerse 工作中重新画了机器人领域的数据金字塔:

机器人遥操作数据
规模最小 · 成本最高
仿真数据
互联网数据 / 人类视频
规模最大

传统数据金字塔:规模从下到上递减,暗示互联网数据天然构成机器人学习基础。

但 EgoVerse 实验给出了不同图景——真正决定效果的,是 Data Mixture 中有没有足够的"对齐区域"

🧪 EgoVerse 数据配比实验关键发现

  • 只用机器人数据 + 自由形态人类数据:提升有限。
  • 只加入与任务对齐的人类示范:改善同样不大。
  • 三类数据共同出现时提升最明显——机器人遥操作 + 任务对齐 Episodic Human Data + 覆盖长尾的 Free-form Human Data。
前两类提供"锚点",告诉模型人类行为与机器人动作空间如何对应。

Simar 建议参考 π0 的训练规模(约 1 万小时)及公开数据集,但他强调这只是一个参照,不是已验证的 Scaling Law。诺亦腾机器人工作人员的判断更直白:架构可以写进论文,数据配方却像不会轻易示人的 recipe

03Data Poor,但 Model Rich

斯坦福大学教授 Karen Liu 在闭幕 Keynote 中把机器人领域概括为 "Model-rich, Data-poor"。机器人 Data Poor 不只因为遥操作难以 scale,还因为任务从桌面抓取走向灵巧操作和全身控制后,采集难度不断增加

但机器人并不缺模型——计算机图形学有物理仿真和数字人模型,计算机视觉有 3D 重建和几何模型,机器人学有轨迹优化和运动规划。问题不是模型没用,而是我们一直给它们安排错了工作

已有专业模型退到训练阶段当 Teacher自动生产示范数据训练通用策略

Karen 团队的 VLK 系统搭建了一条 Real-to-Sim-to-Real Pipeline:用 3D Gaussian Splatting 高效重建真实环境,用全身动作跟踪策略把运动学轨迹转化为真实机器人动作。整套系统不需要人类示范,在重建的室内环境中自动合成了 4.8 万条视觉、语言和全身运动学轨迹,训练出的策略成功迁移到真实 Unitree G1 上,完成导航和物体搬运。

04从"能跑"+"能干活"到全身智能

宇树在春晚跑跳起舞,各家 Demo 在精细操作上发力。但港大李弘扬教授在 Early Career Spotlight 中提出:真正的下一步是全身智能(Whole-body Intelligence)

问题藏在"能跑"和"能干活"之间——真实任务不会配合机器人分步执行:

⚖️ 为什么不能拆成两个动作?全身协同

  • 搬自行车:双腿需随重量变化实时调整重心。
  • 够远处物体:另一只手要主动抬起保持平衡。
  • 窄通道搬运:必须一边侧身一边继续搬运。
走路和操作不能再拆成互不相干的动作——腿、腰、躯干和双手必须作为一个整体协同。

李弘扬给出的是一套分层系统,而非一个从图像直接输出电机电流的超级模型:

大脑:语义推理具身模型:全身动作身体模型:平衡与执行

北京通用人工智能研究院黄思远用神经元数量解释了底层控制为何值得投入:

"人类大脑皮层约 160 亿个神经元,而主要负责控制、平衡与协调的小脑,约有 690 亿个神经元,占整个大脑神经元数量的 80% 以上。让机器人'知道要做什么'很难,但让几十个关节在真实世界里同时把这件事做好,同样远没有解决。"

— 黄思远,北京通用人工智能研究院研究科学家

黄思远的路径是:先训练多个专业控制模型(跑、跳、攀爬),再让通用模型吸收它们的经验。这与 Karen Liu 的"模型当 Teacher"、Tony Zhao 的"高层策略与底层控制之间设计动作接口"思路一脉相承。端到端回答的是模块内部如何学习,模块化回答的是整套系统如何分工——两者从来不是二选一。

05硬件先出海,智能再跟上

RSS 2026 展厅里,中国公司几乎成了绝对主角:宇树、千寻智能、诺亦腾、Seeed Studio、智元、Sharpa 均设展位。但展台前最常出现的不是采购商,而是追着技术细节问个不停的学生和研究者

国内常见场景

文娱表演、商务指引——需求大但澳洲市场有限。

海外最先落地的

矿区勘测、巡检、分拣——能明确计算投入产出比的任务。

中国公司选择了不同的出海路径:

🌏 三条出海路径现场观察

  • 宇树:借助当地合作伙伴与分销商,先降低进入新市场的成本。
  • 智元:在澳新地区设立自有团队,独立运营虽更重,但能更快获得客户反馈、了解当地真实任务需求。
  • Seeed Studio:提供开源硬件和边缘计算设备,价格低、社区完整、上手快——对预算有限的海外高校,比炫 Demo 更有吸引力。

但硬件先出去,不等于具身智能已经完成出海。中国在供应链、价格和交付上的优势让机器人率先拿到船票,但模型如何适应当地任务、数据如何形成闭环、开发者生态如何建立,仍需在当地重新生长。

编辑视角

本文核心判断主要来自 Physical Intelligence 团队成员及实习生在 RSS 2026 现场的口头交流,属单方披露,未见第三方复测或独立验证。读者宜将其视为北美头部团队对行业成熟度的主观体感,而非可量化的技术评测结论。报道中"中国硬件领先美国"的判断,亦来自同一团队观察,应结合具体维度(供应链、价格、交付能力 vs 模型、数据、生态)理解,不宜笼统泛化。

另外需注意:RSS 论文从截稿到开会相隔 5.5 个月,会场内容与当下行业最前沿存在天然时差——用顶会论文反推"技术趋势"时,务必叠加这层时间滤镜

当全球具身智能都还在寻找"奠基性工作"时,谁先停止对标别人、谁先在自己的优势环节(硬件、供应链、数据闭环)跑通端到端产业闭环,谁就握住了下一阶段的定义权。

延伸阅读

全身智能概念详解与 RSS 2026 最佳论文详情,可参考以下入口:

archon.tech → 全身智能