RSS 2026 现场:具身智能没有"中国版",中国硬件率先出海
在悉尼举办的机器人顶会 RSS 2026 上,来自 Physical Intelligence 团队的多位受访者给出一个意外判断:包括 PI 在内,北美头部具身公司离成熟都还有不短距离。与此同时,宇树、智元、Seeed 等中国厂商占据展厅主角,硬件出海进度已明显领先美国。
在悉尼举办的机器人顶会 RSS 2026 上,来自 Physical Intelligence 团队的多位受访者给出一个意外判断:包括 PI 在内,北美头部具身公司离成熟都还有不短距离。与此同时,宇树、智元、Seeed 等中国厂商占据展厅主角,硬件出海进度已明显领先美国。
国内"VLA 已死,世界模型当立"的说法已传了好几轮,但凡有融资新闻的具身公司,基本都在做世界模型。但在 RSS 2026 现场,模仿学习与 VLA 相关报告塞满整整半个下午,世界模型反而与"记忆"挤在同一场 Session。
这种"时差"的根源在审稿周期:
从截稿到开会相隔近 5.5 个月,算上论文从 idea 到实验写作的时间,会场成果往往在大半年甚至一年前就已启动。顶会论文是过去的技术切片,很难反映过去几周的行业热搜。
更关键的是,来自 Physical Intelligence 的两位博士生给出了一个与国内叙事截然不同的判断:VLA 和世界模型并不矛盾,甚至可以同时推进——π0.7 本身就包含一个世界模型组件。
"你真的见过一个部署了世界模型的机器人,说'这个动作我做了可能有问题,我不该这样做'吗?"
佐治亚理工学院博士 Simar Kareer 给出更具体的解释:现阶段视频预测或许能生成视觉合理的未来状态,却未必知道机器人的手有多大、要抓取的物体有多大。缺少这些与真实动作相关的信息,预测再逼真也难以转化为可靠操作。
VLA 直接输出动作;世界模型预测未来状态、辅助规划与避险——后者是前者的替代。
两者不矛盾。视频预测负责"想象未来",动作预测负责"落地执行",可联合学习。
香港大学陈立博士在 Robot World Models 研讨会上补充:"预测会发生什么"和"评估这对我是否有用"必须解耦。他的 RISE 框架中,动力学模型负责生成未来状态,价值模型判断状态是否符合任务目标,机器人在模型生成的未来中先试错,再迁移到真实世界。
数据已是具身领域最重要的话题,但论文里最显眼的仍是模型。Simar Kareer 在 EgoVerse 工作中重新画了机器人领域的数据金字塔:
传统数据金字塔:规模从下到上递减,暗示互联网数据天然构成机器人学习基础。
但 EgoVerse 实验给出了不同图景——真正决定效果的,是 Data Mixture 中有没有足够的"对齐区域":
Simar 建议参考 π0 的训练规模(约 1 万小时)及公开数据集,但他强调这只是一个参照,不是已验证的 Scaling Law。诺亦腾机器人工作人员的判断更直白:架构可以写进论文,数据配方却像不会轻易示人的 recipe。
斯坦福大学教授 Karen Liu 在闭幕 Keynote 中把机器人领域概括为 "Model-rich, Data-poor"。机器人 Data Poor 不只因为遥操作难以 scale,还因为任务从桌面抓取走向灵巧操作和全身控制后,采集难度不断增加。
但机器人并不缺模型——计算机图形学有物理仿真和数字人模型,计算机视觉有 3D 重建和几何模型,机器人学有轨迹优化和运动规划。问题不是模型没用,而是我们一直给它们安排错了工作。
Karen 团队的 VLK 系统搭建了一条 Real-to-Sim-to-Real Pipeline:用 3D Gaussian Splatting 高效重建真实环境,用全身动作跟踪策略把运动学轨迹转化为真实机器人动作。整套系统不需要人类示范,在重建的室内环境中自动合成了 4.8 万条视觉、语言和全身运动学轨迹,训练出的策略成功迁移到真实 Unitree G1 上,完成导航和物体搬运。
宇树在春晚跑跳起舞,各家 Demo 在精细操作上发力。但港大李弘扬教授在 Early Career Spotlight 中提出:真正的下一步是全身智能(Whole-body Intelligence)。
问题藏在"能跑"和"能干活"之间——真实任务不会配合机器人分步执行:
李弘扬给出的是一套分层系统,而非一个从图像直接输出电机电流的超级模型:
北京通用人工智能研究院黄思远用神经元数量解释了底层控制为何值得投入:
"人类大脑皮层约 160 亿个神经元,而主要负责控制、平衡与协调的小脑,约有 690 亿个神经元,占整个大脑神经元数量的 80% 以上。让机器人'知道要做什么'很难,但让几十个关节在真实世界里同时把这件事做好,同样远没有解决。"
黄思远的路径是:先训练多个专业控制模型(跑、跳、攀爬),再让通用模型吸收它们的经验。这与 Karen Liu 的"模型当 Teacher"、Tony Zhao 的"高层策略与底层控制之间设计动作接口"思路一脉相承。端到端回答的是模块内部如何学习,模块化回答的是整套系统如何分工——两者从来不是二选一。
RSS 2026 展厅里,中国公司几乎成了绝对主角:宇树、千寻智能、诺亦腾、Seeed Studio、智元、Sharpa 均设展位。但展台前最常出现的不是采购商,而是追着技术细节问个不停的学生和研究者。
文娱表演、商务指引——需求大但澳洲市场有限。
矿区勘测、巡检、分拣——能明确计算投入产出比的任务。
中国公司选择了不同的出海路径:
但硬件先出去,不等于具身智能已经完成出海。中国在供应链、价格和交付上的优势让机器人率先拿到船票,但模型如何适应当地任务、数据如何形成闭环、开发者生态如何建立,仍需在当地重新生长。
本文核心判断主要来自 Physical Intelligence 团队成员及实习生在 RSS 2026 现场的口头交流,属单方披露,未见第三方复测或独立验证。读者宜将其视为北美头部团队对行业成熟度的主观体感,而非可量化的技术评测结论。报道中"中国硬件领先美国"的判断,亦来自同一团队观察,应结合具体维度(供应链、价格、交付能力 vs 模型、数据、生态)理解,不宜笼统泛化。
另外需注意:RSS 论文从截稿到开会相隔 5.5 个月,会场内容与当下行业最前沿存在天然时差——用顶会论文反推"技术趋势"时,务必叠加这层时间滤镜。
全身智能概念详解与 RSS 2026 最佳论文详情,可参考以下入口:
archon.tech → 全身智能