🤖 RSS 2026 · 现场直击

机器人操作迈入"少样本时代":一次演示产千条数据,两次演示拿下 90% 成功率

7 月 13 日,机器人领域顶级学术会议 RSS 2026 在悉尼开幕,主会仅收录约 160 篇论文。首日操作环节,来自全球顶尖实验室的 9 项研究指向同一趋势:机器人正在摆脱对海量标注数据的依赖,以极低的学习成本,学会最精细的活。

来源:综合公开信息整理 事件时间 2026-07-13 全文约 4 分钟读完
#RSS 2026 #机器人操作 #少样本学习 #具身智能 #灵巧操作
~160 篇 主会收录论文,极低接收率
9 项 精选前沿研究,现场直击
3 大 技术突破方向
90% 两次演示下的任务成功率

注:以上数据取自会议公开日程与现场报告口径;"90%"为 SID 论文在六个真实世界任务中的平均表现。

⚡ 30 秒速览
  • 现场主线:机器人操作正从"数据饥渴"走向"样本高效"——一次演示合成千条数据、两次演示保持 90% 成功率。
  • 数据来源革命:研究者从人类视频"白嫖"操作知识,用触觉手套实现跨物种对齐,不再死磕昂贵的遥操作采集。
  • 泛化破壁:手术机器人仅凭约 150 条演示实现零样本移植,水下抓取不用下水采数据,深度图成了水陆"通用语言"。
  • 架构反思:Meta 用 89 个策略跑出 VLA 数据配比"黄金搭档";触觉正从额外输入变成连接物理现实的"接地"桥梁。
  • 编辑预判:少样本的真正瓶颈不在数据量,而在分布偏移管理——这恰恰是系统设计能发力的地方。

01一场"反内卷":研究者们不再死磕千万次演示

双臂协同、手术辅助、水下灵巧操作——这些任务过去都卡在同一道坎上:高质量演示数据太贵。遥操作采集可靠但费时费力,仿真合成效率高却难以跨越虚实鸿沟。

现在,这个两难正在被拆解。

旧范式:数据换能力

海量遥操作采集,可靠但昂贵;仿真数据高效但失真;端到端策略一遇环境偏移就翻车。

新范式:设计换数据

一次真实演示自动合成数千条数据;从人类视频与触觉信号中"白嫖"先验;在推理时设置护栏,把系统"滑"回安全区

一句话总结:研究者们正在用巧劲替代苦力。而他们的共同手段,无非以下三招。

人类视频白嫖 跨物种触觉对齐 仿真预训练 + 真机微调 推理时安全护栏 跨域表示对齐

注:标签云为本次精选论文中使用频率最高的五类技术手段,按出现次数排序。

02数据从哪来?一次演示、一段视频、一双手套

既然真机数据难以海量采集,研究者把目光投向了最丰富的资源库——人类的日常行为。难点在于:如何跨越"人与机器"的结构鸿沟,直接提取知识?

🧬 BiDemoSyn:一次演示,生成千条训练数据一次演示 → 千条数据

华南理工大学

  • 把双臂任务拆解为"不变协调块""可变物体适应":前者锁定双臂协同模式,后者按物体位姿灵活调整。
  • 基于解耦,通过视觉引导对齐和轻量级轨迹优化,数小时自动合成数千条物理可行的多样化数据。
  • 六个双臂任务上鲁棒泛化到新物体位姿与形状,还实现了零样本跨本体迁移——换台机器人也能直接上手。
方法本质:把"协同模式"与"物体适应"解耦,让一份演示数据可以被批量复制。

📺 DexImit:看人类视频,机器人学会用刀切苹果吃透人类视频

上海人工智能实验室 & 清华大学

  • 四阶段自动化管线:手-物交互三维重建 → 子任务分解与双臂调度 → 轨迹合成 → 综合数据增强。
  • 不挑食:任意视角的人类操作视频、甚至 AI 生成的视频都能直接学习,无需昂贵遥操作采集。
  • 工具使用与精细操作的门槛被大幅拉低——互联网本身就是训练场。
核心突破:绕开人手与机械手的结构差异,直接"榨取"互联网视频中沉淀的操作先验。

🧤 TactAlign:触觉手套教机器人拧灯泡,无需配对数据跨物种对齐

UC Berkeley & Meta

  • 整流流(rectified flow)将人类与机器人的触觉观测映射到同一共享潜在空间。
  • 对齐锚点直接来源于手物交互中自然产生的伪配对——不需要配对数据集、人工标注或特权信息。
  • 拧灯泡这种高灵巧任务,仅需不到五分钟的人类触觉数据,就实现了零样本迁移。
关键创新:物理交互的共性成为天然监督信号——人手与机械手抓同一物体,模式必然相似。

03环境突变怎么办?手术室、水下、陌生工具

数据从哪来解决了,下一个问题是:环境一变就翻车怎么办?手术室、水下、陌生工具,恰恰是机器人最常失控的三种场景。

先看最难的那个:手术室。

手术机器人面对的环境比工厂流水线复杂一个量级——组织会变形、视野会遮挡、任何小失误都可能致命。德国国家肿瘤疾病中心给出的答案很轻量:一个能像插件一样叠加在任意自主策略之上的监督式混合专家(MoE)架构。

<150 条演示数据,学会长时序牵拉
1 路立体内窥镜,唯一视觉输入
2 类猪组织验证:离体 + 体内
0 个新场景下的人工干预

注:数字为论文公开的实验设置;"0 个"指论文报告在弱光、遮挡及全新抓取位置下无需重训。

更值得关注的是泛化表现。面对新场景,各路基线纷纷失灵:

通用视觉-语言-动作模型新场景下完全失效
标准 Action Chunking Transformer弱光、遮挡下频频掉链子
MoE 增强版稳健通过,并完成离体猪组织零样本验证

手术室之外,同一条思路被带到了工具操作与水下场景。

🛠 SCFields · 触觉 + 视觉工具操作

新加坡 A*STAR & 新加坡国立大学

  • 把视觉语义与密集接触估计融合进统一三维表示,同时解决"用哪里"和"用多大力"。
  • 两阶段 Sim-to-Real:大规模仿真预训练接触先验 + 少量真实数据伪标注微调。
  • 未见过的工具实例上实现类别级泛化,大幅超越纯视觉与原始触觉基线。

🌊 UMI-Underwater · 水下抓取

斯坦福大学 & 哥伦比亚大学

  • 深度图在光照与水质变化下远比 RGB 稳定,成为弥合水陆域差的"通用语言"
  • 陆地手持演示训练,通过几何对齐零样本部署到水下;配合自监督采集管线自主试错。
  • 泳池实验全面超越纯 RGB 方法,甚至能泛化到仅在陆地出现过的物体。

04回归物理本质:数据配比、安全区与接触接地

前两个方向解决"数据从哪来、环境变了怎么办",第三个方向更底层:大语言模型的架构直接套在机器人上并不完美。研究者开始回归机器人的物理本质。

Meta AI 用一场大规模实证给出了 VLA 模型的第一份"数据菜谱":

视觉-语言数据 + 跨本体机器人数据 = 黄金搭档,两者联合共训显著提升分布偏移与未见任务的泛化;离散动作 token 收效甚微。
4,000h 操作数据 5,000w 视觉-语言样本 89 个 VLA 策略 60,000+ 次测试

注:数据规模为论文公开的实验设置;研究还发现,仅用机器人数据会严重退化视觉-语言理解,共训可有效恢复。

如果说 Meta 的研究回答的是"喂什么",浙江大学的 SID 回答的则是"怎么防翻车"。

90%
SID:两次演示,九成成功率

与其死磕数据,不如在推理时主动把系统"拉回"安全区。以物体为中心的运动场在偏离时提供大幅纠正,接近目标后自然衰减,交由轻量级执行策略收尾。六个真实世界任务、分布外初始条件下,成功率约 90%。

Contact-Grounded PolicyUCSD · Brown · Sony AI

条件扩散模型预测"机器人状态 + 触觉反馈"的耦合轨迹,可学习的接触一致性映射把预测转化为柔顺控制器可执行的目标状态——让 AI 策略的接触意图真正落地到物理世界。

"触觉不应只是锦上添花的额外观测,必须成为连接 AI 策略与物理现实的'接地'桥梁。"

05为什么是现在?从数据饥渴到样本高效

三个方向、九篇论文,一条主线贯穿始终:机器人操作正在换一种活法

从"数据饥渴"到"样本高效",中间只隔着一层系统设计。

人类视频 / 一次演示仿真预训练 + 伪标注微调跨域对齐(深度图 / 触觉)推理时运动场护栏接触接地动作

BiDemoSyn 一次演示合成千条数据、SID 两次演示拿下九成成功率、DexImit 从人类视频榨取操作知识、CGP 让灵巧手真正感知接触——这些探索共同指向一个未来:机器人不必再在实验室里苦熬千万次演示

但数据只是故事的一半。

真正的分水岭是系统设计。同样的数据量,有人翻车,有人稳健;同样的底座模型,有人只能死记硬背,有人学会了在偏离时主动回到安全区。少样本的瓶颈从来不在数据不够多,而在分布偏移管理得不够好。

编辑核心判断

机器人操作的"少样本时代",本质是系统工程对数据堆砌的胜利。谁能把人类先验、仿真知识与物理约束编排进同一套框架,谁就能用最少的演示,干最精细的活。

想第一时间读到完整解读?

一个人读论文太孤单,一群人刷顶会才好玩。RSS 2026 专题持续更新中,9 篇论文将逐一深拆。

通过官方渠道联系报道团队,备注「论文群 + 研究方向」