机器人操作迈入"少样本时代":一次演示产千条数据,两次演示拿下 90% 成功率
7 月 13 日,机器人领域顶级学术会议 RSS 2026 在悉尼开幕,主会仅收录约 160 篇论文。首日操作环节,来自全球顶尖实验室的 9 项研究指向同一趋势:机器人正在摆脱对海量标注数据的依赖,以极低的学习成本,学会最精细的活。
注:以上数据取自会议公开日程与现场报告口径;"90%"为 SID 论文在六个真实世界任务中的平均表现。
7 月 13 日,机器人领域顶级学术会议 RSS 2026 在悉尼开幕,主会仅收录约 160 篇论文。首日操作环节,来自全球顶尖实验室的 9 项研究指向同一趋势:机器人正在摆脱对海量标注数据的依赖,以极低的学习成本,学会最精细的活。
注:以上数据取自会议公开日程与现场报告口径;"90%"为 SID 论文在六个真实世界任务中的平均表现。
双臂协同、手术辅助、水下灵巧操作——这些任务过去都卡在同一道坎上:高质量演示数据太贵。遥操作采集可靠但费时费力,仿真合成效率高却难以跨越虚实鸿沟。
现在,这个两难正在被拆解。
海量遥操作采集,可靠但昂贵;仿真数据高效但失真;端到端策略一遇环境偏移就翻车。
一次真实演示自动合成数千条数据;从人类视频与触觉信号中"白嫖"先验;在推理时设置护栏,把系统"滑"回安全区。
一句话总结:研究者们正在用巧劲替代苦力。而他们的共同手段,无非以下三招。
注:标签云为本次精选论文中使用频率最高的五类技术手段,按出现次数排序。
既然真机数据难以海量采集,研究者把目光投向了最丰富的资源库——人类的日常行为。难点在于:如何跨越"人与机器"的结构鸿沟,直接提取知识?
华南理工大学
上海人工智能实验室 & 清华大学
UC Berkeley & Meta
数据从哪来解决了,下一个问题是:环境一变就翻车怎么办?手术室、水下、陌生工具,恰恰是机器人最常失控的三种场景。
先看最难的那个:手术室。
手术机器人面对的环境比工厂流水线复杂一个量级——组织会变形、视野会遮挡、任何小失误都可能致命。德国国家肿瘤疾病中心给出的答案很轻量:一个能像插件一样叠加在任意自主策略之上的监督式混合专家(MoE)架构。
注:数字为论文公开的实验设置;"0 个"指论文报告在弱光、遮挡及全新抓取位置下无需重训。
更值得关注的是泛化表现。面对新场景,各路基线纷纷失灵:
手术室之外,同一条思路被带到了工具操作与水下场景。
新加坡 A*STAR & 新加坡国立大学
斯坦福大学 & 哥伦比亚大学
前两个方向解决"数据从哪来、环境变了怎么办",第三个方向更底层:大语言模型的架构直接套在机器人上并不完美。研究者开始回归机器人的物理本质。
Meta AI 用一场大规模实证给出了 VLA 模型的第一份"数据菜谱":
注:数据规模为论文公开的实验设置;研究还发现,仅用机器人数据会严重退化视觉-语言理解,共训可有效恢复。
如果说 Meta 的研究回答的是"喂什么",浙江大学的 SID 回答的则是"怎么防翻车"。
与其死磕数据,不如在推理时主动把系统"拉回"安全区。以物体为中心的运动场在偏离时提供大幅纠正,接近目标后自然衰减,交由轻量级执行策略收尾。六个真实世界任务、分布外初始条件下,成功率约 90%。
条件扩散模型预测"机器人状态 + 触觉反馈"的耦合轨迹,可学习的接触一致性映射把预测转化为柔顺控制器可执行的目标状态——让 AI 策略的接触意图真正落地到物理世界。
"触觉不应只是锦上添花的额外观测,必须成为连接 AI 策略与物理现实的'接地'桥梁。"
三个方向、九篇论文,一条主线贯穿始终:机器人操作正在换一种活法。
从"数据饥渴"到"样本高效",中间只隔着一层系统设计。
BiDemoSyn 一次演示合成千条数据、SID 两次演示拿下九成成功率、DexImit 从人类视频榨取操作知识、CGP 让灵巧手真正感知接触——这些探索共同指向一个未来:机器人不必再在实验室里苦熬千万次演示。
但数据只是故事的一半。
真正的分水岭是系统设计。同样的数据量,有人翻车,有人稳健;同样的底座模型,有人只能死记硬背,有人学会了在偏离时主动回到安全区。少样本的瓶颈从来不在数据不够多,而在分布偏移管理得不够好。
机器人操作的"少样本时代",本质是系统工程对数据堆砌的胜利。谁能把人类先验、仿真知识与物理约束编排进同一套框架,谁就能用最少的演示,干最精细的活。
一个人读论文太孤单,一群人刷顶会才好玩。RSS 2026 专题持续更新中,9 篇论文将逐一深拆。
通过官方渠道联系报道团队,备注「论文群 + 研究方向」