29秒视频即学新技能,HOST框架让机器人告别"学新忘旧"
8月3日,自变量机器人与北京理工大学、清华大学联合发布并开源 HOST 框架。机器人只需观看一段平均 29 秒 的人类演示视频,即可在不更新模型参数、不采集新数据的情况下执行全新任务——测试覆盖 50 项 未见过的桌面操作任务,技能复现成功率达到 62%。
8月3日,自变量机器人与北京理工大学、清华大学联合发布并开源 HOST 框架。机器人只需观看一段平均 29 秒 的人类演示视频,即可在不更新模型参数、不采集新数据的情况下执行全新任务——测试覆盖 50 项 未见过的桌面操作任务,技能复现成功率达到 62%。
过去,教机器人一个新技能,需要专业工程师用昂贵的遥操作设备采集数百条演示数据,再花数小时微调模型参数。而且,学会新技能后,旧技能往往会被"遗忘"——论文数据显示,最强基线模型在微调后,旧任务表现下降至原来的 43%。
HOST(Human-to-robot One-Shot Skill AcquisiTion)彻底改写了这个流程。它让机器人从"动作模仿"转向"结果推理"——不再试图复制人类的肢体动作,而是观察人类完成任务后的结果状态,再反推自己需要执行的行动序列。
采集数百条轨迹 → 微调模型参数 → 学新技能 → 旧技能大幅退化。成本以数万元计,每次学习都是从头再来。
观看一段 29 秒人类视频 → 不修改参数 → 学会新技能 → 旧技能完整保留。无需专业工程师,普通人即可操作。
HOST 的核心创新在于一套"结果先行"的推理范式。与传统方法"看到人类动作 → 映射为机器人动作"的直线思路不同,HOST 的处理流程分为三步:
第一步:任务阶段判断。机器人观看人类视频时,首先判断当前任务进行到哪一阶段。以烹饪为例,系统需要识别出"此刻是切菜阶段还是炒菜阶段"。这一判断基于视觉内容的任务进度语义理解,而非简单的时间戳对齐。
第二步:视角迁移。将人类执行完动作后的画面,转化为机器人自身视角和身体结构下的画面。人类用五指完成的任务,机器人需要用夹爪完成——这一步解决了"身体鸿沟"问题。
第三步:动作反推。从目标画面反推需要执行的动作序列并执行。机器人不是在"复制"人类动作,而是在"求解"一个问题:要达成这个结果状态,我应该怎么做?
人类与机器人的执行速度不同。同样经过10秒,视频中的人类可能已完成切菜并开始炒菜,而机器人仍在切菜阶段。HOST 的解决方案是"按任务进度对齐"——将视频每一帧和机器人操作的每一步映射到同一向量空间,再通过动态时间规整算法自动建立对应关系。论文数据显示,该方法将对齐误差从基于时钟时间的 0.079 降至 0.006(平均绝对进度差),降低了一个数量级。
这意味着,即使人类以快进或慢速演示,机器人也能正确理解每个阶段应该完成的任务目标。普通人不需要刻意放慢动作或标准化流程,随手拍摄的视频即可作为教学素材。
HOST 的技术底座是一个带有视觉预测功能的级联策略模型,采用双专家混合架构。其核心设计是将技能学习拆分为两个阶段,从根本上解决了"学新不忘旧"的问题。
模型首先在 193,462 条机器人同体轨迹数据上预训练,覆盖 229 项任务。这一阶段的目标是让机器人学会"跟随演示过程"的基本能力——通过预测同一任务另一条轨迹的未来状态和动作来建立基础技能框架。数据以机器人执行自身任务的轨迹为主,相对容易采集。
在预训练基础上,使用 5,847 条人类-机器人配对演示数据进行微调。这一阶段将模型的能力从"机器人跟随机器人"扩展到"机器人跟随人类",实现跨本体迁移。配对数据极为稀缺,因此 HOST 通过先打基础再迁移的策略,在有限数据条件下实现了高效学习。
由于推理时权重冻结,同一台机器人今天学会切菜,明天学会擦桌子,只需更换输入视频即可,无需重新配置或训练。论文数据显示,在微调方案学习新技能后,最强基线模型在旧任务上的表现下降至原来的 43%,而 HOST 几乎完整保留了所有已掌握的技能。
更关键的是技能保留率:HOST 在旧任务上的表现几乎不变,而微调方案学习新技能后旧技能保留率大幅下降至 43%。这意味着传统方法每学一个新技能,就"忘记"一半以上的旧技能——在真实部署场景中,这是不可接受的。
在 Scaling Law 仍主导 AI 叙事的今天,HOST 证明了算法创新同样可以大幅降低数据依赖——与其无限堆数据,不如教会机器人如何更聪明地学习。具身智能的下一站,不是更大的数据集,而是更聪明的学习范式。
论文、代码与模型权重已全部开源至 GitHub 及 Hugging Face,搜索「HOST」即可获取完整项目文档与示例教程。
GitHub 项目主页 → 开源仓库