🤖 具身智能 · 开源突破

29秒视频即学新技能,HOST框架让机器人告别"学新忘旧"

8月3日,自变量机器人与北京理工大学、清华大学联合发布并开源 HOST 框架。机器人只需观看一段平均 29 秒 的人类演示视频,即可在不更新模型参数、不采集新数据的情况下执行全新任务——测试覆盖 50 项 未见过的桌面操作任务,技能复现成功率达到 62%

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#HOST #单样本学习 #具身智能 #开源 #结果反推
62% 单样本学习成功率 · 50项未见任务
1/50 数据量缩减至传统方案
1/507 学习时间缩短至传统方案
注:成功率基于 50 项训练阶段从未见过的桌面操作任务测试,每项任务执行多次取均值。数据量与时间对比基准为 Pi-0.5 配合微调方案。

⚡ 30 秒速览

  • 核心突破:机器人观看一段 29 秒人类视频即可学会新技能,无需重新训练或采集数据。
  • 数据效率:数据量减少至传统方法的 1/50,学习时间缩短至 1/507,成功率显著领先。
  • 技能保留:学新不忘旧——旧技能保留率近乎 100%,而微调方案学习新技能后旧技能降至 43%
  • 技术路线:从"动作模仿"转向"结果推理",绕开人机身体结构差异这一不可约难题。
  • 开源开放:论文、代码与模型权重已全部开源至 GitHub 及 Hugging Face。

01发生了什么 机器人学习范式的转折

过去,教机器人一个新技能,需要专业工程师用昂贵的遥操作设备采集数百条演示数据,再花数小时微调模型参数。而且,学会新技能后,旧技能往往会被"遗忘"——论文数据显示,最强基线模型在微调后,旧任务表现下降至原来的 43%

HOST(Human-to-robot One-Shot Skill AcquisiTion)彻底改写了这个流程。它让机器人从"动作模仿"转向"结果推理"——不再试图复制人类的肢体动作,而是观察人类完成任务后的结果状态,再反推自己需要执行的行动序列。

一个简单的对比,就能看清差异:

传统方法(微调方案)

采集数百条轨迹 → 微调模型参数 → 学新技能 → 旧技能大幅退化。成本以数万元计,每次学习都是从头再来。

HOST 框架

观看一段 29 秒人类视频 → 不修改参数 → 学会新技能 → 旧技能完整保留。无需专业工程师,普通人即可操作。

注:传统方法以 Pi-0.5 配合 SFT 微调为典型代表,HOST 在推理时完全不修改模型权重,技能习得类似于"加载新菜谱"而非"重塑大脑"。
50测试任务数
29平均视频时长(秒)
62%技能复现成功率
100%旧技能保留率
注:50 项任务均为训练阶段从未见过的桌面操作类任务,涵盖放水果、堆碗、擦盘子、插笔等场景。旧技能保留率基于 HOST 在推理时冻结权重的设计特性。

02为什么可信 "结果反推"的三步推理

HOST 的核心创新在于一套"结果先行"的推理范式。与传统方法"看到人类动作 → 映射为机器人动作"的直线思路不同,HOST 的处理流程分为三步:

① 任务阶段判断 ② 视角迁移 ③ 动作反推
注:三个阶段依次执行——先理解当前任务进度,再转换到机器人自身视角,最后从目标状态反求出动作序列。全程不依赖时间轴对齐,而是基于语义理解。

第一步:任务阶段判断。机器人观看人类视频时,首先判断当前任务进行到哪一阶段。以烹饪为例,系统需要识别出"此刻是切菜阶段还是炒菜阶段"。这一判断基于视觉内容的任务进度语义理解,而非简单的时间戳对齐。

第二步:视角迁移。将人类执行完动作后的画面,转化为机器人自身视角和身体结构下的画面。人类用五指完成的任务,机器人需要用夹爪完成——这一步解决了"身体鸿沟"问题。

第三步:动作反推。从目标画面反推需要执行的动作序列并执行。机器人不是在"复制"人类动作,而是在"求解"一个问题:要达成这个结果状态,我应该怎么做?

一个关键的技术细节:时间不同步怎么办?

人类与机器人的执行速度不同。同样经过10秒,视频中的人类可能已完成切菜并开始炒菜,而机器人仍在切菜阶段。HOST 的解决方案是"按任务进度对齐"——将视频每一帧和机器人操作的每一步映射到同一向量空间,再通过动态时间规整算法自动建立对应关系。论文数据显示,该方法将对齐误差从基于时钟时间的 0.079 降至 0.006(平均绝对进度差),降低了一个数量级。

这意味着,即使人类以快进或慢速演示,机器人也能正确理解每个阶段应该完成的任务目标。普通人不需要刻意放慢动作或标准化流程,随手拍摄的视频即可作为教学素材。

03它能做什么 两个满分任务拆解

🍎 物品整理:放水果、堆碗、擦盘子、插笔 50 项任务全覆盖

  • 不给任何预设数据,机器人仅观看一段 29 秒人类演示视频,即学会将水果放入指定容器、将碗堆叠整齐、擦拭盘子表面、将笔插入笔筒。
  • 即使执行过程中物品位置被移动,机器人也能根据目标状态重新规划动作,继续完成任务——这是"结果反推"机制带来的泛化能力。
  • 50 项任务均为训练阶段从未见过的全新操作,机器人仅凭一次观看即成功复现,成功率 62%。
评分维度:任务完成度 / 状态识别 / 动作规划 / 鲁棒性 —— 在单样本学习场景下达到突破性水平。

🍳 多阶段烹饪:切菜→炒菜的任务进度对齐 阶段识别满分

  • 机器人观看人类烹饪视频后,自主识别出"切菜阶段"与"炒菜阶段"的语义边界,而非简单按时间轴切割。
  • 执行过程中,即使人类视频中切菜耗时 20 秒、炒菜耗时 15 秒,而机器人执行速度不同,系统仍能通过动态时间规整精准对齐每个阶段的完成目标。
  • 对齐误差从 0.079 降至 0.006,确保机器人不会因速度差异而"错过"某个任务阶段。
LLM 评审结论:「阶段识别与动作衔接表现卓越,未出现因时间不同步导致的任务中断」

04为什么能做到 双专家架构与两阶段训练

HOST 的技术底座是一个带有视觉预测功能的级联策略模型,采用双专家混合架构。其核心设计是将技能学习拆分为两个阶段,从根本上解决了"学新不忘旧"的问题。

第一阶段:同体预训练

模型首先在 193,462 条机器人同体轨迹数据上预训练,覆盖 229 项任务。这一阶段的目标是让机器人学会"跟随演示过程"的基本能力——通过预测同一任务另一条轨迹的未来状态和动作来建立基础技能框架。数据以机器人执行自身任务的轨迹为主,相对容易采集。

第二阶段:人机视频训练

在预训练基础上,使用 5,847 条人类-机器人配对演示数据进行微调。这一阶段将模型的能力从"机器人跟随机器人"扩展到"机器人跟随人类",实现跨本体迁移。配对数据极为稀缺,因此 HOST 通过先打基础再迁移的策略,在有限数据条件下实现了高效学习。

🔹 193,462 条同体轨迹 🔹 229 项预训练任务 🔹 5,847 条人机配对数据 ✦ 推理时冻结权重
注:HOST 在推理时完全不修改模型参数,技能习得类似于"加载新菜谱"而非"重塑厨师的大脑"。旧技能以模型权重形式存在,新技能以推理时输入的形式存在,两者互不干扰。

由于推理时权重冻结,同一台机器人今天学会切菜,明天学会擦桌子,只需更换输入视频即可,无需重新配置或训练。论文数据显示,在微调方案学习新技能后,最强基线模型在旧任务上的表现下降至原来的 43%,而 HOST 几乎完整保留了所有已掌握的技能。

05数据效率的全面领先 HOST vs 传统微调方案

一个诚实的注脚:数据不是越多越好,关键是学会如何学习。
🥇 HOST 框架自变量机器人·清华·北理工
62%
Pi-0.5 + 微调传统方案基准
~26%
Wall-OSS + SFT最强基线模型
~22%
注:柱形自 15% 起缩放,非零起点;分差以标注分数为准。HOST 在成功率、数据量(1/50)、学习时间(1/507)三个维度全面领先。基线数据基于论文中公开的对比实验。

更关键的是技能保留率:HOST 在旧任务上的表现几乎不变,而微调方案学习新技能后旧技能保留率大幅下降至 43%。这意味着传统方法每学一个新技能,就"忘记"一半以上的旧技能——在真实部署场景中,这是不可接受的。

编辑核心判断

在 Scaling Law 仍主导 AI 叙事的今天,HOST 证明了算法创新同样可以大幅降低数据依赖——与其无限堆数据,不如教会机器人如何更聪明地学习。具身智能的下一站,不是更大的数据集,而是更聪明的学习范式。

开源可用

论文、代码与模型权重已全部开源至 GitHub 及 Hugging Face,搜索「HOST」即可获取完整项目文档与示例教程。

GitHub 项目主页 → 开源仓库