打破多模型割裂:华为诺亚等提出 RoboHarness,以 Coding Agent 协同异构策略破解长任务难题
具身智能领域模型众多但彼此割裂。华为诺亚方舟实验室联合多所名校提出 RoboHarness 系统,在零重训底层策略的前提下,利用 Coding Agent 统一组织调度 VLA、RL、TAMP 等异构模型,将机器人长时序复杂任务成功率大幅拉升至 86.0%。
具身智能领域模型众多但彼此割裂。华为诺亚方舟实验室联合多所名校提出 RoboHarness 系统,在零重训底层策略的前提下,利用 Coding Agent 统一组织调度 VLA、RL、TAMP 等异构模型,将机器人长时序复杂任务成功率大幅拉升至 86.0%。
在真实场景中,让机器人完成“打开柜门、找到积木并搭成一座桥”这类日常任务,需要同时满足语义理解、几何规划、闭环控制与环境推测等多维能力。
目前主流的各路模型均有明显的能力边界:
VLA:泛化力强,但在长时序任务中易失去动作一致性;
RL 策略:闭环控制极稳,但高度依赖训练分布,抗扰动差。
TAMP:擅长符号逻辑,面对开放模糊目标时规划器易失效;
WAM:可预测未来状态,但随预测时域延长会产生误差累积。
试图靠单一端到端模型长期兼顾所有能力,目前仍横亘着技术鸿沟。
与其等待单一完美大模型出现,不如先让现有异构策略协同运转。 这正是 RoboHarness 的设计起点。
单靠 Coding Agent 读取原始图像,很难判断具体子任务该派发给哪位“专才”。RoboHarness 引入了三类辅助技能,将量化控制信号提炼给 Agent:
这套系统的调度机制形成了清晰的闭环链路:
当 TAMP 完成上一步操作停下时,机器人所处的位置很可能恰好落在下一个 VLA 模型从未处理过的分布外状态,导致交接瞬间失败。
为解决这一异构编排特有的难题,Memory Bridge 分三步完成平滑过渡:
结合文本与视觉相似度,从记忆库中抽取目标策略曾经成功执行的 Top-K 似轨迹,提取末端位姿与关节角度。
根据轨迹进程赋予监督信号,实时在线回归拟合出目标策略“最习惯接手”的状态范围。
综合考虑置信度与运动代价采样最优候选状态,引导机器人安全抵达该状态后,再交出控制权。
消融实验直观证明了这一模块的不可替代性:
数据来源:论文公开消融实验数据。结果表明,缺乏平滑交接机制会导致大量长时序任务在最后一步因状态不兼容而功败垂成。
在具身智能领域,北美及全球学术与工业界此前分化出两条技术路线:一类强调基础模型 Scaling(如 Physical Intelligence 的 pi 系列),试图以统一大模型收揽所有能力;另一类则注重分层架构与符号规划(如 Gemini Robotics 及商业化探索团队),强调高层推理与低层技能协同。
近几个月来,两条路线呈现出明显的汇流趋势:端到端模型在尝试引入更强可控性与技能组合,而分层系统也在深度吸收大模型的推理泛化力。
异构策略编排绝非否定通用大模型的终极价值,而是现阶段让机器人走出实验室的最务实解法。更深远的意义在于:混合编排在执行复杂长任务时沉淀的跨能力、跨场景交互数据,将反哺为训练下一代真正通用具身大模型的核心养料。
论文已公开发布,包含了完整的框架设计与消融实验细节。