🤖 具身智能 · 架构突破

打破多模型割裂:华为诺亚等提出 RoboHarness,以 Coding Agent 协同异构策略破解长任务难题

具身智能领域模型众多但彼此割裂。华为诺亚方舟实验室联合多所名校提出 RoboHarness 系统,在零重训底层策略的前提下,利用 Coding Agent 统一组织调度 VLA、RL、TAMP 等异构模型,将机器人长时序复杂任务成功率大幅拉升至 86.0%

来源:公开信息整理 2026-07 全文约 4 分钟读完
#具身智能 #RoboHarness #Agentic System #机器人架构
86.0% 完整任务成功率(消融对照组仅 60.4%)
0 底层策略修改/重训要求
3 理解、记忆与演化辅助技能模块

⚡ 30 秒速览

  • 行业痛点: 机器人领域并不缺单项能力模型(VLA 擅长泛化、RL 擅长精细控制、TAMP 擅长符号规划),但模型间输入格式与状态空间割裂,缺乏统一协同组织层。
  • 破局方案: RoboHarness 引入 Coding Agent 作为高层决策“指挥官”,以非侵入方式编排异构策略,无需重训底层模型。
  • 关键突破: 针对跨模型交接时容易坠入“分布外状态”的瓶颈,设计 Memory Bridge(记忆桥接) 模块,实时拟合目标策略舒适区并生成过渡轨迹。
  • 实测效果: 消融实验显示,移除 Memory Bridge 后成功率从 86.0% 骤降至 60.4%,验证了平滑交接机制的决定性作用。
  • 趋势信号: 通用模型 Scaling 与分层编排(Agentic Hierarchy)正在走向融合,混合编排产生的交互经验正反哺下一代具身大模型训练。

01能力不缺,协作缺位 单一大模型暂难包揽一切

在真实场景中,让机器人完成“打开柜门、找到积木并搭成一座桥”这类日常任务,需要同时满足语义理解、几何规划、闭环控制与环境推测等多维能力。

目前主流的各路模型均有明显的能力边界:

VLA / RL 策略

VLA:泛化力强,但在长时序任务中易失去动作一致性;
RL 策略:闭环控制极稳,但高度依赖训练分布,抗扰动差。

TAMP / WAM 模型

TAMP:擅长符号逻辑,面对开放模糊目标时规划器易失效;
WAM:可预测未来状态,但随预测时域延长会产生误差累积。

试图靠单一端到端模型长期兼顾所有能力,目前仍横亘着技术鸿沟。

与其等待单一完美大模型出现,不如先让现有异构策略协同运转。 这正是 RoboHarness 的设计起点。

02Coding Agent 调度 三大辅助技能赋能精准决策

单靠 Coding Agent 读取原始图像,很难判断具体子任务该派发给哪位“专才”。RoboHarness 引入了三类辅助技能,将量化控制信号提炼给 Agent:

🔍 理解技能(Understanding Skills) 策略匹配度量化

  • 计算当前图像嵌入与各策略训练数据的分布相似度
  • 评估物体位姿在时间窗口内的稳定性及传感器数据质量,作为路由依据。

🧠 记忆技能(Memory Skills & Bridge) 核心创新点

  • 检索历史成功经验,通过 Memory Bridge 处理跨策略交接时的状态分布不匹配问题。

🔄 演化技能(Evolution Skills) 在线闭环学习

  • 利用实时在线反馈持续更新策略元数据与编排逻辑,避免面对新环境时重头推演。

这套系统的调度机制形成了清晰的闭环链路:

接收长指令 理解技能量化场景 Agent 拆解任务 Memory Bridge 状态桥接 异构策略执行

03破解交接断层 Memory Bridge 的三步桥接机制

当 TAMP 完成上一步操作停下时,机器人所处的位置很可能恰好落在下一个 VLA 模型从未处理过的分布外状态,导致交接瞬间失败。

为解决这一异构编排特有的难题,Memory Bridge 分三步完成平滑过渡:

第一步:历史轨迹检索(Retrieve)

结合文本与视觉相似度,从记忆库中抽取目标策略曾经成功执行的 Top-K 似轨迹,提取末端位姿与关节角度。

第二步:舒适区在线拟合(Model)

根据轨迹进程赋予监督信号,实时在线回归拟合出目标策略“最习惯接手”的状态范围。

第三步:过渡轨迹生成(Bridge)

综合考虑置信度与运动代价采样最优候选状态,引导机器人安全抵达该状态后,再交出控制权。

消融实验直观证明了这一模块的不可替代性:

RoboHarness 完整系统含有 Memory Bridge
86.0%
移除 Memory Bridge策略路由正常,交接未优化
60.4%

数据来源:论文公开消融实验数据。结果表明,缺乏平滑交接机制会导致大量长时序任务在最后一步因状态不兼容而功败垂成。

04技术路线的碰撞与汇流 从单体 Scaling 到分层架构

在具身智能领域,北美及全球学术与工业界此前分化出两条技术路线:一类强调基础模型 Scaling(如 Physical Intelligence 的 pi 系列),试图以统一大模型收揽所有能力;另一类则注重分层架构与符号规划(如 Gemini Robotics 及商业化探索团队),强调高层推理与低层技能协同。

近几个月来,两条路线呈现出明显的汇流趋势:端到端模型在尝试引入更强可控性与技能组合,而分层系统也在深度吸收大模型的推理泛化力。

编辑核心判断

异构策略编排绝非否定通用大模型的终极价值,而是现阶段让机器人走出实验室的最务实解法。更深远的意义在于:混合编排在执行复杂长任务时沉淀的跨能力、跨场景交互数据,将反哺为训练下一代真正通用具身大模型的核心养料。

🔗开源与论文信息

论文已公开发布,包含了完整的框架设计与消融实验细节。

arXiv: 2607.18060 · www.robo-harness.com