🦾 具身智能 · 开源框架

不用示教,一句话让机器人干活:Jiuwen Symbiosis 开源,以「态势感知闭环」叫板端到端大模型

OpenJiuwen 社区近日开源面向 Physical AI 的 Agent 框架 Jiuwen Symbiosis(九问·共生):用户无需示教、无需写脚本,一句自然语言指令,系统即自主完成感知、理解、规划、执行与结果校验,并原生适配昇腾、鲲鹏国产算力。它要向行业证明:物理世界的智能体不该是一个黑盒端到端模型,而应是一套持续闭环、可解释的系统

来源:公开报道 类型:项目方技术解析 全文约 4 分钟读完
#Physical AI #具身智能 #OpenJiuwen #机器人 #昇腾
0 次示教 换任务只需换一句话,代码不改、配置不动
5 环节闭环 感知→规划→执行→观察→反馈,持续迭代
6 个文件 接入一台新机器人所需的全部适配工作

⚡ 30 秒速览

  • 是什么:OpenJiuwen 社区开源的 Physical AI Agent 框架,一句自然语言即可驱动机器人跑完「感知→规划→执行→校验」全流程,官方示例指令:「把黑色盒子放到白盒子上」。
  • 核心主张:物理世界既不能靠开环脚本,也不能只靠单一端到端大模型——答案是一套持续运行的「态势感知循环」(SA Loop)。
  • 关键取舍:规划层零空间解算,用纯 LLM 而非 VLM(规避空间幻觉);闭环判稳只回答二值问题(抓住了/滑掉了),几何判据 + VLM 双轨兜底。
  • 工程底座:端云协同部署,原生对接昇腾 NPU + 鲲鹏 CPU;新机器人接入只需写 6 个文件的适配器,核心智能体逻辑不动。
  • 阅读提示:原文为项目方设计阐述,全文无成功率等实测数据,建议带着这个背景阅读(详见文末「编辑视角」)。代码已在 GitHub / GitCode 双仓库开源。

01它是什么 从「教它怎么做」到「告诉它做什么」

写代码、查资料、调工具——AI Agent 在数字世界已相当能干,但这些能力大多停留在软件与屏幕之内。Jiuwen Symbiosis 瞄准的下一步,是让智能体从「数字助手」变成「物理世界的执行者」:像指挥一位经验丰富的工人那样说清目标,剩下的感知、规划、执行全部由 Agent 自主完成。

传统机器人模式

示教器一点点记录轨迹,动作顺序写成固定脚本;任务或环境一变,就要重新配置、甚至重排整个流程。可控,但泛化能力有限。

Jiuwen Symbiosis 模式

一句自然语言指令:自主识别环境状态、定位目标、拆解规划;抓取偏移、放置不准会动态纠正并重试,不依赖预先写死的步骤。

「只告诉它做什么(What),不必教它怎么做(How)。」

这正是「Symbiosis(共生)」命名想表达的含义:人与智能体在同一目标下分工协作,而不是简单的控制与被控制。
🗣️

官方给出的使用方式

「把黑色盒子放到白盒子上。」——机器人自行视觉识别目标,自主规划每一步,完成抓取、搬运、放置,跑完整个闭环。想换任务?换一句话即可:代码不改,配置不动,技能自动复用。

02为什么不把一切交给端到端大模型

把「感知理解→任务规划→动作执行」完整压进一个 Transformer、端到端直接输出关节位姿——看起来足够优雅,但原文指出了三个在真实机器人系统里绕不开的挑战,以及对应的工程设计:

痛点 ① 跨本体、跨环境、跨任务泛化有限

当前主流端到端具身模型(如 VLA)与特定机器人形态、训练场景强耦合;换硬件、换环境,甚至面对分布外的任务变体,往往要重新采集数据、重新训练,迁移成本高。

解法:解耦本体、环境与动作执行

三者拆为独立模块,硬件形态或场景环境变化时,系统仍能稳定泛化迁移。

痛点 ② 长程复合任务能力不足

多步骤、长时序任务中,单一端到端模型缺乏显式的任务分解与子任务编排,难以中途纠错与策略回退——本质是「轨迹模仿」,而非在线规划与决策。

解法:原子化工具库(Tool Library)

通过工具组合完成复杂任务,依托组合泛化能力适配各类长时序复合作业。

痛点 ③ 成功率低、稳定性差

黑盒结构直接输出关节位姿,认知决策与运动控制混在一个模型里,整体训练难度大,在真实物理系统中往往表现为稳定性不足、任务成功率低。

解法:显式模块 + 闭环智能体循环

感知、规划、执行拆为独立可解释模块,统一运行在带实时视觉反馈与动态重规划的 SA Loop 中,降低端到端优化难度。

一句话概括这条技术路线的分歧:端到端路线赌的是「一个足够强的模型」,Jiuwen Symbiosis 赌的是「一个足够稳的系统」

03核心拆解:态势感知循环(SA Loop)

为什么物理世界必须是闭环?数字世界里说错话可以撤回、重生成;物理世界里抓错了,轻则操作失败,重则设备损坏、生产中断,甚至安全事故。而且物理世界持续变化、不可完全回放——物体被碰走、机械臂累积误差,这些不确定性是常态。因此系统不能「预先规划完整流程、一次性执行」的开环模式,必须在感知与执行之间持续循环:

九问物理感知安全规划物理执行状态观察观测反馈↺ 回到感知

① 九问物理感知:先看懂现场,输出结构化世界状态感知器官

  • 接收视觉、文本、语音多模态输入;相机同步采集 RGB + 深度信息,为空间解算提供高精度数据基础。
  • 物体检测摒弃硬编码类别清单,采用开放词汇范式:把「黑色盒子」这样的目标描述以纯文本输入,即可完成定位识别——检测对象由用户指令动态指定。
  • 目标坐标统一投影至机械臂基座坐标系,自动解算抓取高度、接近位置、放置点位,输出含语义、位姿、置信度与可执行参数的结构化状态。
  • 关键分工:感知层承担所有空间解算,规划层无需任何数值推算,只做逻辑决策——感知与规划彻底解耦。

② 安全规划:纯 LLM 做大脑,先校验再执行规划大脑

  • 刻意使用纯 LLM 而非 VLM:VLM 在空间计算精度上有天然短板且鲁棒性更弱;既然感知层已完成全部几何测算,规划层便从坐标运算中解放,从源头规避「空间幻觉」导致的误操作。
  • 意图解析后将复杂任务拆成时序有序的子任务序列;以通用 Skill 模板 + 感知层已解算的精确参数动态绑定,组装出「场景专属可执行技能」。
  • 内置物理约束与安全边界校验:越界、碰撞、不合物理逻辑的动作,在源头就被过滤。

③ 物理执行:原子化动作,异常可回退执行小脑

  • 所有动作封装为原子化函数:move_to_xyzr()gripper_open()……每个动作独立、与环境和本体解耦,可自由组合为任意操作序列。
  • 能力与动作严格匹配:系统只调用真实存在的硬件能力——一个吸盘机器人永远不会被指派「闭合夹爪」这种不存在的动作。
  • 异常状态可恢复:任何一步抛异常,系统精确回退至上一个稳态节点,机械臂自动回 Home 位、松开夹具,而非悬停在不可预知的中间位置。
  • 保留兼容性:VLA 等「小脑模型」也可封装为统一工具接口,由系统按需调度。

④ 状态观察与反馈:只问二值问题,判稳永不降级闭环判稳

  • 每轮操作后回到固定观测位拍照判稳:只回答二值问题——「抓住了还是滑掉了」「放上去了没有」,大幅压低对模型空间理解能力的要求,VLM 也能可靠胜任。
  • 几何判断 + VLM 双轨制:默认按「物体是否进入目标区域」快速判定;也可直接向 VLM 提问(如「黑色盒子是否已放置在白盒子上?」);VLM 不可用时自动回退几何判据,判稳逻辑任何情况下不降级。
  • 失败则按异常类型触发局部重规划或参数修正;无论成败,下一轮感知都会重新采集现场、刷新世界状态——一切回到事实层面,而非上一轮的推测。

这套设计贯穿同一条逻辑:把对单个模型能力的门槛压到最低——空间解算全归感知,规划只做纯逻辑,判稳只答二值问题。稳定性来自系统结构,而不是某个模型的超常发挥。

04端云协同与本体解耦 昇腾 NPU + 鲲鹏 CPU,6 个文件换一台机器人

Agent 框架始终保持端侧闭环运行(完整的感知-规划-执行-反馈回路),模型则按算力需求做差异化部署:

☁️ 云侧:大参数复杂模型

用于意图解析与任务拆解的大语言模型(LLM),以及用于视觉反馈的视觉语言模型(VLM)。

🤖 端侧:轻量实时感知模型

轻量化实时多模态感知模型,直接提供本地 server 服务,确保机器人对环境的快速响应。

算力底座原生对接国产化生态,形成「端云异构、分层承载」:昇腾 NPU 统一承载端云两侧的 AI 推理负载(视觉检测、多模态感知、大脑规划等高频重算任务);鲲鹏 CPU 专职流程调度、设备状态管理与底层运动控制。设计逻辑是将异构算力与业务类型精准匹配,避免单一计算单元因并发争抢资源导致性能瓶颈。

🔌 本体解耦:Capability Mixin + Adapter 模式。支持任意构型、末端执行器及传感器形态,接入新硬件只需实现 6 个文件,无需修改核心智能体逻辑:
配置驱动环境接口会话YAML
于是「换一台机器人」从「重写一套 Agent」变成「写一个适配器,其余照旧」。对想把框架用进真实场景的团队,这往往比「支持了多少种机器人」更重要。
✍️ 编辑视角 · 阅读提示

先说立场:本文是 行业媒体刊发的技术解析,通篇为项目方视角的设计阐述,接近一份「官方设计白皮书」。阅读时建议带上三副眼镜——

① 零实测数据。全文没有任务成功率、对比基线、时延节拍等任何量化指标;「端到端模型成功率低、稳定性差」是项目方的立论,而非第三方结论。架构之争最终要靠跑分与复现说话。

② 分层解耦是工程共识,不是独家发明。感知 / 规划 / 执行解耦是当下具身智能的主流工程路线之一,多家团队路线相近。它换来的是稳定性与可解释性;能否真正解决跨本体泛化,仍待开源社区验证。

③ 算力底牌值得留意。「对昇腾、鲲鹏天然亲和」点明了项目与华为国产算力生态的深度绑定——这是差异化优势,也是选型时绕不开的技术栈约束。

独立判断:这篇文章真正的价值不在结论,而在取舍逻辑——「规划层不做空间解算,所以用纯 LLM 而非 VLM」「闭环判稳只需回答二值问题」——这些刻意压低模型能力门槛的工程思路,对任何做 Agent 系统的人都有参考价值。至于「好不好用」,请以仓库实测为准。

代码已开源,可亲自验证

框架已在 GitHub 与 GitCode 双仓库开源。官方建议的上手方式只有一步:
像指挥一位经验丰富的工人那样,说清楚目标——例如 「把黑色盒子放到白盒子上」