通用机器人告别「单一人形」:AI 跨越硬件鸿沟,架构化取代形态统一
随着具身智能进入商业落地期,行业出现显著的分化倾向:工作场景正强行拆分机器人的身体形态,而具身大模型则在软件层寻找通用性。“通用机器人”正从单一的硬件实体,演变为一套能够长出不同身体的分层架构。
随着具身智能进入商业落地期,行业出现显著的分化倾向:工作场景正强行拆分机器人的身体形态,而具身大模型则在软件层寻找通用性。“通用机器人”正从单一的硬件实体,演变为一套能够长出不同身体的分层架构。
过去一年,机器人行业展现出极其矛盾的演进轨迹。
一方面,进入车间、仓库与巡检现场的机器人“越来越不像同一种机器”。为了适应具体的搬运、精细装配或复杂地形,有的机器换上轮式底盘与 50 公斤级重载手臂,有的继续保留双足,有的则转向小型化或四足形态。
然而在硬件分化的同时,底层 AI 模型却在尝试强行连接这些不同的身体。
所谓“通用机器人”的定义已经发生根本改变:它不再指代某一台什么都能干的标准化人形机器,而是一套能够适配多种硬件形态的分层架构。
传统自动化的核心痛点在于专用化带来的重复研发成本。换一副关节或夹爪,感知与规划能力往往需要从零训练。新一代具身模型正致力于打破这种硬件绑定:
基于 6 万小时数据预训练,将单臂、双臂、半人形及人形等 20 种构型的控制信号统一映射至 55 维规范化状态与动作空间。
单一模型检查点可同时控制双足双臂 Apollo 2、搭载灵巧手的 Apollo 2 以及双臂 Franka Duo。对新本体通常只需不到 200 个样本微调。
开源训练工作流,使用相对末端执行器动作空间,先表达操作末端的移动轨迹,再由底层控制系统解算为具体关节运动。
使用约 90 万条轨迹覆盖机械臂、轮式、四旋翼及四足机器人,证明跨形态物理数据包含可复用的空间语义与任务结构。
数据观察:跨本体模型并非实现无门槛零样本控制,而是实现了“任务知识与视觉理解”的跨硬件复用,显著缩短了新形态机器人的后训练周期。
虽然上层语义理解可以共享,但当动作逼近物理接触与精细力控时,身体结构的微小差异会被迅速放大。
以 DeepMind 披露的 Gemini Robotics 2 实测数据为例,搭载 SharpaWave 五指灵巧手的机器人执行不同接触类任务时,成功率呈现明显分化:
数据来源:基于 Google DeepMind 发布测试。拧下与拧回灯泡在语言层仅为方向相反,但后者涉及接触力学、螺纹微调与失败重试,成功率由 92% 骤降至 36%。这种物理层面的不确定性即为“本体差距(Embodiment Gap)”。
基于场景分化与技术迁移的客观现实,行业正在形成清晰的分层构建模式:
基础大模型与视觉语义:负责跨形态共享的视觉理解、语言指令解析、高层任务规划与通用操作知识。
控制转换与后训练系统:负责运动学映射、相对动作空间转换、接触力学约束与安全边界控制。
执行机构与物理本体:根据工况定制的轮式/双足底盘、不同自由度的机械臂、大负载执行器与末端夹爪。
身体形态的分化不是通用性的倒退,而是工业落地的必然结果。未来具身智能的竞争,将从“谁能造出完美的全能人形躯干”,转向“谁能用最小的数据与工程成本,让一套智能架构穿透百变身体”。