🤖 具身智能 · 产品深析

一款灵巧手打磨14个月才发售,具身智能的瓶颈从"理解"转向"执行"

灵巧智能 DexHand021 Pro 历时 14 个月工程化打磨,在行业普遍追求快速迭代的节奏中,选择先解决"能用"再谈"智能"。创始人坦言:市面上约 80% 的灵巧手都不好用。

综合公开信息整理 2026-07-24 全文约 4 分钟读完
#灵巧智能 #DexHand021 Pro #具身智能 #灵巧操作 #工程化
14 个月 工程化打磨,不对外售卖
80% 灵巧手存在过热、寿命等工程问题
1 个月 从工厂考察到场景方案交付
3 指 UMI 三指灵巧手,兼顾实用与精度

⚡ 30 秒速览

  • 核心选择:灵巧智能没有做人形机器人,而是押注灵巧手——认为"操作"比"移动"更难,也更基础。
  • 14 个月不卖:旗舰款 DexHand021 Pro 去年 5 月发布,但团队用 14 个月做工程化:热平衡、连续使用、寿命验证,解决"80% 灵巧手都不好用"的行业顽疾。
  • 数据路线:放弃主流的真机遥操作,改用光学动捕采集人手数据,精度从厘米级提升至亚毫米级,为精细操作提供支撑。
  • 商业化起步:"1+3+N"战略,与上海电气合资,紧固件随机抽检场景已部署两台,一个月从考察到交付。
  • 技术判断:具身智能仍处于"前 GPT 状态",数据工程与场景落地能力,比参数比拼更关键。

01为什么是手?先解决操作,再解决移动

2024 年初,几个来自上海交大机器人所的合伙人站在创业岔路口:做人形,还是做灵巧手?他们选了后者。判断很直接——机器人不管表演走路还是跳舞,最后落到应用一定需要用手去操作。

先解决操作(manipulation),再解决移动(locomotion)。

灵巧操作要求数据精度、接触建模、力控能力,是具身智能里最难的子集。团队认为,处理了最难的基座,往简单的方向泛化是自然的;反过来,只解决夹爪问题再向灵巧手泛化,经验几乎不可复用——自由度差了一个量级,手与物体的接触模式也完全不同。

人形机器人路线

先解决移动(走路、跳舞),再考虑操作。但操作能力长期停留在夹爪级别,精细任务做不了。

灵巧智能路线

先攻克灵巧操作这个最难子集,再向简单场景泛化。高自由度灵巧手是核心,数据与模型能力复用。

注:自由度指灵巧手可独立运动的关节数量,高自由度(如 12+ 个)才能实现掌内调姿、旋拧等精细动作,与两指夹爪有本质区别。

0214 个月工程化憋着不卖,把"能用"做扎实

去年 5 月,灵巧智能发布了旗舰款高自由度灵巧手 DexHand021 Pro,性能接近当时展馆里大部分同类产品的工程化水平。但接下来整整 14 个月,这只手没有对外卖过一只。

"我们花了大概 14 个月,一直憋着没有对外卖,就是去做各种工程化。"

展馆里不少灵巧手用 5 分钟、10 分钟、20 分钟就要休息——因为过热;用一两个月可能就坏了。行业特性让大家希望快速迭代,但有些过程绕不开。

🔥
热平衡 达到热平衡后保持状态,可连续使用,不会因过热被迫停机。
寿命验证 开模做大量寿命测试、工程化验证,普通用户试用几个月没有问题。
⚙️
标准化量产 第一家把绳驱做成标准化量产,从设计到产线全链路打通。

灵巧智能 CTO 朱豪华去年曾公开说了一句不太好听但真实的话:市面上大约 80% 的灵巧手都不太好用。今年情况有所好转,因为大家都在往场景逼近,不能一直装在那里当摆设。

注:工程化指从实验室原型到可量产、可稳定运行的工业级产品所需的全链路验证与优化,包括热管理、耐久性、一致性与成本控制。

03人手数据 vs 遥操作精度差了一个量级

2024 年下半年灵巧手进入标准化量产,同年年底公司开始搭建数据集。当时行业最主流的采集方式是真机遥操作——特斯拉也在用。但灵巧智能在 2024 年 12 月前后做了一个判断:真机遥操作可能不是模型训练的主流数据方向,至少不是底座数据来源。

为什么遥操作做不了精细操作?

人直接操作物体的精度在 亚毫米级,动作捕捉系统在指尖采集原始动作可以做到 0.5 毫米。但遥操作经过人机映射、控制延迟、反馈缺失,精度通常退化到 厘米级——差了一个量级。用遥操作采集精细动作数据,采到的只是降级后的粗糙模仿。

遥操作
~1 cm
经过人机映射、控制延迟、反馈缺失,精度退化到厘米级,精细操作几乎不可能。
人手数据(光学动捕)
0.5 mm
指尖原始动作精度,亚毫米级,为精细操作提供高质量数据基础。

灵巧智能在 2025 年下半年发布了基于光学动捕的人手数据集。原理上和英伟达同期发布的大规模数据集基本一样,但启动得更早。团队通过强化学习把物理约束规则作为牵引融入数据,反推出力的信息——有了力觉,掌内调姿这类精细动作的成功率和收敛性都大幅提升。

注:上表对比的是"末端执行精度"——即手指最终定位与目标位置的偏差。亚毫米级是完成精密操作(如拧螺丝、穿针)的前提条件。

04"中训练"策略用 9% 的增量,撬动 90% 的后训练压力

灵巧智能没有从零训练一整个大模型。做法是在现有基模上做一层针对高自由度灵巧手的动作扩增,用一个"积木"模型打底,再在上面训一个灵巧操作相关的模型,两个模型形成对话。

技术上的难点:时间尺度不一样。

任务执行过程中,下层模型做自主决策,碰到问题再向上层模型请求,拿到进一步指令后继续滚动推进。但更独特的是他们的"中训练"策略——在预训练和后训练之间加了一层。

预训练
完成 90% 底层感知和理解工作,通用能力基座。
中训练
用大规模灵巧操作数据,让机器人获得通用的"会用手"的能力,从 90% 推到 99%
后训练
仅剩 1% 的工作量,用少量数据、少量算力即可完成新任务适配。

注:中训练是灵巧智能的核心方法论——表面只提升 9 个百分点,但后训练压力降低 90%。人手在这里被当作"通用中间表示",先在仿真里学通用操作能力,再通过接触敏感的重定向算法迁移到具体灵巧手构型。

这套仿真管线目前能带来 10 倍左右的有效数据扩增。强化学习修正穿模、虚接触,补全原始数据缺失的接触力,扩增不同的物体和场景。团队大量用 LoRA 做微调,在正确配置下能匹配全量微调的结果,让有限算力做更多实验。

05"1+3+N" 落地从紧固件检测到三指 UMI

灵巧智能用 "1+3+N" 概括商业化路径:1 是技术底座(硬件、数据管线、模型服务、数采设备),3 是三个聚焦赛道(电力、工业、教育科研职教),N 是更多场景。

第一个真正落地的小场景,来得很快。

灵巧智能与上海电气成立合资公司,随后去电气的一个紧固件工厂考察,挑了一个场景:紧固件随机抽检。原来靠工人借助工具检测,灵巧智能用三指灵巧手加视觉做了一个检测工位,一个月交付,已部署两台,进入验证阶段。

🔩 紧固件随机抽检 已部署 · 验证中

  • 场景痛点:传统人工借助工具检测,效率低、一致性差,工人疲劳导致漏检风险。
  • 方案:三指灵巧手 + 视觉感知,自主完成抓取、定位、检测全流程。
  • 交付速度:从工厂考察到方案部署,一个月完成。
  • 为什么用三指:五指偏复杂操作,目前在工业场景 POC 阶段偏多;三指在物流搬运等场景更实用,操作能力比两指强很多。
灵巧智能与星际归途合作开发了三指 UMI(Universal Manipulation Interface),相比主流两指 UMI,抓握能力差距显著。团队已针对三指形态训专属基模。

朱豪华打了一个比方:传统机器人像炮弹,预设好精准方向打出去;具身智能更像导弹,初始精度没那么重要,靠末端感知牵引,最终到达目的。他把"数据-模型-场景"的闭环视为核心,认为系统化能力强、有迭代能力的公司更容易跑出来。

注:POC(Proof of Concept,概念验证)指在真实场景中验证技术可行性的阶段,尚未大规模铺开。

编辑核心判断

具身智能的"前GPT时刻",比拼的不是参数规模,也不是demo的酷炫程度,而是数据工程与场景落地的系统能力。灵巧智能用14个月工程化换来的"能用",比100个实验室演示更接近产业真相。谁先打通"数据-模型-场景"的闭环,谁就能在技术奇点来临前占据定义权。

了解更多

灵巧智能 DexHand021 Pro 已进入标准化量产,技术能力通过合资公司与合作伙伴在电力、工业、教育等场景加速落地。

产品与技术进展以官方披露为准