人形机器人进厂两年半:签下2000台订单,首席科学家却说"物理世界不可约,落地不可急"
8 月 20 日,2026 世界机器人大会在北京开幕。浙江大学求是特聘教授、浙江人形机器人创新中心首席科学家熊蓉,在"应用牵引"论坛上交出一份反差感极强的报告:3C 领域百台级签约、服装领域2000 台订单、工业级99.99%任务成功率——而她反复强调的是另一句话:物理世界不可约,落地不可急。
8 月 20 日,2026 世界机器人大会在北京开幕。浙江大学求是特聘教授、浙江人形机器人创新中心首席科学家熊蓉,在"应用牵引"论坛上交出一份反差感极强的报告:3C 领域百台级签约、服装领域2000 台订单、工业级99.99%任务成功率——而她反复强调的是另一句话:物理世界不可约,落地不可急。
熊蓉团队做的事情很朴素:让人形机器人在多个真实场景里同时干活,而不是只在 Demo 里做高难度动作。两年半时间,零售、商服、工业各场景跑通了整套技术体系,部分工厂里已是真正的产线劳动力。
注:订单量为演讲披露口径,实际交付与验收节奏以官方后续披露为准;99.99% 指目标场景内任务成功率,不代表跨场景通用能力。
效率是另一组关键数字。以服装产线最考验手感的贴袋工序为例:
注:柱条按较慢任务归一化,仅用于单项对比;机器人 50 秒 ≈ 人工效率的 80%。5 米内搬运最快可达 35 秒。
但订单与指标,并不是故事的全部。
真正让团队不敢说"成了"的,是 Demo 视频之外的问题。
机器人一旦进厂,考验就从"能不能做"变成"能不能一直做、换着做、精准做"。熊蓉列出四道坎:
工厂常有突发情况与异常工况。模型一旦失败,整个作业中断,只能补数据、再训练。
普遍是"一试一训":物体变、场景变、光照变,就要重新采集数据、重新学习。
操作目前停在厘米到毫米级,工业常要求亚毫米级——而这一精度视觉已不可见,必须靠力触,这是当前短板。
感知→推理→决策→控制回路变长,还要保证推理准确,比"闭眼重复"慢得多。
注:四道坎叠加即熊蓉所说的"gap"——可靠性、高效率、低成本、高精准,缺一项都进不了产线。
为什么数据越堆越多,问题却依然在?
熊蓉的判断很直接:现在的方法并没有真正解决传统模型的问题。泛化性没靠数据多样性补上来,反而失去了机器人原本的精准、可靠、高效。
"物理世界具有不可约性。专家模型无法用总结出的规则描述物理世界的复杂性;现在的数据和模型能力,也无法涵盖物理世界的丰富性和复杂性。"
这句话的潜台词是:拿杯子不只是"看见"杯子——还有重量、材质、摩擦力,以及这些属性与动作的强耦合。视觉表征看不全交互的本质,仿真学习又隔着 Sim to Real 的鸿沟。
机器人要学的,不是更多帧画面,而是物理交互的底层逻辑。
那么,路在哪里?
把力触与形状、重量、材质、行为强耦合地融合为通用表征,支撑在仿真中训练、再迁移到真实环境。
在 VLM 基础上增强空间理解,构建非接触/接触状态的预测模型,与具身模型互相迭代、共同进化。
引入专家模型的人类既有知识保证通用性,用数据补偿长尾场景——学会拿一双鞋,就学会拿千变万化的鞋。
采集真实操作数据,高保真重构进可编辑的仿真环境,批量生成新数据反哺真实部署,低成本获得大规模高质量数据。
结果是:很多场景不用重新训练,人在真实环境里一次示教,机器人就能完成任务;高精度操作再通过真机强化校正。这套体系同时驱动"大脑"长程规划纠错与"小脑"精准技能作业。
一个人的团队走不远,一个不协同的行业走不快。熊蓉把另一部分时间花在"体系"上:
注:人才数字为公开演讲披露口径;生态布局的目标,是把单点技术变成可复制的行业能力。
人形机器人的落地竞赛,比的从来不是谁的 Demo 更惊艳,而是谁能在物理世界里,率先建立"低成本、大规模、高质量"的交互数据飞轮。
99.99% 的成功率来自特定场景的反复迭代,跨场景的举一反三仍是全行业共同的未解之题。人形机器人已走到"能干活"的门口,但离"雇得起、用得稳"还有一段真实的路。未来行业的分水岭不在模型参数,而在谁能把物理交互变成可持续积累的数据资产。
2026 世界机器人大会于 8 月 20 日在北京开幕,展览与论坛仍在进行中——从人形机器人整机到大小脑模型、力触传感器,今年的看点不止于 Demo。
关注世界机器人大会官方渠道 · 查看演讲回放与展区信息