🤖 具身智能 · 数据基建 · 对话创始人

仿真 89.4%、真实仅 12%:具身智能的「数据断层」,正变成一门十亿级生意

斯坦福《2026 AI Index Report》给行业撕开一道口子:机器人在仿真操作基准中的任务成功率已达 89.4%,进入真实家庭环境后只剩 12%。博登智能创始人兼 CEO 赵捷正把这道「断层」做成生意——公司在手订单接近 10 亿元,年内计划交付约 5 亿元,年产 50 万小时真机训练数据。

综合公开信息 WAIC 2026 期间对话 全文约 4 分钟读完
#具身智能 #数据基建 #博登智能 #人形机器人
💰 近 10 亿元 在手订单 · 年内计划交付约 5 亿元
89.4% / 12% 仿真 vs 真实环境任务成功率,差距 77.4 个百分点
50 万小时 真机数据年产能,另有百万小时级 Ego 数据

⚡ 30 秒速览

  • 最大卡点不是本体,是数据:仿真成功率 89.4%,进入真实家庭只剩 12%;互联网数据带不动物理世界。
  • 数据是座金字塔:底层仿真/互联网数据,中层 Ego 视角,顶层真机遥操作;最贵的是人类介入那一刻的失败数据
  • 这门生意的盘子:真机数据按小时采购,预付款 20%–30%,在手订单近 10 亿元
  • 壁垒不在采集:Boden Cloud 三平台把原始数据加工成训练资产,200+ 预标注模型,部分任务效率提升 7 倍
  • 泡沫与洗牌:世界模型同质化严重;没有订单和交付能力的公司,明年起可能逐渐被淘汰。

01从 89.4% 到 12% 一条必须由物理世界填平的鸿沟

斯坦福《2026 AI Index Report》给出的这组对比,可能是具身智能行业今年最刺眼的数据:在仿真操作基准中,机器人的任务成功率已经做到 89.4%;一旦进入真实家庭环境,成功率就跌到 12%

这不是工程细节问题。这是路线问题。

大语言模型靠互联网文本就可以「喂养」,机器人却学不会这个世界——关节扭矩、触觉反馈、每一次失败与纠正,都必须由真机在物理世界里逐条生产。因此行业的数据逻辑注定是:采集 → 训练 → 部署 → 反馈,循环永不停止。

仿真环境

89.4%

可控、可重复、成本低;但物理规律被简化,与真实世界存在系统性偏差。

真实家庭

12%

光照、扰动、物体形态无穷多样——「见过」与「做过」之间,隔着一道 Sim2Real 鸿沟。

注:数据来自斯坦福《2026 AI Index Report》。仿真与真实环境的成功率差,不是简单的误差,而是「模拟中理解世界」与「在真实世界里操作世界」的本质距离。

02机器人数据是一座金字塔 越贵的数据,越值钱

具身智能数据不是一种,而是一座金字塔。赵捷把它分成三层,它们会长期共存、各司其职——不是哪一种完全替代另一种。

真机遥操作数据 单条价值最高 · 成本最高
Ego 第一人称视角 / 第三人称数据 获取难度中等,覆盖面广
仿真 / 合成 / 互联网数据 规模最大 · 成本最低

注:金字塔结构为赵捷在对话中给出的分层方式。越往顶层,数据获取越难、单条数据承载的有效信息越多;各层数据长期共存,模型在不同阶段需要不同组合。

比普通真机数据更贵的,是失败那一刻的数据。

🤏 一次人类的介入,胜过二十次成功 失败数据 · 价值最高

  • 一个机器人拿瓶子,连续二十次都成功,第二十一次失败了。
  • 人类介入,把瓶子重新拿起。这条数据告诉模型:它在什么情况下失败,人类又是如何纠正的
  • 当模型能力进入平台期,再增加大量相似的成功数据,提升十分有限;失败数据暴露的,才是模型尚未解决的问题。
赵捷的判断:「用不上的数据才是最贵的。」判断数据价值,不能只看单价,要看它包含多少有效信息、能否真正改善模型。

03这门生意的盘子 10 亿订单 · 5 亿交付

博登智能正把这门生意规模化。公司目前在手订单接近 10 亿元,计划年内完成约 5 亿元交付,很多订单预付款比例在 20%–30%。真机数据按小时采购,客户需求已经从较小规模,走向数万小时、十万小时甚至更大的项目。

3万+㎡三大具身机器人创新中心
500+台多型号实体机器人部署
数千套自产 Ego 采集设备
100+类家庭/零售/工业/办公/仓储场景

训练场的钱花在哪里?赵捷给出了一个大致的成本结构:本体与运营各占约 40%,场地约占 20%。机器人本体的更新周期约一年半到两年——不同本体有不同关节与控制方式,同一个任务不一定能直接复用,但多本体也让数据覆盖更多技术路线。

本体 40% 运营 40% 场地 20%

注:三大中心分别位于宁波、湖州、马鞍山,总面积超过 3 万平方米,覆盖家庭、零售、工业、办公、仓储等上百类场景。成本比例为赵捷在对话中给出的估算,不同训练场会因技术路线不同而有所变化。

04把数据从「文件交付」变成「持续闭环」 Boden Cloud 三平台

客户按小时采购数据,但博登不希望只被当成一家数据采集公司。赵捷的定位是:覆盖采集、标注、训练与验证的物理 AI 基础设施服务体系。客户最终拿到的,不是一批孤立的数据文件,而是一套可以持续生产、训练、验证和迭代的数据闭环。

BRIC 多模态数据采集
视觉 · 力觉 · 关节 · 轨迹
BASE 数据标注与治理
200+ 预标注模型
Blink 版本 · 算力 · 工作流
统一管理

具体来看:BRIC 负责采集视觉、力觉、关节角度、动作轨迹等多模态数据;BASE 通过 200 多个预标注模型和人工校正,把原始数据加工成训练数据,部分任务效率最高提升 7 倍,综合准确率超过 99%Blink 统一管理数据版本、算力与工作流。

这也定义了数据公司的竞争壁垒——不是雇更多标注员,而是平台能力、供应链与项目管理、对客户模型的理解,以及能否交付可复用的数据产品。质量、成本、交付速度、数据是否真正提升了模型能力,才是客户最后会看的东西。

注:BRIC、BASE、Blink 是博登 Boden Cloud 体系的三个核心平台。效率和准确率数据来自赵捷公开表述,针对具体任务类别可能有差异。

05泡沫退去后,谁能真正进入场景?

具身智能很热,泡沫论的讨论也没停过。赵捷对泡沫并不悲观——「一个行业如果一点泡沫都没有,说明这个行业可能根本不值得投资。」但局部已经过热,最典型的是世界模型:做的公司太多,很多人讲不清自己和别人的区别,也讲不清核心竞争力。刷榜也不再是唯一依据——「就像两个高中生做小学试卷,都考一百分,这张试卷就无法说明谁更强。」

⚠️ 先承压

没有实际订单、也没有很强交付能力的公司,会先感受到行业转向。

⏳ 时间表

明年起,一些世界模型公司可能逐渐被淘汰;第一轮较剧烈的优胜劣汰,预计在未来两三年内显现。

✅ 先跑出来

有明确任务的机器人更早产生收入,也更快启动数据飞轮:能力→进场景→采数据→再训练。

赵捷同样不认为「人形」是落地的前提。在一些工业场景里,两只机械臂加视觉系统和足够强的大脑,就能解决很多任务。决定商业化的不是外形,而是有没有确定的场景、能不能稳定完成工作。他还建议,真正的进步往往藏在线索里——看一家公司是否拥有持续的数据回流、可验证的模型能力、以及在失败之后变得更好的机制

机器人真正的进步,有时就藏在一次失败之后——它有没有记住,人类当时是怎样把错误纠正过来的。

编辑核心判断

具身智能的竞争,正在从「谁的模型更聪明」转向「谁能持续、稳定、低成本地把真实世界的数据喂给大脑」。数据不是耗材,而是决定模型上限的稀缺资源。下一轮洗牌中,最先出局的,不是没有故事的公司,而是没有订单、没有场景、数据无法回流迭代的公司。

给从业者的一句话

如果你正做本体或模型,最实际的起步点可能不是更聪明的大脑,而是更真实的场景。

赵捷的观察:先找一个有明确任务的真实场景,让机器人稳定完成工作,失败与人类介入的数据自然会回流到训练环节——这可能是比追求「通用人形」更现实的起点,也是数据飞轮真正的转动方式。