🤖 硬科技 · 产业观察

造得出一万台机器人,却喂不饱一个大脑

2026 年夏天,人形机器人的新闻一条比一条炸:运动成绩碾压人类、万台量产落地、巨额融资进场。但算法工程师们叹的气却越来越深——造得出一万台机器人,喂不饱一个大脑。真实物理交互数据的饥荒,正在成为整个行业最硬的瓶颈。

来源:综合公开信息整理 2026 年夏 全文约 6 分钟读完
#人形机器人 #具身智能 #数据饥荒 #sim2real #产业观察
一组数字,两个世界
1.5万台 智元机器人通用具身机器人量产下线
8.64 人形机器人百米成绩,快过博尔特近 1 秒
0 互联网上现成的真实机器人操作数据

左侧两个数字代表"身体"的量产与速度,右侧 0 条代表"大脑"的现成数据——繁荣与饥荒,在同一个行业里并存。

⚡ TLDR 30 秒速览

  • 繁荣与断裂:百米 8 秒 64、第 1.5 万台量产下线、9 亿美元融资、60 亿美元收购——身体在军备竞赛;算法工程师的共识却是:缺数据
  • 两种水:大模型喝自来水(Common Crawl 有 2500 亿 token),机器人喝瓶装水(每条数据 = 一次真实物理操作),量级差 一百万倍
  • 仿真救不了场:模拟器里练到 99%,真机一上手掉到 30%;展台演示怕随机,东西挪个位置就翻车。
  • 一条死循环:要智能 → 要数据 → 要真实场景 → 要足够聪明才进得去 → 还是回到要数据。没人跑通
  • 怎么判断公司:别只看本体参数和量产计划,问三问:真实数据多少小时?采集成本多高?数据闭环跑通了吗?

01这个夏天,身体在军备竞赛 四件事,同一个指向

🏁 运动极限 · 超越人类纪录 天骄队百米 8 秒 64

机器人运动会直接跑赢博尔特 9 秒 58;天卓队 1500 米 2 分 21 秒 64,人类 3 分 26 秒的纪录被甩在身后。

🏭 量产提速 · 不到 3 个月 智元机器人第 1.5 万台下线

6 月正式下线,距离第 1 万台下线还不到三个月。

💰 一级市场 · 9 亿美元 小鹏机器人首轮融资落地

投后估值 63 亿美元。

🌍 并购传闻 · 60 亿美元 软银拟收购 1X Technologies 多数股权

被曝出,尚未正式官宣。

四条新闻集中在 2026 年春夏,覆盖运动、量产、融资、并购——全部指向身体的繁荣。

每一条都在说同一件事:硬件越来越强,价格越来越低,产量越拉越大。但你要是跟做机器人算法的工程师聊一聊,他们多半会先叹口气。

"硬件现在真不缺了,缺的是数据。"

这话听着反直觉——都万台量产了,还缺数据?

缺。而且缺得厉害。

02机器人和大模型,喝的不是一种水 自来水 vs 瓶装水

大语言模型能从 GPT-1 迭代到 GPT-5.6,靠的是互联网上免费的文本数据:网页、书籍、论文、代码,爬下来就能用。但机器人要的不是文字,是物理世界的真实交互——伸手抓一个杯子该用多大力、踩到一滩水的重心怎么调、一个没见过的工具怎么上手。

这些数据,互联网上一条都没有。

大模型 · 自来水

Common Crawl 一个数据集就有 2500 亿 token,维基、GitHub、百万册图书全部免费下载。拼的不是数据有没有,是谁清洗得更干净。拧开龙头就有。

机器人 · 瓶装水

每一条有效数据 = 一次真实物理操作。照片只告诉机器杯子长什么样,不告诉它抓的时候手指怎么弯、用多大劲、滑了怎么补。还得自己灌装。

2500亿Common Crawl 文本 token
100万+全球最大开源机器人数据集轨迹数
500+该数据集覆盖的技能数
<2000每种技能平均轨迹数

Open X-Embodiment 由谷歌 DeepMind 联合全球 21 家机构、34 个实验室构建。100 万条轨迹听着多,摊到 500 多种技能上,每种平均不到 2000 条——与大模型 2500 亿 token 的量级差了一百万倍。

一千万次抓取 = 一台机器人不停抓三年多。一次真实抓取从感知到执行大约 10 秒,一台机器人 24 小时不停,一天 8640 次,抓满一千万次要将近 1200 天。而这,还只是"抓杯子"一个动作。

03仿真救不了场 sim2real 的 99% 与 30%

真机采集又贵又慢,那在电脑里建个虚拟世界、让机器人先在模拟器里练,行不行?行业管这个叫 sim2real。想法挺好,现实却很骨感。

模拟器训练
99%
真机实测
30%

典型情境示意:同一抓取任务,模拟器里练到 99% 成功率,搬到真实机械臂上可能直接掉到 30%。差距来自"接触丰富操作"——机械手碰到物体瞬间的形变、摩擦、滑动,目前没有模拟器算得准。

为什么摔得这么狠?

模拟器里的世界是程序员写出来的。一个杯子多重、摩擦力多少,全靠人工设。你设 200 克,真实杯子可能 180 克也可能 250 克;摩擦系数设 0.4,杯子沾了油就变成 0.2。差一点,结果就差很多。英伟达 Isaac Sim、微软 Mujoco、谷歌 DeepMind Control Suite 都在做,但这个鸿沟目前没有哪家公司能填上

展台细节:为什么演示都怕随机测试

  • 动作看着行云流水——分拣、叠衣服、操作工具。
  • 但你凑近看:物品位置是固定的,光照是调好的,连物品本身都是挑过的标准件
  • 东西挪个位置、换个牌子,或让观众随手放一个上去,成功率就可能断崖式下跌。
  • 不是工程师不想做随机测试,是随机测试一上就翻车。

模拟器里的杯子和真实的杯子,根本不是同一个东西。

04数据饥荒最难的:它是个死循环 要数据 → 要场景 → 要智能

数据饥荒最让人头疼的地方,不是难,是它绕成了一个圈。

要数据要场景要智能要数据

要数据,需要把机器人放进真实场景;要进真实场景,需要机器人足够聪明、能稳定干活;要足够聪明,又需要大量真实数据。转一圈,回来了。

大模型从来没有遇到过这个问题——它爬数据不需要先证明自己能写文章。机器人却不行,真实场景是有门槛的

🏭 工厂

不会让一台不稳定的机器人上产线。撞坏设备、伤了人、耽误生产,谁担责?

🏠 家庭

不会买一台常犯错的机器人。打碎一个陶瓷杯,可能比机器本身还贵。

🧪 实验室

场景标准、数量有限,与真实世界的多样性比,是九牛一毛。

所以现在大部分公司的数据,还停留在实验室里反复攒。也有人试过遥控操作——人戴 VR 设备远程操控,机器人跟着做,同时记录数据。优点是质量高,缺点是贵(熟练操作员时薪不低,还得培训)、慢(一个人一次只能操控一台),而且采的是"人怎么操作",不是"机器人怎么自主操作"

遥控操作能做冷启动,解决不了规模化。至少在公开信息里,还没有哪家公司宣布跑通了"低成本、规模化、高质量获取真实物理数据"的闭环。

05几条路,都还没跑通 三种解法的未解之题

死循环摆在这,行业不可能干等着。目前能看到三条思路,但每一条都还早。

🏭 重资产堆量

铺机器进场景 / 自建数据工厂

几百台机器人 24 小时专门采集;或铺到真实场景里边干活边攒。前者从仓储分拣等半标准化场景切入,后者成本极高。

瓶颈:场景门槛高,客户不让不稳定机器进场;"人造的真实"与"真实的真实"永远有差距。

🤝 跨机构共享

Open X-Embodiment

30+ 学术实验室凑出 100 万条轨迹,覆盖 22 种机器人、500+ 技能,开源给全行业。能降低入门门槛。

瓶颈:商业公司不愿分享核心数据;22 种硬件接口格式不统一,适配成本高。

🧠 大模型生成合成数据

文字 → 操作视频轨迹

让大模型根据文字描述生成机器人操作的视频轨迹,拿来训练。听着有想象力,但目前还很早期。

瓶颈:大模型自己就没见过真实物理交互,脑补的东西可能从根上就不对。

三条路径分别对应重资产、开源生态与生成式 AI 三种解法,截至 2026 年夏,均未形成被验证的商业闭环。

三条路,没有一条被验证跑通。

所有人都知道数据是瓶颈,但没有人找到低成本规模化的解法。

06怎么判断一家机器人公司 三问,比参数更值钱

评估一家机器人公司,别只看本体参数和量产计划。该问的是这三个问题:

1
你们现在有多少小时真实交互数据?不是仿真数据,是真实物理环境里跑出来的。
2
采集成本和速度是多少?这决定了数据规模能否滚起来。
3
数据闭环跑通了吗?采回来的数据能不能反哺模型、模型更强之后能不能采到更多数据。

这三个问题的答案,比自由度和百米速度更能决定一家公司三年后值不值钱。

通用数据大家都缺,但垂直场景的数据可以靠深耕攒出来。一个只做电力巡检的机器人,在这个场景的数据量可能超过所有通用机器人公司的总和——这就是壁垒。不是头部玩家就别卷身体了,供应链已经成熟,找个垂直场景扎进去,把数据吃干榨净,可能更聪明。

编辑核心判断

身体已经进入量产时代,大脑还在等米下锅。算法是菜谱,数据是食材——菜谱更新到第三版了,食材依然匮乏。谁先跑通"低成本、规模化、高质量"的真实物理数据闭环,谁才真正拥有机器人的大脑。在那之前,所有号称"通用"的人形机器人,都只是身体强壮、但没怎么见过世面的孩子。

下次换个问法

再看到"人形机器人又融资 X 亿""第 X 万台量产下线"的新闻,把目光从关节和速度上移开,多问一句:它的数据从哪来?