97家玩家涌入具身数据:一年吸金44.7亿,谁在裸泳?
过去一年,15家独立具身数据服务商共完成 34 起融资,合计约44.7 亿元。但同期具身智能全行业半年融资达 438 亿元——数据赛道仅占零头。在 97 家玩家、年产能 160 万小时的喧嚣中,没有一家公司披露过利润。
过去一年,15家独立具身数据服务商共完成 34 起融资,合计约44.7 亿元。但同期具身智能全行业半年融资达 438 亿元——数据赛道仅占零头。在 97 家玩家、年产能 160 万小时的喧嚣中,没有一家公司披露过利润。
具身数据行业已分化出五类玩家。独立数据服务商以 39 家、40% 的占比成为最大群体,意味着数据采集不再是机器人公司的附属业务。
不做本体、不练模型,只卖数据。从零构建数据资产,新公司轻装上阵。
不怕重。买本体、租场地、雇操作员,重资产的真机遥操路线恰好是其优势。
另有机器人公司 24 家(25%)、工业/IT 跨界公司 5 家(5%)、大厂平台型公司 4 家(4%,如华为、京东)。
按"出身"拆分:65 家为"具身原生"(67%),32 家为"跨界转型"(33%)。但数采与 infra 两个环节构成完全相反——数采公司八成是原生新玩家,infra 公司七成是从 AI 数据标注、自动驾驶等领域转型而来。
主流采集方案分为四类,同时押注多条路线的玩家有 30 家,占 43%,比单独押注任何一条的都多。没有任何一种方式能独自满足训练需求。
注:统计基数为 70 家数采公司/平台。曾以仿真为核心的银河通用今年 6 月发布全身遥操作系统,光轮智能也开始采集人类数据——坚定的仿真派正在把鸡蛋放进多个篮子。
筛选标准:不做通用本体、不训练具身模型、数据为核心业务。符合这一定义的 15 家公司,过去一年完成 34 起融资,融资时间高度集中——2026 年 4-6 月占了四成多。
统计仅含真机遥操与无本体采集数据(剔除仿真合成),由于各家披露口径不同,小时数与条数并列。实际数字可能更多。
160-180 万 小时
+ 7000-8000 万条
2500-3500 万 小时
+ 亿条级
仅看小时数,短期目标是现有产能的 15-20 倍。但参照系令人清醒:截至今年初,全球高质量真实物理交互数据总量约 50 万小时,不足 LLM 训练数据量的两万分之一。
全国数采工厂已铺到 20 个省份,国资背景覆盖 16 个。长三角以 30 座居首,无锡成为首个提出"城市全域数据采集"概念的城市——鼓励制造业、服务业开放产线作采集厂。不少三四线城市(宿迁、自贡、郴州、运城、德清)也因人力成本低成为选址地。
本文核心数据来自单一行业媒体的统计,"97 家玩家""44.7 亿融资"等数字基于其自行圈定的筛选标准(如"独立服务商"三条定义),未见第三方机构交叉复测;产能数字来自各公司自行披露,口径不统一,读者宜将其视为量级参考而非精确计量。
更值得留意的是叙事立场:报道将"无人披露利润"作为核心悬念,这一判断方向无误,但结论仍待一两个季度的财报窗口验证。所谓"卖数据是不是赚钱生意",本质上是问给整个具身智能产业链的——如果数据商赚不到钱,下游的本体厂和模型厂就得自己采,垂直整合的压力会反向倒逼行业洗牌。
具身数据赛道的真正价值不在"卖铲子能赚多少",而在于它将决定机器人产业是走向开源共享的数据飞轮,还是走向各自封闭的垂直寡头。
具身数据行业的验证窗口就在未来一两年——谁先拿出利润表,谁就坐实"卖铲人"身份。关注各梯队公司后续融资动态与产能兑现情况。
订阅 AI 快讯 → 每周产业观察