AI·快讯
🔬 具身智能 · 数据基建

能赚钱的 Ego 数据公司不超过五家,EgoScale 凭什么稳居国内前三?

创始人袁日正断言:今年国内能靠 Ego 数据赚钱的公司不超过五家。他的 EgoScale 用一顶自研双目帽子、一套自动化系统和一套"反共识"方法论,在具身智能数据赛道跑通了规模化交付,月周转 1500 名采集员,全职团队却不到 20 人。

综合公开信息整理 2026 年 7 月 全文约 4 分钟读完
#EgoScale #具身智能数据 #Ego数据 #数据基础设施
🥉 国内前三 Ego 数据交付量 · 多家头部客户供应商
80% 数据有效采集率,行业平均 50% 甚至 10%
1,500 人/月 采集员轮转规模,全职管理不到 20 人

⚡ 30 秒速览

  • 行业格局:全中国能规模化交付 Ego 数据、通过头部客户验收的团队 不超过 5 家,EgoScale 交付量稳居前三。
  • 核心主张:数据多样性比规模更重要。50 个场景的 10 万小时数据,价值远低于 5 万个场景的 10 万小时——堆量是行业最大的误区。
  • 采集创新:全球首个双目帽子数采设备,轻便自然可戴 10 小时;无线传输当天采、当天传、当天反馈,运营闭环独此一家。
  • 运营效率:月周转 1500 人,大多数是宝妈,不谈规范谈赚钱,有效采集率 80%;自动化系统 1.0 已跑通,2.0 进行中。
  • 商业模式:只做数据,不做模型,保持中立第三方立场。数据是资产,不是服务。

01行业格局 能赚钱的 Ego 数据公司不超过五家

袁日正把当前 Ego 数据赛道玩家分为三类:自研硬件采原始数据的创业公司依托标注流水线做加工的公司(包括从智驾转型和从互联网视频蒸馏的),以及从具身智能生态内部孵化出来的数据团队

玩家虽多,但真正能规模化交付、被头部客户验收的,全中国不超过五家。

为什么多数公司卡住了?答案藏在数据同质化里。一位头部客户告诉袁日正,他看过四五十家 demo,"好几家的数据长得一模一样"。

行业普遍模式

通过 B 端人力公司组织采集,人力公司同时服务多家客户——同一场景被反复拍,数据底层无差异。即便签了"独家协议",供应链上依然是二手数据。

EgoScale 模式

采集员自己运营管理,分布全国各地,不依赖中间商。同一个采集员只服务一家,场景、任务、动作的多样性有底层保障。

注:数据同质化是行业隐形天花板。当多家公司的数据"长得一模一样",价格战和低效内卷就不可避免。

02数据误区 10 万小时数据,可能一文不值

"强调规模是这个行业最大的误区。"袁日正这句话直接挑战了行业主流叙事。同样是 10 万小时数据,一个只包含 50 个场景,另一个包含 5 万个场景——后者的价值远超前者,但大多数人选择堆量,因为拓场景比堆量难得多。

数据多样性的真正含义,远不止场景数量:

场景家庭 · 商业 · 办公
任务烹调 · 清洁 · 整理
动作抓取 · 旋转 · 插拔
物体工具 · 餐具 · 日用品

注:上表仅展示四个核心维度。实际还包括人员、环境、操作路径、成功与失败过程、异常恢复行为等。多维度交叉才构成高价值训练数据。

EgoScale 重点采集家庭和商业场景,基本不碰工业。"工业场景在固定环境做固定事,放几个摄像头就够了,根本不需要 Ego。"袁日正说。去年 5 月之前做 Ego 的公司都在采工业数据,"这不 make sense"。

关键判断:如果目标是训练通用具身大模型,底层喂养的必须是海量、泛化、带 corner case 的真实人类生活数据。10 万小时重复场景数据,对 World Model 或 VLA 的边际价值接近于零。

03采集革命 一顶双目帽子,一群宝妈采集员

EgoScale 的采集设备是一顶帽子——全球第一个双目数采设备,也是第一个帽子形态的采集设备。配一个小充电宝就能 10 小时全时拍摄,魔术贴固定,几乎没有负重感。

为什么是帽子,而不是眼镜或头环?

袁日正的逻辑很直接:采集员愿意戴满 10 小时,数据才有效。大多数公司设计设备时只从技术角度出发,却没人问过采集员是否愿意每天戴着它工作。帽子不突兀,干活自然,周围人也不会觉得奇怪。

双目 vs 六目:减法比加法更难产品哲学

  • 核心问题:采集数据是为了做环境采集,还是做手部操作的训练数据?如果是训练"大脑"执行手部操作,盯着双手就够了。
  • 成本陷阱:多一个摄像头,数据量暴增,传输、处理、存储成本全面上涨。六目带来的价值未必能覆盖其硬件和隐形成本。
  • 运营闭环:当天采、当天传、当天反馈,第二天任务自动更新。六目方案数据当天传不完,做不到无线闭环。
运营逻辑:无线传输不是技术问题,是产品思维问题。插卡传输只能集中管理,效率低、成本高、中间有人抽成。EgoScale 通过互联网找 C 端采集员,寄设备、收设备,全程线上对接。

这套体系支撑的采集规模是:月周转 1500 人,大多数是宝妈,标注体系 800 人,整体人员动态调整。全职团队不到 20 人,4 月之前只有 6 个人。

管理 1500 个分散在全国的采集员,质量怎么保证?

答案是对人性的理解。袁日正说,采集员最关心的是赚钱。培训不谈规范,而是告诉他:"你不按这个角度拍,就会少赚多少钱。" 这套"人性论"让有效采集率达到 80%,而行业平均只有 50%,甚至 10%。

🎯 有效采集率 80% 🧑‍🤝‍🧑 月周转 1500 人 👩 宝妈采集员为主 📡 无线传输闭环 🎩 全球首个帽子数采设备

注:以上标签对应 EgoScale 采集体系的五大核心特征。其中"有效采集率 80%"指数据可用于模型训练的比例,行业均值约 30%-50%。

04商业哲学 数据是资产,不是服务

袁日正对 EgoScale 的定位很明确:数据基础设施公司,不是数据服务公司。

区别在于:服务公司做标注、清洗等后半段,不碰采集,素材靠爬虫或外购;而 EgoScale 覆盖采集、结构化、质量管理和授权体系的全链路,持续沉淀可复用的数据资产。

Scale AI 模式(数据服务)

主要做标注、清洗等数据处理服务,不涉及采集。素材来源依赖网络爬虫或外购存量互联网内容。

EgoScale 模式(数据资产)

覆盖真实世界数据的采集、结构化、质量管理和授权体系,全链路自控,数据可复用、可沉淀。

一个更关键的立场是中立。袁日正认为,数据公司和模型公司之间有一条天然红线:

"如果我是做大模型的公司,向竞争对手买数据,就等于在养对手。" 因此 EgoScale 明确只做数据,不做模型,也不会被大厂收购。客户知道你没有做模型的意图,才敢把数据需求甚至训练方向告诉你。

市场有多大?袁日正的估算很具体:全球今年愿意花 10 亿人民币以上买 Ego 数据的客户约 5 家,中国约 1.5 家,海外约 3.5 家。单一海外头部客户预算 2 亿美金以上。

到今年年底,真正能产生收入和利润、具备持续运营能力的公司,中国可能只剩 5 家左右,海外也可能只有 5 家左右。"大部分企业都会在竞争中被淘汰。资本投入只能支撑企业走一段路,最终决定生存能力的还是商业化和盈利能力。"

编辑核心判断

Ego 数据赛道真正的壁垒不在采集设备,而在规模化、自动化、多样性的系统工程能力。当行业还在卷参数和规模时,EgoScale 用"产品思维+人性理解"构建了一套低成本、高效率、高多样性的数据生产体系,证明了懂产品、懂运营、懂人性的"非主流"组合,在数据基础设施领域比纯技术路线更有竞争力。