能赚钱的 Ego 数据公司不超过五家,EgoScale 凭什么稳居国内前三?
创始人袁日正断言:今年国内能靠 Ego 数据赚钱的公司不超过五家。他的 EgoScale 用一顶自研双目帽子、一套自动化系统和一套"反共识"方法论,在具身智能数据赛道跑通了规模化交付,月周转 1500 名采集员,全职团队却不到 20 人。
创始人袁日正断言:今年国内能靠 Ego 数据赚钱的公司不超过五家。他的 EgoScale 用一顶自研双目帽子、一套自动化系统和一套"反共识"方法论,在具身智能数据赛道跑通了规模化交付,月周转 1500 名采集员,全职团队却不到 20 人。
袁日正把当前 Ego 数据赛道玩家分为三类:自研硬件采原始数据的创业公司、依托标注流水线做加工的公司(包括从智驾转型和从互联网视频蒸馏的),以及从具身智能生态内部孵化出来的数据团队。
玩家虽多,但真正能规模化交付、被头部客户验收的,全中国不超过五家。
为什么多数公司卡住了?答案藏在数据同质化里。一位头部客户告诉袁日正,他看过四五十家 demo,"好几家的数据长得一模一样"。
通过 B 端人力公司组织采集,人力公司同时服务多家客户——同一场景被反复拍,数据底层无差异。即便签了"独家协议",供应链上依然是二手数据。
采集员自己运营管理,分布全国各地,不依赖中间商。同一个采集员只服务一家,场景、任务、动作的多样性有底层保障。
注:数据同质化是行业隐形天花板。当多家公司的数据"长得一模一样",价格战和低效内卷就不可避免。
"强调规模是这个行业最大的误区。"袁日正这句话直接挑战了行业主流叙事。同样是 10 万小时数据,一个只包含 50 个场景,另一个包含 5 万个场景——后者的价值远超前者,但大多数人选择堆量,因为拓场景比堆量难得多。
数据多样性的真正含义,远不止场景数量:
注:上表仅展示四个核心维度。实际还包括人员、环境、操作路径、成功与失败过程、异常恢复行为等。多维度交叉才构成高价值训练数据。
EgoScale 重点采集家庭和商业场景,基本不碰工业。"工业场景在固定环境做固定事,放几个摄像头就够了,根本不需要 Ego。"袁日正说。去年 5 月之前做 Ego 的公司都在采工业数据,"这不 make sense"。
EgoScale 的采集设备是一顶帽子——全球第一个双目数采设备,也是第一个帽子形态的采集设备。配一个小充电宝就能 10 小时全时拍摄,魔术贴固定,几乎没有负重感。
为什么是帽子,而不是眼镜或头环?
袁日正的逻辑很直接:采集员愿意戴满 10 小时,数据才有效。大多数公司设计设备时只从技术角度出发,却没人问过采集员是否愿意每天戴着它工作。帽子不突兀,干活自然,周围人也不会觉得奇怪。
这套体系支撑的采集规模是:月周转 1500 人,大多数是宝妈,标注体系 800 人,整体人员动态调整。全职团队不到 20 人,4 月之前只有 6 个人。
管理 1500 个分散在全国的采集员,质量怎么保证?
答案是对人性的理解。袁日正说,采集员最关心的是赚钱。培训不谈规范,而是告诉他:"你不按这个角度拍,就会少赚多少钱。" 这套"人性论"让有效采集率达到 80%,而行业平均只有 50%,甚至 10%。
注:以上标签对应 EgoScale 采集体系的五大核心特征。其中"有效采集率 80%"指数据可用于模型训练的比例,行业均值约 30%-50%。
袁日正对 EgoScale 的定位很明确:数据基础设施公司,不是数据服务公司。
区别在于:服务公司做标注、清洗等后半段,不碰采集,素材靠爬虫或外购;而 EgoScale 覆盖采集、结构化、质量管理和授权体系的全链路,持续沉淀可复用的数据资产。
主要做标注、清洗等数据处理服务,不涉及采集。素材来源依赖网络爬虫或外购存量互联网内容。
覆盖真实世界数据的采集、结构化、质量管理和授权体系,全链路自控,数据可复用、可沉淀。
一个更关键的立场是中立。袁日正认为,数据公司和模型公司之间有一条天然红线:
市场有多大?袁日正的估算很具体:全球今年愿意花 10 亿人民币以上买 Ego 数据的客户约 5 家,中国约 1.5 家,海外约 3.5 家。单一海外头部客户预算 2 亿美金以上。
到今年年底,真正能产生收入和利润、具备持续运营能力的公司,中国可能只剩 5 家左右,海外也可能只有 5 家左右。"大部分企业都会在竞争中被淘汰。资本投入只能支撑企业走一段路,最终决定生存能力的还是商业化和盈利能力。"
Ego 数据赛道真正的壁垒不在采集设备,而在规模化、自动化、多样性的系统工程能力。当行业还在卷参数和规模时,EgoScale 用"产品思维+人性理解"构建了一套低成本、高效率、高多样性的数据生产体系,证明了懂产品、懂运营、懂人性的"非主流"组合,在数据基础设施领域比纯技术路线更有竞争力。