大晓联合南洋理工开源 L5 级具身数据集 ACE-Data-0:200 个任务、1700 万帧,把真实家庭变成机器人的物理世界教材
大晓机器人联合新加坡南洋理工大学 S-Lab,正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。这不是又一批「动作视频」:200 类任务、1700 万帧视频、7.5 万个交互片段,全部来自 2 个真实家庭——数据不仅记录动作,还同步保存了接触压力、自然犹豫与恢复过程。
大晓机器人联合新加坡南洋理工大学 S-Lab,正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。这不是又一批「动作视频」:200 类任务、1700 万帧视频、7.5 万个交互片段,全部来自 2 个真实家庭——数据不仅记录动作,还同步保存了接触压力、自然犹豫与恢复过程。
过去几年,视觉语言模型、VLA 与世界模型发展飞快,但机器人真正走进家庭后,仍要面对一个基础问题:该从什么数据里学习人类的能力?打开橱柜、倒水、叠衣服,同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉与任务规划。
普通视频能记录「发生了什么」,却记不住「接触何时发生、力度如何变化、物体怎样运动」。
第一人称视频缺精确的人体、手部与物体状态;动捕来自理想化实验室,缺少自然遮挡、音频与触觉;大量数据停留在数秒级的抓取、放置单步动作。
不把活动切割成孤立短片,连续记录感知、行动、接触与状态变化;多模态对齐至同一时空;任务以分钟甚至半小时为单位。
阅读提示:左边是「看见动作」的数据,右边是「理解行动」的数据。差异不在模态数量,而在模态之间是否共享同一条物理时间线。
ACE-Data-0 没有把家务切成互不相干的短片段。最短的原子级交互也以分钟计,最长的家庭活动链持续 20—30 分钟——因为真实家务本来就是一系列相互依赖的决策。
阅读提示:三类任务分别对应不同研究问题——精细操作看第一类,任务规划与长程依赖看第二类,场景理解看第三类。
精细手部操作与房间尺度活动,对采集系统的要求截然相反:指尖接触需要近距离密集传感器,跨房间移动需要大范围覆盖与统一空间坐标。
面向精细化手—物交互。操作区周围部署多视角摄像机、光学动捕与触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠中的手部姿态、物体轨迹与接触变化。
回答:手与物体如何精细交互覆盖厨房、餐厅、客厅、卧室。广基线摄像机与全空间动作捕捉,持续记录全身运动、跨区域移动,以及发生在不同位置的连续交互。
回答:人如何在环境中移动与规划参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动与手部关节状态;多视角外部摄像机再补足第一人称视角中容易遮挡的身体与环境信息。每个活动时刻,都由多个视角同步观察,并与可度量的人体、手部、物体状态一一对应。
两套配置不是两条孤立管线,而是共享同一套流转流程。
阅读提示:链路上每个环节对桌面与房间两套系统一致生效,这是两类数据能合并进同一数据集、并保持空间一致性的前提。
多模态数据真正的难点,不是设备够不够多,而是不同设备能不能准确对应。摄像机、动捕、触觉手套与音频设备各有独立时钟与采样频率——几毫秒偏差,就会出现画面里手还没碰到杯子、触觉信号却已经产生的矛盾。
时间同步解决「何时」,空间标定解决「何地」。
物体运动、全手掌触觉压力与多通道音频同时被记录:视觉描述外部变化,运动数据还原人体与物体轨迹,音频记录碰撞与设备状态,触觉提供接触、压力与滑动信息。
更关键的是,ACE-Data-0 的大量标注直接来自已经标定的采集系统,而非完全依赖模型事后估计。这使数据在遮挡、快速运动与长期任务中保持稳定一致——模型学到的是同一时刻发生的视觉、动作、声音与接触,而不是彼此错位的信号堆叠。
脚本式采集会规定每一步动作,数据干净,却远离真实。ACE-Data-0 采用目标级指令:参与者只被告知最终任务,自由选择物品、操作顺序与移动路径,可以犹豫、改变计划、返回上一步、处理意外。
但数据,从来不是标准答案。
ACE-Data-0 的另一半价值,是它顺带建立了一套三级具身感知评估基准——不只看任务最终是否成功,而是拆开看模型究竟在哪一步失效。
阅读提示:三层自下而上,越上层越接近真实任务。一次失败可能源于没感知到接触(L1),也可能源于物体状态估计错误(L2)或动作顺序理解偏差(L3)——分层评测把「哪里断了」拆开给人看。
具身智能的竞赛,正在从「模型参数」转移到「数据质量」。ACE-Data-0 的价值不在 1700 万帧的规模,而在于它把接触、触觉、犹豫与恢复这些「看不见的物理过程」变成了可训练的信号。数据不再只回答「动作看起来像什么」,而开始回答「行动为什么会这样发生」。当真实世界的混乱与不确定性被高保真地写进训练信号,具身智能才真正离开实验室。
ACE-Data-0 已开源,涵盖原始多模态数据、同步工具链与三级评测基准。
面向模仿学习、世界模型、VLA、机器人策略学习与人类示范迁移,可通过大晓机器人官方渠道获取。