150小时、1700万帧、200类任务:ACE-Data-0 开源,为机器人打造物理世界「数据引擎」
大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身数据集 ACE-Data-0,包含 150 小时真实家庭交互、1700 万帧视频、200 个任务类别,覆盖从精细手部操作到房间尺度长程活动的完整物理过程。数据集以目标级指令采集、多模态高精度同步,为具身模型提供真正可用的「物理世界数据底座」。
大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身数据集 ACE-Data-0,包含 150 小时真实家庭交互、1700 万帧视频、200 个任务类别,覆盖从精细手部操作到房间尺度长程活动的完整物理过程。数据集以目标级指令采集、多模态高精度同步,为具身模型提供真正可用的「物理世界数据底座」。
ACE-Data-0 不是一段段孤立的视频,而是对真实家庭物理过程的连续、多模态、高精度记录。它同时捕获视觉、运动、触觉、音频与物体状态,并将所有信号锁定在同一时空坐标系下。
一组数字勾勒它的规模:
注:以上数字为数据集核心统计指标。200 个任务类别涵盖原子级操作、长时序活动链与人-场景交互三大类,7.5 万交互片段均标注了手-物接触、物体位姿与任务上下文。
但规模只是起点。ACE-Data-0 的真正价值在于它解决了一个关键问题:机器人从什么数据中学习人类的行动能力?普通视频可以记录「发生了什么」,却无法呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。
精细手部操作与房间尺度活动,对采集系统提出了截然不同的要求。ACE 引擎设计为两套互补配置,各自回答一个核心问题:
回答「手与物体如何精细交互」——多视角摄像机、光学动捕、触觉设备,记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态与接触变化。
回答「人如何在完整环境中移动、规划并完成任务」——广基线摄像机、全空间动捕,覆盖厨房、餐厅、客厅、卧室,记录全身运动与跨区域连续交互。
两套配置共享统一的数据采集、同步、标定、质检和标注流程。参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机补足第一人称视角中容易被遮挡的信息。
注:桌面尺度与房间尺度并非两套独立系统,而是同一 ACE 引擎的两种部署形态,数据格式、标注规范、时空坐标系完全统一,可组合使用。
多模态数据的真正难点不是设备够不够多,而是不同设备产生的数据能否准确对应。摄像机、动捕系统、触觉手套和音频设备各有独立时钟与采样频率,几毫秒偏差就会导致「画面中手尚未接触杯子,触觉信号却已产生」。
ACE-Data-0 同步采集以下 7 种模态:
通过时间同步与空间标定,所有模态被统一到同一条时间线,并配准至共享世界坐标系。每次采集不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化。
注:时间同步精度达到亚毫秒级,空间标定覆盖外部摄像机、第一人称设备、人体、双手与物体之间的全部几何关系。大量标注直接来自采集系统,而非模型事后估计。
与严格规定每一步动作的脚本式采集不同,ACE-Data-0 采用目标级指令——参与者只被告知最终任务,不要求遵循固定流程。同样是整理房间,有人先收拾桌面,有人先整理沙发;同样是准备食物,不同参与者会选择不同工具和顺序。
这些差异在标准化采集中可能被视为噪声,但对于真正进入家庭场景的机器人来说,正是必须理解的现实。ACE-Data-0 覆盖三类互补任务:
注:目标级采集意味着同一个任务指令在不同参与者手中会产生不同的操作路径、工具选择和时序安排。ACE-Data-0 不提供「标准答案」,而是记录真实世界中的行为多样性。
基于 ACE-Data-0,研究团队构建了自底向上的三级具身感知评估基准,并评测了 30 多种代表性方法。结果清晰显示:现有模型在接触感知、严重遮挡、第一人称自运动和长时间任务中仍存在明显能力缺口。
模型能否从视觉观测中预测接触与触觉信息?——考察基础物理感知能力。
在遮挡、复杂姿态和持续运动下,模型能否准确恢复人体与手部运动状态?——考察空间理解与鲁棒性。
从第一人称和第三人称视频中,模型能否完整恢复接近、抓取、调整和释放等手-物交互过程?——考察任务级理解。
这套基准不只看任务最终是否成功,更试图回答:模型究竟在哪一步失效?一次失败可能源于没有感知到接触,也可能来自物体状态估计错误、任务上下文丢失或手部运动恢复不准确。分层评测将这些问题拆解,帮助研究者定位能力断裂层。
注:评测覆盖 30 多种方法,包括视觉语言模型、VLA、世界模型与机器人策略模型。结果显示,现有方法在 L1 接触预测和 L3 长时序交互理解上差距最大,尤其在遮挡和第一人称快速运动场景下。
ACE-Data-0 的开源,标志着具身数据建设从「规模堆叠」进入「信息密度」阶段。当模型参数竞赛触及天花板,真正决定机器人能否走进家庭的关键,变成了它从什么样的数据中学习物理世界。保留真实行为中的犹豫、调整与恢复,比提供完美的动作模板更有价值——因为机器人的通用能力,最终诞生于对真实世界不确定性的理解,而非对理想轨迹的拟合。
ACE-Data-0 数据集及三级评测基准已全面开源,研究者可获取完整数据、标注与评测代码,用于模仿学习、世界模型、VLA 及机器人策略研究。
获取 ACE-Data-0 → 开源地址数据集、评测代码与文档已上线,支持学术研究与商业应用