🤖 具身智能 · 数据开源

150小时、1700万帧、200类任务:ACE-Data-0 开源,为机器人打造物理世界「数据引擎」

大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身数据集 ACE-Data-0,包含 150 小时真实家庭交互、1700 万帧视频、200 个任务类别,覆盖从精细手部操作到房间尺度长程活动的完整物理过程。数据集以目标级指令采集、多模态高精度同步,为具身模型提供真正可用的「物理世界数据底座」。

综合公开信息整理 2026-07-28 全文约 4 分钟读完
#ACE-Data-0 #具身智能 #数据集开源 #大晓机器人 #NTU S-Lab
🏆 L5 级 全球首个 L5 多模态具身物理智能数据集
150小时 真实家庭场景连续交互数据
1700万帧 多视角视频,7 种模态同步

⚡ 30 秒速览

  • 数据规模:150 小时、1700 万帧、200 类任务、50 名参与者、2 个真实家庭场景、7.5 万个交互片段,全部标注对齐。
  • 采集方式:桌面尺度 + 房间尺度两套互补系统,覆盖精细手部操作与跨区域长程活动,全程多模态同步。
  • 核心创新:目标级指令而非脚本式采集,保留人类真实行为中的犹豫、调整与恢复过程,让机器人学习「真实物理世界」而非「理想模板」。
  • 开源价值:附带三级评测基准,覆盖 30+ 主流模型,可用于模仿学习、世界模型、VLA 与机器人策略迁移,全流程可复现。

01数据集全景 真实家庭场景的数字化镜像

ACE-Data-0 不是一段段孤立的视频,而是对真实家庭物理过程的连续、多模态、高精度记录。它同时捕获视觉、运动、触觉、音频与物体状态,并将所有信号锁定在同一时空坐标系下。

一组数字勾勒它的规模:

150 h连续交互数据
1700万视频帧
200任务类别
50参与者
2真实家庭场景
7.5万交互片段

注:以上数字为数据集核心统计指标。200 个任务类别涵盖原子级操作、长时序活动链与人-场景交互三大类,7.5 万交互片段均标注了手-物接触、物体位姿与任务上下文。

但规模只是起点。ACE-Data-0 的真正价值在于它解决了一个关键问题:机器人从什么数据中学习人类的行动能力?普通视频可以记录「发生了什么」,却无法呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。

02两套采集系统 桌面尺度 × 房间尺度

精细手部操作与房间尺度活动,对采集系统提出了截然不同的要求。ACE 引擎设计为两套互补配置,各自回答一个核心问题:

桌面尺度系统

回答「手与物体如何精细交互」——多视角摄像机、光学动捕、触觉设备,记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态与接触变化。

房间尺度系统

回答「人如何在完整环境中移动、规划并完成任务」——广基线摄像机、全空间动捕,覆盖厨房、餐厅、客厅、卧室,记录全身运动与跨区域连续交互。

两套配置共享统一的数据采集、同步、标定、质检和标注流程。参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机补足第一人称视角中容易被遮挡的信息。

注:桌面尺度与房间尺度并非两套独立系统,而是同一 ACE 引擎的两种部署形态,数据格式、标注规范、时空坐标系完全统一,可组合使用。

03多模态同步 把 7 种信号锁定在同一时空

多模态数据的真正难点不是设备够不够多,而是不同设备产生的数据能否准确对应。摄像机、动捕系统、触觉手套和音频设备各有独立时钟与采样频率,几毫秒偏差就会导致「画面中手尚未接触杯子,触觉信号却已产生」。

ACE-Data-0 同步采集以下 7 种模态:

🎥第一人称视频
📹多视角第三人称视频
🦾全身运动数据
手部关节状态
📦物体六自由度轨迹
🎤多通道音频
🖐️全手掌触觉压力

通过时间同步与空间标定,所有模态被统一到同一条时间线,并配准至共享世界坐标系。每次采集不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化。

注:时间同步精度达到亚毫秒级,空间标定覆盖外部摄像机、第一人称设备、人体、双手与物体之间的全部几何关系。大量标注直接来自采集系统,而非模型事后估计。

04目标级采集 不给标准答案,保留真实行为差异

与严格规定每一步动作的脚本式采集不同,ACE-Data-0 采用目标级指令——参与者只被告知最终任务,不要求遵循固定流程。同样是整理房间,有人先收拾桌面,有人先整理沙发;同样是准备食物,不同参与者会选择不同工具和顺序。

这些差异在标准化采集中可能被视为噪声,但对于真正进入家庭场景的机器人来说,正是必须理解的现实。ACE-Data-0 覆盖三类互补任务:

🔬 原子级人-物交互 单次约 3 分钟

  • 包括倒水、清洗、擦拭、切割、折叠、整理等单项操作,以分钟计而非传统 HOI 数据的数秒片段
  • 记录完整的接触、施力、调整与释放过程,保留手部与物体之间持续变化的物理关系。
关键区别:长度足够长,包含完整的开始-执行-结束阶段,而非截取的动作片段。

🧩 长时序家庭场景活动链 20-30 分钟

  • 从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾——多步之间存在依赖关系,前置决定影响后续可执行动作。
  • 参与者可能中途改变计划、返回上一步或处理意外情况,这些自然变化被完整保留。
长时序的难点不只是「视频更长」,更在于模型必须持续记住任务目标、物体状态和已完成步骤。

🚶 人-场景交互 约 5 分钟

  • 移动、坐下、锻炼、开关家具、取放物品及姿态转换,覆盖全身与环境的动态关系
  • 记录人在不同空间之间的转移,以及同一空间内多次交互的上下文衔接。
这类数据过去常被忽略,但正是机器人进入家庭后最频繁面对的场景类型。

注:目标级采集意味着同一个任务指令在不同参与者手中会产生不同的操作路径、工具选择和时序安排。ACE-Data-0 不提供「标准答案」,而是记录真实世界中的行为多样性。

05三级评测基准 从底层信号到交互理解,逐层拆解模型能力

基于 ACE-Data-0,研究团队构建了自底向上的三级具身感知评估基准,并评测了 30 多种代表性方法。结果清晰显示:现有模型在接触感知、严重遮挡、第一人称自运动和长时间任务中仍存在明显能力缺口。

L1

底层信号推断

模型能否从视觉观测中预测接触与触觉信息?——考察基础物理感知能力。

L2

场景组成要素恢复

在遮挡、复杂姿态和持续运动下,模型能否准确恢复人体与手部运动状态?——考察空间理解与鲁棒性。

L3

具身交互理解

从第一人称和第三人称视频中,模型能否完整恢复接近、抓取、调整和释放等手-物交互过程?——考察任务级理解。

这套基准不只看任务最终是否成功,更试图回答:模型究竟在哪一步失效?一次失败可能源于没有感知到接触,也可能来自物体状态估计错误、任务上下文丢失或手部运动恢复不准确。分层评测将这些问题拆解,帮助研究者定位能力断裂层。

注:评测覆盖 30 多种方法,包括视觉语言模型、VLA、世界模型与机器人策略模型。结果显示,现有方法在 L1 接触预测和 L3 长时序交互理解上差距最大,尤其在遮挡和第一人称快速运动场景下。

编辑核心判断

ACE-Data-0 的开源,标志着具身数据建设从「规模堆叠」进入「信息密度」阶段。当模型参数竞赛触及天花板,真正决定机器人能否走进家庭的关键,变成了它从什么样的数据中学习物理世界。保留真实行为中的犹豫、调整与恢复,比提供完美的动作模板更有价值——因为机器人的通用能力,最终诞生于对真实世界不确定性的理解,而非对理想轨迹的拟合。

数据已开源

ACE-Data-0 数据集及三级评测基准已全面开源,研究者可获取完整数据、标注与评测代码,用于模仿学习、世界模型、VLA 及机器人策略研究。

获取 ACE-Data-0 → 开源地址

数据集、评测代码与文档已上线,支持学术研究与商业应用