🤖 具身智能 · 数据开源

大晓联合南洋理工开源 L5 级具身数据集 ACE-Data-0:200 个任务、1700 万帧,把真实家庭变成机器人的物理世界教材

大晓机器人联合新加坡南洋理工大学 S-Lab,正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。这不是又一批「动作视频」:200 类任务、1700 万帧视频、7.5 万个交互片段,全部来自 2 个真实家庭——数据不仅记录动作,还同步保存了接触压力、自然犹豫与恢复过程

综合公开信息整理 2026-07-23 全文约 5 分钟读完
#具身智能 #ACE-Data-0 #L5级数据集 #世界模型 #VLA
L5 级 全球首创信息密度定律 · 物理智能数据分级
1700 多模态视频帧
200 任务 · 7.5 万交互片段
2 真实家庭 · 50 名参与者

⚡ 30 秒速览

  • 为什么是 L5:依据大晓提出的具身模型信息密度定律,L1-L2 数据只能支撑预训练,L3-L4 止步于拟合已知任务;ACE-Data-0 迈入 L5——接触压力、自然犹豫与恢复过程都被完整记录。
  • 规模数字:1700 万帧视频、200 类任务、7.5 万交互片段、50 名参与者、2 个真实家庭场景,最短任务也以分钟计。
  • 同步精度:第一人称与多视角视频、全身与手部运动、物体六自由度轨迹、音频与触觉,全部对齐至同一时间线与共享世界坐标系。
  • 三类任务:原子级人—物交互(约 3 分钟)、长时序家庭活动链(20—30 分钟)、人—场景交互(约 5 分钟),覆盖精细操作到完整家务。
  • 诚实一面:基于它评测 30+ 种代表性方法,现有模型在接触感知、严重遮挡、第一人称自运动与长任务中仍存在明显缺口。
  • 可用场景:面向模仿学习、世界模型、VLA、机器人策略学习与人类示范迁移,数据集已开源。

01机器看见了动作,却没看见物理过程

过去几年,视觉语言模型、VLA 与世界模型发展飞快,但机器人真正走进家庭后,仍要面对一个基础问题:该从什么数据里学习人类的能力?打开橱柜、倒水、叠衣服,同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉与任务规划。

普通视频能记录「发生了什么」,却记不住「接触何时发生、力度如何变化、物体怎样运动」。

传统具身数据

第一人称视频缺精确的人体、手部与物体状态;动捕来自理想化实验室,缺少自然遮挡、音频与触觉;大量数据停留在数秒级的抓取、放置单步动作。

ACE-Data-0

不把活动切割成孤立短片,连续记录感知、行动、接触与状态变化;多模态对齐至同一时空;任务以分钟甚至半小时为单位。

阅读提示:左边是「看见动作」的数据,右边是「理解行动」的数据。差异不在模态数量,而在模态之间是否共享同一条物理时间线。

02200 类任务,三个长度量级

ACE-Data-0 没有把家务切成互不相干的短片段。最短的原子级交互也以分钟计,最长的家庭活动链持续 20—30 分钟——因为真实家务本来就是一系列相互依赖的决策。

🔬 原子级人—物交互 单次约 3 分钟

  • 倒水、清洗、擦拭、切割、折叠、整理等单项操作,取代传统 HOI 数据中常见的数秒片段。
  • 完整保留手如何接近、抓握、施力、释放,以及物体如何响应。
对应研究问题:精细手—物接触与操作技能学习

⛓️ 长时序家庭活动链 持续 20—30 分钟

  • 从打开冰箱、取出食材,到清洗、切配、烹饪、装盘、收拾——一步的错误会传导到后续所有动作
  • 物体可能离开视野再重新出现,子任务可能中断、重排或在其他位置继续。
对应研究问题:任务规划、长程记忆与状态跟踪

🏠 人—场景交互 约 5 分钟

  • 覆盖移动、坐下、锻炼、开关家具、取放物品与姿态转换。
  • 回答「人如何在完整房间里移动、规划并完成任务」
对应研究问题:场景理解与空间行为规划

阅读提示:三类任务分别对应不同研究问题——精细操作看第一类,任务规划与长程依赖看第二类,场景理解看第三类。

03从桌面到房间:两套互补的采集系统

精细手部操作与房间尺度活动,对采集系统的要求截然相反:指尖接触需要近距离密集传感器,跨房间移动需要大范围覆盖与统一空间坐标。

🖐桌面尺度

面向精细化手—物交互。操作区周围部署多视角摄像机、光学动捕与触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠中的手部姿态、物体轨迹与接触变化

回答:手与物体如何精细交互

🏠房间尺度

覆盖厨房、餐厅、客厅、卧室。广基线摄像机与全空间动作捕捉,持续记录全身运动、跨区域移动,以及发生在不同位置的连续交互。

回答:人如何在环境中移动与规划

参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动与手部关节状态;多视角外部摄像机再补足第一人称视角中容易遮挡的身体与环境信息。每个活动时刻,都由多个视角同步观察,并与可度量的人体、手部、物体状态一一对应。

两套配置不是两条孤立管线,而是共享同一套流转流程。

数据采集时间同步空间标定质检高精度标注

阅读提示:链路上每个环节对桌面与房间两套系统一致生效,这是两类数据能合并进同一数据集、并保持空间一致性的前提。

04不是一堆数据流,而是同一份物理记录

多模态数据真正的难点,不是设备够不够多,而是不同设备能不能准确对应。摄像机、动捕、触觉手套与音频设备各有独立时钟与采样频率——几毫秒偏差,就会出现画面里手还没碰到杯子、触觉信号却已经产生的矛盾。

时间同步解决「何时」,空间标定解决「何地」。

同一时间线视频帧、人体动作、物体状态、触觉读数与音频全部对齐
共享世界坐标外部摄像机、持续运动的第一人称设备、人体、双手与物体配准至同一坐标系
可回溯查询任一视频帧可直接对应人体姿态、物体位置、接触压力与声音变化

物体运动、全手掌触觉压力与多通道音频同时被记录:视觉描述外部变化,运动数据还原人体与物体轨迹,音频记录碰撞与设备状态,触觉提供接触、压力与滑动信息。

更关键的是,ACE-Data-0 的大量标注直接来自已经标定的采集系统,而非完全依赖模型事后估计。这使数据在遮挡、快速运动与长期任务中保持稳定一致——模型学到的是同一时刻发生的视觉、动作、声音与接触,而不是彼此错位的信号堆叠。

05不给标准答案:目标级采集保留真实差异

脚本式采集会规定每一步动作,数据干净,却远离真实。ACE-Data-0 采用目标级指令:参与者只被告知最终任务,自由选择物品、操作顺序与移动路径,可以犹豫、改变计划、返回上一步、处理意外。

但数据,从来不是标准答案。

同一个目标,两种完全不同的过程

  • 🧺 同样整理房间——有人先收拾桌面,有人先整理沙发
  • 🍳 同样准备食物——不同参与者会选择不同工具与操作顺序
  • 这些差异在标准化采集中常被视为噪声,但正是进入真实家庭的机器人必须理解的现实
诚实的注脚:长时序的难点不只是「视频更长」——模型必须持续记住任务目标、物体状态与已完成步骤,而不是把活动当成一串独立动作。
记住目标跟踪状态处理中断恢复执行

06不只给数据,还给一把尺子

ACE-Data-0 的另一半价值,是它顺带建立了一套三级具身感知评估基准——不只看任务最终是否成功,而是拆开看模型究竟在哪一步失效

L1
底层信号推断模型能否从视觉观测中预测接触与触觉信息
L2
场景组成要素恢复遮挡、复杂姿态与持续运动下,能否恢复人体与手部运动状态
L3
具身交互理解从第一/第三人称视频恢复接近、抓取、调整、释放的完整手—物交互
30+ 种代表性方法已评测 现有模型在接触感知、严重遮挡、第一人称自运动、极端视角与长时间任务中,仍存在明显的分层能力缺口。

阅读提示:三层自下而上,越上层越接近真实任务。一次失败可能源于没感知到接触(L1),也可能源于物体状态估计错误(L2)或动作顺序理解偏差(L3)——分层评测把「哪里断了」拆开给人看。

编辑核心判断

具身智能的竞赛,正在从「模型参数」转移到「数据质量」。ACE-Data-0 的价值不在 1700 万帧的规模,而在于它把接触、触觉、犹豫与恢复这些「看不见的物理过程」变成了可训练的信号。数据不再只回答「动作看起来像什么」,而开始回答「行动为什么会这样发生」。当真实世界的混乱与不确定性被高保真地写进训练信号,具身智能才真正离开实验室。

现在就能用

ACE-Data-0 已开源,涵盖原始多模态数据、同步工具链与三级评测基准。

面向模仿学习、世界模型、VLA、机器人策略学习与人类示范迁移,可通过大晓机器人官方渠道获取。

📍 已开源 · 官方渠道开放获取