AI·快讯
🤖 具身智能 · 数据集

200 个任务、1700 万帧、L5 级标注:大晓联合南洋理工开源 ACE-Data-0,把真实家庭场景炼成物理智能「数据引擎」

大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。包含 150 小时真实家庭交互数据、1700 万帧视频、200 个任务类别,通过桌面与房间两套互补采集系统,将日常家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景,为通用物理智能提供面向泛化与进化的高质量数据底座。

来源:综合公开信息整理 2026 年 7 月 全文约 4 分钟读完
#ACE-Data-0 #具身智能 #多模态数据集 #大晓机器人 #物理智能
🏠 L5 级 多模态具身物理智能数据集
150h 真实家庭交互数据
200 任务类别,覆盖全场景

⚡ 30 秒速览

  • 多大规模:150 小时数据、1700 万帧视频、200 个任务类别、50 名参与者、2 个真实家庭场景、7.5 万个交互片段。
  • L5 级意味着什么:数据不仅记录动作,还完整保留接触压力、自然犹豫与恢复过程、开放行为变量——这是机器人真正理解物理世界所需的信息密度。
  • 两套系统互补:桌面尺度聚焦精细手—物交互,房间尺度覆盖长程家庭活动,共享统一时空标定,数据可跨系统对齐。
  • 目标级指令,非脚本:参与者只被告知最终任务,自由选择路径、工具和顺序,真实记录人类完成任务时的规划、调整与恢复过程。
  • 不仅是一批数据:同步采集第一人称视频、多视角第三人称视频、全身运动、物体轨迹、音频与触觉,全部对齐至同一时空坐标系。

01ACE-Data-0 全景 规模、维度与采集配置

ACE-Data-0 不是一堆零散视频的简单堆叠,而是一套经过精密设计的具身数据基础设施。它同时覆盖原子级人—物交互长时序家庭场景活动链人—场景交互三个层次,数据采集深度贯穿感知、行动、接触与状态变化的完整物理过程。

1700 万帧视频
150 h连续数据
7.5 万交互片段
200任务类别
50名参与者
2真实家庭场景

注:数据覆盖桌面尺度(精细手—物操作)与房间尺度(跨区域长程活动)两套配置,所有模态均对齐至同一时间线与空间坐标系。原子级交互单次约 3 分钟,长时序活动链可持续 20—30 分钟。

02为什么需要这样的数据?

机器看见了动作,却没有看见完整的物理过程。

过去几年,视觉语言模型、VLA 和世界模型快速发展,但机器人进入真实家庭环境后,仍然面对一个基础问题:应该从什么数据中学习人类的行动能力?打开橱柜、倒水、叠衣服——这些日常行为同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉和任务规划。普通视频可以记录发生了什么,却难以准确呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。

现有数据的局限在于:第一人称视频缺少精确的人体、手部和物体状态;动作捕捉数据多来自理想化实验室,缺少自然遮挡与真实交互;大量数据停留在数秒的单步动作,难以描述家庭场景中的长期依赖。

一个关键的区别:

传统数据

单步动作、理想化实验室、缺少触觉与音频、时空对齐粗糙、脚本化采集。

ACE-Data-0

长时序任务、真实家庭环境、多模态同步(视觉+运动+音频+触觉)、统一时空标定、目标级采集保留自然行为差异。

ACE-Data-0 不再把活动切割成孤立短片,而是连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程。其核心能力可以概括为:完整感知、长时序任务、多模态同步

03从桌面到房间 两套互补采集系统

精细手部操作与房间尺度活动,对采集系统提出了截然不同的要求。指尖接触、抓握变化和物体细微运动,需要近距离密集传感器;人在厨房、客厅和卧室之间移动,则需要大范围覆盖与统一空间坐标。

大晓将环境式采集引擎 ACE 设计为桌面尺度房间尺度两套互补配置:

🖐️ 桌面尺度
精细手—物交互
🏠 房间尺度
跨区域长程活动

桌面尺度系统在操作区域周围布置多视角摄像机、光学动作捕捉和触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。房间尺度系统覆盖厨房、餐厅、客厅、卧室等完整家居空间,通过广基线摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动以及连续交互。

两套配置共享统一的数据采集、同步、标定、质检和标注流程。采集过程中,参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机补足第一人称视角中容易被遮挡的身体和环境信息。

注:桌面尺度回答「手与物体如何精细交互」,房间尺度回答「人如何在完整环境中移动、规划并完成任务」。两套系统数据可跨空间对齐,统一用于模型训练与评测。

04不是一堆数据流 把所有信号锁定在同一时空

多模态数据真正的难点,不是设备够不够多,而是不同设备产生的数据能否准确对应。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立时钟与不同采样频率。即使只有几毫秒偏差,也可能出现画面中的手尚未接触杯子,触觉信号却已经产生的问题。

ACE-Data-0 通过时间同步与空间标定,把视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并将外部摄像机、持续运动的第一人称设备、人体、双手和物体配准至共享世界坐标系。

同步采集的模态:

📹 第一人称视频 4 路鱼眼 👥 多视角第三人称视频 🦾 全身运动 + 手部关节 📦 物体六自由度轨迹 🎧 多通道音频 🤲 全手掌触觉压力 🧭 IMU + 头戴设备位姿

因此,每次采集并不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,也可以比较第一人称与第三人称视角下的同一事件。大量标注直接来自经过标定的采集系统,而非完全依赖模型事后估计,使数据在遮挡、快速运动和长期任务中拥有更稳定的一致性。

05不给标准答案 目标级采集保留真实行为差异

与严格规定每一步动作的脚本式采集不同,ACE-Data-0 采用目标级指令。参与者只被告知最终任务,不被要求遵循固定流程,因此可以自由选择物品、操作顺序和移动路径,也可能在过程中犹豫、改变计划、返回上一步或处理意外情况。

三类互补任务,覆盖从秒级操作到半小时长程活动:

🔧 原子级人—物交互 单次 ≈ 3 分钟

  • 包括倒水、清洗、擦拭、切割、折叠、整理等单项操作
  • 即使最短序列也以分钟计,而非传统 HOI 数据中常见的数秒片段
  • 保留完整的接触、力度变化与物体状态演化
覆盖精细操作所需的所有基础动作单元,是机器人学习手部技能的核心素材。

⏳ 长时序家庭场景活动链 20—30 分钟

  • 从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾——完整任务链
  • 此前的决定会改变后续可执行的动作,物体可能离开并重新进入视野
  • 子任务可能中断、重排或在其他位置继续,模型必须持续记住任务目标与状态
长时序任务的难点不只是「视频更长」,而是模型必须理解任务结构、状态依赖与动态调整。

🚶 人—场景交互 单次 ≈ 5 分钟

  • 包括移动、坐下、锻炼、开关家具、取放物品及姿态转换等
  • 记录人与完整家居环境之间的空间交互与行为适配
  • 为机器人在家庭场景中的自主导航与操作提供行为参考
这些差异在标准化采集中可能被视为噪声,但对于真正进入家庭场景的机器人来说,正是必须理解的现实。

06从采集到评估 三级基准拆解模型能力缺口

基于 ACE-Data-0,大晓建立了由底向上的三级具身感知评估基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。

1

底层信号推断

模型能否从视觉观测中预测接触与触觉信息?——检验模型对物理接触的感知能力。

2

场景组成要素恢复

在遮挡、复杂姿态和持续运动下,模型能否准确恢复人体与手部运动状态?——评估对动态场景的理解能力。

3

具身交互理解

从第一人称和第三人称视频中,模型能否完整恢复接近、抓取、调整和释放等手—物交互过程?——终极的综合理解测试。

研究团队进一步评测了30 多种代表性方法。结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显能力缺口。这套基准不只判断任务最终是否成功,更试图回答:模型究竟在哪一步失效?

注:分层评测将问题拆解为接触感知、物体状态估计、任务上下文丢失、动作顺序理解偏差等维度,帮助研究者判断模型已经理解了什么,又在哪一层发生能力断裂。

编辑核心判断

具身数据的价值不在于规模堆叠,而在于能否高密度记录那些真正改变行动结果的信息。ACE-Data-0 的「0」代表起点——它标志着行业从「让机器看见动作」正式进入「让机器理解完整物理过程」的阶段。未来,哪家公司的数据引擎能更高效地从真实交互中提取因果信号,谁就掌握了物理智能的入场券。

开源资源

ACE-Data-0 已正式开源,包含完整数据集、采集与标注流程、三级评测基准及基线模型评测结果。数据集及技术文档可通过大晓机器人官方渠道获取。

daxiaorobot.com → 获取 ACE-Data-0