200 个任务、1700 万帧、L5 级标注:大晓联合南洋理工开源 ACE-Data-0,把真实家庭场景炼成物理智能「数据引擎」
大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。包含 150 小时真实家庭交互数据、1700 万帧视频、200 个任务类别,通过桌面与房间两套互补采集系统,将日常家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景,为通用物理智能提供面向泛化与进化的高质量数据底座。
大晓机器人联合南洋理工大学 S-Lab 正式开源 L5 级多模态具身物理智能数据集 ACE-Data-0。包含 150 小时真实家庭交互数据、1700 万帧视频、200 个任务类别,通过桌面与房间两套互补采集系统,将日常家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景,为通用物理智能提供面向泛化与进化的高质量数据底座。
ACE-Data-0 不是一堆零散视频的简单堆叠,而是一套经过精密设计的具身数据基础设施。它同时覆盖原子级人—物交互、长时序家庭场景活动链与人—场景交互三个层次,数据采集深度贯穿感知、行动、接触与状态变化的完整物理过程。
注:数据覆盖桌面尺度(精细手—物操作)与房间尺度(跨区域长程活动)两套配置,所有模态均对齐至同一时间线与空间坐标系。原子级交互单次约 3 分钟,长时序活动链可持续 20—30 分钟。
机器看见了动作,却没有看见完整的物理过程。
过去几年,视觉语言模型、VLA 和世界模型快速发展,但机器人进入真实家庭环境后,仍然面对一个基础问题:应该从什么数据中学习人类的行动能力?打开橱柜、倒水、叠衣服——这些日常行为同时涉及视觉、全身运动、手部操作、物体状态、声音、触觉和任务规划。普通视频可以记录发生了什么,却难以准确呈现接触何时发生、力度如何变化、物体怎样运动,以及当前动作与前后任务之间的关系。
现有数据的局限在于:第一人称视频缺少精确的人体、手部和物体状态;动作捕捉数据多来自理想化实验室,缺少自然遮挡与真实交互;大量数据停留在数秒的单步动作,难以描述家庭场景中的长期依赖。
一个关键的区别:
单步动作、理想化实验室、缺少触觉与音频、时空对齐粗糙、脚本化采集。
长时序任务、真实家庭环境、多模态同步(视觉+运动+音频+触觉)、统一时空标定、目标级采集保留自然行为差异。
ACE-Data-0 不再把活动切割成孤立短片,而是连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程。其核心能力可以概括为:完整感知、长时序任务、多模态同步。
精细手部操作与房间尺度活动,对采集系统提出了截然不同的要求。指尖接触、抓握变化和物体细微运动,需要近距离密集传感器;人在厨房、客厅和卧室之间移动,则需要大范围覆盖与统一空间坐标。
大晓将环境式采集引擎 ACE 设计为桌面尺度与房间尺度两套互补配置:
桌面尺度系统在操作区域周围布置多视角摄像机、光学动作捕捉和触觉设备,重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。房间尺度系统覆盖厨房、餐厅、客厅、卧室等完整家居空间,通过广基线摄像机和全空间动作捕捉,持续记录参与者的全身运动、跨区域移动以及连续交互。
两套配置共享统一的数据采集、同步、标定、质检和标注流程。采集过程中,参与者佩戴第一人称设备,系统同步记录四路鱼眼视频、IMU、头戴设备位姿、全身运动和手部关节状态;多视角外部摄像机补足第一人称视角中容易被遮挡的身体和环境信息。
注:桌面尺度回答「手与物体如何精细交互」,房间尺度回答「人如何在完整环境中移动、规划并完成任务」。两套系统数据可跨空间对齐,统一用于模型训练与评测。
多模态数据真正的难点,不是设备够不够多,而是不同设备产生的数据能否准确对应。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立时钟与不同采样频率。即使只有几毫秒偏差,也可能出现画面中的手尚未接触杯子,触觉信号却已经产生的问题。
ACE-Data-0 通过时间同步与空间标定,把视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并将外部摄像机、持续运动的第一人称设备、人体、双手和物体配准至共享世界坐标系。
同步采集的模态:
因此,每次采集并不是一组互不相关的数据流,而是一份对同一物理过程的统一记录。研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,也可以比较第一人称与第三人称视角下的同一事件。大量标注直接来自经过标定的采集系统,而非完全依赖模型事后估计,使数据在遮挡、快速运动和长期任务中拥有更稳定的一致性。
与严格规定每一步动作的脚本式采集不同,ACE-Data-0 采用目标级指令。参与者只被告知最终任务,不被要求遵循固定流程,因此可以自由选择物品、操作顺序和移动路径,也可能在过程中犹豫、改变计划、返回上一步或处理意外情况。
三类互补任务,覆盖从秒级操作到半小时长程活动:
基于 ACE-Data-0,大晓建立了由底向上的三级具身感知评估基准,系统检验模型在接触感知、人体与物体状态恢复、手—物交互理解等关键环节的真实能力。
模型能否从视觉观测中预测接触与触觉信息?——检验模型对物理接触的感知能力。
在遮挡、复杂姿态和持续运动下,模型能否准确恢复人体与手部运动状态?——评估对动态场景的理解能力。
从第一人称和第三人称视频中,模型能否完整恢复接近、抓取、调整和释放等手—物交互过程?——终极的综合理解测试。
研究团队进一步评测了30 多种代表性方法。结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显能力缺口。这套基准不只判断任务最终是否成功,更试图回答:模型究竟在哪一步失效?
注:分层评测将问题拆解为接触感知、物体状态估计、任务上下文丢失、动作顺序理解偏差等维度,帮助研究者判断模型已经理解了什么,又在哪一层发生能力断裂。
具身数据的价值不在于规模堆叠,而在于能否高密度记录那些真正改变行动结果的信息。ACE-Data-0 的「0」代表起点——它标志着行业从「让机器看见动作」正式进入「让机器理解完整物理过程」的阶段。未来,哪家公司的数据引擎能更高效地从真实交互中提取因果信号,谁就掌握了物理智能的入场券。
ACE-Data-0 已正式开源,包含完整数据集、采集与标注流程、三级评测基准及基线模型评测结果。数据集及技术文档可通过大晓机器人官方渠道获取。
daxiaorobot.com → 获取 ACE-Data-0