L5级具身数据破局:ACE-Data-0如何重构物理智能训练范式?
在人工智能从虚拟空间向物理世界渗透的关键节点,具身智能(Embodied AI)正面临着前所未有的数据瓶颈。过去几年,视觉语言模型(VLM)和世界模型的快速迭代虽然极大提升了机器对语义的理解能力,但当这些模型被部署到真实的家庭或服务场景中时,却往往显得“手足无措”。这是因为传统的视频数据仅记录了“发生了什么”,却难以精确量化“如何发生”以及“物理状态如何变化”。
近日,大晓机器人联合南洋理工大学 S-Lab 重磅开源的 L5 级多模态具身物理智能数据集 ACE-Data-0,试图从根本上解决这一难题。该数据集不仅仅是一批高质量的视频录像,而是基于全球首创的具身模型信息密度定律,通过环境式采集引擎 ACE 构建的一套完整的物理数据基础设施。它通过将真实家庭场景转化为可持续记录、统一标定和精准同步的“数据引擎”,为全球具身模型提供了面向泛化、反思与进化的高质量数据底座。
突破数据层级:从 L4 拟合到 L5 泛化的本质跨越
要理解 ACE-Data-0 的价值,首先需要审视当前具身智能数据的发展层级。在具身模型信息密度定律的框架下,数据的价值不在于规模的简单堆叠,而在于其高密度记录那些真正改变行动结果的关键信息。
此前的 L1 至 L2 级数据主要支撑基础预训练,仅能提供粗糙的视觉特征;L3 至 L4 级数据虽然能够支持更复杂的任务拟合,但大多仍局限于已知场景下的动作模仿,缺乏对物理接触力和环境变化深层因果关系的建模。相比之下,ACE-Data-0 标志着 L5 级数据的成熟。这一层级的核心特征在于深度融入接触压力、自然出现的犹豫与恢复过程,以及真实家庭场景中的开放行为变量。
具体而言,ACE-Data-0 包含了 150 小时的数据、1700 万帧视频、200 个任务类别、50 名参与者以及 7.5 万个交互片段。这些数据并非孤立存在,而是覆盖了原子级的人—物交互、长时序的家庭场景活动链以及人与场景的复杂交互。通过桌面尺度与房间尺度两套互补的采集系统,数据集将日常生活中的真实交互直接转化为机器人学习物理世界的来源,使模型能够从单一的“视觉跟随”进化为具备“物理直觉”的智能体。
双系统互补:精细操作与长程活动的全景捕获
在真实家庭环境中,机器人面临的任务具有极高的多样性。指尖的精细操作需要毫秒级的响应和高精度的触觉反馈,而跨房间的活动规划则需要全局视野和长时序的记忆能力。传统的单一视角采集系统难以同时兼顾这两类需求。
为此,大晓将环境式采集引擎 ACE 设计为桌面尺度与房间尺度两套互补配置,构建了 ACE-Data-0 的硬件基础。
桌面尺度系统专注于精细化的人—物交互。在操作区域周围,系统布置了多视角摄像机、光学动作捕捉设备和高精度触觉传感器。这一配置重点记录抓取、倾倒、擦拭、切割、折叠等任务中的手部姿态、物体轨迹和接触变化。例如,在处理易碎品或液体时,系统能够捕捉到手指与物体表面接触压力的微小变化,以及物体因受力而产生的细微形变或位移。
房间尺度系统则覆盖厨房、餐厅、客厅、卧室等完整家居空间。通过广基线摄像机阵列和全空间动作捕捉技术,系统持续记录参与者的全身运动、跨区域移动,以及发生在场景不同位置的连续交互。这不仅包括人在房间间的移动路径,还包括打开橱柜、取放物品、调整家具位置等长程活动。
时空统一:多模态数据的同步与标定艺术
多模态数据真正的难点,从来不是设备数量的堆砌,而是不同设备产生的数据能否在时间和空间上准确对应。摄像机、动作捕捉系统、触觉手套和音频设备通常拥有独立的时钟频率和采样率。即使只有几毫秒的偏差,也可能导致画面中的手尚未接触杯子,触觉信号却已产生的“时空错位”。这种错位会严重干扰模型对因果关系的学习。
ACE-Data-0 通过严格的时间同步与空间标定流程,解决了这一核心痛点。系统将视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线上,并将外部摄像机、持续运动的第一人称设备、人体、双手和物体配准至共享的世界坐标系。
这意味着,研究者可以直接检索到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化。例如,在一个倒水的任务中,系统能够精确同步以下信息:
- 视觉信号:第一人称四路鱼眼视频和多视角第三人称视频,还原视觉感知。
- 运动信号:IMU、头戴设备位姿、全身运动和手部关节状态,还原运动意图。
- 物理信号:物体六自由度轨迹、全手掌触觉压力,还原物理接触。
- 听觉信号:多通道音频,记录碰撞声、水流声及设备运行声。
- 语义信号:与物理时间线对齐的自然语言描述,提供任务上下文。
这种“全景式”的记录方式,使得自然行为与高精度物理监督得以同时保留。数据不再是互不相关的信号流,而是一份对同一物理过程的统一、高保真记录。对于模型而言,这意味着它可以同时观察“看到什么”、“感觉到什么”、“听到什么”以及“做了什么”,从而建立起更鲁棒的感知—行动闭环。
目标级采集:保留真实世界的不确定性与多样性
传统的数据采集往往采用“脚本式”指令,要求参与者严格按照既定步骤执行动作。这种方法虽然保证了数据的一致性,却牺牲了真实世界的复杂性和多样性。在现实中,人类完成任务时往往伴随着犹豫、计划变更、意外处理以及策略调整。
ACE-Data-0 采用了独特的“目标级采集”策略。参与者仅被告知最终任务目标,而不被要求遵循固定流程。这种设计使得数据中天然包含了丰富的行为差异和适应性策略。
数据集覆盖了三类互补任务:
- 原子级人—物交互:单次约 3 分钟,包括倒水、清洗、擦拭、切割、折叠和整理等单项操作。与传统 HOI 数据中常见的数秒片段不同,ACE-Data-0 保留了完整的操作前后过程,使得模型能够学习动作的起始与终止边界。
- 长时序家庭场景活动链:可持续 20—30 分钟,例如从打开冰箱、取出食材,到清洗、切配、烹饪、装盘和收拾的全过程。此类任务要求模型具备长程记忆能力,能够理解子任务之间的依赖关系以及物体状态的连续变化。
- 人—场景交互:约 5 分钟,包括移动、坐下、锻炼、开关家具、取放物品及姿态转换等。此类任务侧重于人作为整体在环境中的移动规划与空间交互。
在这种采集模式下,同样是整理房间,有人先收拾桌面,有人先整理沙发;同样是准备食物,不同参与者会选择不同的工具和顺序。这些在标准化采集中被视为“噪声”的差异,恰恰是机器人进入真实家庭场景时必须理解的现实。模型不仅需要学习“理想动作”,更需要学习如何应对不确定性、如何处理中断以及如何恢复任务。
三级评测基准:从信号推断到交互理解的深度检验
数据的价值最终体现在对模型能力的评估与提升上。基于 ACE-Data-0,大晓建立了一套由底向上的三级具身感知评估基准,旨在系统检验模型在关键物理交互环节的真实能力。
- 第一级:底层信号推断。该层级研究模型能否从视觉观测中预测接触与触觉信息。例如,仅凭视频画面,模型能否判断出物体是否被接触、接触力度如何、表面是否打滑。这是机器人建立物理直觉的第一步。
- 第二级:场景组成要素恢复。该层级评估模型在遮挡、复杂姿态和持续运动下恢复人体与物体运动状态的能力。在真实家庭中,遮挡是常态。模型需要具备从部分可见信息中推断完整状态的能力,包括手部关节角度、物体位姿以及人的全身姿态。
- 第三级:具身交互理解。该层级要求模型从第一人称和第三人称视频中恢复接近、抓取、调整和释放等完整的人—物交互过程。这不仅涉及动作的执行,更涉及对交互意图、物体物理属性以及任务上下文的理解。
研究团队对 30 多种代表性方法进行了评测,结果显示,现有模型在接触感知、严重遮挡、第一人称自运动、极端视角和长时间任务中仍存在明显的能力缺口。分层评测的价值在于,它不仅能判断任务是否成功,更能诊断模型在哪一层发生能力断裂。是一次失败的抓取源于没有感知到接触,还是源于物体状态估计错误,或是任务上下文丢失?通过拆解这些问题,研究者可以更精准地定位模型瓶颈,推动算法迭代。
迈向通用物理智能:数据引擎的未来展望
ACE-Data-0 中的“0”,象征着这套具身数据体系的起点,而非终点。其真正价值在于为模仿学习、机器人策略学习、世界模型构建、视觉—语言—动作模型(VLA)训练,以及人类示范向不同机器人本体的迁移,提供了一套可扩展、可复用的数据基础设施。
在通用物理智能的愿景下,数据建设不能只追求小时数和轨迹数的规模扩张,更需要保留真实世界中的物理联系、任务结构、接触反馈与状态演化。ACE-Data-0 通过高保真的多模态同步和目标级采集,将真实家庭场景转化为可持续进化的数据引擎。
未来,随着大晓机器人在具身数据引擎、通用具身基础模型、世界模型和 VLA 领域的持续研发,以及与合作伙伴的共同探索,我们有理由相信,机器人将不再仅仅是执行预设程序的机械臂,而是能够理解物理规律、适应环境变化、并在复杂家庭场景中自主规划与行动的通用智能体。ACE-Data-0 正在为这一愿景铺设坚实的数据轨道,让每一次真实生活中的感知、接触与行动,都成为机器人理解物理世界的宝贵训练信号。
从“看见动作”到“理解行动”,从孤立视频到连续物理过程,具身智能的下一次突破,或许就藏在对这些细微物理信号的精准捕捉与深度解析之中。