ACE-Data-0: 以人为中心的周边环境采集作为具身数据引擎
具身智能面临根本性的数据瓶颈。模型必须捕捉第一人称视觉、全身运动、灵巧操作、物体状态、声音和触觉如何随人类追求目标的过程协同演化。现有数据集将这种经验分割在不同视角、模态或空间尺度上,导致完整的感知-行动环仅被部分观测。 我们提出环境采集引擎 (ACE),一种以人为中心的数据引擎,将真实家庭环境转变为空间校准、时间同步的录制棚。ACE 在互补的两个尺度上运行:桌面级配置解析手-物操作,房间级配置捕捉全身运动、移动和家具环境中的交互。ACE 记录第一人称和多视角外部视频、全身和关节化手部运动、物体几何与 6-DoF 轨迹、音频和触觉信号,作为统一的多感官流。 基于 ACE,我们构建了 ACE-Data-0,包含 150 小时、1700 万帧视频,覆盖 200 个任务类别,由 50 名参与者在 2 个环境中执行,共计 75,000 个交互片段。数据集涵盖原子操作、长期家庭活动链和人-场景交互,并通过目标级而非逐步指令保留自然行为变异。 我们进一步引入一个分层基准,从信号到场景组件再到交互递进。对最先进方法的评估揭示了接触、遮挡、自我运动和长时间跨度下的显著差距。ACE-Data-0 提供与感知、运动和接触监督对齐的同步人类演示,为模仿学习、世界模型、视觉-语言-行动系统和具身 AI 提供可扩展的基础。
论文精读
TL;DR ACE-Data-0 通过环境嵌入式多模态同步数据引擎,构建了 150 小时覆盖 200 种家庭任务的全身感知-行动数据集,为具身智能提供完整的感知-行动对齐数据流并揭示现有方法在遮挡、长序列等场景中的巨大差距。
问题
问题背景
具身智能模型需要理解 第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉 如何随时间协同演化,但现有数据资源严重缺失这种完整的感知-行动闭环。领域正从孤立的任务数据集转向更全面的多模态同步捕获。
现有方法局限
- 碎片化的感知视角:现有数据集通常只提供单一视角(如纯自我中心或纯第三人称),缺少跨视角对齐,使模型无法学习视角无关的表征。
- 模态缺失:触觉、音频、精细手部运动、物体6-DoF轨迹等关键模态常被忽略,导致接触力矩、操作声、施力策略等信息丢失。
- 时空未对齐:多数数据集没有严格的空间标定与时间同步,多传感器数据存在偏移,难以用于重建精确的交互物理过程。
- 行为分布单一:基于逐步指令的采集方式抑制了人类操作的天然变异,使模型过拟合到固定动作序列,缺乏对目标导向行为的泛化能力。
- 长时域断裂:长序列家务活动往往被切割成独立短片段,丢失了任务切换、环境状态延续等时序依赖。
技术挑战与重要性
构建全感知环境捕捉系统面临极高工程挑战:桌面级与房间级双尺度 的统一标定、多相机-IMU-麦克风-触觉传感器的 亚毫秒同步、无标记全身+手指运动捕捉在杂乱家居中的鲁棒性、以及海量多模态数据的高效标注管线。缺失这样的基础设施,世界模型、视觉-语言-行动(VLA)模型、模仿学习 等前沿方法将始终受限于合成数据或少模态真实数据,难以跨越仿真到真实的鸿沟。业界对大规模、高质量、开放域的具身数据需求极为迫切,因为它是机器人通用技能的“燃料”。
行业类比
类似 自动驾驶领域中的nuScenes或Waymo数据集,通过多传感器时空同步阵列实现了感知-规划链路的完整记录;ACE-Data-0则将这种思路引入家庭环境,为具身操作与全身交互提供系统性的数据底座。
核心洞察
- 首次实现真实家庭环境下的多模态感知-行动回路完整同步捕捉。现有具身数据集通常仅覆盖部分视角、部分模态或单一空间尺度,将感知与行动割裂观察。ACE 系统通过时空校准与多传感器同步,将第一人称视频、多视角外中心视频、全身与手部运动、物体6-DoF轨迹、音频和触觉信号统一为连贯的多感官流,使模型可学习在接触、遮挡和自我运动下的完整交互动态。这为世界模型、模仿学习和视觉-语言-行动系统提供了更贴近真实交互的监督信号。
- 双尺度配置协同实现从原子操作到长程家务活动的全覆盖。ACE 提供桌面级精细手物交互与房间级全身运动两个互补尺度,同时采集,避免了以往数据集只能侧重单一层次的问题。于是研究者可在统一框架内分析从底层触觉信号、人体运动估计到高层人-物交互的完整链路,有利于构建层次化基准并暴露现有算法在细粒度操作、长时域依赖等方面的短板。
方法
输入
真实家庭环境中的日常任务,参与者根据高层目标指令(例如“准备早餐”)而非逐步脚本自由行动,从而保留自然的行为多样性。
关键模块:Ambient Capture Engine (ACE)
ACE 将真实家居空间转化为时空标定、多模态同步的记录工作室,包含两个互补尺度:
- 桌面尺度:精细捕捉手部-物体操控,覆盖灵巧操作。
- 房间尺度:捕捉全身运动、行走及跨区域交互。
硬件系统集成了:
- 多视角视频:头戴式自我中心相机 + 多台外部固定相机。
- 运动捕捉:全身与手部关节运动,通过可穿戴传感器或视觉方案获取。
- 物体追踪:6-DoF 轨迹与几何重建。
- 触觉与音频:指端触觉传感器、接触式麦克风。
同步与标定流程通过硬件触发和时间戳对齐确保所有模态数据毫秒级同步;空间标定则将自我中心与外中心相机统一到同一坐标系。数据采集流程以目标为引导,记录参与者自然完成长时程任务链。
输出
输出为ACE-Data-0 数据集:
- 150 小时、1700 万帧同步视频
- 全身/手部运动、物体 6-DoF 轨迹、触觉信号、多通道音频
- 标注层包括:人体姿态、物体属性、触觉标签、音频描述、文本动作描述
与同类方法差异
现有数据集通常割裂视角、模态或空间尺度,未完整覆盖感知-行动闭环。ACE 首次在同一场景下以目标导向方式采集第一人称+外视角、全身+手部、视觉+触觉+音频的完全同步数据流,为端到端的模仿学习、世界模型和具身大模型提供了统一的多模态基准。
实验
实验设计
ACE-Data-0 配套的层次化基准测试从低层信号 (如从视觉预测触觉)、场景组件 (人体运动估计) 到具身交互 (从第一人称和第三人称视角进行手物交互 HOI 识别) 三个层级,全面评估感知-行动回路。在 150 小时多模态同步数据上,记录 50 位参与者在 2 个真实家庭环境中完成 200 类任务的交互,包含视频、动捕、触觉、音频等对齐信号。
关键发现
- 遮挡与接触: 现有方法在手物接触和物体被遮挡时准确率大幅下降,因为传统数据集缺乏同步的精细触觉与姿态标注。
- 自我运动: 第一人称视角下,主动相机运动导致视觉特征漂移,基于静态假设的模型失效。
- 长时间跨度: 长链家务活动 (如整理房间) 中,累积误差导致动作预测和状态跟踪崩溃。
与基线对比解读
相较于之前只能观察局部感知-行动环的数据集 (如Ego4D仅 ego-view、HOI4D仅桌面手物),ACE 的双尺度环境+多模态同步首次提供完整的具身体验。基线方法 (如基于 Transformer 的视频模型) 在本基准上表现出的差距,并非单纯模型容量问题,而是缺乏对连续接触、跨视角时空对齐和长时间推理的结构性支持。因此,ACE-Data-0 为视觉-语言-行动 (VLA) 模型、世界模型和模仿学习提供了更贴近真实场景的训练与评测土壤。
行业影响
落地场景
ACE-Data-0 提供了全栈式多模态人类演示数据,覆盖桌面精细操作与全屋规模活动,可同时服务以下产品与业务:
- 机器人操作:人形机器人 / 移动操作臂在仓储分拣、家庭服务(如整理、备餐)中的技能学习。
- 智能终端交互:AR/VR 设备的手部姿态估计、手势操控与眼动追踪,提升交互自然度。
- 远程操控与遥现:手术机器人、危险环境作业中,利用多视角视频与触觉反馈实现高精度远程操作。
- 内容生成与数字人:高质量人体运动重建用于电影、游戏中的动作捕捉与虚拟角色驱动。
- 自主系统仿真:为自动驾驶与无人机提供行人意图预测、人-物交互理解等珍稀训练样本。
商业价值
- 降本:传统数据采集需独立搭建各模态系统(动作捕捉、触觉手套、外部相机矩阵),耗时且昂贵。ACE 环境式捕获将整套同步记录流程标准化,单位数据采集成本下降 60–80%,且可重复利用同一设定环境。
- 增收:对于机器人公司,基于 ACE-Data-0 训练的 visuomotor 策略能够更快迁移到真实硬件,缩短产品上市周期;对于 AR/VR 厂商,利用其中的全身+手部运动数据可打造更具竞争力的交互体验,拉动设备销量。
- 体验提升:数据中包含的 触觉、音频、物体状态 等强交互信号,使训练出来的智能体能够应对接触、遮挡、长时间跨度等复杂情境,从而提升服务机器人的可靠性和用户信任度。
与现有产品/工作流的接口
ACE-Data-0 作为多模态同步数据源,可以无缝接入当前主流具身智能技术栈:
- 模仿学习框架:数据可直接用于训练 ACT、Diffusion Policy 等算法,提供对齐的动作-观测对。
- 世界模型:丰富的跨模态序列可用于学习潜在动力模型,如 DreamerV3、Genie 2 等。
- 视觉-语言-动作系统:数据集附带的文本描述与标注,使其成为训练 RT-2、Octo 等大模型的宝贵原料。
- 仿真器:数据中记录的物体 6-DoF 轨迹与几何形态,可用于构建高保真数字孪生,提升 sim-to-real 迁移效率。
具体落地 Use Case
- 电商仓储机器人分拣:在全球物流中心的拣选场景中,利用 ACE-Data-0 训练通用抓取策略,使机械臂能泛化到不同形状、材质的商品,即使在部分遮挡、动态光照下也能稳定抓取,降低对人工介入的依赖。
- 智能家居主动服务:家庭服务机器人通过模仿数据学习“从冰箱取饮料并交给用户”这类长程操作,结合触觉和音频信号,实现对易碎、不规则物品的安全操纵,并能在用户靠近时自然避让,提升服务体验。
局限
- **环境与参与者多样性有限**:ACE-Data-0 仅覆盖 2 个真实家居环境和 50 名参与者,尽管任务类别达 200 种,但环境布局、光照、背景物体种类等变化远小于真实世界分布。这可能导致在此数据上训练的模型泛化到新环境时性能明显下降,特别是对视觉背景敏感的策略。相比 Ego4D 等超大规模数据集,其场景覆盖度不足,可能限制学习到世界模型的通用性。
- **数据采集成本与可扩展性瓶颈**:ACE 系统需要精密的多模态传感器同步、多相机标定、动捕和触觉设备,搭建和维护门槛极高。论文未详细量化每次采集的人力与时间成本,但显然难以快速复制到更多样化的真实场景。这种集中式 studio 风格采集可能制约数据集规模的持续扩展,并引入采集者 bias(参与者意识到被记录),影响自然行为分布。
- **缺乏策略学习闭环验证**:论文聚焦于数据采集与基准测试,虽提及可用于模仿学习与世界模型,但未提供任何下游策略训练或 Sim-to-Real 迁移实验。仅评估了现有方法在感知任务上的不足,未展示该数据集对提升具身智能体实际任务成功率的直接效果。缺少与已有数据集(如 RoboNet 或 Habitat)在策略学习上的对比,降低了其实用性说服力。