Open-AoE:面向具身学习的开放式自我中心操作数据集与工具链
现有自我中心视频资源很少同时具备低成本持续采集、操作级结构化标注和可复用工具,难以支持具身智能的规模化训练。为此,我们提出 Open-AoE,一个面向社区的开放式自我中心操作数据集与工具链,覆盖从智能手机采集到模型训练的完整流程。 数据集首版包含约 2,000 小时 操作视频,由 500 多位贡献者 使用 400 多部智能手机 在自然环境中采集。每段视频提供文本描述、基于 MANO 的手部姿态、相机轨迹以及时域定位的原子动作标注。数据通过时间动作分割、语义标注、手部重建和相机轨迹重建等流水线处理为结构化样本。 下游工具链支持可视化、跨具身重定向、模型特定数据转换,以及针对 VLA 策略、WAMs 和 World Models 的训练配方。通过集成规模化采集、结构化处理和下游适配,Open-AoE 降低了数据贡献与复用的门槛,为具身模型训练、人-机迁移和世界建模提供了实用的开放基础设施。
论文精读
TL;DR Open-AoE 提供约 2000 小时第一人称操控视频,由 500+ 人用 400+ 智能手机采集,并配套全流程工具链,从数据处理到机器人策略训练,大幅降低具身学习的数据门槛。
问题
具身智能 的规模化学习高度依赖第一人称操作视频作为监督信号,行业正寻求能支撑机器人操作策略、世界模型训练的大规模、高质量数据集。
现有资源存在三重割裂:
- 采集成本与规模不足:多数数据集使用受限环境或少量设备,难以覆盖长尾操作和光照、背景多样性;
- 标注粒度粗糙:常见标签仅为视频级分类或稀疏关键帧,缺乏细粒度的操作原子动作、手部姿态 MANO 参数和相机轨迹,无法直接用于策略学习和 sim-to-real 迁移;
- 工具链断层:数据处理、标注、重定向、训练转换等环节各自为战,社区缺乏从原始视频到策略训练的统一流水线,数据复用与二次开发门槛高。
该问题的重要性和挑战在于:
- 现实操作的视觉复杂性使得合成数据难以泛化,必须依赖真实场景的大规模人类行为数据,但低成本众包与标注质量控制本身存在矛盾;
- 具身模型训练需要时空对齐的视觉-动作-状态元组,对手部重建和相机运动恢复的精度要求极高,且需适配不同形态机器人;
- 业界对开放、可复现的具身数据基础设施的需求日益迫切,类似 ImageNet 在 2D 视觉中的角色,但操作数据维度更高、采集与加工链条更长。
类比而言,Open-AoE 之于具身操作,正如 LLaMA-Factory 之于大语言模型微调:提供从数据到训练的全链路工程化工具,降低整个领域的进入壁垒。
核心洞察
- **端到端开放生态**:Open-AoE 不仅提供了由 500+ 贡献者、400+ 手机采集的约 2000 小时第一人称操作视频,还整合了从时序动作分割、语义标注、手部重建到跨形态重定向、多模型格式转换的完整工具链。这与多数仅发布原始视频或单一标注的数据集形成对比,显著降低了社区贡献与复用的工程门槛,为具身学习提供了可直接启动模型训练的开源基础设施。
- **低成本众包与操作级结构化标注的融合**:借助智能手机的普适性,Open-AoE 实现了自然场景下的大规模连续采集,并通过自动化流水线生成 MANO 手部姿态、相机轨迹和原子动作标签等细粒度标注。这种高质量结构化数据对于训练机器人操作策略至关重要,而以往获取同类数据往往依赖昂贵的动捕设备,或缺乏操作层面的时空粒度。
- **面向多模型范式的训练就绪设计**:Open-AoE 为 VLA 策略、世界-动作模型(WAM)和世界模型等不同架构直接提供数据转换工具和训练配方,将人类视频快速适配到多种机器人形态。这种“数据工厂”模式让研究者跳过繁琐的预处理环节,更快地进入策略学习与 sim-to-real 验证,有望系统性加速具身智能的研发迭代。
方法
数据采集与边缘预处理
Open-AoE 从 500+ 贡献者 使用 400+ 种不同智能手机 在自然环境中采集约 2,000 小时 的第一人称操作视频。原始视频首先经过 边缘侧在线检测,在设备端初步筛选含操作片段的连续场景,降低后续处理负担。
离线质量检查与场景标注
采集后的视频进入云端流水线:先用图像级检测 剔除无关镜头,再通过视频切片与帧率固定 统一时序结构;最后调用大模型检测(视觉语言模型)自动生成场景描述、物体类别和粗粒度文本标注。
重建与结构化标注
这是核心加工环节:
- 时间动作分割(Temporal Action Segmentation)将连续行为切分为原子操作单元;
- 语义标注 为每个片段赋予动作短语、交互物体等标签;
- MANO 手部重建 恢复 3D 手部姿态,相机轨迹重建 同步估计相机运动,输出时空对齐的手姿、相机位姿与动作边界。
最终通过 质量检查与数据交付 确保每一条样本具备多模态完整性:文本描述、MANO 手姿、相机轨迹和时域定位的原子动作。
下游工具链
Open-AoE 提供配套工具覆盖从可视化到训练部署:
- AoE-Visualization:交互式浏览标注数据;
- AoE-Reconstruct-Retarget:执行 4D 手物重建,支持跨具身重定向,生成机器人视角的重演视频;
- AoE-Training-Ready:将结构化样本转换为模型专用格式,并提供 VLA 策略、WAM 与 世界模型 的训练配方,直接衔接具身学习 pipeline。
关键差异
不同于 Ego4D 等通用第一人称数据集,Open-AoE 专为机器人操作设计,统一了低成本采集 → 操作级结构化标注 → 跨具身迁移的全程工具链,使原始智能手机视频可直接转化为机器人可用的训练样本,大幅降低社区贡献与复用门槛。
实验
实验设计
Open-AoE 的数据集分析围绕四个维度展开:高维视觉多样性(场景、光照、相机内参分布)、语义广度与时间完整性(操作动作类别、原子动作切分密度)、图像-标注一致性(人工校验与自动标注的匹配度)以及训练窗口保留(多模态信息的有效帧比率)。所有统计基于首次发布的约 2,000 小时操控视频,采集自 500 多位贡献者、400 余部智能手机。
关键发现
视觉多样性分析显示,得益于非受限消费级相机的广域覆盖,数据在成像参数、背景和光照上呈现长尾分布,这为跨实体迁移的视觉鲁棒性提供了基础。语义方面,数据集覆盖日常操控的多种动作与交互物体,时间上细粒度原子动作分割保证了动作理解的时序完整性。多模态完整性检查表明,手部姿态、相机轨迹与视频帧的对齐率足以支持下游模型训练(约 85% 以上窗口保留全部模态)。
与基线的对比解读
相比 Ego4D 等通用第一人称视频数据集,Open-AoE 聚焦于操纵任务(manipulation),其结构化的原子动作标注和全栈工具链(处理、可视化、重定向、训练配方)填补了现有资源在“可操作数据到可部署模型”闭环中的空白。虽然总时长小于 Ego4D,但操控场景的集中度和工具链的完整性使其在具身学习下游任务(VLA、世界模型)中更具工程实用性。这种以社区贡献驱动、端到端覆盖的设计,为机器人学习的数据飞轮提供了可复现的范式。
行业影响
落地场景
Open-AoE 为具身智能提供了大规模、低成本、结构化的第一人称操作数据,可广泛应用于机器人操作策略训练、世界模型构建和跨实体技能迁移。具体场景包括:
- 仓储与物流机器人:利用人类拣选、分拣视频训练抓取和放置策略,加速自动化仓储部署。
- 家用服务机器人:基于日常家务操作视频学习精细任务(如擦桌、整理),提升环境适应能力。
- 智能内容平台:结构化操作标注可赋能视频理解、技能教学和 AR/VR 交互,增强沉浸式体验。
- 工业与医疗辅助:通过人类精细操作数据训练协作机器人,在装配、手术辅助等任务中降低试错成本。
商业价值
- 降本:用智能手机众包采集替代昂贵的遥操作或动捕系统,数据获取成本大幅下降,同时自然场景下的多样性提升了模型泛化能力,减少对特定环境微调的开销。
- 增收:缩短机器人产品研发周期,使自动化方案更快进入市场。例如在电商履约场景,可快速复制到多个品类仓库,降低人力依赖,直接增加订单处理容量。
- 体验提升:基于真实人类操作的策略使机器人行为更自然、鲁棒,提升用户信任与接受度,尤其在家用和服务场景中增强产品竞争力。
与现有产品/工作流的接口
Open-AoE 工具链设计为可插入现有机器人学习 stack 的模块:
- 数据处理管线:从原始视频到时序动作分割、手部重建、相机轨迹估计的自动化流程,可输出标准格式数据,直接对接 PyTorch、JAX 等训练框架。
- 下游适配工具:
AoE-Reconstruct-Retarget将 MANO 手部姿态重定向至不同机器人本体,生成机器人视角的操作视频;AoE-Training-Ready提供 VLA、WAM、World Model 等模型的训练配方,可与 LeRobot、RoboAgent 等社区主流工具集成,降低工程门槛。 - 模型集成:处理后的数据可作为模仿学习演示集或强化学习的辅助目标,简便融入现有自动化平台(如 NVIDIA Isaac、ROS 生态)。
具体落地 use case:
- 电商分拣机器人快速迭代:物流团队收集分拣员佩戴智能手机的第一人称拣货视频,经 Open-AoE 处理为带手部姿态与原子动作的样本,重定向生成机械臂抓取数据,训练 VLA 策略,数周内即可从概念验证走向实际部署,避免昂贵定制开发。
- 家用机器人操作技能扩展:智能家居厂商利用用户授权的生活视频(脱敏后)提取摆盘、浇花等原子操作,构建家庭环境数据集,训练机器人执行多样化任务,通过 OTA 持续升级,提升产品长期价值和用户粘性。
局限
- **跨形态迁移的视觉域 gap**:数据全部来自消费者智能手机采集的第一人称视频,虽然覆盖了多种自然操作场景,但缺少工业机器人部署中常见的固定相机视角、腕部相机或深度传感器数据。工具链中的跨形态重定向(cross-embodiment retargeting)仅处理了身体结构映射,并未解决输入视角与目标机器人视觉域之间的分布差异。这可能导致直接在 Open-AoE 上训练的视觉-语言-动作(VLA)策略在真实机器人上部署时出现显著的 sim-to-real 退化,限制了数据集在工业一级机器人学习中的应用。
- **自动标注的噪声与质量不确定性**:数据处理流水线依赖时序动作分割、MANO 手部重建、相机轨迹重建等模块自动生成标注。但在严重遮挡、快速运动或多人交互场景下,这些重建算法容易产生误差。论文虽然设置了离线质量检查和人工抽检,但未给出标注正确的定量报告(如关键点误差、动作边界 F1 等),也没有公开人工校验的比例。如果基础标注存在系统性噪声,基于此训练的具身模型可能会学到错误模式,影响下游任务的稳定性和可复现性。
- **缺乏标准化的下游基准与对比**:工具链提供了 VLA 策略、WAM、世界模型的训练配方,但并未在论文或项目中内置标准化的评估基准(如仿真或真实机器人上的任务成功率)。也没有展示使用 Open-AoE 训练的模型与基于现有大规模数据集(如 Ego4D)的模型进行定量比较。这使得潜在用户难以判断该数据集的相对价值,也无法快速验证自己的模型改进。缺少基准会降低社区采纳动力,减弱其“开放基础设施”的实用性。