论文

HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据

HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据

具身基础模型期望像大语言模型一样从数据规模中受益,但面临着更严重的数据瓶颈。当前,遥操作真实机器人轨迹因其精确的动作监督和本体对齐而成为主要预训练来源,但其可扩展性受限于高昂采集成本、获取难度大以及行为和环境的低多样性。 为突破这一瓶颈,自我中心人类视频作为一种可扩展、低成本、高多样性的替代方案引起关注。然而,其相对于遥操作数据的有效性尚未被充分探索。本文系统对比了两种数据源在固定后训练和验证协议下对具身基础模型预训练的影响。令人惊讶的是,经过精心设计的过滤与标注流水线处理后,自我中心数据不仅仅是可行的替代品,还能取得更优性能。 在相同预训练数据量下,基于自我中心数据预训练的模型在真实机器人动作预测上的验证损失降低24%,在分布内和分布外任务执行成功率上分别提升52.5%和90%。这一发现验证了一个可扩展的范式:先在大规模自我中心人类视频上预训练以学习多样的世界表征,再用少量标注的真实机器人数据进行微调以实现动作空间对齐。我们希望本研究能鼓励更广泛地探索自我中心数据,并在昂贵机器人数据采集前提供数据质量评估指导。

论文精读

TL;DR 以自我为中心的人类视频经精心过滤标注后,用作具身模型预训练,可超越遥操作机器人数据,在动作预测和任务执行上表现更优,成本更低。

问题

问题背景

具身基础模型期望通过数据规模扩展获得性能突破,类似大语言模型的 scaling law。但目前机器人操作数据的获取远比文本或图像困难,成为制约发展的关键瓶颈。

现有方法的局限

主流预训练数据源是 遥操作真实机器人轨迹,它提供精确的动作监督并与执行器本体对齐,但存在三个根本性局限:

  • 采集成本极高:需专业人员长时间遥操作,硬件与人力开销巨大,导致单个任务的数据量常以“小时”计;
  • 行为和场景多样性低:受限于固定实验室环境与预设任务,难以覆盖真实世界的物品交互、光照、背景等变化,模型泛化能力差;
  • 扩展性差:每增加一个新任务或新场景都要重新采集,无法像网络数据那样线性扩展,违背预训练对规模与覆盖度的需求。

这些因素使遥操作数据无法成为可扩展的预训练基石,整个领域被迫在“数据饥饿”中寻找替代方案。

问题的难度与重要性

寻找替代数据源需攻克双重挑战:既要足够廉价和多样以实现规模化,又要弥合与机器人动作空间的 领域差距(domain gap),防止预训练表征在下游动作预测中失效。该问题的重要性在于:一旦验证替代源的有效性,具身模型将可能复现视觉与语言领域的规模化预训练范式——用海量低成本数据学习通用世界表征,再以少量高质量机器人数据适配。这直接关系到通用机器人操作能否走向实用,业界因此对 以自我为中心的人体视频(egocentric human video) 寄予厚望,因其天然具备第一视角手物交互,且可从互联网大规模获取。

行业类比

这一问题类似于视觉领域用 大规模网络图像 预训练主干网络,再针对下游任务微调——核心在于找到“通用且可扩展”的预训练数据,使模型学到可迁移表征,从而以极少专有标注实现高效适应。

核心洞察

  • **自我中心人类视频数据在具身预训练中超越遥操作机器人数据**:尽管缺少直接的动作标注,经过精心设计的过滤与标注管道,自中心人类视频能提供远高于遥操作机器人轨迹的环境与行为多样性,从而学到更通用的世界表征。在相同数据量下,其预训练模型在机器人动作预测验证损失上降低 24%,在同分布和异分布任务成功率上分别提高 52.5% 和 90%,颠覆了“必须用机器人自身数据预训练”的固有认知,为低成本、大规模具身数据收集开辟了新范式。
  • **预训练-适配范式可突破具身学习的数据瓶颈**:该研究实证了一种可扩展路径——先利用海量、易于获取的自中心人类视频预训练世界模型,再仅用少量带动作标注的机器人数据适配动作空间。这种方法在保持性能优势的同时,极大降低了对昂贵、低多样性遥操作数据的依赖,为具身基础模型走出数据稀缺困境提供了明确的技术路线和量化依据。

方法

总体流程

输入原始自我中心人类视频(egocentric human video)与遥操作机器人轨迹,经专用管线处理后进行对比预训练,最终在少量机器人标注数据上微调完成动作空间对齐。

数据过滤与标记管线

  • 过滤:去除与任务无关的片段(如纯静态、过度抖动、非交互镜头),保留包含明确手部操控或物体交互的连续帧序列。利用离线物体检测与手部关键点检测模型自动筛选,确保视频中可见手部或被操作物体。
  • 标记:对过滤后片段自动生成伪标签,包括物体类别、手部接触状态、交互类型等结构化属性。采用启发式规则结合现成大模型(如视觉语言模型)进行弱监督标注,形成 (observation, pseudo-action-description) 对。

预训练架构

采用 Video‑MAE 式掩码自编码器,但将输入扩展为多模态:RGB 帧、手部关键点热力图、物体分割掩码拼接为统一张量。通过随机掩码高比例块(如 90%),使模型学习重建缺失区域,强制捕捉时空上下文与细粒度操控线索。

动作预测头与微调

在预训练主干上附加一个轻量 动作预测头 (Transformer 解码器加 MLP),用少量遥操作机器人数据(object−robot−trajectory)进行端到端微调。损失函数为纯动作回归损失(MSE + 方向余弦相似度),无额外对齐损失,依靠预训练表示泛化。

评估协议

固定微调数据量与超参,仅替换预训练集。在相同数据量下对比自我中心视频与遥操作轨迹预训练的效果。

与同类方法差异

有别于直接堆砌原始视频或采用对比学习,本工作通过全自动过滤与语义标记将嘈杂原始视频转化为高质量预训练样本,使自我中心数据在动作预测和任务执行上反超机器人数据,证明了数据质量管理比数据来源本身更关键。

实验

实验设计

研究系统地对比了两种预训练数据源:自我中心人类视频(通过过滤与标注管道处理)和遥操作真实机器人轨迹。预训练后,所有模型在统一的后训练与验证协议下评估,使用相同的少量标注机器人数据微调,在真实机器人平台上测试动作预测损失和任务执行成功率。

关键发现

当预训练数据量相同时,自我中心数据预训练模型在真实机器人动作预测上验证损失降低 24%,在分布内任务分布外任务执行成功率上分别提升 52.5% 与 90%。这验证了自我中心视频不仅可作为可行替代,且因具备更高的行为多样性环境多样性,能学习到更泛化的世界表征。

基线对比解读

传统遥操作机器人数据虽提供精确动作监督,但采集成本高、多样性有限。本实验表明,利用经过过滤和标注的自我中心数据预训练,再通过少量机器人数据对齐动作空间,可超越纯机器人数据预训练的性能。这一发现颠覆了“精确动作监督为必需”的假设,为具身基础模型指明了经济、可扩展的新路径:大规模自我中心视频预训练 + 小样本机器人微调。实验也强调数据处理管道(如质量过滤、伪动作标注)对效果至关重要,未来可进一步探索数据筛选策略。

行业影响

落地场景

该工作揭示了以第一人称人类视频作为具身预训练数据的巨大潜力,直接降低了对昂贵遥操作机器人数据的依赖。其核心产出(预训练模型 + 数据筛选流水线)可迅速落地于:

  • 仓储物流机器人:利用佩戴摄像头的人类操作员的拣选、搬运视频进行预训练,然后用少量遥操作数据微调,加速新仓库环境下的策略部署。
  • 家庭服务机器人:通过大规模第一人称日常活动视频(如烹饪、清洁)学习多样化的世界表征,再用目标机器人本体少量标注数据对齐动作空间,使机器人快速适应非结构化家庭环境。
  • 工业协作机械臂:在柔性制造场景中,利用人类工人执行装配任务的视频进行预训练,减少对每道工序重新编程或人工示教的需求。

商业价值

  • 降本:数据采集成本大幅下降,第一人称视频可通过低成本运动相机、AR 眼镜甚至手机大规模收集,而遥操作机器人单轨迹成本高昂。模型预训练阶段不再需要昂贵的机器人硬件和遥操作设备,大幅降低具身智能的研发门槛。
  • 增效:预训练模型在同量数据下验证损失降低 24%,分布内/外任务成功率提升 52.5% 和 90%,意味着机器人策略泛化能力更强,部署到新场景时所需微调数据更少,上线周期显著缩短。
  • 体验提升:更丰富的行为多样性和环境多样性使机器人能够应对长尾场景,提升服务机器人的自主性和鲁棒性。

与现有产品/工作流的接口

该方法可无缝嵌入当前端到端模仿学习或视觉-语言-行动(VLA)模型训练流程:

  • 数据层:在现有数据采集管线中加入第一人称视频过滤与标注模块(如使用图像-文本对齐模型自动化标注动作特征),与原本遥操作数据混合或分阶段预训练。
  • 模型层:可直接与主流具身模型(如 RT 系列、Octo 等)兼容,作为初始化权重或采用两阶段训练策略:先在大量人类视频上学习视觉-动作表征,再用少量机器人数据微调。
  • 评估层:验证集中的动作预测损失和实际任务成功率可作为数据质量评估指标,指导是否需要补充机器人数据或调整过滤策略。

具体落地 use case

  1. 智能仓储拣选:某物流方案商可让仓库工作人员佩戴轻便头戴摄像头,采集数百万帧拣选动作视频,用于预训练拣选策略模型,再仅用 1 小时遥操作数据微调,部署至不同品牌的移动操作机器人上,实现新仓库的快速冷启动。
  2. 辅助型居家机器人:基于 YouTube 等平台上大量第一人称烹饪视频,预训练一个通用的厨房操作表征,然后针对特定桌面清扫机器人本体收集 100 条遥操作轨迹微调,使其学会开抽屉、收拾餐具等任务,将产品从单一功能扩展到多任务服务。

局限

  • **数据过滤与标注管道依赖人工设计且域迁移泛化性待验证**:论文中强调通过精心设计的过滤与标注流水线处理自我中心视频,但该流水线的参数与规则可能针对使用的特定数据集(如大规模自我中心视频库)和下游机器人任务高度定制。不同场景(如不同机器人形态、不同环境)可能需要重新调整过滤策略与标注模型,自动化标注的噪声与错误可能影响预训练表征质量。论文未充分讨论该管道在其他自我中心数据源上的迁移成本与性能变化。
  • **后续动作空间对齐仍需真实机器人数据,且最少数据量未知**:尽管预训练阶段使用低成本自我中心视频,但模型仍需在少量真实机器人轨迹上进行微调以映射动作空间。论文中观察到的显著提升建立在有一定量(可能仍不少)真实机器人微调数据的基础上,对于极度稀缺机器人数据的场景,这种范式能否维持优势尚不明确。此外,不同任务所需的最少机器人数据量差异会影响该范式的实际可扩展性。
  • **实验仅在单一机器人平台与任务类型上验证,普适性存疑**:当前对比实验在一个机器人平台和有限任务集上进行,且分布外任务可能仍属同一操作域。结论“自我中心视频可超越真实机器人数据”能否推广到更复杂的移动操作、力控精细任务或不同观察模态(如触觉)的机器人上尚未知。若扩展到其他机器人形态,自我中心视频中的手部动作可能无法直接对应末端执行器运动,动作对齐的难度会增加。
论文Juncheng Ma2026-06-18原文

相关内容