ActiveMimic: 具有主动感知的自中心视频预训练
自中心人类视频为机器人预训练提供了一种可扩展的替代方案,但基于此类视频预训练的模型始终不如基于机器人数据预训练的模型。我们将这一差距归因于缺失的信号——自中心视频中的主动感知行为,即人类在操作过程中不断调整视角,导致标准预处理将其视为噪声的相机运动。 为解决这一问题,我们提出ActiveMimic预训练框架,该框架从单个身体佩戴的RGB相机中恢复同步的相机与手腕轨迹,将相机运动建模为视角动作,从野生自中心人类视频中联合学习主动感知与操控,再适配到目标机器人。 实验表明,在多种需要不同程度主动感知的任务中,ActiveMimic一致超越基于人类视频预训练的基线,并匹配基于机器人数据预训练的SOTA模型。进一步分析证明,主动感知能力源于自中心人类视频预训练而非机器人特定微调,证实主动感知是解锁自中心人类视频用于机器人预训练的关键。
论文精读
TL;DR ActiveMimic 从自我中心人类视频恢复摄像头主动感知轨迹,联合学习视角操控与操作,解决了人类视频预训练长期不如机器人数据的关键瓶颈,使机器人学会像人一样主动调整视角去完成任务。
问题
问题背景
机器人操作策略的预训练面临数据短缺,自我中心人类视频 (egocentric video) 因其易采集、行为丰富成为可扩展的替代数据源。然而,直接基于此类视频预训练的模型,在下游机器人任务上性能始终落后于使用真实机器人数据预训练的模型。
现有方法局限
主流做法将自我中心视频视为固定视角的观察序列,直接将相机捕获的连续帧输入模型,未对相机运动信号进行显式建模。实际中,人在操作时不断转动头部或移动身体以改变视线,这些相机运动在标准流程中被当作噪声或无关量,导致:
- 模型无法区分环境动态与主动视点变化,表征中混入大量无关信息;
- 预训练学到的策略缺失了主动感知 (active perception) 行为,即“何时转动头颈、如何调整视角以获取任务关键信息”的决策能力;
- 预训练表征与需要主动调整视点的机器人策略之间存在较大分布鸿沟,限制迁移效果。
为什么这个问题难 / 重要
恢复并利用主动感知信号面临双重挑战:
- 信号解耦难:单目 RGB 视频中,相机自身运动与场景动态强耦合,从纯视觉输入中恢复出相机轨迹和手部操作轨迹需要有效的三维几何推理,且必须处理尺度模糊和遮挡;
- 行为学习难:主动感知是一种序贯决策行为,要求模型预测未来视点,并与操作动作协同优化。学术界近年关注将具身智能的感知-行动闭环扩展到观察行为,工业界也正寻求不依赖昂贵机器人数据的预训练范式,因此解决该缺口兼具理论价值与工程紧迫性。
行业类比
类似自动驾驶领域,纯端到端模仿学习若只克隆驾驶动作而忽略驾驶员何时转头观察盲区、如何分配注意力,往往在复杂路口决策时失效,显式建模观察动作能补全缺失的决策链。
核心洞察
- 将相机运动建模为视角动作而非噪声,是弥合自视视频与机器人数据性能差距的关键。传统视频预训练通常将人类视角变化视为干扰,而 ActiveMimic 视其为主动感知行为,并联合学习视角调整与操作动作,使模型在真实机器人任务中表现媲美甚至超越仅用机器人数据预训练的 SOTA 模型。
- 实验证明,主动感知能力源自自视视频预训练阶段,而非后续的机器人微调。这意味着大规模自视人类视频中天然蕴含着可迁移的感知策略,其价值被长期低估;授权此类数据用于机器人预训练,不仅降低了对昂贵机器人采集的依赖,也为兼顾泛化性与主动视觉的操控模型开辟了新路径。
方法
从自我中心视频到统一动作空间
- 输入:单目 RGB 头戴摄像头采集的自我中心人类视频,包含丰富的手部操作与相机运动。
- 轨迹恢复:从视频中联合恢复 相机轨迹 和 手腕轨迹,并处理二者耦合(手部运动自然引起视点变化),得到度量尺度的同步动作序列。
- 统一表示:将相机运动建模为 视角动作(viewpoint action),与手腕操作动作合并为一个 27 维动作空间(例如 6D 相机位姿 + 21D 手部动作),使得主动感知与物理操控在同一语义空间内被表征。
模型架构与训练策略
- 序列建模:采用基于 Transformer 的架构,输入多帧视频,输出对应的 27 维动作序列预测。
- 联合损失:训练目标同时监督相机运动(视角动作)和手腕运动(操作动作),强迫模型学习感知与操作的耦合模式。
- 两阶段训练:
- 预训练:在大规模野外自我中心人类视频上进行动作预测训练,利用恢复的轨迹标签引导模型掌握主动感知先验;
- 下游适配:将预训练模型微调至目标机器人平台,通过轻量适配层将人类动作空间映射到机器人执行空间。
与同类方法的关键差异
以往方法将自我中心视频中的相机晃动视为噪声而加以抑制或滤除,ActiveMimic 则 首次将其作为主动感知信号引入训练目标,从而让模型在预训练阶段即学会“如何移动视点以辅助操作”,这是其达到与机器人数据预训练同等性能的核心原因。
实验
实验设计
ActiveMimic 在 in-the-wild 自我中心人类视频 上预训练,从中恢复 同步的相机与手腕轨迹,并建模相机运动为 视点动作,形成 27 维统一动作空间。预训练后,模型迁移到 真实世界人形机器人 上,在多个需要不同 主动感知 能力的操作任务上评估。对比方法包括:(1) 基于人类视频的预训练基线(将相机运动视为噪声或忽略),(2) 基于机器人数据的 SOTA 预训练方法。
核心发现
- ActiveMimic 在所有任务上 一致超越 所有人类视频预训练基线。
- 其性能 匹配 甚至部分超过 用机器人数据预训练的 SOTA 模型。
- 消融分析表明,主动感知能力主要源于 自我中心视频预训练阶段 对相机运动信号的建模,而非下游的微调;这确认了 主动感知是解锁自我中心视频用于机器人预训练的关键因素。
与基线对比的深度解读
标准人类视频预训练常将相机运动视为噪声并去除,导致信息丢失,模型无法理解观察者自主动作对视角的影响,因此在需要主动调整视点的任务上表现不佳。ActiveMimic 通过 恢复相机与手腕轨迹,把相机运动显式建模为动作,使得预训练模型能 同时学习主动感知与操作,弥合了与机器人数据预训练的差距。这一发现对工程实践的直接启示是:对于移动操作场景下的视觉预训练,不应简单丢弃 ego-motion,而应将其转化为监督信号,以提升策略的视角调整与任务执行之间的协同能力。
行业影响
落地场景
ActiveMimic 解决的核心矛盾是:将大规模、低成本的以自我为中心的人类视频(egocentric video)转化为机器人操作预训练的有效监督信号。这项工作直接瞄准通用机器人操作模型的规模化数据瓶颈。
- 具身智能产品:人形机器人、移动操作臂、家用服务机器人等产品在部署前需要大量操作技能预训练。ActiveMimic 使得直接从 YouTube 等平台的日常第一人称视频中提取训练信号成为可能,大幅降低对昂贵遥操作或真实机器人采集的依赖。
- 自动驾驶与辅助驾驶:车辆的环视或舱内第一视角数据同样存在视点主动调整行为,可将驾驶员转头、调整后视镜等行为建模为“视点动作”,提升预测模型对主动感知行为的理解。
- 增强现实/虚拟现实 (AR/VR):头显设备记录的第一人称交互序列可被复用,使虚拟助手或空间计算模型具备主动调整虚拟视角的能力,优化交互自然度。
商业价值
商业收益主要来自降低机器人数据采集与标注成本,同时提升策略模型的泛化能力。
| 价值维度 | 具体表现 |
|---|---|
| 降本 | 机器人预训练数据从昂贵的遥操作采集(约 $100 / 条以上)转向互联网级别的自我为中心视频(近乎零成本),大幅削减数据基础设施投入。 |
| 增收 | 更强的泛化能力使同一套模型可快速适配不同硬件形态与任务场景,缩短产品上市周期,抢占长尾场景服务市场。 |
| 体验提升 | 机器人主动调整视点以寻找最佳操作角度,减少遮挡与传感盲区,提高任务成功率与交互流畅度,直接改善用户体验。 |
作者通过实验证明,基于人类视频预训练的 ActiveMimic 在多种需要主动感知的真实任务中,性能持平甚至超越基于真实机器人数据预训练的 SOTA 模型,验证了其商业替代方案的可行性。
与现有产品/工作流的接口
ActiveMimic 的输出是一个统一的 27 维动作表征(相机六自由度位姿 + 手腕轨迹),其预训练模型可平滑接入现有的模仿学习或强化学习训练栈。
- 集成路径:
- 收集或获取第一人称人类操作视频,利用 ActiveMimic 的轨迹恢复与耦合解决模块自动生成训练标签。
- 在统一动作空间上预训练一个视觉-运动 transformer(或类似架构),学习主动感知与操作的联合策略。
- 将预训练权重迁移到目标机器人模型,仅需少量机器人特化数据(fine-tuning)即可部署。
- 与现有工作流的关系:该框架可作为数据预处理与预训练阶段的前置插件,与 Behavior Cloning、RLPD 等下游策略训练方法无缝衔接。其相机运动监督信号亦可作为现有机器人预训练框架(如 R3M、Voltron)的额外上游任务。
具体落地用例:
- 仓储机器人:电商履约中心的分拣与补货任务中,机器人需要在密集货架间主动移动头部相机以观察物品堆叠状态。使用现场操作人员佩戴的摄像头拍摄的日常补货视频即可完成预训练,避免在真实仓储环境进行昂贵的遥操作采集。
- 远程操作手术辅助机器人:医疗场景中,医生头部与手腕的动作共同构成精细操作轨迹。从公开的腹腔镜手术第一人称视频中恢复相机与器械运动,可预训练手术机器人主动调整内窥镜视角的能力,加速产品迭代并降低对稀缺专家时间的占用。
局限
- **数据规模与形态多样性有限**。论文所采用的预训练视频规模(数千小时)相较于互联网级自我中心视频(如 Ego4D)仍较小,作者也指出扩大视频量可能带来性能提升。此外,当前实验仅在单一人形机器人平台上验证,未涉及多机器人形态,因此方法在不同形态(如移动机械臂、四足机器人)上的泛化性尚未证实。
- **标签恢复精度存在噪声**。从单目 RGB 恢复相机与腕部轨迹需通过结构运动恢复(SfM)和逆运动学等估计,会引入不可忽视的误差。作者在 limitation 中承认标签保真度是瓶颈,尤其是在遮挡、快速运动及光照剧烈变化场景下,恢复出的 27 维动作表示可能与真实值存在偏差,影响模型学到的主动感知策略。
- **任务场景与交互模式受限**。当前工作聚焦于桌面操作类任务,未涉及移动操控(loco‑manipulation)或需要人机交互的复杂协调场景。真实世界中机器人通常需要边移动边操作,并与人协同,这些场景中主动感知的动态特性远复杂于静态桌面环境,现有框架难以直接迁移。