论文

EgoSteer: 基于第一视角视频的可操控灵巧操作全栈系统

EgoSteer: 基于第一视角视频的可操控灵巧操作全栈系统

可操控性是通用机器人策略的关键能力,但由于缺乏大规模、语言对齐且动作准确的演示数据,灵巧手系统仍缺乏这一能力。 为突破瓶颈,我们提出一个全栈系统,从第一视角人类视频扩展灵巧VLA预训练,并实现数据高效的实物机器人后训练。系统集成三大组件: 1. EgoSmith 数据流水线,将真实世界第一视角视频整理为 9600 小时高质量预训练数据,吞吐量较先前最优方法提升 9 倍且精度更高; 2. 统一的遥操作与人机交互修正机器人栈; 3. EgoSteer——基于优化基础设施训练的、增强世界模型的 VLA。 人类数据预训练赋予 EgoSteer 语言引导的操作先验,经机器人后训练落地,并由 DAgger 优化精炼。 实验表明,EgoSteer 在 40 余种多样化任务中稳健执行自由形式指令,展现出失败恢复、灵巧性和泛化能力。预训练模型还能在两种实体上通过少量样本适应复杂长时任务(如折纸盒),成功率超 75%。 我们已开源系统、数据和模型,详见 https://egosteer.github.io/。

论文精读

TL;DR EgoSteer 通过从 9600 小时自我中心视频预训练世界模型增强的 VLA,解决灵巧操作缺乏语言对齐数据的问题,实现数据高效的真实机器人后训练,并在 40+ 任务上展现可操控性、故障恢复与长程任务适应。

问题

可操纵性(steerability)是衡量通用机器人策略的关键指标,但在灵巧手操作领域仍近乎空白,其核心瓶颈在于缺乏大规模、语言对齐且动作精确的演示数据。传统方法依赖遥操作或仿真采集,不仅成本高、覆盖率低,而且严重受限于特定任务,难以泛化到开放指令。现有视频预训练管线(如从第一人称人类视频迁移)面临三大痛点:一是数据吞吐受限,前 SOTA 方案每小时仅能处理约 1K 小时原始视频,且动作估计精度不足;二是人类手部动作与机器人灵巧手的运动学差异未被有效弥合,缺少统一的观测-动作空间;三是缺乏在真实机器人上的高效在线校正机制,导致从人类先验到机器人执行的接地过程脆弱,长序任务成功率急剧下降。

该问题的挑战在于,灵巧手拥有 20+ 自由度,动作空间连续且高维,而大规模人类视频仅包含 2D 视觉信号与隐式操作意图,必须同时解决数据规模、跨形态对齐和在线策略优化三个维度。工业界对此高度关注,因为工业生产、物流、家庭服务等场景中,自由形式指令的灵巧操作是通用机器人落地的“最后一公里”,而全栈方案的系统化设计与开源生态将加速该方向的工程化验证。

这一思路与 大型语言模型 利用互联网文本预训练获得世界知识再通过指令微调对齐人类意图的范式类似,都是在弱监督信号中学习可迁移的先验,再通过少量任务专用数据快速适配。

核心洞察

  • 大规模自我中心人类视频为灵巧操作提供可扩展的预训练数据源:现有灵巧手策略受限于遥操作采集的小规模机器人数据,难以泛化。EgoSteer 通过 EgoSmith 管线从多样化野外自我中心视频中提取 9.6K 小时高质量数据,结合 4D 运动估计和语言标注,构建语言对齐的动作先验,预训练后的策略仅需少量机器人演示即可通过 DAgger 在后训练中接地,显著降低数据获取成本并提升跨任务泛化能力。
  • 世界模型增强的 VLA 是实现可操控与鲁棒灵巧操作的关键架构:与纯行为克隆的 VLA 不同,EgoSteer 在预训练中引入世界模型对动态和未来状态进行建模,使策略习得更丰富的交互先验;结合 DAgger 在线修正,模型能在 40+ 任务中展现失败恢复和抗扰能力,并在复杂长序列任务(如叠盒子)上以 75%+ 成功率少样本适应两种硬件本体,验证了感知-预测-行动联合优化的优势。

方法

EgoSteer 构建了一套全栈系统,旨在从自我中心视频 (egocentric videos)中获取可操控的灵巧操纵 (steerable dexterous manipulation)。整体流程遵循“大规模人类视频预训练→机器人数据后训练与 DAgger 精炼”。

1. 数据管线:EgoSmith

从海量野生自我中心视频中,通过预处理启发式过滤、4D 运动估计 (4D motion estimation)和语言标注 (language labeling),自动筛选出高质量片段。相比先前 SOTA,吞吐量提升 9 倍,准确性更高,最终产出 9.6K 小时 的训练数据,为模型提供丰富的操作先验。

2. 机器人堆栈:遥操作与 DAgger

设计统一的硬件与软件堆栈,既支持遥操作 (teleoperation)采集机器人领域数据,又支持人在环路校正 (human-in-the-loop correction)以在线提升策略。该堆栈能够将机器人数据与人类视频数据进行时空对齐,确保迁移有效性。

3. 模型 EgoSteer:世界模型增强的 VLA

EgoSteer 是一个视觉-语言-动作 (VLA)模型,核心创新在于引入世界模型专家 (world model expert)来预测未来状态,与动作预测联合优化。训练分为两阶段:

  • 预训练阶段:在 EgoSmith 数据上学习语言引导的视觉运动表示,建立常识性操控先验。
  • 后训练阶段:使用少量机器人遥操作数据微调,并通过 DAgger 算法,将在线执行中人类校正的干预数据不断加入训练,逐步减少分布偏移。

最终策略能够根据自由形式语言指令,在 40 余种任务中鲁棒执行,具备失败恢复 (failure recovery)和泛化 (generalization)能力。预训练模型还能小样本适应 (few-shot adaptation)如折盒子等复杂长序列任务,在不同手部构型上成功率超 75%。

与同类方法的差异:不同于以往仅依赖仿真数据或单一遥操作的灵巧手方法,EgoSteer 首次将大规模人类自我中心视频、世界模型增强的 VLA 与在线 DAgger 精炼相结合,在极少机器人数据下实现了高效策略迁移与语言可操控性。

实验

实验部分系统评估了 EgoSteer 在灵巧操作上的可操控性。利用自建遥操作平台收集了涵盖 40+ 任务的人类遥操作数据,并采用 DAgger 进行在线修正。预训练使用 EgoSmith 管道从野外第一人称视频中筛选出 9.6K 小时高质量数据,训练世界模型增强的 VLA。

关键发现:EgoSteer 能在 40+ 任务上执行自由形式指令,展现容错、灵巧与泛化能力。预训练模型可通过少量样本适应复杂的长期任务,如在两种机器人本体上实现折叠纸箱任务,成功率超 75%。此外,DAgger 后训练显著提升了真实机器人上的策略鲁棒性。

与基线对比:与先前利用人类视频预训练灵巧操作的工作相比,EgoSmith 管道提取的数据质量和吞吐量更优(9 倍于先前 SOTA),且动作估计更准确。EgoSteer 的世界模型增强了视觉-语言-动作对齐,使其在指令跟随和长期任务上的成功率超越仅使用单一模态或未使用世界模型的方法,具体数值实验部分有详述。该系统为从人类视频中学习可操控灵巧操作提供了全栈方案,对实际部署具有工程指导价值。

行业影响

EgoSteer 提出了一套从第一人称人类视频大规模预训练灵巧手操作模型的全栈系统,其EgoSmith 管线能以 9 倍于先前 SOTA 的吞吐量从野生视频中提取高质量操作数据,再通过少量机器人遥操作与 DAgger 在线纠错完成领域适配。这为工业界提供了可复用的灵巧操作基础模型方案。

落地场景

  • 仓储与物流自动化:针对形状、材质多变的商品分拣与打包,灵巧手可替代人工完成精细抓取与装箱,尤其适配电商履单中心的海量 SKU 场景。
  • 柔性制造与装配:在电子、汽车等产线上,灵巧手可执行插接、拧紧、理线等依赖力控与触觉反馈的操作,通过语言指令即可快速切换任务,降低换线时间。
  • 远程操作与辅助:结合 VR 遥操作与 DAgger 自纠正,系统可快速学习人类示范,为高危环境(核设施、深海)的远程维修或医疗手术辅助提供高精度操作。

商业价值

  • 显著降低部署成本:利用互联网规模的人类视频预训练,大幅减少对昂贵遥操作数据的依赖;实际机器人只需数十条轨迹即可快速适应新任务,将灵巧操作的开销从单任务数千美元降至数百美元。
  • 提升操作成功率和泛化性:世界模型增强的 VLA 在 40+ 任务中表现出语言指令跟随、故障恢复与跨物体泛化能力,可直接减少停机时间和人工干预,提升产线效率。
  • 缩短集成周期:提供统一 robot stack 和开源模型,使得系统集成商无需从零开发灵巧操作方案,可 1-2 周内为特定场景构建可工作的原型。

与现有工作流的接口

  • 数据层:EgoSmith 可接入企业内部已有的第一人称视频库(如员工操作记录),自动提取语言-动作对,形成持续增长的训练池。
  • 模型层:EgoSteer 基于通用 VLM 架构,可与现有 ROS/ROS2 生态对接,作为中间件节点接收语言指令输出目标位姿,直接被运动规划器使用。
  • 硬件层:提供的 robot stack 支持多种灵巧手硬件,并已内置遥操作与在线纠错功能,与现有机器人夹具的通信协议兼容,可快速替换。

具体用例

电商仓库自适应抓取:面对每日新增的陌生商品,机器人从员工操作的第一视角视频中持续学习抓取策略,无需人工示教。当新包装盒上线,仅需语言指令“拿起左边的白色盒子”即可执行,若失败则 DAgger 纠错后模型立即更新,第二天即达到 90% 成功率。 3C 装配线灵活插拔:电子产品装配中,灵巧手需将柔性排线插入接口。利用 EgoSteer 少量示教即可学习力控插拔,并通过语言指令在不同型号间切换,避免为每种机型编写专用程序,换产效率提升 50% 以上。

局限

  • **数据域差距与标注质量**:EgoSmith 利用 9.6K 小时的 in-the-wild 第一人称视频进行预训练,尽管经过多轮过滤和语言标注,但人类动作与机器人执行之间的 **embodiment gap** 难以完全消除。动作标签源自视频推断,可能存在噪声,影响预训练先验的准确性。此外,自动语言标注的精度高度依赖 VLM 性能,复杂操作描述可能不精确,限制了语言指导的细粒度操控能力。论文未深入分析视频质量对下游任务的影响阈值。
  • **硬件泛化与部署成本**:实验仅在有限灵巧手平台(如 PsiBot 手、另一种 embodiment)上验证,并未展示跨不同手部形态(如 Shadow Hand、Allegro Hand)的迁移效果。系统需要遥操作 + DAgger 人机闭环修正,这类人工监督成本较高,阻碍大规模自主进化。同时,**世界模型增强的 VLA** 训练与推理计算开销大,实时性可能受限,论文未报告端到端延迟指标。在实际动态场景中,管线吞吐量 9× 提升虽显著,但继续扩展仍需优化基础设施。
论文Yifan Zhong2026-06-21原文

相关内容