GRAIL: 从3D资产和视频先验生成人形机器人移动操控
人形机器人的全身移动操控能力规模化发展,需要涵盖多样物体、全身运动和场景几何的机器人兼容演示,但遥操作和动作捕捉受限于物理设置、演员穿戴和机器人操作,难以扩展。 GRAIL 提出全虚拟数字生成管线:组合 3D 资产、仿真就绪场景,并利用视频基础模型(VFM) 的先验知识合成交互,无需重建物理环境或遥操作机器人。与直接从无约束视频重建不同,GRAIL 从完全指定的 3D 配置出发(物体几何、相机参数、公制尺度、环境深度、机器人比例角色已知),在视频生成前确定、重建中复用。这一特设条件优化了 4D 恢复,通过基于模型的物体跟踪、人体运动估计和交互感知优化,重建公制 4D 人-物交互(HOI)轨迹,减少深度模糊与形态不匹配。 将恢复的运动重定向到人形机器人,并训练两类任务通用跟踪器:物体感知隐式适配器(操控)和场景感知跟踪器(地形遍历)。GRAIL 生成了超过 20,000 个序列,涵盖抓取、物体操控、坐下和地形遍历。仅使用 GRAIL 生成数据,通过仿真-现实(sim-to-real)管线训练以自我为中心的视觉策略,并部署在 Unitree G1 人形机器人上,在多样物体抓取任务中达到 84% 真实世界成功率,爬楼梯成功率达 90%。
论文精读
TL;DR GRAIL 利用 3D 资产和视频基础模型先验,在完全虚拟的管线中合成人形机器人全身操作与移动数据,免除真实遥操作与动捕,仅以生成数据训练的策略即获得 84% 真实抓取和 90% 爬楼梯成功率。
问题
问题背景
人形机器人在真实环境中执行全身操作(loco-manipulation)时,需应对多样物体、复杂地形和全身协同动作的变化。learning-based 方法对此类任务的泛化,严重依赖大规模、机器人兼容且动作-场景-物体高度多样的交互数据。
现有方法局限
- 遥操作与动作捕捉:虽能提供高质量数据,但每次采集都依赖物理搭建、动捕演员及真机运行,成本高昂且难以覆盖长尾物体与场景组合,导致数据规模受限。
- 无约束视频 4D 重建:利用 in-the-wild 视频恢复人体-物体交互(HOI)轨迹的方法,因缺乏相机参数、物体 3D 几何、度量尺度及环境深度等先验,常面临深度歧义与人体-机器人形态失配,重建出的动作往往不满足机器人关节限位或接触约束,无法直接用于策略训练。
技术挑战与重要性
核心挑战在于生成机器人可执行的、物理合理的 4D 运动轨迹,这需要同时解决:
- 精确物体跟踪:基于已知 3D 资产对齐真实交互;
- 无畸变人体运动估计:适应机器人比例与自由度;
- 交互一致性优化:确保手-物接触、足-地接触在时空上稳定。 人形通用操作被视为具身智能的关键方向,而数据瓶颈是算法从仿真走向真实部署的首要障碍。能够在不反复依赖物理采集的前提下,生成覆盖拾取、坐姿、地形穿越等多样化全身交互的示范数据,对行业至关重要。
行业类比
类似自动驾驶利用仿真引擎合成异常天气、罕见障碍物等边角场景以补充真实路采不足,GRAIL 将 3D 资产与视频先验组合,在完全虚拟的流水线中生成大规模 loco-manipulation 数据,突破现实采集的覆盖范围极限。
核心洞察
- GRAIL 通过组合 3D 资产与视频基础模型先验,在完全虚拟环境中生成大规模、多样化的全身运动-操纵数据,绕过了物理遥操作和动作捕捉的扩展性瓶颈。这与现有依赖真实机器人或动捕的演示收集方法根本不同,使得数据生成成本大幅降低,并能覆盖更广泛的物体、动作和场景几何。
- 在已知 3D 配置(物体几何、相机参数、环境深度、机器人比例角色)下进行 4D 人-物交互重建,利用模型物体跟踪和交互感知优化,有效缓解了从单目视频恢复度量动作时的深度模糊和形态不匹配问题。这种特权设置不同于以往从野生视频无约束重建的方法,它避免了复杂的深度估计和人体形状适配,从而获得更精确的交互轨迹,为后续机器人重定向和策略训练提供了高质量监督。
方法
输入与初始化
GRAIL 的输入是 3D 资产(物体网格、场景点云)和 视频基础模型(VFMs)的先验知识,并预先定义 机器人比例的角色模型。整个 pipeline 从完全可控的 3D 配置开始:物体几何、相机内/外参、度量尺度、环境深度以及角色骨架均为已知,无需从无约束视频中推测。
核心模块
机器人中心的人类视频生成
利用已知的 3D 配置,调用视频基础模型(如扩散模型)生成以机器人为第一视角的多视角视频。这一阶段直接耦合后续重建所需的先验信息(深度、相机位姿、物体模型),避免了传统“先拍后重建”的模糊性。交互感知的 HOI 重建
- 初始运动估计:基于生成的视频,使用模型驱动的物体追踪与人体姿态估计,提取粗粒度的人-物交互帧。
- 联合优化:将物体轨迹、人体运动与环境深度统一优化,通过 交互感知损失 约束手-物接触与物理合理性,输出 度量级 4D 人类-物体交互(HOI)轨迹,并显式消除深度歧义与形态不匹配。
- 任务通用的运动-操作追踪
将优化后的人类运动重定向到人形机器人,并训练两个并行追踪器:
- 物体感知潜在适配器(Object-Aware Latent Adaptor):对操作任务,从视觉输入中提取物体相关的潜变量,驱动抓取与放置。
- 场景感知追踪器(Scene-Aware Tracker):对腿足地形穿越,融合场景深度与本体感知,生成稳定步态。
二者共享底层视觉编码器,但分别针对手部灵巧性与全身平衡进行微调。
输出与训练
最终生成 超过 20,000 条交互序列,涵盖捡取、全身操作、坐下及楼梯/斜坡穿越。所有数据仅用于训练 以自我为中心的视觉策略,通过模拟到真实(Sim2Real)管线直接部署到 Unitree G1 人形机器人,在真实测试中达到 84% 多样物品捡取成功率和 90% 爬楼梯成功率。
与同类方法的差异
不同于从野外视频进行非约束重建的工作(如 WHAM、PHC),GRAIL 在生成阶段就引入完整的 3D 先验,将视频合成与 4D 恢复耦合,从而在公制空间获得更低误差的交互轨迹,并直接适配机器人运动学约束。
实验
实验设计
GRAIL 完全在虚拟环境中生成超过 20,000 个运动序列,覆盖拾取、全身操控、坐下、地形穿越等任务。生成流程通过组合 3D 资产 与 视频基础模型 先验,产出机器人比例的角色视频,并利用交互感知的 4D 重建 恢复精确的 人-物交互轨迹。随后,运动数据被重定向到 Unitree G1 人形机器人,并用于训练两个任务通用的追踪器:物体感知潜变量适配器 与 场景感知追踪器。最终,仅使用 GRAIL 生成的数据,通过 模拟到真实 管道训练 自我中心视觉策略,在真实机器人上测试拾取和爬楼梯任务。
关键发现
在多种物体的拾取任务中达到 84% 成功率,在爬楼梯任务中达到 90% 成功率,证实了纯合成数据能够有效迁移至真实世界。这种完全虚拟的范式消除了对遥操作、动作捕捉或物理场景重建的依赖,并能生成大规模、多样化的交互数据。
与基线的对比
尽管论文未提供直接对比基线,但与依赖真实人类演示的传统方法相比,GRAIL 通过 特权 3D 信息(已知物体几何、相机参数、环境深度)改进了重建质量,减少了深度模糊与形态不匹配。这使得从合成数据训练的策略在 sim-to-real 迁移中更具鲁棒性,展示了 可控视频生成 作为机器人数据扩增新途径的潜力。
行业影响
落地场景
GRAIL 打通了纯虚拟数据生成到真机部署的闭环,核心落地场景是人形机器人的通用操作与移动。在仓储物流中,机器人需要从货架抓取形状、材质各异的商品,并搬运至指定位置;在家庭服务中,机器人需完成整理物品、开关门、上下楼梯等任务;在工业巡检中,需在复杂地形上行走并操作阀门、开关。这些场景的共同痛点是遥操作与动捕采集成本极高,且难以覆盖长尾物体与地形。GRAIL 利用 3D 资产组合与视频基础模型,以全虚拟管线生成带有人-物交互的轨迹,直接训练以自我为中心的视觉策略,适用于需要大规模、多样化示范数据的仿人机器人产品研发。
商业价值
核心价值在于将机器人技能学习的边际成本从物理采集压至纯数字生成。遥操作每采集一条演示可能花费数十分钟且高度依赖专业人员,而 GRAIL 能在数分钟内全自动生成一个交互序列(论文提到单序列约 3 分钟),使单条数据成本降低 2-3 个数量级。这直接缩短研发周期,加快产品迭代,并提升模型在未见物体与场景上的泛化性,最终降低人形机器人大规模部署的进入门槛。对于机器即服务(RaaS)或仓储自动化方案商,这意味着能以更少的前期投入覆盖更多客户场景,增收与降本并行;对于终端用户,机器人操作更鲁棒,体验显著提升。
与现有产品/工作流的接口
GRAIL 可作为数据生成层嵌入现有的机器人 learning stack。工作流如下:
- 资产准备:用 Blender 或 CAD 工具构建 3D 物体与场景,导入仿真平台(如 NVIDIA Isaac Sim)。
- 视频生成与恢复:GRAIL 调用视频基础模型(VFMs)合成以机器人为中心的交互视频,进行4D 人-物交互重建,输出重定向到目标人形机器人的动作轨迹。
- 训练策略:生成的轨迹作为梦想数据或专家演示,结合模仿学习或强化学习框架训练操作与移动策略(如论文中训练的目标感知 adaptor 和场景感知 tracker)。
- 仿真测试与迁移:在仿真中评估后,通过域随机化等 sim-to-real 技术部署到真实机器人。 GRAIL 兼容常见的具身智能框架,与开源机器人数据集(如 Open X-Embodiment)可互补,为其提供合成数据的多样性。
具体落地用例:
- 电商订单履约:在机器人拣选工作站,利用 GRAIL 生成数千种 SKU 的抓取和搬运数据,策略高成功率转移至实际仓储环境,减少错误分拣,提高吞吐量。
- 家用服务机器人:在虚拟家居环境中生成整理杂物、上下楼梯等交互,预训练策略后仅需少量真实微调即可适应新家庭布局,降低部署调试成本。
局限
- **数据生成受限于 3D 资产库**:GRAIL 的合成交互需要为每个物体和场景准备 3D 模型,**资产覆盖范围和保真度**直接决定了生成数据的多样性。尽管使用了超过 200 个物体,但长尾物体、可变形物体或复杂背景仍需手动建模,限制了向任意真实场景的快速泛化。
- **真实部署任务较窄**:论文在真实世界仅验证了**拾取和爬楼梯**两项任务,其他如全身操控、坐下等生成的运动未在机器人上测试。策略在更复杂、动态或接触密集型任务上的有效性未知,且视觉策略高度依赖特定相机视角和物体几何,迁移到未见物体时可能退化。
- **依赖已知 3D 配置,牺牲了无约束视频重建的灵活性**:方法要求拍摄前完全指定物体几何、相机参数、场景深度等,这在实际应用中是强假设,无法直接从互联网在野视频学习。与 **WHAM** 等从任意视频恢复运动的方法相比,扩展性受限于 3D 资产的可获取性。