论文

OASIS: 从仿真数据收集到真实世界人形机器人移动操控

OASIS: 从仿真数据收集到真实世界人形机器人移动操控

机器人操控的近期进展很大程度上依赖于从大规模演示中学习。然而,对于人形机器人移动操控任务,现有数据源在轨迹质量与可扩展性之间迫使一个不满意的权衡。真实世界遥操作提供最高质量的轨迹,但需要专用物理空间和耗时的场景重置。仿真提供了摆脱这一困境的替代方案:它可以在没有物理硬件的情况下,大规模生产清洁、与实施例对齐的数据。 在本文中,我们提出OASIS,一个仿真数据驱动的人形移动操控框架。OASIS使用3D生成模型从真实世界图像自动重建逼真的物体资产。基于这些资产,首先通过仿真中的遥操作收集轨迹,然后在后处理阶段在多种域随机化下进行增强。利用由此产生的仿真数据,我们进一步设计了一个用于人形移动操控的层次化视觉运动策略。 在真实人形机器人上的大量实验表明,在零样本部署下,基于我们仿真数据训练的策略在大多数任务上实现了比基于真实机器人遥操作数据训练的策略更高的成功率,这主要归功于我们的仿真渲染所覆盖的广泛光照和环境变化,而真实机器人数据未能捕捉到这些变化。

论文精读

TL;DR OASIS 通过 3D 生成模型重建物体资产,在仿真中用遥操作与域随机化生成大规模数据,训练层次化视觉运动策略,使人形机器人零样本完成运动操作,性能超越真实遥操作训练。

问题

问题背景

人形机器人 loco-manipulation (移动与操作协同) 被认为是通用机器人进入日常环境的关键能力。当前主流范式依赖从大规模演示数据中学习闭环策略,但数据采集本身成为核心瓶颈。

现有方法局限

业界面临两难:真实世界遥操作 能提供最高质量的轨迹,但每一条数据都需占用专用物理空间、手动重置场景,采集效率极低,且场景光照与布局高度固定,导致训练出的策略泛化能力严重不足仿真数据 虽可以无限生成,但传统仿真资产大多为人工建模,缺乏真实物体的几何与纹理细节,sim-to-real gap 巨大,且域随机化策略往往粗放,难以覆盖真实世界多样性。两者均无法同时满足轨迹质量、场景多样性、数据可扩展性三个需求。

为什么这个问题难/重要

  • 技术挑战:loco-manipulation 的全身协调控制维数极高,轨迹数据同时包含行走、避障、抓取、放置等复杂接触动态,小规模数据极易导致过拟合;而仿真数据的视觉真实性物理保真度必须足够高,才能让策略在零样本部署时应对真实光照、遮挡、材质变化。
  • 业界关注度:人形机器人的通用操作能力是特斯拉 Optimus、波士顿动力 Atlas 等系统的核心追求,但数据采集成本通常是限制技术落地的第一道门槛。如果能用仿真数据替代或大幅减少真实遥操作数据,将极大加速研发迭代。

类比关系

此问题与自动驾驶感知训练的模拟数据问题高度相似:早期纯真实数据面临长尾场景覆盖不全,后来通过仿真生成极端天气、光照、交通异常并结合域随机化,大幅提升了感知模型泛化性。不同的是,人形操作仿真还需克服接触物理的精确建模,挑战更为综合。

核心洞察

  • **仿真数据的视觉多样性可弥补真实遥操作数据的质量优势**:传统观点认为,真实遥操作轨迹质量最高,但 OASIS 证明,通过域随机化在渲染阶段引入丰富的光照、纹理和背景变化,仿真数据能覆盖真实数据难以捕获的环境分布,使策略在零样本部署时对视觉扰动更鲁棒。实验中仿真训练策略的成功率反超真实数据训练策略,说明对于需要应对非结构化环境的 loco-manipulation 任务,训练数据的视觉多样性比单个轨迹的精细度对泛化性贡献更大。
  • **3D 生成模型驱动的自动化资产创建是实现仿真数据管道闭环的关键**:OASIS 利用 3D 生成模型从真实物体图像中重建具身一致的资产,避免了手工建模的巨大开销。结合模拟遥操作和后处理域随机化,该框架无需任何物理硬件即可持续产出大规模、高质量的全身操控数据,打破了数据采集对专用场地和人工重置的依赖,为仿人机器人复杂技能学习提供了可扩展、低成本的数据引擎。

方法

OASIS 提出了一种完全基于仿真数据的人形机器人移动操控框架,其核心思路是:以低成本仿真数据替代昂贵且场景受限的真实遥操作数据,并通过域随机化实现更好的视觉泛化。

输入 → 关键模块

  1. 仿真资产自动构建 输入为真实世界物体图像,利用 3D 生成模型自动重建高保真物体网格与纹理,并估计物理属性(如密度),直接生成可交互的仿真场景,省去人工建模。

  2. 仿真内遥操作与轨迹增强 在构建好的仿真场景中,通过遥操作采集少量高质量全身运动轨迹;随后对每条轨迹进行后处理域随机化——在渲染时随机改变光照、材质、背景、相机视角等,生成大量带有多样化视觉外观的轨迹。这一阶段在不增加操作负担的前提下,成倍放大数据规模。

  3. 分层视觉运动策略

    • 架构:采用分层设计,高层策略根据视觉输入(如目标物体位置)输出身体关键点或末端位姿指令,低层全身控制器将其转化为关节力矩,实现移动与操作的紧密耦合。
    • 训练:使用仿真增强数据,通过行为克隆(监督学习)训练高层策略,低层则借助强化学习或逆运动学平滑执行。训练时引入课程学习滚动收集策略,逐步提高任务难度。

输出与部署

训练出的策略可直接零样本部署到真实人形机器人:仅依赖机载 RGB 相机,无需真实遥操作采集的视教数据。实验表明,其成功率在多数任务上超越真实遥操作数据训练的策略,原因是仿真渲染覆盖了大量真实采集难以穷举的光照与环境变化。

与直接使用真实遥操作数据的方法相比,OASIS 的关键差异在于用可控的视觉域随机化替代了受限的真实数据采集过程,既保留了轨迹质量,又大幅提升了策略对视觉扰动的鲁棒性。

实验

实验设计

OASIS 的实验围绕仿真数据驱动的 loco-manipulation 展开,核心对比的两组数据来源:

  • OASIS 仿真数据:从真实物体图像通过 3D 生成模型重建资产,在仿真中通过遥操作收集基础轨迹,再经域随机化(光照、纹理、物理参数等)后处理扩增;
  • 真实遥操作数据:直接在真实环境远程操控机器人收集的轨迹。

策略均为分层视觉运动策略,在真实人形机器人上零样本部署,测试多项日常生活操作任务的成功率。

关键发现

  • 仿真数据训练的模型在多数任务上成功率反超真实遥操作数据训练的模型,逆转了“真实数据质量更优”的常规认知。
  • 成功的关键来自仿真渲染覆盖了广泛的光照和环境变化,域随机化使策略习得更鲁棒的视觉表征,有效抵御真实环境的视觉分布偏移。
  • 真实遥操作数据虽然轨迹自身质量高,但数据量有限且场景单一,面对光照、背景等视觉变化时泛化能力不足。

与基线对比的深层解读

传统机器人学习倾向于将真实遥操作视为黄金标准,但 OASIS 揭示了这种依赖的局限:真实数据收集的物理成本和时间成本极高,难以规模化,且总是绑定特定物理空间,导致数据多样性不足。仿真数据通过自动化重建和域随机化,在成本极低的前提下实现了数量级更大的数据覆盖,弥补了动力学近似带来的 sim-to-real gap。这一结果提示从业者:在视觉策略学习中,数据的分布覆盖度可能比单一轨迹的绝对物理精度更重要,未来可进一步探索将仿真随机化策略与少量高质量真实数据精调结合的范式。

行业影响

落地场景

OASIS 框架使人形机器人能够以低成本获取高质量的 loco-manipulation 训练数据,适用于仓储物流、零售服务、家庭辅助等场景。例如,在仓库中,机器人需要一边行走一边从货架取放异形商品,传统真机遥操作采集数据效率低、覆盖环境有限,而仿真管线可快速生成大量带有光照/纹理/物体形状随机化的轨迹,让策略在真实环境零样本泛化。

商业价值

降低数据采集成本

真机遥操作需占用物理空间、人工操作及场景重置,单条轨迹成本高。OASIS 将采集全面移入仿真,利用 3D 生成模型 从单张图片还原资产,结合仿真遥操作与域随机化,使高质量轨迹边际成本趋近于零,直接降低研发投入。

提升产品可靠性

策略在仿真中经受大量视觉多样性训练后,对真实场景的光照、背景变化鲁棒性显著提升,实验表明仿真训练的成功率甚至高于真机数据训练,有助于加速机器人产品在非受控环境中的部署,改善客户体验。

与现有产品/工作流的接口

OASIS 可无缝嵌入机器人开发流水线:

  • 数据生成:替代或补充遥操作采集环节,仅需输入目标物体的二维图像或草图,由 3D generative model 自动生成网格、纹理及物理属性,导入仿真器(如 Isaac Sim)。
  • 策略训练:分层视觉运动策略可基于现有模仿学习框架(如 ACT 或 Diffusion Policy)训练,仅需替换数据源。
  • 部署验证:在真机部署前,可利用仿真环境进行批量回归测试,结合域随机化覆盖 corner case。

具体落地案例

  1. 电商仓储拣选:大型电商仓库中物品形态多样、布局动态变化,使用 OASIS 仅需拍摄新品照片即可生成训练数据,使人形机器人学会在货架间行走并抓取任意商品,减少数月人工采集周期。
  2. 服务机器人配送:企业园区内配送机器人需穿过不同光照条件的走廊、自动开门并递送物品,OASIS 的渲染增强可让策略直接适应未见过的大堂灯光与装饰纹理,避免为每个部署点重新采集遥操作数据。

局限

  • **3D 资产重建质量受限**:OASIS 使用 3D 生成模型从单张真实图像重建物体网格,但对于高反光、透明或精细几何的物体(如金属工具、玻璃杯),重建精度可能不足,进而导致物理属性估计偏差,影响操作策略的可靠性和泛化能力。论文未讨论此类边缘情况下的补偿机制。
  • **仿真遥操作效率与质量折中**:初始轨迹仍依赖人类在仿真中遥操作,虽解除了物理场景重置开销,但仿真遥操作缺乏真实力反馈和立体视觉,操作员可能需要额外适应,长序列 loco-manipulation 轨迹的收集效率和质量可能不及真实世界遥操作,限制了大规模数据扩展的潜力。
  • **物理动态的 sim-to-real 残留 gap**:领域随机化主要针对视觉外观,物理参数(如接触摩擦、关节阻尼)的随机化范围和模型保真度未充分验证,对于需要精细力控的接触式操作(如推开重门、精密装配),仿真训练的策略迁移到真实机器人时仍可能性能下降,文中未与基于真实接触力数据的 sim-to-real 方法对比。
论文Zehao Yu2026-06-07原文

相关内容