零样本 Sim-to-Real 机器人学习:反应式抓取的灵巧操作研究
灵巧操作是物理密集型任务,对建模误差和感知噪声高度敏感,使得从仿真到真实(sim-to-real)的迁移极具挑战性。领域随机化(DR) 常用以提高所学策略的鲁棒性,但传统 DR 每轮仅随机化一个实例,对真实世界动态变化的暴露非常有限。 为此,我们提出领域随机化实例集(DRIS),它同时表示并传播一组随机化实例,提供对不确定动力学更丰富的近似,使策略能够学习考虑多种可能结果的动作。理论分析表明,DRIS 能产生更鲁棒的策略,并减少对真实世界微调的需求,即使使用适中数量的实例(例如 10 个)。 我们在一个具有挑战性的反应式抓取任务上进行了演示。与传统的使用末端执行器(如曲面或封闭表面)机械稳定物体的抓取设置不同,我们的系统使用一个平板,不提供任何被动稳定性,使任务对噪声高度敏感并需要快速反应动作。所学的策略展现出对不确定性的强大鲁棒性,并实现了可靠的零样本 sim-to-real 迁移。
论文精读
TL;DR DRIS 同时随机化多个域实例并一起传播,让策略学习多种可能动态下的应对动作,在无真实微调的情况下实现高灵敏灵巧接球任务的零样本 sim-to-real 迁移。
问题
问题背景
在机器人灵巧操作领域,通过仿真训练策略并迁移到真实环境(sim-to-real)是降低数据成本和风险的关键范式。域随机化(Domain Randomization, DR)被广泛用于提升策略对动力学和感知差异的鲁棒性。
现有方法的局限性
传统DR方法在每一回合(episode)仅采样一组随机化参数,策略在整个轨迹中只接触单一实例 的动力学特性。这带来几个突出问题:
- 暴露不足:策略无法感知动力学参数的分布宽度,导致泛化能力有限。
- 保守策略:为应对未知扰动,策略倾向于保守动作,在需要快速反应的场景(如动态抓取)中表现不佳。
- 现实微调依赖:零样本迁移成功率低,常需借助现实世界的额外微调,增加了部署成本与风险。 此外,DR通常需要大量随机化参数组合来覆盖不确定性,计算开销大且调参繁琐。
技术挑战与重要性
灵巧操作任务(如反应式接球)对建模误差、感知噪声和毫秒级响应高度敏感。传统单实例DR无法让策略学习到“考虑多种可能结果”的决策能力,因为真实世界的动力学在一次部署中可能随时间变化或与训练分布有偏移。实现零样本sim-to-real意味着:
- 策略在仿真中已具备应对多模态不确定性的能力;
- 无需昂贵且危险的真实机器人试错;
- 为更复杂的接触密集型任务铺平道路。 因此,如何让策略在仿真中高效地同时关注多种动力学可能,是提升鲁棒性和减少调参负担的核心挑战。
行业类比
与自动驾驶仿真中若仅用单一天气/光照模式训练感知模型就难以应对真实多变环境类似,机器人灵巧操作也需要并行考虑多种动力学实例 才能实现可靠的零样本迁移。
核心洞察
- DRIS 将传统的单实例域随机化扩展为同时传播一组随机化实例,使策略能预见多种可能动态结果。这突破了常规 DR 在每次 episodes 仅采样一个实例的限制,提供了更紧密的不确定性下界,从而使学到的策略内在地对建模误差和感知噪声鲁棒,无需真实环境微调即可零样本迁移。
- 在反应性抓取任务中故意使用无被动稳定机构的平板末端,迫使系统完全依赖主动的快速反应而非机械几何约束。这种极具挑战的设定把 sim-to-real gap 的影响放大到极致,充分验证了 DRIS 训练的策略如何在感知噪声和物理参数不确定时依然做出精准的实时决策,凸显了从多样性动态中学习动作稳健性的核心价值。
方法
输入与问题形式化
任务抽象为 马尔可夫决策过程 (MDP),其中动态参数(如质量、摩擦、关节阻尼)存在不确定性。传统域随机化 (DR) 在每个 episode 开始时对参数采样一次,策略仅观察到该单一实例下的状态转移,缺乏对真实动态分布的整体感知。
关键模块:Domain-Randomized Instance Set (DRIS)
DRIS 的核心改进在于 同时维护一组随机化实例,而非单一实例。其工作流程如下:
- 实例集初始化:在 episode 开始时,从域参数分布中采样
K个实例(例如K=10),每个实例对应一组独立的物理参数,构成集合S_0。 - 并行状态传播:给定当前策略
π和动作a_t,每个实例基于自己的参数独立进行状态转移,得到下一时刻的实例状态集合S_{t+1}。这一步在仿真中通过批量化模拟实现,不会显著增加计算开销。 - 聚合观测表示:将集合
S_{t+1}转化为策略可用的观测。一种简单而有效的方式是计算集合的 均值和方差(或更高阶统计量),作为策略网络输入的附加特征。这使得策略能够感知到状态的不确定性范围,从而学习规避高风险动作。 - 策略输出:策略网络基于聚合后的确定性观测输出动作
a_{t+1}。训练时,策略在所有实例上同步优化,损失函数通常为所有实例上的平均回报或加权累积奖励,促使策略找到在多数可能动态下都表现良好的动作。
理论支撑与训练细节
文中的理论分析表明,DRIS 等价于在 分布鲁棒优化 (DRO) 框架下寻求一个对参数扰动不敏感的策略。通过引入实例集,训练目标隐式地最小化了最坏情况下的风险,从而获得比单实例 DR 更平滑的策略梯度。训练中无需复杂的元学习或真实环境微调,仅需在实例集上执行标准的强化学习算法(如 PPO)。
与同类方法的差异
与传统 DR 相比,DRIS 将 点估计式的随机化升级为集合式的不确定性传播,使策略在单一 episode 内就能接触到动态参数的多样性。与基于集成模型或贝叶斯推理的方法不同,DRIS 直接利用并行仿真实现,没有显式的概率推断模块,更易于集成到现有仿真训练管线中,且用极少实例(如 10 个)即可实现有效的零样本迁移。
实验
实验设计
任务为反应性抓取(Reactive Catching),使用 平板末端执行器,无被动稳定结构,对建模误差与感知噪声极度敏感。比较 DRIS 与常规 域随机化(DR):DR 每回合仅随机化一个实例,而 DRIS 同时表示并传播一组实例(如 10 个),提供更丰富的动态不确定性近似。评估覆盖仿真鲁棒性及真实世界零样本迁移。
关键发现
- DRIS 策略即使在小批量实例(如 10)下也展现出显著提升的鲁棒性,成功实现零样本 sim-to-real 迁移,无需任何真实世界微调。
- 常规 DR 策略因训练时暴露不足,在面对真实世界多模态变动时失败,而 DRIS 策略能快速做出反应性调整,在平板这种挑战性配置下稳定抓取物体。
与基线对比解读
常规 DR 每次仅考虑单一随机化结果,策略倾向于过拟合该特定实例的动力学,无法泛化至分布外变化。DRIS 则迫使策略在动作选择时同时考虑多种可能结果,相当于对不确定动力学进行集成建模。理论分析表明,多实例传播能更准确地逼近真实世界的条件分布,从而让策略学会“为多种未来做准备”的元行为,这是其零样本迁移能力的根本来源。
行业影响
落地场景
DRIS 最直接的落地场景是机器人灵巧操作,尤其是需要快速反应且环境不确定性高的任务。例如:
- 电商仓库分拣:在传送带上高速抓取形状、材质各异的物体(如塑料、玻璃、不规则包装),平板夹爪无被动稳定机制,必须实时补偿感知与动力学误差。
- 食品加工:在流水线上处理易损食材(如水果、蛋糕),要求轻柔且精准的力控,无法依赖机械定位或固定夹具。
- 服务机器人:在动态场景(如家庭、医院)中接住抛来的物品或拦截滚动的物体,对物理交互的鲁棒性要求极高。
商业价值
- 降本:传统 sim-to-real 常需大量真实世界微调(数小时至数天),DRIS 实现零样本迁移,省去现场部署工程师的调参成本,缩短从仿真到产线的时间。
- 增收:更强泛化性可使同一模型覆盖更多 SKU 或场景,减少重新训练支出;在物流等场景中,提升分拣成功率和速度直接增加吞吐量。
- 体验提升:服务机器人若能可靠地完成反应式抓取等动态任务,将大幅增强用户对机器人能力的信任,推动消费级人机交互应用。
与现有产品/工作流的接口
DRIS 可嵌入现有的仿真训练管线(如 NVIDIA Isaac Sim、MuJoCo、PyBullet):
- 在仿真环境中,对每个决策步同时维护多个并行域随机化实例(例如 10 个),策略从该实例集提取特征并融合输出动作。
- 训练完成后,策略直接部署至物理机器人,无需附加在线随机化或适配模块。
- 与现有 ROS 或实时控制系统对接时,DRIS 只影响训练阶段,推理时计算量等同于单策略前传,适合嵌入式硬件。
具体落地用例
- 电商仓储机器人(如 Amazon Robotics 生态):在货品抓取任务中,传送带上物体外观、位置、摩擦系数变化大。DRIS 可让平板夹爪的策略在仿真中经历数百种组合的动态变化,一次训练后直接上产线,处理未见过的包装,显著降低每次新增 SKU 的重新标定和调试成本。
- 自动驾驶中的末端操控:在车辆装配场景,机械臂需精准装入零件且适应微小位姿偏差。DRIS 可训练出对视觉噪声和传动误差不敏感的策略,减少 jig(夹具)设计依赖,加快产线切换时间。
局限
- **DRIS 对实例数量与计算开销的权衡尚不明确**。尽管实验中使用 10 个实例即可实现零样本迁移,但当状态-动作空间维度较高时,同时传播多个动力学模型可能导致实时规划或推理延迟显著增加,论文未提供计算时间对比或可扩展性分析,实际部署的可行性受限。
- **任务场景较为单一,泛化性有待验证**。所有实验均围绕平板上无夹持辅助的反应性接物任务,缺乏在其他灵巧操作任务(如装配、转动门把手等)上的评估。该任务的运动模式相对固定,难以直接说明 DRIS 在需要复杂接触次序或长序列决策场景下的优势。
- **依赖仿真器精度,未涉及感知噪声的高阶建模**。DRIS 主要针对动力学参数随机化,对视觉感知延迟、遮挡等真实世界噪声的建模仍沿用简单的高斯噪声假设,当 sim-to-real 差距主要来自感知域时,方法可能失效,且未与自适应域随机化等策略进行对比,难以判断相对增益的普适性。