OmniTacTune: Policy-Agnostic 真实世界 RL 用于视觉策略的触觉残差自适应
视觉策略从人类视频、遥操作和机器人演示中学习得到可扩展的运动先验,但在接触密集操作中常常失败——此类任务的成功高度依赖于局部力和接触几何。触觉感知 能提供这些互补信号,然而触觉数据收集成本高昂,且难以在传感器、机器人和任务间泛化。 我们提出 OmniTacTune,一种策略无关的真实世界 强化学习 管线,通过 残差校正 将触觉反馈适配到预训练的视觉策略。OmniTacTune 采用 两阶段设计:首先从自主的基础策略 rollout 中引导出触觉感知学习,然后通过在线交互学习一个轻量化的 触觉残差策略。 大量实验表明,OmniTacTune 能够泛化到多种接触密集任务、视觉基础策略和触觉表示。在四个真实世界接触密集任务上,它将在 40–80 分钟内将视觉基础策略的成功率从 5–40% 提升至 85–100%,展示了将触觉反馈高效适配到可扩展视觉机器人策略的可行路径。
论文精读
TL;DR OmniTacTune 通过两阶段残差 RL 高效适配触觉反馈至视觉基策略,在 40-80 分钟内将多项接触丰富任务成功率从 5-40% 提升至 85-100%,实现策略无关的快速泛化。
问题
问题背景
机器人操作学习正快速向数据驱动范式演进:从大规模人类视频、遥操作和机器人示教数据中学习的视觉策略提供了可泛化的运动先验,但在接触密集任务中表现脆弱。
现有方法局限
- 纯视觉策略:依赖 RGB 或深度信息推测接触状态,易受遮挡、无纹理表面和光照变化影响,难以感知微小的力与接触几何变化,导致插入、开盖等任务失败。
- 端到端视觉-触觉学习:试图同时从示教数据中建模视觉和触觉,但真实世界触觉数据收集成本高昂、耗时长,且传感器物理特性差异大,策略难以跨夹爪、传感器和任务泛化。
- 已有适配方法:如 ACT + Tactile、ViTAL 等,往往需为每个新任务重新采集大量触觉示教,样本效率低,且缺乏对已有视觉先验的复用机制。多数方法还依赖特定策略结构,无法灵活适配不同的视觉策略基座。
为何难且重要
接触丰富操作是机器人部署落地的核心瓶颈。技术挑战在于:1) 触觉信号高维、低延迟且与局部接触几何强耦合,静态数据难以覆盖所有交互模式;2) 真实世界的在线学习需要在物理机器人上安全探索,样本效率要求极高;3) 理想方法应策略无关,即能复用多种视觉策略基座和触觉表征,但现有方案普遍与特定策略绑定。工业界关注度:精密装配、物流分拣等场景迫切需要低成本、快速的触觉适应能力,使视觉策略在关键接触环节获得可靠力觉反馈,从而大幅度提升成功率。
行业类比
这类似自动驾驶中纯视觉方案与毫米波雷达融合:视觉策略负责全局路径与语义理解,触觉则相当于近距离精确传感,补充局部接触细节,二者结合才能实现安全可靠的操作。
核心洞察
- OmniTacTune 的策略无关性允许它作为一个即插即用的触觉增强模块,适配各种预训练视觉策略,而无需重新训练或改变原始策略架构。这与多数要求联合训练或紧耦合的视觉-触觉方法不同,显著降低了将触觉引入现有机器人系统的门槛。
- 两阶段 warm-start + 在线 RL 的框架巧妙利用基础策略自主 rollouts 收集的数据来预热触觉表征,从而大幅提升在线交互学习的样本效率。这种设计突破了触觉 RL 在真实世界中数据昂贵、难以从零启动的瓶颈,使得在 40 分钟内完成复杂接触任务成为可能。
- 通过残差动作校正而非从头学习,触觉反馈专注于修正视觉策略在精细接触阶段的不足,实现了视觉泛化能力与触觉精细操控的互补。这种解耦方式比端到端联合训练更易于调试,且兼容多种视觉策略架构。
方法
输入与前置条件
OmniTacTune 接收一个预训练视觉策略(如 Flow-based Policy、Diffusion Policy、ACT、π₀.₅)作为基础运动先验,该策略已在人类视频、遥操作或机器人演示上训练,擅长生成全局运动轨迹,但在接触密集操控任务(如 peg-in-hole 插孔、充电器插入、开瓶盖、开盒)中经常失败。机器人配备触觉传感器(如 GelSight)以及常规视觉相机。
两阶段触觉残差学习架构
OmniTacTune 的核心是一个策略无关的残差 RL 管道,将触觉反馈通过动作残差的形式注入基础策略,而非重新训练整个策略。
阶段 I:触觉感知预热(Warm-start)
- 目标:快速为残差策略提供有效的触觉先验,避免从零开始在线探索。
- 做法:运行基础策略自主 rollout 收集一批状态-动作数据(包含触觉读数),利用这些离线数据通过行为克隆或离线 RL 预训练一个轻量级触觉残差策略。此时残差策略学习在给定触觉输入下预测“应施加的动作修正”。
- 关键技巧:采用 ControlTac 轨迹级增强 提高数据利用率,使残差策略对初始状态分布偏移更鲁棒。
阶段 II:在线触觉残差 RL 微调
- 交互模式:策略执行循环为
a_final = a_base + a_residual,其中 a_base 由基础视觉策略给出,a_residual 来自触觉残差策略。两个策略共享观察空间,但残差策略额外接入触觉信号。 - 训练:在真实世界机器人上运行在线 RL(本文使用 PPO),优化多感官奖励函数。奖励同时考虑任务完成度(稀疏目标奖励)和触觉引导的成形奖励(如接触力、滑移检测、插入深度等),驱动残差策略学会对接触事件的细粒度响应。
- 轻量化设计:残差策略通常为小型 MLP 或简单网络,参数量远小于基础策略,训练收敛快(单任务 40-80 分钟)。
与同类方法的差异
不同于 ViTAL 等需要联合训练视觉-触觉表征的端到端方法,或 PLD 等完全抛弃视觉、仅依赖触觉的策略蒸馏范式,OmniTacTune 复用任意现成视觉策略,仅学习一个独立的、可插拔的触觉残差模块,实现策略无关的通用适配,显著降低对触觉演示数据的依赖,并大幅提升真实世界样本效率。
实验
实验设计
OmniTacTune 在四个真实世界接触密集型任务上进行评估:Peg-in-Hole、Charger Insertion、Cap Opening、Box Opening。实验旨在验证触觉残差学习对多种视觉基础策略的通用性、与现有视觉-触觉方法的对比、以及不同触觉表示下的适应性。
模型训练采用两阶段管线:
- 第一阶段(warm-start):利用基础视觉策略自主运行产生的数据,离线预训练一个触觉感知的初始残差策略。
- 第二阶段(online RL):在真实机器人上通过在线交互精调轻量残差策略,仅需 40-80 分钟即可完成。
基础策略涵盖 Flow Policy、Diffusion Policy、ACT、π0.5 等不同架构,触觉表示包含原始触觉图像、接触点力向量等多种形式。基线方法包括仅视觉的 PLD、全传感器 ViTAL、ACT + Tactile 等。
关键发现
- 成功率飞跃:引入触觉残差后,基础视觉策略的成功率从 5-40% 一跃提升至 85-100%,且适用于所有四项任务。
- 高效在线适应:仅需 40-80 分钟的真实世界交互即可完成在线 RL,大幅降低触觉数据采集成本。
- 策略无关性:OmniTacTune 对不同架构的视觉基座策略均表现出一致的提升效果,证明其作为通用触觉适配层的潜力。
- 触觉表示泛化:多种触觉输入形式均可驱动残差学习,降低了传感器选择与标定的工程约束。
对比基线深度解读
与仅依靠视觉的 baseline 相比,触觉残差在接触阶段提供了关键的力与几何信息,使策略能够感知局部接触变化,从而显著提高精度。
相比 PLD*(联合视觉-触觉离线学习)和 ViTAL(端到端视觉-触觉 RL),OmniTacTune 的关键优势在于:
- 数据效率:第一阶段仅需自主运行的无成本数据,无需昂贵的人工演示或全程传感器配准。
- 模块化:残差结构解耦了视觉运动先验与触觉精细控制,便于与任意已部署视觉策略即插即用。
- 训练速度:只学习轻量残差策略,避免了全模型在线 RL 的高维探索难度,从而在数十分钟内收敛。
该工作为视觉机器人策略快速融入触觉反馈提供了一条低成本、高移植性的工程路径,对工业装配、精细操作等场景具有参考价值。
行业影响
落地场景
OmniTacTune 解决接触密集型操作中视觉策略的失败问题,为机器人提供触觉残差自适应,可直接用于需要精细力控和几何感知的场景:
- 精密装配:电子元件插接、连接器对位、齿轮啮合等,视觉示教容易因遮挡或低容差失败,触觉残差可补偿局部偏差。
- 包装与物流:开箱、取放异形物品、封箱等,物品尺寸、材质多变,触觉反馈能稳定抓取和操作。
- 服务机器人:开关门、拧瓶盖、插拔充电器等日常任务,依靠力觉避免损坏物品。
商业价值
- 降低部署成本:通过两阶段 RL 在 40–80 分钟内将成功率从 5–40% 提升至 85–100%,无需大量触觉数据采集,显著减少人工标注和示教成本。
- 提升产线柔性:视觉基策略可从人类视频或遥操作快速获得运动先验,触觉残差使同一策略适应不同工件和工艺变化,减少换线示教时间。
- 增强设备竞争力:机器人集成商可将该 pipeline 作为离线标定或在线自适应工具,提供“开箱即用 + 自主微调”的解决方案,降低集成门槛。
与现有产品 / 工作流的接口
OmniTacTune 设计为策略无关的残差模块,可插拔集成到已有视觉策略栈:
- 视觉策略部分:支持 Flow Policy、Diffusion Policy、ACT 等主流基策略,只需提供动作分布或轨迹,即可通过残差网络输出修正量。
- 触觉传感:兼容 GelSight 等触觉传感器,通过两阶段学习自动对齐特征,不依赖特定传感器模型,可扩展至其他触觉硬件。
- 强化学习框架:采用离策略 RL(如 DrQ)在线采集少量交互数据,可与现有工业机器人控制器(如 ROS 架构)通过动作空间配置对接。
实际用例:在电商仓储中,使用人类遥操作采集抓取纸箱的视觉轨迹,部署到产线后通过 OmniTacTune 在工作站上用少量尝试学会适应不同纸箱尺寸和材质,实现无码垛切换。在汽车电子装配中,将点云示教的插接动作作为基策略,触觉残差在线补偿插孔位置微变,避免刚性碰撞导致的损坏。
该方案为机器人触觉应用提供了低数据、高泛化的部署范式,推动触觉传感器从实验室走向工业规模化落地。
局限
- OmniTacTune 的两阶段 RL 流程严重依赖于基础视觉策略的性能:第一阶段的 warm‑start 需要从自主 rollout 中收集数据,若基础策略在目标任务上完全失败(例如成功率接近 0%),则无法产生有效的接触交互样本,进而导致第二阶段残差学习缺乏有意义的初始化,可能退化为纯在线探索,收敛更慢或失败。论文未讨论这一退化情形的应对机制。
- 训练效率仍有提升空间:单个任务的在线适应需要 40–80 分钟的实际机器人交互,虽然相对纯 RL 已有缩减,但对于多任务或频繁切换产线的场景,耗时仍然偏高。此外,触觉传感器的通用性问题并未深入探讨——实验使用了特定触觉传感器,不同传感器在信号频率、空间分辨率和安装方式上的差异可能要求重新设计状态表示或奖励函数,限制了方法的即插即用性。