Reinforcement Learning 引导的检索与软融合用于缺失模态下的鲁棒多模态模仿学习
机器人系统通过多种输入模态(如视觉相机流和自然语言指令)感知世界,并据此选择合适动作。然而,在部署过程中假设所有输入设备永久可用是不现实的,因为传感器可能故障、被遮挡或完全丢失。因此,鲁棒处理缺失模态场景对于真实世界的机器人操作至关重要。 本文提出 RL4IL,一种基于强化学习引导的模仿学习方法。它通过从训练库中识别最相关的专家演示,为给定观测选择最合适的动作。具体地,使用近端策略优化(PPO)在广度优先搜索(BFS)候选集上训练一个强化学习策略,对候选演示进行排序,并通过软交叉注意力融合头聚合它们的动作信号以产生最终预测。当推理时缺失某个模态时,一个专用的逐模态 RL 检索策略从训练库中识别捐赠演示,并通过软插补头利用交叉注意力对排名靠前的捐赠者进行缺失嵌入重建——无需对系统进行任何重训练。 在三个 LIBERO 基准套件上的实验表明,RL4IL 在传感器缺失条件下显著优于最先进的模仿学习方法,且无需策略网络训练。代码可在 https://github.com/h-ismkhan/Reinforcement-Learning-via-kNN-for-Robotic-Learning-with-Missing-Camera 获取。
论文精读
TL;DR RL4IL 在模仿学习中引入强化学习检索最相关专家演示,并用软交叉注意力融合动作信号;传感器缺失时,它靠学到的检索策略即时插补模态,全程无需重新训练。这种设计让机器人操作在模态丢失场景下显著鲁棒。
问题
问题背景
机器人系统日益依赖多模态输入(如多视角摄像头、自然语言指令)来感知环境并执行操作。多模态模仿学习通过模仿专家演示来学习从观察映射到动作,在结构化任务中取得了进展。然而,多数方法假设训练和部署时所有模态始终完整可用,这忽略了真实场景中常见的传感器故障或遮挡。
现有方法的局限
当前主流的模仿学习框架,如 ACT、Diffusion Policy 或 RT 系列,通常以固定模态集合为输入进行训练,一旦某个模态缺失(如摄像头被遮挡或语言指令丢失),模型往往无法正常工作:
- 重训练依赖:需要为每一种可能的缺失模态组合重新采集数据并训练独立策略,工程代价高昂。
- 融合刚性:多数方案使用简单的拼接或求和来融合多模态编码,缺少对缺失信息的自适应填补机制。
- 检索增强方法不足:基于 k 近邻检索的方案(如 Imitating by Retrieving)在完整模态下有效,但面对缺失模态时,距离计算会偏向仍有信号的模态,导致检索到的演示与当前情境不匹配。
难度与重要性
该问题的核心挑战在于缺失模态造成信息不对称:策略必须从部分观察中推理出全局状态,并生成正确动作。传感器故障不可预测且可能发生在多种组合中,要求系统具备零样本(无需重训练)的跨模态推断能力。同时,在保持高成功率的前提下,推理延迟需满足机器人实时控制需求。业界对 鲁棒多模态感知 的关注度持续提升,尤其是在服务机器人、自动驾驶和远程操作等实际部署场景,缺失模态处理能力直接影响系统的安全性和可靠性。
行业类比
类似 自动驾驶中的传感器融合:当激光雷达因雨雪衰减或摄像头被污渍遮挡时,系统必须依赖其他传感器与先验知识继续完成规划的决策,而不能停机重训。
核心洞察
- **用强化学习选择演示而非直接决策** 是该工作的核心思路。传统模仿学习从专家数据中直接学习状态到动作的映射,在模态缺失时泛化脆弱。RL4IL 把动作生成分解为两步:先通过 RL 检索最相关的专家演示,再用交叉注意力软融合它们的动作信号。这种检索增强决策与端到端策略学习形成根本差异——RL 策略不直接输出动作,而是输出候选演示的排序,从而在模态缺失时能动态切换检索源,无需重新训练整个网络。
- **缺失模态的即插即用插补机制** 通过独立训练的 per-modality RL 检索策略实现。当某个传感器失效时,系统不要求任何全局模型调整,而是利用对应模态的 RL 策略从训练库中找回结构相似的 donor 演示,然后以 soft imputation head 重构缺失嵌入。这一点与现有依赖对抗生成或联合训练的多模态补齐方法不同:它完全解耦了模态,可实现零样本热插拔,显著降低了部署时的计算与数据适应成本。
- **软融合取代硬选择** 体现在交叉注意力对多个候选演示的加权聚合。RL 策略输出排序后,软融合头通过交叉注意力自动学习候选之间的贡献权重,避免简单 top-1 选择带来的高方差或错误累积。与常见 kNN 检索中固定距离加权或多数表决相比,交叉注意力能捕获候选间的关系,对环境噪声和检索错误更加鲁棒,使得在传感器严重丢失的场景下仍能维持可观的操控成功率。
方法
整体流程:检索-排序-融合的模仿学习框架
RL4IL 将模仿学习形式化为检索-精排-融合管线,输入为多模态观测(视觉相机流 + 语言指令),输出为连续动作。核心思想是不直接学习从状态到动作的映射网络,而是从专家演示库中动态提取、组合最相关的动作信号。
关键模块
候选生成与增强
对于当前观测,首先基于模态公平归一化后的特征距离进行kNN检索,得到初始邻居集。随后在邻居关系图上执行广度优先搜索 (BFS),扩展候选集以提升多样性,避免过早收敛到局部最优。RL 引导的候选排序
引入一个通过 PPO 训练的排序策略,输入为状态特征与 BFS 候选集特征的拼接,输出每个候选的标量分数。奖励信号源自候选动作与真实专家动作的相似度,策略学会为更有用的演示分配更高权重。这一 RL 策略仅用于检索选择,而非直接生成动作。软交叉注意力融合
取排序后 top-K 候选,使用 soft cross-attention fusion head 聚合它们的动作向量。交叉注意力以当前观测为 query,候选隐状态为 key / value,自适应地加权组合动作贡献,缓解硬选择的不稳定性。缺失模态下的无重训练适配
当某模态(如某个相机视角)缺失时,每个模态配有独立的 RL 检索策略,从训练库中召回“捐赠演示”。软插补头再次利用交叉注意力,将 top 捐赠者的嵌入加权求和,重建缺失模态的特征表示。整个过程无需微调或重新训练底层特征提取器,即插即用。
与同类方法的差异
不同于传统模仿学习需要训练端到端策略网络(如 BC、Diffusion Policy),RL4IL 将动作生成解耦为检索规划与特征融合,并借助 RL 学习检索策略,从而在传感器失灵时自动切换为插补模式,无需额外训练,提供了一种更灵活、鲁棒的动作决策范式。
实验
实验设计
实验在 LIBERO 系列基准的三个任务套件上展开,覆盖多种机器人操作任务(如拾取放置、开关抽屉等)与物体集合。核心评估场景是 传感器缺失 (sensor dropout),尤其模拟单目相机完全失效或间歇性遮挡的情况。对比基线包括近年主流的模仿学习模型:ACT、Diffusion Policy、BeT 等,均以完整多模态输入(RGB + 语言指令)训练。
关键发现
- 缺失鲁棒性飞跃:当视觉模态缺失时,RL4IL 的成功率显著高于所有基线,且在完全无相机输入时仍能保持可用的操作能力,而多数基线性能直接崩溃。
- 无重训适应:系统利用 per-modality RL 检索策略 从离线演示库中查找“捐赠演示”,通过 soft imputation head 以交叉注意力方式重建缺失模态特征,无需对策略网络做任何再训练或微调。
- 软融合优于硬选择:消融实验表明,soft cross-attention fusion 相比直接使用 top-1 近邻动作有着明显提升;同时 modality-fair 归一化 能平衡不同模态特征尺度,避免某一模态主导距离计算。
- BFS 候选集提升检索质量:用 BFS 扩展 kNN 候选池,再由 RL 策略从中精选,比单纯的暴力最近邻检索能在更复杂的状态空间中找到更相关的演示。
与基线的深度对比
常规模仿学习模型将多模态特征直接映射到动作,当某一模态缺失时,模型面对分布外输入,极易产生不可控的錯誤動作。RL4IL 将问题转化为 基于上下文检索的动作聚合:即使当前观测缺失模态,仍可通过检索历史上相似的完整状态,从专家演示中“回忆”缺失信息。相比 MAE-style 重建 或直接丢弃模态,这一检索-插补机制更加稳定,且无需昂贵的在缺失数据上重训练。实验进一步证明,RL 引导的选择 比单纯依靠距离度的 kNN 更能捕捉到任务相关的相似性,而软融合允许吸收多个候选的动作信息,在模糊或部分匹配场景下保持决策的连续性与精度。这些设计使得 RL4IL 成为一套 即插即用 的多模态机器人鲁棒执行框架,特别适合部署环境不稳定、传感器易故障的真实场景。
行业影响
落地场景
RL4IL 提供了一种无需重训即可处理多模态缺失的模仿学习框架,可广泛应用于依赖多传感器输入的机器人操作环境。典型部署包括:
- 仓储与物流机器人:在摄像头被遮挡、脏污或部分故障时仍能完成抓取、分拣任务,确保产线连续运行。
- 家庭服务机器人:当视觉传感器或语音指令意外中断时,可依赖历史经验库与跨模态填补维持任务执行,避免任务失败。
- 自动驾驶与移动机器人:在激光雷达或特定相机失效的情况下,从训练库中检索相似场景的驾驶演示,生成安全控制动作。
- 柔性制造:生产线上的机械臂面临传感器漂移或环境遮挡时,无需人工干预即可自适应调整。
商业价值
RL4IL 直接对应降本与体验提升两条线:
- 降本:免除因传感器失效导致的重复训练或人工重编程,大幅减少模型维护成本;由于使用检索式推理,无需在线训练策略网络,推理资源消耗可控。
- 体验提升 / 增收:系统鲁棒性提升直接转化为更长的无故障运行时间(MTBF),使机器人产品在真实非受控环境中更具商业可行性,加速自动驾驶、服务机器人等领域的落地变现。
- 快速适配:多模态检索与填补模块与下游策略解耦,企业可在不改变现有模仿学习主干网络的前提下添加容错能力,降低集成门槛。
与现有产品 / 工作流的接口
RL4IL 可视为现有模仿学习系统的旁路增强插件:
- 零侵入集成:核心组件(BFS 候选集、RL 排序策略、交叉注意力融合 / 填补头)独立于主策略网络,只需提供训练过的专家演示库与嵌入提取器即可工作。
- 标准化嵌入接口:多模态输入被编码为固定维度特征,RL 检索策略以 kNN 方式在嵌入空间中搜索,兼容任何基于嵌入的模仿学习管线(如 ACT、Diffusion Policy)。
- 运行时切换:推理时,若所有模态正常,可选用 Soft Candidate Fusion 提升精度;若某一模态缺失,自动切换至 Per-Modality RL 填补分支,无需额外决策逻辑。
- 可审计性:基于检索的机制使得动作生成可追溯至具体演示片段,有助于日志记录与安全审计,利于企业合规与调试。
具体落地 Use Case
电商仓储拣选机器人:在大型订单履约中心,机器人依赖多视角相机与物品数据库指令工作。当某一相机因货架遮挡或镜头脏污完全失效时,RL4IL 可从历史拣选演示库中检索与当前单视角特征加指令最相似的成功案例,通过交叉注意力填补缺失视角的感知信息,并生成抓取动作,避免拣选任务中断。无需停机清污或人工接管,拣选效率(UPH)可维持稳定。
自动驾驶车辆局部传感器故障应对:L4 自动驾驶系统常配备多个摄像头与雷达。若某一前视摄像头因天气或污染失效,RL4IL 的相应模态检索策略可从云端或本地存储的长尾场景库中检索相似工况(其他传感器一致、仅该相机缺失)的驾驶操作记录,通过 Soft Imputation Head 重建缺失的环境感知表征,再由下游规划器输出安全轨迹,实现失效条件下的安全降级运行(fail-operational),而非直接退出至安全员接管,显著提升 ODD 内可用性。
局限
- 方法需要为每个模态训练独立的 **RL 检索策略** 以及一个 **主检索策略**,当模态数量增多或需要适应新传感器时,训练成本线性增加,且策略之间缺乏共享,无法快速泛化。**BFS 候选集生成** 和 **PPO 训练** 本身也引入了额外的计算负担,可能难以部署在边缘设备上。
- 性能高度依赖于训练库中 **专家演示** 的多样性与质量。当演示集规模有限、分布稀疏或包含噪声时,检索到的 **donor** 可能不相关,导致填补和决策错误。论文未探讨在 **记忆库覆盖不足** 时的性能退化规律,也未提供记忆库构建的指导原则,这对真实应用中收集大规模演示提出了较高要求。
- 实验仅在 **LIBERO** 仿真基准上验证,未涉及真实世界传感器退化场景(如部分视野丢失、间歇性故障、传感器噪声等),且缺失模态设定为完全缺失,未评估不同缺失比例或混合缺失下的表现,因此其在实际复杂条件下的泛化能力仍待检验。