论文

分层优势加权:基于稀疏回合结果的 VLA 在线强化学习微调

分层优势加权:基于稀疏回合结果的 VLA 在线强化学习微调

当预训练的 VLA 策略通过在线强化学习微调时,每个回合仅产生一个二元结果(成功或失败),但 actor 更新需要每个 transition 的监督。现有方法常将此稀疏结果简化为单个标量奖励或 优势信号,混淆了不同形式的 transition 级反馈,且一旦基本任务成功实现,提供的指导就非常有限。 首先,单个标量信号混淆了 可行性 与 效率 这两个目标;基本成功达成后,二元标签无法区分高效完成与缓慢完成。其次,真实回合混合了自主段与干预段;简单地将回合结果跨边界分配会引入不正确的信用分配。 为解决这些问题,我们提出 分层优势加权行为克隆 (HABC),该方法为这两个目标训练独立的 critic 头,在不同数据子集上分别学习,并通过 状态自适应平衡 组合它们的输出。状态自适应门 gt 合并单步优势:当成功不确定时优先考虑可行性,仅当可行性高时才转向效率,并将结果转换为每个 transition 的权重用于 actor 损失。干预感知信用分配 进一步将结果标签限制在当前策略执行的段,防止监督泄露。 在三个接触丰富的双臂任务中,HABC 将 监督微调 (SFT) 基线从 36%、44% 和 12% 分别提升至 92%、88% 和 38%,显著提高了成功率。

论文精读

TL;DR HABC 将稀疏结局分解为可行性与效率,通过双头 critic 和干预感知信用分配生成细粒度优势权重,显著提升在线 RL 微调的真实机器人操作成功率。

问题

问题背景

在线强化学习(RL)微调预训练视觉-语言-动作(VLA)策略是提升机器人操作性能的关键途径。真实部署中,每个交互回合(episode)仅返回稀疏的二进制结果(成功 / 失败),而策略更新却需要逐帧(per-transition)的稠密监督,如何从稀疏结局中提炼有效训练信号成为瓶颈。

现有方法局限

主流方法将稀疏结局压缩为单一标量奖励或优势信号,存在两重缺陷:

  • 目标混淆:单一标量无法区分可行性(viability)效率(efficiency)。一旦任务能初步成功,二元标签不再提供任何梯度来区分快速完成与缓慢完成,导致策略固化为“能跑就行”的保守行为,无法持续优化。
  • 信用分配错误:真实操作中常混入人工干预段(如遥操作纠正),若简单将整段结局标签均摊到所有帧,会造成误归因——将干预段的表现错误地奖励或惩罚当前策略,破坏学习稳定性。

为什么这个问题难 / 重要

挑战在于,稀疏结局下的 RL 必须在极低反馈密度中提取多维度优化方向,同时应对真实数据中不可避免的 intervention boundaries。业界对离线预训练+在线微调的管线寄予厚望,但若在线阶段无法充分利用稀疏成功信号,就难以挖掘 VLA 的上限性能。特别是接触密集型(contact-rich)双机械臂任务,成功样本稀缺且行为多样性低,差劲的 credit assignment 会直接导致训练失败或过早收敛到次优解。

行业类比

类似自动驾驶从罕见的人类接管(intervention)信号中改进规划模型——不仅需要区分“安全抵达”和“高效抵达”,还必须精确定位哪些决策片段真正导致了接管,避免错误的梯度回传让模型学到错误关联。

核心洞察

  • 将稀疏成功/失败信号解耦为可行性(viability)与效率(efficiency)两个独立优化目标,通过双头值函数和状态自适应门控实现细粒度逐步优势加权。单一标量奖励在任务初步成功后失去区分度,无法引导策略从“能完成”走向“完成得快且稳”。HABC用不同数据子集分别训练可行性critic(面向是否成功)和效率critic(面向完成质量),并根据当前状态下对成功的置信度自适应融合二者,使得优势信号在探索期偏向安全探索、在熟练期偏向效率提升,首次在在线RL中为稀疏结果提供贯穿全过程的稠密且目标一致的监督。
  • 干预感知的信用分配(intervention-aware credit assignment)仅将episode结果标签作用于当前策略自主执行的片段,切断跨干预边界的监督泄漏。真实机器人训练中的人为干预(如安全接管)往往夹杂在自主轨迹中,若不加区分地把成功/失败标签赋予整条轨迹,会导致严重误归因——将干预者的好表现误当作策略的能力,或将策略的良好自主段误判为失败。HABC显式识别干预段并将其排除在critic回归和actor权重计算外,使得在线学习不再依赖纯净演示,而能从混合干预的日常操作数据中安全提升策略,极大降低了部署门槛。

方法

输入

HABC 在在线 RL 微调阶段使用预训练的 VLA(Vision-Language-Action) 策略,每次 rollout 产生一条轨迹,但仅得到一个稀疏的二元结局标签(成功 / 失败),无密集奖励。

关键模块

  1. 双头 Critic(Dual-Head Critic)
    两个独立的价值估计头分别学习 viability(可行性)efficiency(效率)one-step advantage。其中,viability 头在只包含成功轨迹的数据子集上训练,判断当前状态能否最终完成任务;efficiency 头在仅由自主策略执行且完成任务的片段上训练,衡量完成速度与流畅度。

  2. 状态自适应门控(State-Adaptive Gate)
    一个可学习的门控网络 g_t 根据当前状态输出融合权重,将两个头的单步优势线性组合为综合优势信号。当成功概率较低时,viability 主导更新方向;一旦可行性足够高,门控自动让 efficiency 梯度介入,引导策略更快收敛到高效行为。

  3. 优势加权 Actor 更新
    综合优势经过指数映射转换为每个时间步的标量权重,直接乘到 行为克隆(BC) 损失上,构成 Advantage-Weighted Behavior Cloning 目标。高优势的动作获得更大模仿权重,低优势动作被抑制,避免无效探索。

  4. 干预感知信用分配(Intervention-Aware Credit Assignment)
    真实 rollout 常混合自主执行段与人类干预段。HABC 通过时间戳标记识别干预边界,仅将结局标签分配给由当前策略自主执行的片段,防止干预动作被错误地赋予成功/失败反馈。

输出

更新后的 VLA 策略,其动作分布向高可行性、高效率区域收缩,同时避免干预数据的噪声污染。

与同类方法的差异

相较于直接使用单一代价信号(如稀疏奖励或 TD 优势)的行为克隆方法,HABC 通过解耦的可行性 / 效率 Critic 与干预感知信用分配,在仅有稀疏结局的在线 RL 中提供了更精细、更安全的每步监督。

实验

实验设计

实验基于 三个接触丰富的双手操作任务,从稀疏的 episode 结局(成功 / 失败)出发,对预训练 VLA 策略进行在线 RL 微调。每个 rollout 仅产生一个二元结果,传统方法将其压缩为单一标量奖励或优势信号,导致生存性(viability)与效率(efficiency)两个目标混淆,且无法处理人类干预片段导致的错误信用分配。

HABC 引入 双头 critic 分别建模这两个目标,通过 状态自适应门控 g_t 动态融合单步优势,并采用 干预感知信用分配 将 episode 结果仅赋予策略自主执行片段。对比基线包括 监督微调(SFT) 以及使用单标量奖励或优势信号的在线 RL 方法(如 Imit-Recap、Imit-DAgger 等)。

关键发现

  • 成功率大幅跃升:三个任务的 SFT 基线仅为 36%、44% 和 12%,HABC 分别提升至 92%、88% 和 38%。尤其在第三个最困难的任务上,虽然绝对成功率仍低,但相对提升显著(+26%),表明分层加权和干预感知信用分配对复杂任务至关重要。
  • 双头 critic 解耦有效:分析表明,生存性头在任务初期不确定性高时主导,而效率头在成功概率高时接管,避免早期过度追求效率导致失败。
  • 干预感知信用分配:切断了干预片段对损失的错误传导,确保 actor 仅从自身执行的错误中学习,避免了监督泄漏。

与基线对比的深度解读

SFT 基线下的策略缺乏在线探索和反馈,无法从失败中自我修正,因此在接触丰富任务中表现不佳。传统的单标量奖励 RL 微调在成功率达标后往往陷入瓶颈,因为二元成功信号无法为“快而好”与“慢而优”的完成方式提供梯度差异。HABC 通过 分层次加权 先保证存活、再优化效率,解决了这一矛盾。与 Imit-Recap 等基于单优势信号的更新规则相比,HABC 的状态自适应门控使权重分配更符合当前策略状态的实际需求,从而在保证成功率的同时提升轨迹效率(如路径更短、速度更快),实验中的恢复行为对比也证实了这一点:HABC 策略在遭遇扰动后能更早切换至高效完成模式。

行业影响

工业界影响分析

落地场景

HABC 直接面向真实机器人操作任务,尤其适合接触密集、高成功率要求的双手协作场景,如:

  • 仓储物流:商品分拣与打包,能大幅降低拣选失败率,并让机器人自主从少量在线试错中学会更快、更稳的操作策略。
  • 柔性制造装配:高精度零件插入、线束连接,HABC 的生存性-效率分层优化可避免损坏工件,同时缩短每个工位节拍。
  • 医疗/实验室自动化:移液、插管等任务,干预感知的信用分配可安全利用专家远程干预数据,减少危险探索。
商业价值

HABC 带来三方面直接收益:

  1. 降低成本:将成功率从 SFT 基线(36/44/12%)提升至 92/88/38%,意味着更少人工介入和物料损耗;同时无需额外人工设计稠密奖赏,减少工程维护成本。
  2. 提升体验与效率:状态自适应门控在任务可行时自动转向效率优化,产出更短路径与更快执行,直接提升机器人工作站吞吐量。
  3. 扩展性:方法对 VLA 策略通用,可作为大多数“预训练+在线微调”流程的即插即用模块,缩短从演示到部署的周期。
与现有产品/工作流的接口

HABC 可集成进现有机器人学习栈:

  • 模型层:作为 VLA 模型(如 RT-2、Octo)的微调阶段替代单一奖励函数,仅需为价值网络增加一个双头 Critic 和轻量门控模块,不改变 Actor 结构。
  • 数据层:兼容现有交互数据记录,只需添加干预边界标记(如通过遥操作切换信号),即可使用干预感知信用分配。
  • 框架层:可在 ROS 2PyTorch RL 框架 中实现,与现有在线 RL 工具(如 RLlib、Luxonis)协同。训练过程中,只需对每个 rollout 记录 viabilityefficiency 标签,并分别训练对应 Critic 头,部署时门控 g_t 前向推理即可。

具体落地 Use Case

  • 某电商仓储机器人公司使用 VLA 模型进行 bin-picking,SFT 后成功率仅 30%。部署 HABC 微调,通过 200 次在线交互将成功率提至 85%+,且每次抓放时间从 12 秒降至 8 秒,直接减少人工复核人力成本。
  • 实验室移液机器人预训练策略在接触液体时容易失败。HABC 利用历史遥操作数据中的干预片段标记,隔离出故障转移序列,仅对自主执行部分分配信用,使微调后移液成功率从 45% 提升至 90%,并避免危险位移行为。

局限

  • **依赖数据划分与人工标注**。HABC 要求将轨迹明确分为 **viability** 和 **efficiency** 两类,并依赖干预段标记实现正确的信用分配。这在实际部署中意味着额外的人工成本:不仅需要标注 episode 级别的成功/失败,还要分割自主与干预片段。当干预形式复杂或策略频繁切换时,精确的边界标注会变得困难,可能限制方法在低标注资源场景下的可扩展性。此外,viability 标签的稀疏性(仅少数关键状态与最终结果相关)可能导致 critic 学习方差增大,影响 gate 的稳定性。
  • **任务泛化性验证不足**。实验仅在三个特定的 **双臂接触丰富** 任务(如装配类操作)上进行,这些任务共享类似的结构化约束和高精度需求。未在更广泛的单臂操作、长 horizon 多步任务或移动导航场景中测试,方法的**跨任务泛化能力**仍存疑。state-adaptive gate 的平衡机制虽然直观,但缺少对不同任务难度下门控行为的消融分析,使得算法在更复杂的时序依赖任务中可能表现不稳定。
  • **仍依赖稀疏二元奖励,与奖励自动化方法存在差距**。相较于近期利用 **视觉-语言模型** 或 **预训练奖励函数** 直接生成稠密奖励的工作,HABC 仍从单一的 episode 级成功/失败信号出发,未利用视觉或语义先验来构造更丰富的反馈。这可能导致在成功率已较高时梯度信号枯竭,限制效率目标的进一步优化。此外,干预感知信用分配虽然解决了部分错误反馈问题,但在完全无干预的自主探索场景中作用有限,方法并未从根本上解决稀疏奖励下的探索难题。
论文Tongyan Fang2026-06-15原文

相关内容