论文

StructRL: 面向长时程视觉-语言-动作任务的在线结构化强化学习

StructRL: 面向长时程视觉-语言-动作任务的在线结构化强化学习

视觉-语言-动作(VLA) 模型在较短时程的操作任务上表现良好,但在需要从单条指令出发完成多个相互依赖操作的长时程任务上仍然吃力。在线强化学习(RL)可以通过环境交互改善这类策略,然而许多现有方法只在整条任务成功后给出奖励。这种终端监督过于稀疏,无法区分早期失败与已有大量部分进展的 rollout。 我们提出 StructRL,一个在线 RL 框架,从可验证的子任务完成情况中构造结构化的中间监督。具体而言: - 将每个任务分解为可验证子任务; - 仅在前置子任务完成后才发放中间奖励; - 依据完成节奏对每项奖励进行缩放。 在 RoboCasa365 与 LIBERO-Long 上,配合 GR00T-N1.5 与 pi 0.5,StructRL 一致优于所评估的在线 RL 基线。 这些结果表明,可验证的、结构化的中间奖励能够改善长时程 VLA 后训练。代码已开源于 https://github.com/amazon-science/StructRL。

论文精读

TL;DR StructRL 将长程 VLA 任务分解为可验证子任务,按前置依赖发放中间奖励并动态缩放,显著缓解稀疏奖励问题,提升 GR00T-N1.5 与 π0.5 在 RoboCasa365 和 LIBERO-Long 上的在线 RL 表现。

问题

问题背景

当前具身智能领域关注 VLA 模型(Vision-Language-Action)在长程操作任务上的能力上限:模型能处理单步或短程抓取放置,但面对“从一条指令完成多个依赖子任务”的长程场景仍显吃力。在线 RL 后训练 被视为提升这类策略的可行路径。

现有方法局限

多数在线 RL 方案只提供 任务成功后的终端奖励(terminal reward),即用户指令完全完成才给正信号。这导致两个具体问题:

  1. 奖励稀疏:长程任务成功概率低,模型长时间得不到反馈,样本效率极差。
  2. 无法区分部分进展:一个 rollout 完成了前 80% 的子任务却失败在最后一步,与一开始就失败相比,终端奖励都是 0,模型学不到“前 80% 是有效的”。

这种粗粒度监督让策略优化方向模糊,且在仿真环境中也要消耗大量交互才能收敛。

为什么难且重要

长程任务天然由多个 依赖子任务 构成,而子任务是否完成在仿真器中往往是可验证的(例如是否抓起了物体、是否打开了抽屉)。挑战在于如何把这种可验证的中间状态转换为 结构化且有序 的奖励信号:过早奖励会误导策略忽略依赖关系,过晚又退化为稀疏奖励。企业界与学术圈对机器人基础模型的后训练效率高度关注,因为真实机器人交互成本昂贵,仿真交互也要算力与时间。

核心矛盾:中间奖励能否既保持依赖约束,又提供足够密集的学习信号。

行业类比

这一挑战类似大语言模型 RLHF 中从 结果奖励 演进到 过程奖励模型(process reward model)的逻辑:对长程推理或规划任务,只有逐步给出可验证的中间反馈,才能让策略高效习得复杂行为链。

核心洞察

  • StructRL 的核心在于用可验证的子任务完成事件构建结构化的中间奖励,并通过前置依赖门控防止奖励误发。与常见的基于终端成功奖励或独立子任务奖励的在线 RL 相比,它显式建模了长程任务中子任务的顺序依赖,确保模型只有在完成必要前置步骤后才获得正反馈,从而避免模型学习到跳跃性、无效的局部行为。
  • StructRL 的 Dynamic Reward Pacing 将子任务完成速度纳入奖励缩放,使奖励不仅反映“是否完成”还反映“完成得多快”。这与固定数值的中间奖励或均匀时间折扣不同,它利用专家演示中的子任务耗时作为参考,对过快或过慢的完成给予不同激励,引导策略学习既准确又高效的操控节奏,这对真实机器人部署中的节拍控制尤为关键。
  • StructRL 作为一种 reward shaping 方法,不依赖特定 RL 算法或模型架构,可无缝集成到 GRPO 等主流在线微调流程中。它用符号化的环境谓词(simulator predicates)验证子任务,无需学习额外的进度预测器,降低了部署复杂度,并在 RoboCasa365 和 LIBERO-Long 两个不同场景、两种 VLA 基座上稳定提升,显示其作为通用后训练模块的潜力。

方法

方法流程

输入 为机器人视觉观察、语言指令及当前策略。StructRL 是面向长程 VLA 任务的在线 RL 框架,后训练模型如 GR00T-N1.5 和 π0.5。

  1. 子任务分解:利用 LLM 将长程任务分解为可验证的子任务,并将每个子任务接地到模拟器谓词(predicate),实现自动完成判定。

  2. 结构化奖励构造:包含两个核心组件:

    • 结构感知奖励门控(Structure-Aware Reward Gating):仅在先决子任务全部完成后才发放中间奖励,防止奖励泄漏或捷径行为。
    • 动态奖励节奏(Dynamic Reward Pacing):根据子任务完成速度(与演示时长相比)缩放奖励值,鼓励高效执行而非拖延。
  3. 策略优化:将结构化中间奖励与终端奖励结合,通过 RL 更新 VLA 策略;该方法可直接扩展到 GRPO。

输出 是经过在线交互优化的 VLA 模型,能够完成多步依赖的长程操控任务。

与现有仅使用终端成功奖励的在线 RL 方法相比,StructRL 的关键差异在于引入可验证的结构化中间监督,显著缓解稀疏奖励问题,并区分早期失败与实质性部分进展。

实验

实验设计

StructRL 在 RoboCasa365 和 LIBERO-Long 两个长时程操纵任务基准上,分别对 GR00T-N1.5 与 pi 0.5 两个 VLA 模型进行在线 RL 后训练。基线为仅提供终端成功奖励的在线 RL 方法。实验包括主结果、奖励源对比(结构化事件 vs 学习进度模型)、奖励组件消融、子任务分解密度影响、GRPO 兼容性、零样本泛化及短时程任务适用性。

关键发现

  • 在两个基准、两个模型上,StructRL 均一致优于所评估的在线 RL 基线。
  • 结构化中间奖励有效缓解稀疏奖励问题,且仅在先决子任务完成后发放,避免无关进展奖励。
  • 动态奖励节奏缩放进一步优化了学习信号。
  • 对子任务分解密度敏感:适中密度表现最佳,过密或过疏均有损性能。
  • 在短时程任务上同样适用,未观察到负面迁移。

与基线对比解读

相比只给终端奖励的方法,StructRL 通过可验证子任务分解构建结构化中间监督,将长时程任务拆解为可检查的里程碑,奖励信号更密集且有序。其 reward gating 机制确保只有满足先决条件的进展才获得奖励,避免了基于学习进度模型可能引入的噪声或错误奖励。Dynamic reward pacing 根据实际完成节奏缩放奖励,使训练更稳定。实验还验证了该方法与 GRPO 算法兼容,可在现有在线 RL 流程中直接替换奖励函数。总体表明,引入可验证的结构化中间奖励是提升长时程 VLA 后训练效率的有效途径。

行业影响

落地场景

StructRL 针对长程 VLA 任务,适用于仓储物流机器人 执行多步拣选打包、家庭服务机器人 完成“整理桌面并倒垃圾”等复合指令、以及工业装配 中的顺序操作。在电商订单履行中心,机器人需要根据单个语言命令完成取货、扫码、装箱等多个依赖步骤,稀疏终端奖励导致策略难以收敛;StructRL 的中间奖励能显著提升训练效率。

商业价值

  • 训练成本降低:通过子任务级奖励引导,减少无效探索,降低仿真与真实环境的交互次数,缩短模型迭代周期。
  • 部署可靠性提升:提升长程任务成功率,减少人工干预和错误恢复,直接降低自动化运维成本。
  • 数据效率增强:现有在线 RL 方法依赖完整轨迹终局奖励,StructRL 利用可验证事件增加有效学习信号,使每一条 rollout 更有价值。

与现有工作流的集成

StructRL 作为在线 RL 的奖励构造模块,可无缝嵌入现有 VLA 训练框架。只需在仿真环境中定义子任务谓词(如 object_in_hand、door_opened),并在训练循环中调用其动态奖励计算函数替换稀疏奖励。与 GR00T-N1.5、π0.5 等模型兼容,代码已开源(GitHub),便于研究团队快速验证或产品团队集成到机器人学习平台。

局限

  • - **子任务分解依赖外部标注**:StructRL 的子任务分解由 LLM 生成,并需要接地到模拟器中的可验证谓词。这一过程依赖仿真环境的完整状态观测,真实机器人上往往难以自动提取子任务完成信号,导致中间奖励缺失或噪声较高。论文没有讨论在无仿真器或部分可观测条件下的降级方案,这限制了方法向真实世界长视界操作的直接迁移。
  • - **实验未跨越 sim-to-real 鸿沟**:所有实验均在 RoboCasa365 和 LIBERO-Long 模拟器上进行,未在真实机器人上验证。模拟器中的谓词检测通常是精确的,但真实视觉感知和状态估计误差可能触发错误的子任务奖励,从而误导策略。论文对感知噪声、传感器延迟等实际因素缺乏鲁棒性分析,这使工业界在部署前仍需额外评估。
  • - **分解粒度敏感且需手动调节**:论文第 4.5 节和附录 C 显示,过密的子任务分解会导致性能下降,说明方法对分解密度较为敏感。此外,动态奖励缩放需要参考示范轨迹的完成时长(尽管附录 C.4 讨论了替代方案),这增加了数据准备成本。与某些自适应分解或端到端学习的进度模型相比,StructRL 缺少自动调整粒度的机制,在实际任务变更时需要重复人工设计。
论文Ziyi Yin2026-09-28原文

相关内容