从预训练到精通:以极少人工干预的真实世界子任务 RL 实现长时程操作
预训练的机器人基础策略往往能完成长时程任务的绝大部分,却会在少数关键子任务上反复失败。若要为此收集完整的任务示范做监督微调(SFT),操作员不得不重复执行策略已经做得很好的行为。强化学习(RL)微调有望弥合这一差距,但现有方法难以仅凭稀疏奖励求解长时程任务。 我们提出 PARTS(Policy Adaptation with RL on Targeted Subtasks),一个真实世界子任务 RL 框架,把练习集中在这些瓶颈处,同时让训练 rollout 以极少人工干预持续推进:冻结的预训练策略 全程提供名义动作,而由智能体生成的 selector 与 success verifier 激活残差修正并提供局部结果奖励。这些奖励使得即便完整任务成功率稀少,也能从成功的子任务中学习。训练将 在线 RL 与 成功度重加权再训练 结合,每次重训后的残差策略都会被重新部署以采集更多经验。人类只需在设置阶段识别瓶颈,并在需要时进行物理复位。 在双臂 YAM 与单臂 Franka 任务上,PARTS 将完整任务成功率分别从 32% 提升到 61%、从 50% 提升到 95%,平均每任务仅需数十分钟的真实世界 RL rollout。与现有真实世界 RL 微调方法相比,在相同机器人 rollout 预算下,PARTS 将全任务成功率提升 超过 25%,且所需人工介入更少。
论文精读
TL;DR PARTS 让预训练机器人策略在真实长程任务中只针对易失败的瓶颈子任务做少量 RL 微调,以极少人工干预将全任务成功率大幅提升(如 50%→95%)。
问题
问题背景
预训练机器人基础策略(如 VLA 或 WAM)在长时程操作任务中能完成大部分步骤,但在少数关键子任务上反复失败,成为整体成功率的瓶颈。
现有方法局限
- 监督微调 (SFT) 需要采集额外完整任务演示,但操作者必须重复演示策略已经掌握的部分,数据采集效率极低且成本高。
- 端到端 RL 微调 使用稀疏奖励(仅依据最终任务成功与否)难以有效学习,因为长时程任务中奖励信号极度稀疏,噪声大,导致探索效率低下。
- 已有残差 RL 等方法虽尝试冻结基础策略并学习修正项,但往往需要大量在线交互或密集人工重置,且对瓶颈子任务的聚焦不足。
为什么难/重要
长时程操作任务的状态-动作空间巨大,探索困难;而关键子任务往往只占据一小部分执行时间,却直接决定最终成败。真实机器人 RL 交互成本高昂,要求最小化人工干预(如重置、演示),因此需要算法能自动定位瓶颈并高效利用交互数据。业界对机器人基础模型的适应性微调需求迫切,但缺乏类似 LLM 中 RLHF/DPO 那样高效且低人工成本的策略微调框架。
行业类比
类似自动驾驶感知模型:预训练模型在常规场景表现稳定,但对罕见 corner case(如极端光照下的行人检测)存在瓶颈,需要针对性采集数据并微调,而非重新标注全部场景。
核心洞察
- **瓶颈子任务聚焦**:将 RL 微调限定在预训练策略反复失败的少数关键子任务,而非整个长程任务。与直接在完整任务上使用稀疏奖励的 RL 相比,这种做法大幅缩小了探索空间,使局部成功信号更密集;同时冻结基础策略提供名义动作,残差策略只在需要时介入,避免了灾难性遗忘,显著提高了样本效率。
- **智能体生成的局部奖励**:通过选择器和成功验证器自动判断子任务是否成功,并生成局部结果奖励。传统真实世界 RL 微调通常依赖人工设计密集奖励或频繁的人类评估,而 PARTS 利用预训练策略自身能力构建自动监督,即使在完整任务成功样本稀缺时也能从成功的子任务中学习,大幅降低了人工干预需求,使训练可扩展。
- **在线 RL 与成功重加权的闭环迭代**:将在线 RL 与成功样本重加权重训练结合,并将改进后的残差策略重新部署以收集新经验。这种自我改进循环使得策略能够持续针对新出现的瓶颈进行适配,与单轮微调相比更加鲁棒;并且由于残差策略的局部性,重训练可以快速进行,使得在真实机器人上以数十秒级 rollout 预算即可获得显著提升。
方法
PARTS 的输入包括:一个预训练的机器人基础策略(如 VLA/WAM 模型),以及人类在设置阶段识别出的瓶颈子任务列表。
关键模块与流程
- 冻结的预训练策略 持续输出名义动作 (nominal actions),作为任务执行的默认控制信号。
- Agentic Scaffolding 包含两个部分:
- selectors 实时检测当前状态是否进入某个瓶颈子任务,一旦触发,激活对应的 残差策略 输出动作修正量,与名义动作叠加。
- success verifiers 判断当前子任务是否成功完成,产生局部二值奖励 (local outcome rewards)。
- 残差策略学习 采用 TD3+BC 作为学习器,利用局部奖励进行在线 RL 更新,即使完整任务成功率很低,也能从成功的子任务样本中提取信号。
- Success-Reweighted Retraining 与 Redeployment:在线 RL 收集的经验按子任务成功与否重新加权,用于离线重训练残差策略;训练后的残差策略重新部署到真实机器人收集更多数据,形成迭代闭环。人类仅在物理重置等必要环节介入。
输出
训练后的 残差策略 与冻结预训练策略叠加,构成完整任务执行策略,显著提升长程任务成功率。
与同类方法的差异点:不同于直接在完整任务稀疏奖励上做 RL 微调,PARTS 将学习集中在瓶颈子任务,利用局部 outcome rewards 和冻结策略提供的稳定基座,大幅降低了对完整任务成功样本和人类干预的需求。
实验
实验设计
PARTS 在两类真实机器人任务上验证: bimanual YAM 与 single-arm Franka。预训练策略负责大多数执行,人类仅在 setup 阶段识别瓶颈子任务,并在需要时进行物理重置。训练 rollout 中,冻结的预训练策略提供 nominal actions,由 agent 生成的 selectors 和 success verifiers 激活残差修正,并给出局部 outcome rewards。在线 RL 与 success-reweighted retraining 交替进行,每次重训后的残差策略重新部署以收集更多经验。Real-world rollout 总时长平均每任务仅数十分钟。
关键发现
- Bimanual YAM:完整任务成功率从 32% 提升到 61%。
- Single-arm Franka:完整任务成功率从 50% 提升到 95%。
- 即便完整任务成功样本稀缺,局部子任务 reward 仍支持有效学习。
- 人类介入量低于现有 real-world RL fine-tuning 方法。
基线对比解读
在相同 robot-rollout budget 下,PARTS 较现有 real-world RL fine-tuning 方法将 full-task success 提高 >25%。这源于其只在瓶颈子任务上集中训练残差策略,避免对已掌握行为重复 SFT 数据收集;而稀疏奖励的 long-horizon RL 通常难以从完整任务中提取学习信号。PARTS 的 agentic scaffolding 与局部 reward 设计降低了 long-horizon exploration 的样本复杂度,是改进的主要原因。
行业影响
落地场景
PARTS 适用于长时程机器人操作 任务的真实世界微调,典型产品包括工业机械臂、仓储分拣、服务机器人等。它针对预训练策略在少数关键子任务(如精细装配、易碎物品抓取)反复失败的问题,通过残差 RL 在瓶颈环节集中训练,无需大量全任务演示。例如,在电商仓储中,机器人执行“拾取-搬运-包装”长流程,只需对“包装”这一易失败子任务进行 RL 微调即可提升整条流水线成功率。
商业价值
直接降低人工演示收集成本 和人工干预频率。PARTS 使用数十分钟真实世界 rollouts 即可将任务成功率提升 20-30 个百分点(如 Franka 从 50% 到 95%),显著减少废料和停机时间。对于机器人即服务(RaaS)提供商,这意味着更快的现场部署和更高的客户满意度。
工作流集成
可集成到现有机器人学习 stack 中:部署预训练策略后,由工程师识别瓶颈子任务,配置选择器和成功验证器,然后运行 PARTS 的在线 RL + 成功重新加权重训练。需要少量物理重置,但无需全任务演示。与此前真实世界 RL 方法(如 full-task RL、SFT)相比,PARTS 在相同 rollouts 预算下成功率提高 >25%,且人工参与更少。
具体 use case
- 电商仓储分拣:预训练 VLA 策略控制机械臂完成多步分拣任务,针对“将商品放入不同尺寸包裹”子任务进行 PARTS 微调,大幅提升整体订单处理成功率。
- 医疗机器人辅助手术:预训练策略完成大部分手术操作,但对“缝合”这一关键子任务可靠性不足,PARTS 可在模拟或尸体环境中针对缝合进行残差 RL 训练,降低医生接管率。
局限
- 人工依赖仍是瓶颈。PARTS 虽然大幅减少了训练过程中的人工介入,但瓶颈子任务的识别和物理重置仍需人类操作员完成。在真实部署中,机器人遇到未见过的失败模式时,需要人类重新判断和干预;同时,agent-generated selectors 和 success verifiers 的可靠性依赖预训练模型,其错误可能需人工校验。因此,该方法目前更适用于有人监督的实验室环境,距离无人值守的长期自主改进仍有差距。
- 实验泛化性不足。论文仅在 bimanual YAM 和 single-arm Franka 两个平台上各验证一个任务,任务数量少且场景相对结构化。子任务选择、局部奖励设计以及 success verifier 的泛化能力未在更多样化的长程操作任务(如不同物体、环境扰动或新技能组合)中测试。因此,PARTS 能否扩展到更广泛的真实世界操作场景尚不明确,需要更多跨任务、跨环境的实验证据。
- 残差学习架构存在潜在局限。冻结预训练策略并仅学习残差修正可能无法处理需要全局行为改变的情况。若基础策略在瓶颈子任务上的动作与最优解相差较大,残差网络需学习较大修正量,可能导致训练不稳定或与基础策略冲突。此外,agent-generated selectors 决定何时激活残差,若选择器不准确,会引入额外误差。论文未系统评估此类失败模式,也未与端到端微调或分层 RL 等方法充分对比。