论文

RetireOPD:面向智能体强化学习的自退役同策略蒸馏

RetireOPD:面向智能体强化学习的自退役同策略蒸馏

多轮智能体 用 强化学习(RL)训练时,每条轨迹只能获得一个标量奖励,因此需要 自同策略蒸馏(self on-policy distillation, OPD):由具备特权任务技能的「自教师」提供 token 级稠密监督,让无技能的学生模型将其内化。但该方案在智能体任务中受两个发现制约:仅有特权信息并不总能让教师保持可靠,且教师监督的收益具有 阶段性依赖。 为此作者提出 RetireOPD(Self-Retiring On-Policy Distillation): 1. 先用环境奖励优化一个 解耦的技能条件教师; 2. 再以 RL 与 OPD 联合训练无技能的学生模型。 它不遵循预设的蒸馏日程,而采用 自适应退役(Adaptive Retirement):一旦师生差距不再缩小、且学生达到教师成功率的目标比例,学生便自行退役教师,此后仅用 RL 继续训练。 在 Qwen2.5 1.5B 至 7B 的多个规模上,RetireOPD 相比 RL 基线将 ALFWorld 成功率提升 14.1%18.8%,WebShop 准确率提升 11.8%19.0%,并在所有设置下超过其自身的技能条件教师。

论文精读

TL;DR RetireOPD 在智能体 RL 中引入可自动退休的特权教师蒸馏,早期提供密集 token 级监督,待学生接近教师表现后自动退出,显著提升 ALFWorld/WebShop 成功率。

问题

问题背景

多轮 agentic RL 中,每个 trajectory 只返回一个标量奖励,导致 token 级信用分配困难。业界逐步采用 on-policy distillation (OPD) 从 privileged teacher 获取密集 token 级监督信号。

现有方法局限

  • OPD 假设 teacher 可靠:现有方法常默认 privileged information 足以构造可靠 teacher,但 agentic tasks 中 teacher 的 skill-conditioned 监督可能与环境奖励冲突,尤其在 student 能力提升后。
  • 固定蒸馏 schedule:传统 OPD 按预定比例或步数衰减 teacher 监督,未考虑 teacher 收益的阶段依赖性。早期需要 teacher 引导探索,后期 teacher 可能束缚 student 性能,固定 schedule 无法适应这种动态变化。
  • 缺乏退出机制:student 始终受 teacher 影响,无法摆脱 teacher 的次优策略,限制最终收敛水平。

为什么这个问题难/重要

难点在于动态判断 teacher 何时从帮助变为干扰。需要在训练中监测 student-teacher discrepancy,并协调与 RL 环境奖励的关系。该问题直接影响 RL + 蒸馏 组合在 agentic 训练中的稳定性与效率,是当前多轮 agent 训练的核心挑战之一。

行业类比

类似代码生成 agent 训练:先注入规则或专家示范解决稀疏奖励,后期需让模型自主探索以超越先验,否则过度依赖 teacher。

核心洞察

  • 技能条件教师构建解决“特权教师不可靠”问题。现有 OPD 方法通常假设拥有特权信息的教师天然可靠,但实验表明特权信息并不保证教师策略最优,甚至可能在后期误导学生。RetireOPD 将教师与环境奖励对齐优化,并引入技能条件解耦,使教师自身成功率达到较高水平,同时作为学生退休的参考标准。这一设计区别于仅依赖特权教师或固定教师的方法,从源头提升监督质量。
  • 自适应退休将教师视为阶段性脚手架而非永久组件。在训练早期,教师提供 token 级监督帮助探索;当学生能力接近教师且策略分歧停止缩小时,继续蒸馏会产生冲突,阻碍 RL 收敛。RetireOPD 让学生根据分歧停止收缩和成功率达到教师的一定比例自主决定退出,无需预定义退火调度,避免了线性退火或全程蒸馏在后期造成的干扰,使学生在多个基准上最终超越其教师。

方法

输入与任务定义

输入为多轮 agent 交互轨迹,环境只返回轨迹级标量奖励。该稀疏奖励难以直接指导逐 token 决策,因此引入自蒸馏 (OPD) 思路:构造一个具备特权任务技能的教师策略,提供逐 token 级监督信号,让学生策略在无特权条件下内化这些技能。

关键模块

  1. 特权教师构造
    不再假设特权信息本身足以保证教师可靠。RetireOPD 先独立优化一个解耦的、以技能为条件的教师:教师接收额外特权信息(例如任务分解、中间状态或专家提示),但训练目标是环境奖励最大化,而非直接让学生模仿。这样教师的质量由环境验证,避免特权信息噪声传导给学生。

  2. 联合 GRPO-OPD 训练学生
    学生策略是无技能条件的,训练时同时接收两个目标:

    • GRPO:标准组相对策略优化,利用轨迹奖励估计优势,推动策略改进;
    • OPD:在每一 token 位置,让学生输出分布向教师输出分布对齐(用 KL 散度等度量),提供密集监督。
      训练初期教师信号帮助探索,但后期可能变成冲突约束,因此需要动态退出。
  3. Adaptive Retirement(自适应退休)
    学生与教师之间的 discrepancy(如策略分布差异或 KL)作为冲突信号。当以下两个条件同时满足时,学生自行停止接收教师蒸馏:

    • 两者的 discrepancy 停止缩小,说明教师不再提供有效梯度方向;
    • 学生成功率已达到教师成功率的目标比例阈值,说明学生已掌握关键技能。

输出

最终输出是一个无特权、可直接部署的 skill-free 学生策略。在 Qwen2.5 1.5B–7B 上,RetireOPD 在 ALFWorld 与 WebShop 上均显著超越 RL 基线,并超过其自身的技能条件教师。

该方法与固定蒸馏计划或线性退火不同,退出时机完全由训练动态和相对成功率决定,无需人工调参。

实验

实验设计

论文在 ALFWorld 与 WebShop 两个 agentic 基准上,基于 Qwen2.5 系列(1.5B 至 7B)对比 RetireOPD、RL baseline 与 skill-conditioned teacher 等方案。核心关注成功率 / 准确率、teacher 可靠性及 self-retiring 动态。

关键发现

  • RetireOPD 在 ALFWorld 成功率较 RL baseline 提升 14.1%~18.8%;WebShop 准确率提升 11.8%~19.0%。
  • 所有设置下,RetireOPD 均超越其自身的 skill-conditioned teacher,表明自适应退出避免了后期 teacher 冲突。
  • 消融显示 privileged information 单靠并非 teacher 可靠,且监督收益随训练阶段变化。

与基线对比解读

与传统固定 schedule 的 on-policy distillation 相比,Adaptive Retirement 让学生模型在 discrepancy 不再缩小且达到目标成功率后自行退出蒸馏,使后续 RL 独立优化。工程上这减少了对教师监督调度的先验依赖,适合长期 agent 训练中的阶段切换。

行业影响

落地场景

RetireOPD 适合需要多轮交互、稀疏奖励的智能体产品:电商导购/客服机器人、企业流程自动化、代码助手、游戏 NPC。核心是让 skill-free student 在训练早期获得 teacher 的 dense token 监督,后期自动切回纯 RL,避免 teacher 冲突。

商业价值

  • 训练成本降低:自适应退休减少无效蒸馏步数,缩短 wall-clock 训练时间;论文在 Qwen2.5 1.5B-7B 上比 RL baseline 提升 ALFWorld 成功率 14.1-18.8%,WebShop 准确率 11.8-19.0%,直接降低同等业务指标下的模型迭代成本。
  • 体验提升:多轮任务成功率上升,减少用户中途跳出;电商场景中更稳定完成商品搜索、比较、下单。

与现有工作流集成

该方法是 on-policy distillation + GRPO 的扩展,与现有 RLHF/RLAIF 训练栈兼容:teacher 可由带工具权限或环境状态的高能力模型担任,student 通过 RetireOPD 适配器在训练循环中监控 discrepancy 和 success ratio,触发 teacher 退出。工程上可按 rollout -> teacher logits -> student loss -> adaptive retire check 插入现有多轮 agent 训练 pipeline,无需重构 reward model。

具体用例:

  1. 电商购物助手:类似 WebShop 的多步搜索-比价-下单场景,用带搜索 API 权限的 teacher 指导通用模型,提升 task completion,降低人工接管率。
  2. 企业 IT 服务台:处理账号配置、权限申请等多轮工单,teacher 可访问内部知识库与工具,student 早期蒸馏,到达阈值后独立 RL,节省长期推理时 teacher 调用成本。

局限

  • **对环境奖励的依赖**:RetireOPD 首先需要优化一个解耦的、技能条件教师,这一过程依赖环境奖励信号来获得可靠行为策略。因此该方法不适用于缺少明确奖励或难以定义奖励函数的开放式任务(如自由对话、创意生成),也不适用于离线数据集场景。相比直接使用预先定义的特权信息作为教师的 OPD 变体,多了一步带环境交互的教师 RL 训练,增加了采样和计算开销。在奖励稀疏的环境中,教师训练早期可能面临探索不足,导致教师本身质量不稳定,进而影响后续学生的蒸馏效果。工程实践中需要额外设计奖励工程或辅助任务来保证教师收敛。
  • **退休准则依赖成功率估计**:Adaptive Retirement 的触发条件之一要求学生达到教师成功率的某个目标分数,这需要在训练过程中持续估计学生当前的成功率,通常通过额外的在线评估或采样实现。这会引入一定的评估开销,并且评估频率和样本量成为新的超参数。虽然论文对退休阈值做了敏感性分析,但阈值本身仍然需要针对任务和模型规模进行调整。当任务难度分布发生漂移或环境动态变化时,固定的退休阈值可能不再适用,需要设计更鲁棒的动态阈值或置信区间。此外,用成功率作为能力度量可能忽略了部分正确但轨迹质量低的样本,导致过早退休或过晚退休。
  • **实验覆盖范围有限**:实验仅在 **ALFWorld** 和 **WebShop** 两个代理任务上验证,模型规模为 Qwen2.5 1.5B–7B,缺乏更广泛的任务类型(如多模态代理、工具调用、长程规划)和更大模型(如 13B+)的验证。退休机制的泛化性尚未在更复杂的行动空间或部分可观测环境中得到检验。与同类工作对比,没有与更先进的 OPD 变体(如带拒绝采样的特权蒸馏、基于价值函数的蒸馏)或课程学习方法进行系统比较,也没有在非 Qwen 架构上测试,限制了结论的普遍性。此外,论文未报告教师训练与学生训练的总计算开销对比,实际部署中的资源权衡不够清晰。
论文Yan Yu2026-09-17原文

相关内容