利用分布化 DAgger 从丰富反馈中进行强化学习
推理模型近期快速发展,但主流的基于可验证奖励的强化学习(RLVR)方法仍十分狭窄:仅对每个回答用单个比特表示最终答案是否正确。然而许多场景提供了丰富反馈,包括执行轨迹、工具输出、专家纠正和模型自评估。 我们研究如何通过经典模仿学习算法 DAgger 的分布化变体来利用此类反馈,其中学习器可以局部访问当前策略所访问状态上的专家分布。这产生了一个简单的前向交叉熵目标,该目标接受黑盒专家,并通过将未来专家-学生分歧反向传播到早期决策来实现丰富的序列级梯度信用分配。 我们证明了基于反向 KL 或詹森-香农散度的先前自蒸馏 RL 目标无法保证单调策略改进:即使专家具有更高奖励,其更新也可能增加在更差动作上的概率。相反,我们证明前向交叉熵可以保证单调策略改进并具有遗憾界保证。进一步,我们的目标优化了教师加权的成功可能性的下界,从而提升 Pass@N。 实验结果表明,我们的方法 DistIL 在科学推理、编程和解决困难数学问题等多个领域优于 RLVR 和基于自蒸馏的 RL 基线。
论文精读
TL;DR 提出 DistIL:将经典模仿学习 DAgger 扩展为分布形式,用前向交叉熵利用富反馈(执行痕迹、工具输出等)进行信用分配,保证策略单调改进,在数学、代码、科学推理上显著优于传统 RL。
问题
问题背景
目前推理模型的训练主流采用强化学习从可验证奖励 (RLVR):对每个问题采样多个回答,仅根据最终答案的正确性给予 0/1 奖励。这种稀疏奖励在数学、编程等任务中有效,但忽略了过程中的丰富反馈信号。
现有方法局限
RLVR 的二元奖励无法利用执行 traces、工具输出、专家纠正、模型自我评估等细粒度反馈,导致信用分配粗糙——所有正确步骤共享单一奖励,错误步骤缺乏针对性信号。近期流行的自蒸馏 (self-distillation) 方法(如基于反向 KL 或 Jensen-Shannon 散度)尝试将学生分布对齐至教师分布,但被证明不能保证单调策略改进:即使教师奖励更高,更新仍可能增加差动作的概率,损害整体性能。该理论缺陷限制了此类方法的稳定性与最终效果。
为什么这个问题难/重要
将丰富反馈融入策略学习面临双重挑战:一是如何设计前向传播的信用分配机制,将未来专家-学生分歧有效传导至早期决策;二是如何确保算法单调收敛至更优策略,避免性能震荡。业界高度关注推理模型的 Pass@N 指标(N 次采样中至少一次正确的概率),它要求模型具备稳定的高成功率。因此,既能利用细粒度反馈、又有理论保障的算法对提升推理可靠性至关重要。
行业类比
在 代码生成 场景中,若能利用编译错误、测试失败、代码审查修正等中间反馈,而非仅看是否构建成功,模型可更快习得稳健的编程模式——正如本文用分布匹配的前向交叉熵目标,将细粒度反馈转化为逐步的策略改进信号,最终提升多次采样的正确率。
核心洞察
- 前向交叉熵目标基于分布匹配的模仿学习,保证了策略的单调改进。传统 RLVR 及基于反向 KL 或 Jensen-Shannon 散度的自蒸馏方法,在利用更优专家策略时无法确保更新后的策略一定会提升期望奖励,甚至可能增加较差动作的概率。而本文从 DAgger 思想出发,将专家视作在学习策略访问的状态上的分布,通过最小化前向交叉熵实现策略更新,从理论上获得了单调改进保证和遗憾界,为强化学习训练推理模型提供了更可靠的优化路径。
- 利用丰富反馈进行细粒度信用分配,将最终成功的信号传播到中间决策。主流 RLVR 方法仅对最终答案的正确性给予二元奖励,忽略了执行轨迹、工具输出、专家修正等丰富中间信号。本文提出的分布式 DAgger 将专家分布视为状态上的软约束,使学生模型在每一步都对齐专家的行为分布,并通过序列级别的梯度将未来专家与学生的分歧反向传播至早期步骤,实现了更精准的信用分配,从而在科学推理、编程和数学难题等多个领域显著提升了 Pass@N 和最终性能。
方法
输入与反馈表示
DistIL 的输入是问题描述与多种丰富反馈,例如执行轨迹、工具输出、专家修正或模型自评估。这些反馈被转化为专家分布——在每个决策状态(如自回归 token 位置)上,给出应采取的 token 概率分布。与 RLVR 仅用二元奖励不同,DistIL 获得了细粒度、步骤级的指导信号。
核心模块:分布 DAgger 与前向交叉熵
DistIL 采用分布变体的 DAgger 迭代训练:
- 采样:用当前策略生成响应,记录访问的所有状态。
- 构建专家目标:对每个状态,利用丰富反馈(如执行逆向推导或工具返回)生成专家动作分布,支持黑箱专家或基于最终正确的回溯计算。
- 训练:学生最小化前向交叉熵 (L = H(p_{\text{expert}}, p_{\text{student}}) = -\sum p_{\text{expert}}(a|s) \log p_{\text{student}}(a|s)),等价于前向 KL 方向优化,鼓励覆盖专家所有模式。
关键创新在序列级梯度传播:损失梯度能捕获未来专家-学生分歧,天然实现高效信用分配。例如,后期错误会反向调整早期 token 的概率,无需等待最终奖励。
训练目标与理论保证
该目标优化的是教师加权成功可能性的下界,直接提升 Pass@N。理论证明,前向交叉熵保证单调策略改进,并具有 regret 边界,克服了逆 KL 或 Jensen-Shannon 自蒸馏中可能增加低奖励动作概率的缺陷。
与同类方法的差异
相比 RLVR,DistIL 利用丰富反馈缓解稀疏奖励;相比基于逆 KL 或 JS 的自蒸馏 RL,前向交叉熵具有更强的理论保障(单调改进、regret 边界),并在科学推理、编程、数学等任务上取得更优的 Pass@N 性能。
实验
实验设计
实验覆盖三个典型推理领域:科学推理、代码生成与数学问题求解。评估方法为 DistIL(基于分布 DAgger 的前向交叉熵目标),对比基线包括传统 RLVR(仅用最终答案正确性单比特奖励)以及基于 反向 KL 散度或 Jensen-Shannon 散度的自蒸馏强化学习。所有实验均借助教师模型(如更大参数的推理模型或带工具访问的模型)构造状态级专家分布,使用当前策略与专家分布之间的前向交叉熵进行调节;训练中通过序列级梯度传播实现跨时间步的信用分配。
关键发现
- 单调策略改进保证:前向交叉熵目标在理论上保证每步更新不会降低期望奖励,而反向 KL 与 JS 散度则可能增加较差动作的概率,缺乏此类保证。
- Pass@N 提升:DistIL 优化了教师加权成功似然的下界,从而在多个温度采样下的 Pass@N 指标上取得一致改善,说明生成多样性并未因模仿学习而牺牲。
- 丰富反馈利用:与仅依赖最终二进制奖励的 RLVR 不同,DistIL 可直接融入执行轨迹、工具输出、专家修正等细粒度信号,训练更高效。
与基线对比的深度解读
RLVR 由于奖励稀疏,常需大量采样和奖励工程;自蒸馏方法虽引入教师信号,但其优化目标(反向 KL / JS)可能导致模型坍塌至教师分布的局部模式,忽视探索中的有用变体。DistIL 的前向交叉熵天然地让当前策略向专家分布靠拢,同时保留了一定概率质量用于探索,从而在低数据场景下更为稳定。这一设计使信用分配更细粒度:未来步的教师-学生分歧可通过梯度反向传播到早期决策,实现类似 hindsight 的修正效果。实验结果表明,在上述三个领域中,DistIL 均一致优于 RLVR 和自蒸馏基线,验证了分布模仿学习在推理任务中的潜力。
行业影响
落地场景
DistIL 利用分布 DAgger 与丰富反馈(执行轨迹、工具输出、专家修正等)训练推理模型,可直接落地于需要复杂多步推理的产品:
- 智能编程助手(如 GitHub Copilot、Cursor):利用代码执行结果、测试报错作为反馈信号,提升生成代码的一次通过率与修复能力。
- 教育解题系统:在数学、科学推理场景中,将逐步推导过程与最终答案正确性结合,生成高质量分步解析,辅助自适应学习。
- 金融分析工具:处理多步数值计算与逻辑推演,利用中间计算步骤的结果反馈优化模型输出,降低人工复核成本。
商业价值
- 降低标注与反馈成本:传统 RLVR 仅依赖单比特结果奖励,而 DistIL 直接消化丰富反馈,大幅减少对人工精细标注的依赖,尤其适用于能自动执行或校验的任务。
- 提升核心指标:方法使 Pass@N 与 成功率 均有显著提高,在科学推理、编码和数学问题上超越 RLVR 与自蒸馏基线,直接转化为产品体验提升(如代码生成可用率、解题正确率),从而增强用户粘性与付费意愿。
- 训练稳定性与效率:前向交叉熵目标具有单调策略改进保证,避免传统基于 reverse KL/Jensen-Shannon 的自蒸馏可能出现的策略退化,降低试错成本,缩短模型迭代周期。
与现有产品/工作流的接口
DistIL 可作为微调阶段的即插即用模块集成到现有 LLM 训练栈:
- 上游:接受 SFT 或预训练模型作为初始策略。
- 反馈源:对接执行环境(如代码解释器、数学引擎)、外部工具或人类专家修正接口,自动收集每条响应的轨迹级反馈。
- 训练替代:替换 PPO 或 DPO 等优化步骤,仅需黑盒专家分布,无需显式奖励模型,与现有 RLHF pipeline 兼容。
- 下游部署:训练后的策略可直接部署于推理服务,无需额外结构调整。
具体落地用例
- 在线编程平台:用户在 IDE 中输入需求,模型生成代码;后台运行测试套件,将通过的测试数量与失败用例的报错信息作为反馈,通过 DistIL 持续优化模型,使代码建议更精准、首次运行即通过率提升。
- 企业客服自动化工单:复杂问题需多步排查(如账号权限、日志分析),模型给出诊断步骤,后台工具执行并返回结果,与专家标注的修正路径共同构成反馈,训练后的模型可自动处理更多长尾工单,减少人工介入。
局限
- **对丰富反馈的依赖与成本**:本文方法假设环境能提供超越二元正确性的**丰富反馈**(rich feedback),例如执行轨迹、工具输出、专家修正、模型自我评估等。但在大量实际任务中,这类反馈的获取成本很高,甚至根本不存在——许多场景仅能给出“最终答案对错”的稀疏信号。从工程落地角度看,构造和维护一个能够产生可靠分布化专家反馈的系统,其标注成本、推理开销和延迟都是不可忽视的。当丰富反馈不可得时,DistIL 会退化成类似传统 RLVR,但在此退化路径上是否依然保持优势,论文未做充分探讨。
- **实验覆盖与泛化边界**:实验聚焦于**科学推理、编程、数学问题**等典型的推理型任务,这些任务的共同特点是存在明确的最终正确性标准,并且可以较自然地构造出过程级或中间步骤反馈。然而,对于更开放或主观的生成任务(如创意写作、对话系统、多模态内容生成),丰富的中间反馈难以定义与量化,此时 DistIL 的适用性存疑。此外,论文未展示在更大规模模型(数百亿参数级)或真实在线学习环境下的表现,其可扩展性和稳定性仍有待验证。
- **与强自蒸馏方法的对比深度有待补充**:本文主要将 DistIL 与基于**反向 KL** 或 **Jensen-Shannon** 散度的自蒸馏目标进行对比,并证明前者具有单调策略改进性质。但在实际实验中,选择的 baseline 是否经过充分调优、是否涵盖近期更精巧的变体(如在线 DPO 等)并不完全清楚。同时,DistIL 引入的分布化专家与**前向交叉熵**目标在实现上需要维护额外的专家策略或轨迹分布,这可能带来额外的内存与计算负担,而这些开销在对比中未做量化分析,使得公平性受到一定影响。