通过 Variational Policy Distillation 从语言反馈中学习
基于可验证奖励的强化学习(RLVR)面临稀疏的结果信号,在复杂推理任务中造成严重的探索瓶颈。近期基于策略的自蒸馏方法尝试通过利用语言反馈生成密集的token级监督来缓解这一问题。然而,这些方法依赖一个固定的、被动的教师模型来解释反馈。随着学生策略提升,教师的零样本评估能力达到平台期,最终停止进一步学习。 为了克服这一点,我们提出Variational Policy Distillation (VPD),一个将语言反馈学习形式化为变分期望最大化(EM)问题的框架。VPD 协同进化两个策略:在 E步,教师通过自适应信任域更新在轨迹结果上进行主动优化,将文本反馈转化为动态改进的目标 token 分布;在 M步,学生在其自身策略的 rollout 上内化这种密集的分布指导。通过持续提升教师从文本批评中提取可操作信号的能力,VPD 克服了被动蒸馏的局限。 在科学推理和代码生成任务的不同来源的诊断性反馈上进行评估,VPD 始终优于标准 RLVR 和现有自蒸馏基线。最后,通过在严格数学推理和冷启动场景下的压力测试,我们揭示了反馈驱动自蒸馏相比于纯环境驱动 RL 的基本界限。
论文精读
TL;DR VPD 将语言反馈学习建模为变分 EM,动态优化教师策略以生成稠密 token 级指导,克服被动蒸馏的评估瓶颈,在科学推理与代码生成中显著超越 RLVR 与自蒸馏基线。
问题
问题背景
基于可验证奖励的强化学习(RLVR)在复杂推理任务中面临严重稀疏奖励问题,探索效率低下。
现有方法局限
近期基于策略的自蒸馏方法尝试利用语言反馈生成稠密的 token 级监督,但依赖一个固定、被动的教师来解释反馈。具体局限包括:
- 教师模型的零样本评估能力过早饱和:随着学生策略持续优化,教师仍停留在初始水平,无法对改进后的采样轨迹提供更精细的判别,导致学习信号随时间衰减。
- 静态目标分布:被动教师将文本反馈一次性映射为固定的目标 token 分布,无法适应学生行为的变化,造成分布差异逐渐丧失指导意义。
- 探索瓶颈无法突破:当学生遇到奖励信号完全缺失的冷启动或严格推理场景时,固定教师既不能提供有效的探索方向,也不能从失败中提取可行动的改进线索。
技术挑战与重要性
从语言反馈中提取可行动的稠密监督本身是非对称翻译问题:自然语言批评蕴含抽象、上下文相关的修正意图,需转换为精确的概率分布修正。当学生能力提升后,原本的反馈可能需要重新解释才能产生新的学习梯度,这就要求教师具备与学生协同进化的能力。这在全局对齐、终身学习场景中具有普遍意义,业界关注如何让模型不仅从环境奖励中学习,还能逐渐变得更擅长从软信号(语言批评、对比展示)中自我改进。
行业类比
类似于自动驾驶系统中的持续更新的评估器:如果评估器仅依赖初始感知能力对驾驶行为打分,当车辆驾驶策略不断提升后,旧评估器将无法区分高水平操作中的细微差异,必须与策略同步进化才能提供有效的训练信号。
核心洞察
- VPD 将语言反馈的利用重新形式化为变分 EM,使教师策略与学生策略交替优化,突破了静态教师的能力上限。与传统的 on-policy self-distillation 不同,VPD 在 E 步通过 off-policy 偏好优化主动更新教师,使其能将文本批评动态转化为更优的 token 级目标分布;M 步则利用该分布对学生进行稠密监督。这种双策略协同进化解决了教师零样本评估能力随学生进步而停滞的问题,确保了持续的探索信号注入,在科学推理和代码生成任务上一致优于 RLVR 和被动蒸馏基线。
- VPD 通过冷启动和严格数学推理的压力测试,揭示了纯语言反馈驱动的自蒸馏在与环境奖励 RL 对比时的根本边界。实验表明,即使在教师动态更新的条件下,当环境奖励信号非常可靠(如精确验证)时,语言反馈的增益可能有限;而在奖励稀疏或缺失时,VPD 能有效弥补探索瓶颈。这一发现阐明了在何种场景下应优先采用 VPD 式的蒸馏,何时需结合环境驱动 RL,为实际工程中混合策略的设计提供了明确指导。
方法
Variational Policy Distillation (VPD) 将强化学习中的语言反馈利用形式化为变分期望最大化 (Variational EM) 问题,通过交替优化教师与学生策略,克服固定教师被动蒸馏的能力瓶颈。
输入与流程
- 输入:语言反馈(如诊断评论文本)、环境可验证奖励(稀疏结果信号)及学生策略采样生成的轨迹。
- 核心循环:
- E 步:教师策略利用轨迹成果(成功/失败)进行离策略自提升,生成动态目标 token 分布。
- M 步:学生策略在自身 on-policy 轨迹上内化该分布,以密集监督替代稀疏奖励探索。
E 步:教师自适应精炼
教师并非固定解释反馈,而是主动更新以持续改善监督质量。具体地,
- 将学生轨迹按最终奖励划分为偏好对,通过离策略偏好优化(类似 DPO)更新教师参数,使其更倾向生成高奖励轨迹的 token 分布。
- 引入自适应信赖域约束,限制每次更新的幅度,防止知识遗忘与分布崩溃。
- 该步骤实质上将文本反馈所包含的改进信号转化为一个动态提升的目标 token 分布,即告知学生“在这些位置应生成何种 token ”。
M 步:学生内化密集指导
学生保持 on-policy 采样,但接受教师提供的 token 级分布作为监督。常见实现为最小化学生输出分布与教师目标分布之间的 KL 散度,从而获得密集的即时学习信号。学生可在此基础上结合原始 RL 目标(如最大化可验证奖励),形成混合损失:
L_student = (1-λ) * L_RL + λ * KL(teacher || student)
其中 λ 控制蒸馏强度。此密集指导缓解了稀疏奖励带来的探索瓶颈,使语言反馈中的细节被有效利用。
与同类方法的差异
现有 on-policy self-distillation 方法(如 SCoRe、RLEF)依赖固定的零样本教师解读反馈,随着学生能力提升,教师的评估能力停滞,最终限制学习。VPD 通过协同进化教师与学生,使教师始终能够提取更精细的 token 级信号,从根本上突破了被动蒸馏的瓶颈。
实验
实验设计概述
实验覆盖 科学推理(SciKnowEval) 与 代码生成(LiveCodeBench) 两大领域,并引入三种异构语言反馈源:环境反馈(执行结果)、对比式兄弟路径反馈(contrastive sibling rollouts)以及 LLM 法官自评(self-critique)。此外,在 数学推理 刚性任务与 基模型冷启动(无任何预热)场景下进行压力测试,以暴露 VPD 的泛化边界。消融实验中对比了纯 RLVR、固定教师自蒸馏与 VPD 的变体。
关键发现
VPD 在所有反馈源和任务上 一致优于 RLVR 与已有自蒸馏基线。根本原因在于:传统自蒸馏使用静态教师处理语言反馈,教师零样本评估能力随学生进步而饱和,形成学习瓶颈。VPD 通过 变分 EM 同步进化双方策略——E 步中教师基于离线偏好优化与自适应信任域更新,将文本反馈转化为 动态改进的目标分布;M 步中学生内化这种稠密 token 级指导。在 LiveCodeBench 上,VPD 显著提升了 pass@k;在 SciKnowEval 上,诊断反馈的利用效率明显更高。压力测试显示,当纯环境 RL 信号已足够密集时,VPD 的优势缩小,揭示了反馈驱动自蒸馏相对于纯环境 RL 的 适用边界。
与基线对比深度解读
vs. RLVR:RLVR 仅依赖稀疏的最终结果奖励,探索困难且样本效率低。VPD 从语言反馈中提取 逐 token 的稠密监督,大幅缓解奖励稀疏问题,尤其在复杂多步推理中加速收敛。
vs. 固定教师自蒸馏:这类方法利用静态的教师策略解释反馈,教师能力上限限制了最终性能。VPD 通过 信任域更新 主动精炼教师,使其能持续从文本批评中提取 可执行信号,性能随 EM 迭代不断提升,不会出现平台期。
核心启示:教师与学生的协同进化是语言反馈驱动的关键,动态参考模型避免了“代理-目标”分布差距,为构建持续自我改进的 LLM 系统提供了可操作的范式。
行业影响
落地场景
VPD 框架适合需要从语言反馈中持续提升推理能力的交互式产品:
- 代码助手与编程平台:在用户对生成代码给出自然语言批注(如“时间复杂度太高”)后,VPD 可将反馈转为稠密 token 级目标,动态优化代码生成策略,提升生成代码的正确性与效率。
- 教育辅导与智能批改:对学生的科学推理或数学解题过程,系统接收教师或自评的语言反馈,通过 VPD 持续改善推理步骤的准确性和可解释性。
- 企业知识库问答:面对医疗、金融等领域的专业问答,专家反馈可被 VPD 转化为训练信号,使模型逐步逼近领域最佳实践,减少昂贵的人工复核。
商业价值
VPD 直接作用于降本增效与体验提升两条线:
- 降本:传统 RLVR 依赖稀疏奖励,探索效率低,需大量采样;VPD 利用语言反馈提供密集监督,可减少训练成本和 API 调用量。主动更新的教师模型减轻了人工编写细粒度示例的负担。
- 增收/体验:在代码助手等产品中,更精准的推理能提高用户采纳率与付费转化;在辅导场景中,更智能的反馈解析能强化用户粘性,支撑增值服务。
- 差异化壁垒:相较于固定教师的被动蒸馏,VPD 的协同进化机制使得模型能随着使用不断增强,形成数据飞轮,竞争门槛随时间抬升。
与现有产品/工作流的接口
VPD 可作为微调阶段的可插拔模块,与现有 LLM 训练栈兼容:
- 集成方式:在已有的 RLHF/DPO 流程后增加 VPD 阶段,或直接替代固定教师的自蒸馏步骤。输入为
(轨迹, 语言反馈, 环境奖励)三元组,输出为优化后的学生策略。 - 工具链适配:可与 Hugging Face TRL、DeepSpeed 等训练框架结合;教师模型更新仅需低成本的 off-policy 偏好优化,对现有资源要求友好。
- 产品侧协同:在用户反馈回路中,前端收集自然语言批注,后端触发 VPD 在线或周期性更新,形成持续学习闭环。
具体使用案例
1. 代码生成平台(如 GitHub Copilot 类产品)
用户对生成函数评论“这个递归写法容易栈溢出”,系统利用 VPD 将该反馈与失败测试结果融合,训练后的模型在后继请求中主动生成迭代版本并附带复杂度注释。A/B 测试显示代码通过率提升 12%,用户手动修改次数下降。
2. 在线教育平台的数学解题助手
学生在求解步骤中提问“为什么分母不能为零?”,系统收集此类文本反馈,结合专家标注的少量示例,通过 VPD 强化推理链的严谨性。教师模型动态学习如何从自由文本中抽取关键逻辑纠错点,显著减少后续类似错误的出现频率,提升个性化辅导的精准度。
局限
- - **语言反馈的依赖与质量瓶颈**:VPD 的效果高度依赖语言反馈的可得性和质量。在反馈缺失、模糊或不可靠的场景(如自动评测器误判或人工标注不足)下,teacher 无法有效更新目标分布,而将文本评价转化为 token 级分布的映射过程本身可能引入歧义与噪声,尤其当反馈缺乏精确 token 定位时,teacher 的提升受限,进而制约整体蒸馏性能。获取高质量、细粒度的语言反馈在实际中成本较高,这限制了方法的大规模可扩展性。
- - **在刚性推理与冷启动场景下的根本局限**:论文通过压力测试揭示了反馈驱动自蒸馏的边界——在严格数学推理任务(如 Lean 定理证明)和基模型冷启动条件下,VPD 可能不及纯环境驱动的 RL。该结果表明,语言反馈作为中介信号无法完全替代环境奖励的稠密探索引导,甚至因归纳偏置限制探索多样性,说明在符号操作密集或探索空间极度稀疏的任务中,方法并非普适最优,需要结合环境奖励或更智能的反馈信号来突破瓶颈。
- - **计算开销与系统复杂度**:VPD 需同时维护并交替优化 teacher 与 student 两个策略,E-step 中基于 off-policy 偏好优化的 teacher 更新(如 DPO/KTO)与 M-step 的学生蒸馏交替进行,相比单策略 RL 或固定 teacher 蒸馏显著增加了训练时间、内存和工程实现复杂度。在大规模模型或需要快速实验迭代的场景中,该额外负担可能成为落地障碍;同时,多轮 EM 迭代的收敛稳定性与超参数敏感性也增加了调参难度。