论文

Zone of Proximal Policy Optimization: 教师于提示而非梯度

Zone of Proximal Policy Optimization: 教师于提示而非梯度

知识蒸馏将教师模型的能力迁移至小型学生模型,但在小模型场景下脆弱:强制学生模仿更大教师的 logits 会使其聚焦于教师最尖锐的模式,损害训练语料外基准测试的泛化能力。强化学习 (RL) 通过基于学生自身轨迹训练避免了 logit 模仿,但当所有轨迹均失败(产生零优势且被静默丢弃)时,将更强教师的响应注入策略梯度会破坏 在线策略假设 并导致偏移。 受 Vygotsky 最近发展区理论启发,我们提出 Zone of Proximal Policy Optimization (ZPPO),将教师保持在提示中而非策略梯度内。对于困难问题,ZPPO 构建两种重新表述的提示:二元候选问题 (BCQ) 将一条正确教师响应与一条错误学生响应配对为匿名候选,学生需区分;负候选问题 (NCQ) 汇总学生错误轨迹至单个提示,暴露其共享失败模式。提示回放缓冲区循环每个困难问题直至其毕业(学生平均轨迹准确率达到一半)或先进先出移出,在学生的当前最近发展区内放大 BCQ 与 NCQ。 在 Qwen3.5 系列上以四个学生规模 (0.8B-9B) 与 27B 教师,后训练为视觉语言模型并在 31 基准套件(16 VLM、10 LLM、5 视频)上评估,ZPPO 优于离/在线策略蒸馏及 GRPO,且在最小规模上增益最大。

论文精读

TL;DR ZPPO 在提示中嵌入教师的正确与错误响应,让学生在最近发展区内自我校正,避免小模型蒸馏时的梯度漂移,显著提升小规模视觉语言模型的泛化推理能力。

问题

问题背景:知识蒸馏(knowledge distillation)是将大型视觉语言模型压缩到可部署规模的核心技术,但学生模型与教师模型间的巨大能力差异常导致训练不稳定与泛化能力下降。

现有方法局限

  • 离线蒸馏通过匹配logits迫使小模型模仿大教师,但在学生容量远小于教师时,会过度聚焦于教师输出分布中最尖锐的模式,损害在训练语料外基准上的泛化能力。
  • 在线RL方法(如GRPO)使用学生自身rollout进行策略梯度训练,避免logit模仿。然而,当所有rollout都失败(奖励为零)时,样本被静默丢弃,梯度消失;若强行注入教师正确响应,则打破on-policy假设,导致策略漂移和训练崩溃。
  • 两种范式均无法在“学生近乎全错”的困难状态下,平稳地利用教师信号进行有效学习。

为什么这个问题难且重要:小模型参数有限,必须在吸收教师知识和保持探索灵活性之间取得平衡,这属于典型的稳定-可塑性困境。在多模态推理等复杂任务中,学生可能完全无法生成任何正确轨迹,导致优化信号彻底中断。业界高度关注如何在RL训练框架中引入教师引导,同时维护on-policy学习稳定性,这对将大模型能力下沉至资源受限设备具有关键工程价值。

行业类比:就像教儿童骑自行车——直接模仿成人姿态(logit蒸馏)容易摔车,完全靠自己摔打(纯RL)可能长期无法起步;需要“辅助轮”提供渐进式引导,让学生在最近发展区(zone of proximal development)逐步掌握平衡。

核心洞察

  • ZPPO 的核心在于将教师信号完全限定在提示空间,而非策略梯度中,从而在强化学习后训练阶段保持 on-policy 假设,避免分布漂移。传统蒸馏强迫学生模仿教师 logits,在小模型时会导致其过度聚焦教师的尖锐模式,损害泛化;而直接向策略梯度注入教师响应(GRPO 变体)会打破 on-policy 性质,引入偏差。ZPPO 通过 Binary Candidate-included Question (BCQ) 和 Negative Candidate-included Question (NCQ) 将正确/错误响应以候选选项形式嵌入提示,学生仅需判别或识别共同失败模式,教师从未进入梯度计算,保证了策略更新的纯粹性,同时让学生从结构化对比中高效吸收教师知识。
  • 提示重放缓冲区将 Vygotsky 最近发展区理论工程化为可操作的课程动态机制。不同于固定重放或简单重复难题,缓冲区仅在学生平均正确率低于 50% 时保留题目,并持续扩大 BCQ/NCQ 的对比强度,直至学生在该题上达标毕业。这自动将训练焦点维持在学生有能力学习但尚未掌握的边界区域,相比预先设定课程或均匀采样子集,更精准地匹配了个体模型的能力动态,尤其在小规模模型上缓解了因容限不足导致的捷径学习或无效梯度问题,实现了规模感知的自适应教学。

方法

输入

ZPPO 的训练语料为包含多模态推理题目的 ZPPO-77K 数据集。每道题首先由学生模型独立生成多条 rollout,若全部错误(奖励为零),则被标记为“难题”,进入提示重放缓冲区。教师模型只参与生成高质量正确回答,不直接介入梯度计算。

关键模块

1. 提示重放缓冲区
维护一个固定容量的 FIFO 队列,专用于储存学生当前无法解决的难题。缓冲区动态更新:每个难题被反复采样,直到学生在该题上的平均 rollout 准确率≥0.5(“毕业”),或被后续新难题挤出。该机制确保训练始终聚焦于学生当前的最近发展区。

2. 提示重构:BCQ 与 NCQ
缓冲区中的每题被转化为两种新提示,教师信息隐含于提示文本而非梯度中:

  • BCQ(Binary Candidate-included Question):将一道题重构为二选一选择题,选项 A 为教师正确答案,选项 B 为学生的一个错误答案,二者匿名化。学生需判断哪一选项正确,奖励基于选择结果。
  • NCQ(Negative Candidate-included Question):将学生的多个错误 rollout 聚合为一条提示,要求学生找出其中的共同失败模式,并生成正确回答。通过暴露典型错误,引导学生自我纠正。

3. 策略梯度更新
学生模型在 BCQ 和 NCQ 题上生成回答,使用 REINFORCE++ 算法(一种两阶段优势估计器)计算策略梯度。整个过程完全基于学生自己的 rollout,保持 on-policy 性质,不会像 GRPO 那样在难题上注入教师梯度导致分布漂移。

输出

训练完成后,学生在 31 个 VLM/LLM/视频基准上的表现显著优于标准 logit 蒸馏、on/off-policy 蒸馏及 GRPO,尤其在最小模型(0.8B)上增益最大,验证了提示内教学在小模型容量下的有效性。

与同类方法的差异

ZPPO 放弃通过梯度或 logit 注入教师知识,转而将教师放在 prompt 中作为正确范例或对比候选,通过提示重构和缓冲区调度,在学生的最近发展区内进行 on-policy 强化学习,从而在小模型上同时获得蒸馏的稳定性与 RL 的泛化性。

实验

实验设计

ZPPO 在 Qwen3.5 家族 上执行后训练,覆盖 4 种学生规模(0.8B、2B、4B、9B),并统一使用 27B 教师 将其转换为视觉-语言模型(VLM)。训练语料为 ZPPO-77K,评测覆盖 31 个多模态与纯文本基准(16 VLM + 10 LLM + 5 Video)。对比基线包括:

  • 离线蒸馏(off-policy distillation)
  • 在线蒸馏(on-policy distillation)
  • GRPO 及其变体
  • Hint / Prefix 辅助方法

核心机制通过 提示重放缓冲区 持续循环困难问题,直到学生达到预定义的正确率阈值("毕业"),否则按 FIFO 移除。

关键发现

  • 全尺度一致领先:ZPPO 在所有学生规模下均超越离/在线蒸馏与 GRPO,验证了“提示内教师”策略的有效性。
  • 小模型收益更显著0.8B 规格下提升幅度最大,印证了该方法在小模型容量下仍能高效利用教师信号,而不会像传统 logit 模仿那样过度聚焦教师尖锐模式。
  • 缓冲区动态:难问题的持续循环放大了 BCQ(二选一判别)与 NCQ(聚合错误暴露共同失败模式)的效用,让学生在“最近发展区”内逐步提升。

与基线对比的深度解读

传统蒸馏强制学生模仿教师 logit 分布,在小模型上尤为脆弱,因为学生被迫适配远大于自身容量的教师决策边界,泛化受损。GRPO 虽避免 logit 模仿,但在穷尽所有尝试均失败的难题上会丢弃零优势样本,若强行注入教师响应则破坏 on-policy 假设。ZPPO 将教师信号保留在提示本身,既不改变策略梯度 on-policy 性质,又通过 BCQ/NCQ 让学生自主从正确与错误答案中学习,从而在保持泛化能力的同时显著提升小模型性能。

行业影响

落地场景

ZPPO 将知识蒸馏的教师信号从梯度转换到提示空间,使小模型在困难问题上无需模仿教师全概率分布,而是通过对比正确与错误候选(BCQ)以及聚合失败模式(NCQ)来自主提升。这特别适合部署在 移动端、边缘设备或离线环境 的多模态模型,例如 视觉问答、图像描述、视频理解 等场景。对于需要低延迟、高准确率但算力受限的产品,如 实时多模态客服机器人、智能硬件上的影像分析,可大幅降低对大型教师模型的在线依赖。

商业价值

  • 降本:用 0.8B–9B 学生模型 取代 27B 教师模型 线上服务,显著节省 GPU 推理成本与能耗。
  • 增收:小模型支持更广泛的设备覆盖(如中低端手机、IoT 设备),可扩大用户基数与付费场景。
  • 体验提升:端侧推理延迟更低且不依赖网络,用户体验更流畅;同时通过 ZPPO 保持了与教师接近的准确率,避免性能大幅下降。

集成与工作流接口

ZPPO 可作为现有 RL 后训练管线(如 GRPO) 的增强组件。训练时需额外生成 BCQ/NCQ 提示 并维护一个 提示重放缓冲区,这可通过offline预处理对每个困难问题采样教师与学生回答来完成,之后无缝接入标准的 policy gradient 更新。该流程与主流框架(如 PyTorch、vLLM)兼容,不需要改动模型架构,仅需适配数据构造与奖励函数。

具体用例

  • 电商平台的多模态商品问答:用户上传商品图片并提问,边缘设备上的小模型通过 ZPPO 训练后可直接理解图片与文本,给出准确描述或推荐,无需将敏感图片上传云端,保护隐私且响应迅速。
  • 自动驾驶的车载场景理解:小尺寸视觉语言模型蒸馏后部署在域控制器上,实时分析摄像头图像并生成驾驶决策解释,满足功能安全对低延迟和高可靠性的要求。

局限

  • 论文承认 ZPPO 目前聚焦于推理正确性(scope beyond reasoning correctness),其奖励信号基于 rule 或 judge 评判对错,难以捕捉流畅度、多样性等生成质量指标,因此对开放式文本生成或需要风格控制的场景可能不适用。此外,方法依赖教师与学生响应的文本构造,若教师自身存在错误,BCQ/NCQ 提示可能放大噪声,降低训练稳定性。
  • ZPPO 在每个困难问题上额外构造 BCQ/NCQ 提示并维护 replay buffer,带来了显著的训练计算和存储开销,特别是在大规模 deployment 中可能影响效率。buffer 容量有限且采用 FIFO 淘汰,可能导致已掌握但偶尔出错的问题被遗忘,或丢失长期未遇到的困难样本,破坏渐进学习节奏。实验仅基于 Qwen3.5 学生与单一 27B 教师,跨架构、规模比例和领域的泛化性尚未验证。
  • 与当前流行的 RL 后训练方法(如 DPO、RLHF 变体)缺乏直接比较,仅与 on/off-policy 蒸馏和 GRPO 对比,无法全面评估其在小模型上的相对性能。ZPPO 的 BCQ/NCQ 设计高度启发式且依赖人工预设,缺乏自适应的候选选择机制,对不同任务模板的鲁棒性可能不足,且没有理论收敛证明,在实际工业落地中可能需要大量调参。
论文Byung-Kwan Lee2026-06-16原文

相关内容