论文

较小模型是 GRPO 中策略级多样性的天然探索者

较小模型是 GRPO 中策略级多样性的天然探索者

本文在 GRPO(Group Relative Policy Optimization)中发现了一个提升 rollout 多样性的新维度。现有策略主要通过增加 token 级随机性 来提升多样性,但这可能引入逐步噪声并导致轨迹不连贯。我们观察到,同一模型族中的 较小模型 天然具有更高的 策略级多样性,表现为随样本数增加时,其 pass@k 优于较大模型。与 token 级噪声不同,这种多样性具有时间相关性,能保持逻辑一致性,并为梯度估计提供结构化探索信号。 为此,我们提出 S2L-PO(Small-to-Large Policy Optimization)框架,利用固定小模型作为天然探索者来训练大模型。为平衡探索与利用,我们设计了 渐进退火策略,从离线的小模型 rollout 逐渐过渡到大学习器自身的采样。这一转变巧妙地避免了因小模型容量限制导致的训练中期性能下降,实现了更快的收敛并解锁了更高的性能上限。 在多个数学推理基准上,S2L-PO 取得了显著提升,例如使用 1.7B 探索者引导 8B 模型在 AIME 24 上提升了 +8.8%,同时减少了 rollout 计算量。

论文精读

TL;DR **S2L-PO** 利用小模型作为天然探索者,为 **GRPO** 提供策略级多样性 rollout,通过渐进式退火将探索信号平稳转移到大模型,在数学推理任务上相比 token 级随机扰动更快收敛且提升上限(如 AIME 24 +8.8%)。

问题

GRPO 已成为大语言模型强化学习微调的主流范式,其梯度估计的质量高度依赖 rollout 的多样性。然而,随着模型规模增长,如何稳定地产生多样化且逻辑连贯的探索轨迹,正成为制约训练效率和最终性能的关键瓶颈。

现有方法普遍通过注入 token 级随机性(如温度采样、nucleus 采样)来提升多样性。这类扰动在单个 token 步上独立施加,破坏了轨迹的时间相关性,容易引入 步进噪声,导致推理路径断裂或出现不合理的跳跃。由此产生的梯度信号存在大量干扰,训练过程收敛缓慢,且模型可能学到表面多样性而非深层推理结构的多样性。

该问题的核心难点在于:真正对策略优化有益的多样性必须发生在 策略级,即整条推理路径层面的结构化变异,同时保持逻辑一致性。研究者发现,同一模型家族内较小模型因参数压缩而天然具有更高的策略多样性(体现为 pass@k 随 k 增长更显著),但这种潜力尚未被有效利用。如何将小模型的“天然探索者”优势嫁接到大模型训练中,同时避免小模型容量限制导致的中途性能退化,是一个兼具理论深度和工程实用性的挑战。业界对 DeepSeek-R1 等模型的关注已证明,在数学推理等场景中,探索策略的改进能直接带来能力跃升,因此该方向具有极高的技术关注度。

行业类比:类似于自动驾驶仿真中,利用轻量级感知模型生成多样化驾驶场景来训练重型决策模型,用小模型的结构化探索能力驱动大模型训练,能以更低计算成本获得更丰富的训练信号。

核心洞察

  • **小模型是 GRPO 中策略级多样性的天然来源**:同一模型家族内的小模型随采样次数增加展现更高的 pass@k,表明其 rollout 具备内禀的多样性,且这种多样性是时序相关、逻辑连贯的,而非 token 级随机性产生的碎片化噪声。 相比主流方法仅依赖温度参数或 top-p 采样注入 token 层噪声,S2L-PO 将固定小模型视为零成本探索策略,其生成的轨迹保留了推理路径的结构完整性,为大规模梯度估计提供高质量探索信号,避免随机扰动导致的梯度干扰和收敛震荡。这为 RLHF 与 GRPO 的多样性设计提供了新维度:从“加噪”转向“模型容量压缩”,低成本、高稳定性。
  • **策略级扰动与 token 级扰动对梯度估计存在本质差异**:论文从理论层面证明,token 级随机性引入的噪声在梯度累加时产生干扰,使优化方向摇摆;而由参数压缩导致的策略级扰动天然具有结构化模式,其产生的梯度信号在组内保持一致性,有效降低方差。 该视角解释了为何简单增加温度会损害训练稳定性,同时揭示了小模型蒸馏过程中的“微扰”——参数减少并非单纯的性能劣化,而是引入了多样化的决策边界,恰可被利用为无偏探索。这颠覆了以往将小模型仅视为弱教师的认知,为未来 RL 微调中的探索策略指明了方向:通过可控模型压缩制造结构化扰动,而非盲目注入随机噪声。

方法

输入

给定训练提示集和同一模型家族中的两个模型:一个待优化的大型学习者(learner)和一个参数固定、容量较小的小型探索者(explorer)。训练目标是在 GRPO 框架下最大化大型模型的预期奖励。

关键模块

1. 策略级扰动的设计与利用

与常规 GRPO 仅通过温度参数等 token 级随机性注入多样性不同,S2L-PO 利用小型模型的输出分布作为策略级扰动源。同一家族的小模型天生具备更高的 pass@k 增长趋势,其采样轨迹保持时间相关性,逻辑连贯且噪声更低。由此,一组 rollout 中混合小模型采样的轨迹,能提供结构化、时序相关的探索信号,避免 token 级噪声导致的梯度干扰。

2. 混合 rollout 生成

在训练步骤 t 上,对于每条提示,按混合比例 alpha(t) 决定 rollout 来源:

  • 部分轨迹由固定的小模型 offline 生成(探索者采样);
  • 部分由当前大型学习者自身采样。 混合后的 rollout 组送入 GRPO 的优势函数计算和策略更新,梯度既来自小模型的探索信号,也来自大模型的 exploitation。

3. 渐进退火策略

alpha(t) 从初始的高比例小模型采样逐渐退火至零,实现从探索到利用的平滑过渡。典型设置:训练初期完全依赖小模型 rollout(alpha = 1.0),随后线性或余弦衰减到仅使用大模型自身采样(alpha = 0.0)。退火步长通过超参控制,过短的过渡期会损害性能收敛。该机制避免了纯小模型 rollout 后期因容量瓶颈导致的性能停滞,最终打通更高的性能天花板。

4. GRPO 更新

混合 rollout 组计算组内相对优势,策略梯度更新仅应用于大型学习者,小模型参数冻结。这一过程可无缝嵌入任何 GRPO 实现,不增加额外推理开销。

输出

训练完成后,直接获得性能优于纯自采样 GRPO 或蒸馏式训练的大型模型,收敛速度更快,最终准确率更高(如 1.7B 探索者辅助下,8B 模型 AIME 24 提升 +8.8%),且 rollout 总计算量更低。

与同类方法的差异

传统方法通过增大采样温度或强制 token 掩码增加多样性,引入的是无时序关联的白噪声,易导致轨迹断裂、梯度估计有偏。S2L-PO 通过固定小模型这一天然探索者,注入策略级、时序连贯的多样性,在保持逻辑一致性的同时提供结构化梯度信号,并以退火方式平衡探索与利用,避免蒸馏式训练中常见的容量瓶颈干扰。

实验

实验设计

本研究在 数学推理基准(如 AIME 2024)上验证 S2L-PO 的有效性。核心设置采用 小模型作为固定探索器(例如 1.7B 参数)为 大模型学习者(例如 8B 参数)生成 rollout,并通过渐进退火策略(progressive annealing)从完全依赖小模型离线 rollout 平稳过渡到学习者自身采样。基线是 标准 GRPO,其仅依赖 token 级随机性(温度采样等)增加多样性。

关键发现

  1. 小模型是天然的策略级探索者:在相同模型家族内,小模型的 pass@k 随采样数增加而快速上升,证明其固有的 策略级多样性,且这种多样性具有时序相关性,能保持逻辑连贯性。
  2. S2L-PO 实现更高的性能上限:以 1.7B 探索器引导 8B 模型训练,在 AIME 2024 上准确率绝对提升 +8.8%,同时减少了 rollout 计算开销。
  3. 渐进过渡至关重要:烧蚀实验表明,从离线小模型 rollout 到自身采样的逐步切换优于突然切换,可避免因小模型容量限制导致的中期性能下降,并加速收敛。

与基线对比解读

标准 GRPO 通过 token 级随机性增加多样性的做法容易引入步骤级噪声,导致轨迹不连贯,梯度估计受到干扰。S2L-PO 则利用 参数级压缩带来的策略级扰动,这种扰动结构更优,能提供 结构化探索信号,使梯度估计更加稳定和高效。这解释了为什么 S2L-PO 不仅最终性能更高,而且收敛更快,证明了在 GRPO 中探索多样性时,策略级扰动优于 token 级扰动的论点。

行业影响

落地场景

S2L-PO 框架可直接用于大语言模型(LLM)的强化学习训练管线,尤其适合需要高质量、多样化 rollout 的 GRPO 类方法。典型场景包括:

  • 数学 / 代码推理产品:如数学解题助手、代码生成工具,需通过强化学习提升复杂推理准确率。
  • 内容审核与安全对齐:RLHF / RLAIF 流程中,多样化但连贯的 rollout 可帮助模型探索更优策略,同时避免因随机噪声导致的低效探索。
  • 多轮对话系统:需要保持上下文一致性的任务中,小模型提供的结构化探索信号比 token 级随机扰动更有价值。

商业价值

  • 降本:利用固定的小模型(如 1.7B 探索器辅助 8B 模型)生成 rollout,可显著减少大型学习者模型的前向采样次数,降低 GPU 算力消耗。论文在 AIME 24 上取得 +8.8% 准确率,同时减少 rollout 计算量,意味着训练同等性能模型所需成本更低。
  • 增速收敛:渐进退火策略使收敛更快,缩短实验迭代周期,加速模型上线。
  • 性能天花板提升:小模型带来的策略级多样性帮助大模型找到更优解,直接提升最终模型能力,带来产品体验的质变。

与现有工作流的接口

S2L-PO 作为 GRPO 训练流程的即插即用增强模块,集成成本低:

  1. 替换现有多样性策略:当前多数 GRPO 实现通过调高温度系数或 top-p 注入 token 级随机性,可直接切换为小模型生成离线 rollout,再混合大模型自采样。
  2. 渐进退火调度:可在训练配置中设置退火步数与比例参数,控制从离线探索到在线利用的过渡,无需修改优化器或奖励模型。
  3. 兼容性:与现有模型家族(如 Llama、Qwen 等)兼容,仅需同系列小模型;也可与蒸馏、剪枝等压缩技术结合,进一步降低探索器成本。

具体用例

  • 电商搜索与推荐:LLM 生成商品描述或搜索查询理解,需探索多样但合理的表述。用较小模型预先采样候选 rewrite,再由大模型学习过滤,既能覆盖长尾意图,又避免不合理输出。
  • 教育对话辅导:数学题分步解答中,小模型生成多条潜在解题路径,大模型通过 GRPO 选择最优路径并提升推理连贯性,最终实现更准确的题解生成,可部署于 AI 辅导产品。

局限

  • **探索能力受限小模型容量**。方法依赖同系列小模型提供策略级多样性,但小模型的能力边界决定了探索空间的上限。当大模型训练到一定程度后,小模型生成的轨迹可能不再提供有意义的探索信号,甚至引入偏差。虽然渐进退火可缓解此问题,但过渡时机的选择需精心设计,过早或过晚都会影响最终性能。
  • **对数据集和任务的泛化性未充分验证**。目前实验仅集中在数学推理(GSM8K、MATH、AIME24 等),其他复杂任务(如多轮对话、代码生成、多模态推理)是否也能从 S2L-PO 受益尚未可知。不同任务所需的探索模式差异较大,小模型是否始终具备天然的策略多样性仍需更多实证。
  • **渐进退火超参数敏感**。退火步长、温度衰减曲线等对最终效果有显著影响,文中消融实验显示不足的退火会导致性能下降,实际应用时需要针对每个模型族和任务单独调整,增加了工程部署的调参负担。此外,使用离线小模型 rollout 额外增加了存储和计算开销,可能抵消部分效率优势。
论文Yiming Ren2026-06-02原文

相关内容