论文

理解 LLM 推理的进化策略:比 GRPO 更广的推理覆盖

理解 LLM 推理的进化策略:比 GRPO 更广的推理覆盖

进化策略 (ES) 近期作为大语言模型 (LLM) 推理的记忆高效后训练范式出现。然而,ES 的优化行为尚未得到充分研究,难以界定其相较于主流后训练范式(如群体相对策略优化 (GRPO))的优势范围。 通过系统研究 ES 的动态与机制,本文首先从理论和实验上识别出 ES 相对于 GRPO 的性能优势:ES 可带来更广的推理覆盖,从而更好地利用预训练 LLM 的推理能力。理论上,我们证明 ES 种群中的验证器投影 Jensen-Shannon 多样性有助于更高的 Pass@K 性能。实验上,与表现出熵坍缩的 GRPO 不同,ES 在提升 Pass@1 的同时实现了比 GRPO 更高的 Pass@K。我们进一步开发了顺序 GRPO-ES 训练策略,结合 GRPO 在 Pass@1 上的优势与 ES 在 Pass@K 上的增益。 其次,我们发现尽管存在显著的全模型参数漂移,ES 的任务性能提升仅由稀疏的大幅更新子集贡献。这种功能稀疏性表明参数的大幅移动不一定意味着功能广泛变化,留出评估进一步显示其不必然导致灾难性遗忘。最后,我们研究超参数设计如何影响 ES 的有效性,证明在更大 LLM 中 ES 需要更小的种群大小。这些发现将 ES 定位为一种独特的推理后训练范式,而非 GRPO 的效果较差、记忆高效的替代方案。

论文精读

TL;DR 本文发现 ES 在 LLM 推理后训练中比 GRPO 覆盖更广的推理路径,Pass@K 更高,且其大参数漂移仅来自稀疏功能更新、不引发灾难性遗忘,可与 GRPO 顺序混合。

问题

问题背景

大语言模型(LLM)推理后训练领域目前聚焦于利用可验证奖励(verifiable rewards)提升数学、代码等任务的 Pass@1 表现,强化学习方法如 Group Relative Policy Optimization (GRPO)已成为主流范式。

现有方法局限

GRPO 在优化过程中会出现 熵坍缩(entropy collapse):随着训练进行,策略输出分布趋于尖锐,采样多样性大幅下降。这导致正确解的覆盖范围变窄——即使单次采样准确率提升,多次采样(Pass@K)的增益依然有限,无法充分释放预训练模型本身具备的多种推理路径。此外,GRPO 的全参数更新可能引起明显的参数漂移,进而引发对灾难性遗忘的担忧。相比之下,Evolution Strategies (ES) 虽以内存高效著称,但其优化行为、相对 GRPO 的差异化定位一直缺乏系统研究,常被视作 GRPO 的低效替代而非独立范式。

为什么这个问题难/重要

推理任务的正确解往往不唯一,复杂推理或开放式问题中可能存在多条有效路径。工程上需要在 Pass@1(单次响应质量)与 Pass@K(覆盖多个可行解)之间根据部署场景权衡。ES 理论上能通过种群多样性提升 Pass@K,但如何严格证明该优势、如何设计超参数(如种群大小随模型规模变化)、以及全参数大幅漂移是否必然造成功能遗忘,都是尚未解决的技术挑战。业界对更高效、覆盖面更广的推理后训练方法存在强烈需求,ES 提供了一条潜在的低成本扩展采样覆盖的路径。

行业类比

这类似于代码补全系统中,提高采样温度可生成更丰富的候选补全,但可能降低第一条建议的采纳率,需要在探索(Pass@K)与利用(Pass@1)之间做工程权衡。

核心洞察

  • ES 通过种群多样性实现更广的推理覆盖,而非单纯节省显存。与 GRPO 在单策略优化下出现熵崩溃、Pass@K 受限不同,ES 用参数扰动构造策略种群,并借助 verifier-projected Jensen-Shannon diversity 增加覆盖不同推理路径的概率,理论证明该多样性与 Pass@K 提升正相关。这重新定位了 ES:它是面向 Pass@K 的独立范式,而非 GRPO 的低效替代品。
  • ES 的参数漂移大但功能更新高度稀疏,颠覆“大漂移必然导致灾难性遗忘”的直觉。实验表明,虽然全模型参数漂移显著,性能提升仅源于少量大幅度参数更新,泛化评估未出现广泛遗忘。这说明 ES 的优化行为不同于普通全参数 SGD 微调,为在受限资源下应用全参数 ES 提供了安全性依据,也提示可稀疏化更新以提升效率。

方法

方法概览

论文从三个维度剖析 Evolution Strategies (ES) 在 LLM reasoning 后训练中的行为:推理覆盖广度、参数漂移与遗忘、超参数可扩展性。

输入 → 关键模块 → 输出

  • 输入:预训练 LLM(参数 θ)与可验证奖励信号(如数学题答案校验)。
  • ES 优化循环:对 θ 施加高斯扰动,生成 n 个候选策略(population)。每个候选策略采样若干推理路径,由 verifier 打分;再用奖励加权平均估计梯度,更新中心策略 θ。与 GRPO 不同,ES 不计算 token-level 概率比,而是直接在参数空间搜索。
  • 多样性分析:提出 verifier-projected Jensen-Shannon diversity 衡量种群在正确/错误答案上的覆盖差异,理论上证明更高多样性有利于 Pass@K。
  • 功能稀疏性诊断:对参数更新量做 magnitude thresholding,发现仅少量大幅更新参数贡献主要性能提升——大参数漂移不等于广泛功能改变。
  • 超参数缩放:研究 reward normalization、perturbation scale、population size,发现更大 LLM 可用更小种群。
  • 混合训练:提出 sequential GRPO-ES,先 GRPO 提升 Pass@1,再 ES 提升 Pass@K。

原文主张:ES 不是 GRPO 的低效替代,而是在推理覆盖广度上有独立价值的 post-training 范式。

跟同类方法的差异点:ES 直接在参数空间搜索,避免 token 级策略梯度带来的 entropy collapse,从而在 Pass@K 上优于 GRPO,同时通过功能稀疏性降低灾难性遗忘风险。

实验

实验设计

本文围绕三个研究问题展开实验:RQ1 对比 Evolution Strategies (ES) 与 Group Relative Policy Optimization (GRPO) 在推理任务上的 Pass@1 和 Pass@K,并提出 sequential GRPO-ES 混合策略;RQ2 分析 ES 的参数漂移幅度与功能稀疏性,评估灾难性遗忘风险;RQ3 探究奖励归一化、扰动尺度、种群大小等超参数对 ES 效果的影响。

关键发现

  • ES 在 Pass@1 上有所提升,同时 Pass@K 显著高于 GRPO;GRPO 表现出熵崩溃(entropy collapse),导致采样多样性下降。
  • ES 虽然导致全模型参数大幅漂移,但性能提升仅由少量大幅更新贡献(functional sparsity),且 held-out 评估显示未引起灾难性遗忘。
  • 更大的 LLM 需要更小的种群大小,说明 ES 的扩展性优于直觉预期。

与基线对比解读

GRPO 的优势主要在 Pass@1(单次采样准确率),但牺牲了推理路径的多样性;ES 通过维持种群多样性获得更高的 Pass@K(多次采样覆盖正确答案的能力)。混合策略可在 Pass@1 与 Pass@K 之间取得 Pareto 平衡,表明 ES 不是 GRPO 的低效替代,而是具有互补优势的独立后训练范式。

行业影响

落地场景

ES 适合需要推理多样性与高 Pass@K 的场景:复杂客服工单自动解答、内容平台多视角文案生成、教育解题多解法展示、金融研报假设探索等。例如电商平台处理退款争议时,用 ES 微调后的 LLM 生成多个候选回复,再通过 verifier(规则或奖励模型)筛出最优,可提高首次解决率。教育产品中,ES 能为同一数学题生成多种正确解法,增强个性化辅导的适应性。

商业价值

  • 降本:ES 内存占用显著低于 GRPO,可在相对小的 GPU 集群上微调大模型,降低训练成本。
  • 增收/体验:Pass@K 提升意味着候选池质量更高,配合 verifier 或人工挑选可提升最终采纳率;GRPO-ES 顺序混合策略同时优化 Pass@1(即时响应质量)与 Pass@K(覆盖度),适合对延迟和多样性有不同需求的 A/B 测试。功能稀疏性表明不需要全参数更新也能获得性能提升,进一步节省计算资源。

与现有工作流接口

在现有 RLHF/GRPO 流水线中,可将 ES 作为第二阶段微调:先用 GRPO 提升 Pass@1,再用 ES 扩展推理覆盖。奖励函数沿用 verifiable rewards(代码执行、数学检查、单元测试),无需额外标注。超参建议大模型采用更小种群规模,可降低采样开销。推理阶段与 vLLM / SGLang 等引擎集成,扰动采样可并行执行,且 ES 的参数漂移不必然导致灾难性遗忘,有利于持续更新模型而不影响其他任务。

局限

  • - 理论分析依赖 **verifier 奖励信号** 与 **Jensen-Shannon 多样性** 的假设,主要适用于可验证奖励的推理任务(如数学/代码)。对开放式生成或弱验证场景,ES 的探索-利用权衡尚未验证;且理论中 Pass@K 提升条件可能对策略分布形态敏感,实际中需仔细校准奖励归一化与扰动尺度,否则多样性收益可能不稳定。
  • - 实验主要基于特定规模的 LLM 与有限的数据集,虽然提出 **功能稀疏性** 和 **种群规模缩放** 的结论,但更新幅度阈值化分析可能混淆噪声与真实功能变化;且全参数 one-point ES 仍需为每个扰动保存参数副本用于回滚/评估,在更大规模模型上与参数高效方法(如 **LoRA**)相比内存优势可能削弱,泛化性需进一步验证。
  • - 提出的 **sequential GRPO-ES training** 是顺序组合,仅探索了有限的 Pareto 前沿,缺乏在线多目标或交替优化策略;实际部署中两阶段训练会增加训练时间与超参数搜索成本,且 ES 阶段性能受初始 GRPO 策略影响明显,对不满足该初始条件的推理任务域可能失效。
论文Yunpeng Ba2026-08-27原文

相关内容