论文

Group Entropy-Controlled Policy Optimization

Group Entropy-Controlled Policy Optimization

在大型语言模型的强化学习对齐中,熵控制已成为平衡探索-利用权衡的有效工具。然而,现有方法常在同一策略下处理异构任务混合,导致不同任务呈现不同的熵状态,全局或 token 级别的熵调节无法满足异构探索需求。这种异质性进一步使得 GRPO 风格的正则化优势产生熵依赖偏差,导致不同 prompt 组之间的优势信号在统计上不可比。 为解决该问题,我们提出 Group Entropy-Controlled Policy Optimization (GEPO),一种对 GRPO 的轻量扩展。GEPO 利用从已有分组样本中估计的组熵,进行熵条件化的非对称优势塑形:在低熵组中衰减正向优势以减少过度利用,在高熵组中削弱负向优势以保持探索。自适应阈值从历史熵统计中推导。 在两个基座模型、涵盖数学、物理、科学、代码生成和指令遵循的 13 个基准上的广泛实验表明,GEPO 始终优于 GRPO 及近期熵控制方法,实现了跨任务的均衡提升,同时在整个训练过程中保留了任务特定的探索水平。

论文精读

TL;DR GEPO 通过组级熵自适应调控优势信号不对称性,解决异构任务混合强化学习中全局熵控失效与跨组优势不可比的问题,在多类基准上一致超越 GRPO 及现有熵控方法。

问题

问题背景

大模型后训练阶段,基于强化学习(尤其是 GRPO )的对齐方法已成为提升推理与指令跟随能力的主流范式。其核心目标之一,是在多任务混合的样本分布下,平衡策略的探索与利用。然而,不同任务(数学推理、代码生成、创意写作等)在解答多样性和难度上差异显著,导致同一策略在不同 prompt 组上产生截然不同的 token 级熵分布,使统一的熵控制策略难以适配各组差异化的探索需求。

现有方法的局限

GRPO 在每个 prompt 组内独立计算相对优势并进行归一化,原本是为了消除任务难度带来的绝对奖励偏差。但当各组熵值存在系统性差异时,这种归一化会引入熵依赖的偏差:低熵组(模型已较确信)的正优势信号被过度放大,造成过度利用(反复采样高概率但可能次优的答案);高熵组(模型不确定)的负优势信号被削弱,阻碍必要的探索。传统的全局熵约束或 token 级熵调节无法感知这种组间异质性,导致优势信号在跨组比较时失去统计可比性,最终损害多任务整体收敛效果。

为什么这个问题重要且困难

多任务混合训练是 LLM 后训练的标配,异质性是固有挑战。要精确修正 GRPO 的组级偏差,需要(1)在线估计各组熵值,(2)构建自适应而非固定的优势修正机制,(3)不引入额外计算开销。过往工作多依赖全局熵预算或启发式阈值,难以针对每个 prompt 组的动态探索状态进行细粒度干预。解决该问题可大幅提升 RL 训练稳定性与最终策略质量,对构建更普适的 LLM 对齐流程有直接工程价值。

行业类比

类似推荐系统中的多任务学习,不同行为任务(点击、收藏、时长)的反馈分布差异巨大,简单全局归一化会导致梯度冲突;需设计任务特定的自适应校准,才能让模型在各任务上均获得有意义的更新信号。

核心洞察

  • - **GRPO 的组归一化在异构任务混合训练中引入了熵依赖的偏差,导致不同提示组的优势信号不可比。** 论文首次从理论上证明了这一结构偏差的存在(Proposition 2.2),并指出低熵任务的优势被系统性地放大,高熵任务的优势被压缩,使全局优化信号失真。这解释了为何在数学推理与代码生成等任务混合时,模型易过拟合单一模式,而此前的熵控制方法(如全局熵约束)忽略了群组级别的异质性。
  • - **GEPO 通过群组熵自适应地塑造非对称优势,实现了比现有熵控制方法更精细的探索-利用平衡。** 不同于仅调节全局或 token 级熵,GEPO 直接利用已分组的采样估计群组熵,并基于历史熵统计动态设定自适应阈值,对低熵组衰减正优势以抑制过度利用,对高熵组衰减负优势以保留探索。这种轻量级扩展几乎不增加计算开销,却在 13 个跨域基准上一致优于 GRPO 和近期熵控制方法,尤其在保持任务特异性探索水平方面表现突出。

方法

输入与问题背景

GEPO 的输入是一个由多个提示组 (prompt group) 构成的 batch。每个组对应一个任务提示 (prompt),组内包含从当前策略采样的一组生成结果 (即“rollout samples”),并带有对应的奖励信号。在 GRPO 等架构下,每个组内会先计算基于组内相对优势 (normalized advantage),再用于策略梯度更新。然而,由于不同任务在相同策略下的输出熵 (output entropy) 不同,这种组内归一化会引入与熵相关的结构性偏差:低熵组的正优势偏大(导致过拟合),高熵组的负优势偏大(抑制探索)。

核心模块:组熵估计与自适应阈值

GEPO 的关键创新在于引入组熵 (group entropy) 作为条件信号来修正上述偏差。具体流程如下:

  1. 组熵估计:对于每个提示组,利用已有的组内采样样本,计算该组的经验熵 (empirical entropy),衡量当前策略在该任务上的不确定度。
  2. 自适应阈值计算:维护一个全局的熵统计量 (historical entropy statistics),据此动态确定低熵/高熵的分界点。方式是将历史熵的均值或分位数作为基准,以避免依赖固定阈值。
  3. 非对称优势塑造 (asymmetric advantage shaping):对于每个组,根据其组熵与阈值的相对大小,对组内正负优势施加不同的缩放:
    • 若为低熵组:压缩正优势(乘以衰减因子),减弱该组样本对策略的正向牵引,防止在确定性任务上过度利用当前策略。
    • 若为高熵组:压缩负优势(衰减负梯度信号),减轻对探索型任务中“不出众”样本的惩罚,保留探索空间。
    • 正/负缩放因子可以采用分段线性或指数衰减形式,且衰减系数与偏离阈值的程度成比例。

输出与训练动态

处理后的优势值替代原 GRPO 中的组内归一化优势,直接用于策略梯度计算。由于 GEPO 仅对已有的组内优势进行重标定,不改变采样过程或奖励计算,其计算开销极小,可作为现有 GRPO 训练流程的轻量插件。训练中,组熵会随策略演变,阈值也会滑动更新,确保整个训练周期中跨任务优势信号统计可比,最终在多种基准上实现更均衡的提升。

与同类方法的差异

不同于全局熵控制 (Global Entropy Control) 对所有样本施加统一调节,也不同于 token 级熵控制仅在解码时干预探索,GEPO 利用组粒度的熵信号对优势进行非对称缩放,直接修正 GRPO 的优势估计偏差,从而更精细地适配任务异质性。

实验

实验设计

  • 模型与数据:在 2 个基础 LLM 上微调,评估跨越 13 个异构基准,覆盖数学 (MATH, GSM8K)、代码 (HumanEval, MBPP)、科学/物理 (MMLU-STEM) 及指令遵循 (AlpacaEval) 等领域。
  • 基线方法:主要对比 GRPO,以及近期的熵控制方法 (如 entropy bonus, adaptive entropy regularization)。
  • 训练细节:在任务混合分布上执行 RL 微调,GEPO 仅需少量额外计算,利用已有分组样本估计组熵,并据此动态调整优势值。

关键发现

  • 跨任务一致提升:GEPO 在所有 13 个基准上稳定超越 GRPO 和熵控制基线,证明了组感知熵调控的有效性。
  • 平衡探索-利用:低熵组易过拟合,GEPO 通过衰减正优势抑制过利用;高熵组探索不足,GEPO 减少负优势惩罚以保留探索,自适应阈值从历史熵统计中学习。
  • 任务特性保持:训练全程各任务保持自身独特的探索水平,避免了全局熵控制可能导致的探索同质化问题。

与基线对比深度解读

  • vs GRPO:GRPO 的组归一化优势在熵异质任务上会产生偏差,使得低熵组的优势信号偏大、高熵组偏小,导致优化不平衡。GEPO 通过熵条件化非对称优势塑造,消除了该结构性偏差,实现更公平的任务间优化。
  • vs 全局/Token 级熵控制:全局方法忽略任务间差异,易牺牲某些任务的探索;Token 级方法过于细粒度,难以捕捉任务级语义。GEPO 在组级别操作,恰到好处地捕捉了任务的熵特征,带来更好的泛化。

行业影响

落地场景

GEPO 瞄准大语言模型 RL 后训练阶段,适用于使用 GRPO 或其变体进行多任务对齐的场景。主要落地产品包括:

  • 通用对话助手(如 ChatGPT、Claude):在指令遵循、写作、代码、数学等混合任务上训练时,GEPO 可动态调整探索强度,避免在低熵任务上过拟合或在高熵任务上探索不足。
  • 垂直领域模型定制:例如金融分析模型需同时处理财报摘要(低熵)与风险量化推理(高熵),GEPO 可保持跨领域性能均衡。

商业价值

  • 降本:通过自适应熵控减少因探索-利用失衡导致的训练退化,降低重复训练和人工干预成本。
  • 增收:提升模型在综合榜单(如 AlpacaEvalMT-Bench)上的表现,直接增强产品竞争力与市场定价权。
  • 体验提升:在多任务场景下提供更一致的输出质量,缓解“某些任务突然变蠢”的用户感知,提高留存与付费意愿。

与现有产品/工作流的接口

GEPO 是 GRPO 的轻量级扩展,集成成本极低:

  • 算法层面:仅需在优势计算时引入历史熵统计,对现有 RLHF 框架(如 TRLDeepSpeed-Chat)改动微小。
  • 数据层面:无需修改 prompt 分组或奖励模型,直接利用 GRPO 已有的采样结果计算组熵
  • 工作流整合:可作为现有训练 pipeline 的一个可插拔组件,在混合任务 SFT → RM 训练 → PPO/GRPO 步骤之间无缝替换原有优势归一化模块。

具体落地 use case

  1. 全球化内容平台的多语言问答系统
    训练数据包含多语种问答、创意写作和事实核查等异构任务。使用 GEPO 后,模型在低熵的事实类查询上避免重复安全回复(over-exploitation),同时在高熵的创意写作中保留多样性,整体用户满意度提升。
  2. AI 代码助手的多语言代码生成
    同时处理 Python 脚本生成(低熵,语法约束强)与复杂算法实现(高熵,解法多样),GEPO 通过组级优势塑形,防止模型在简单补全上过拟合固定模式,而在算法题上保持探索,减少“生成死板代码”的投诉。

局限

  • GEPO 的**自适应阈值**依赖于历史熵统计(如滑动窗口均值与标准差),这引入额外的超参数(窗口长度、阈值缩放因子等)。论文未系统分析这些参数在不同任务分布下的敏感性,实际部署时可能需要针对具体任务组合进行调优,否则可能导致阈值滞后或震荡,影响训练稳定性。
  • 实验仅在**两个基模型**(可能为 7B 级别)上进行验证,虽然覆盖 13 个基准,但缺少更大规模模型(如 30B+ 或 70B+)以及不同架构(如非 Transformer 或 MoE)上的测试,GEPO 的扩展性与通用性尚待确认。此外,对比的熵控制方法仅限少数近期工作,未与更多自适应探索策略(如基于互信息的 intrinsic reward)对比。
  • GEPO 仍然构建在 **GRPO 的组归一化优势**之上,虽缓解了组间熵差异导致的偏差,但未根本解决组归一化本身在奖励尺度极端变化时的脆弱性。理论假设任务分布满足独立同分布,但真实场景中任务流可能非平稳,历史统计可能无法及时反映分布变化,使非对称塑造的效果有所折扣。
论文Guangran Cheng2026-07-18原文

相关内容