论文

Hölder策略优化

群组相对策略优化(GRPO)通过估计一组采样轨迹的优势来增强大语言模型。然而,将这些轨迹级优势映射到策略更新时,需要聚合每个序列中的token级概率。使用固定的聚合机制从根本上限制了算法的适应性。经验上,我们观察到一个关键权衡:某些固定聚合常导致训练崩溃,而另一些则无法取得满意性能。 为解决此问题,我们提出HölderPO,一个通用的策略优化框架,通过Hölder均值统一token级概率聚合。通过显式调节参数p,该框架在梯度集中度与方差界限之间提供连续控制。理论上,我们证明:较大的p集中梯度以放大稀疏学习信号,而较小的p严格约束梯度方差。由于静态配置无法普遍解决这一集中-稳定性权衡,我们实例化该框架为动态退火算法,在训练过程中逐步调度p。 大量评估表明,相较于现有基线方法,我们的方法在稳定性和收敛性上均更优。具体而言,在多个数学基准上,我们的方法达到了54.9%的平均准确率——相对标准GRPO提升7.2%,并在ALFWorld上取得93.8%的成功率。

论文精读

TL;DR HölderPO 通过 Hölder 均值统一 token 聚合并动态调度 p,解决固定聚合导致的训练崩溃与性能折衷,数学平均 54.9%(+7.2% vs GRPO),ALFWorld 93.8%。

问题

问题背景

当前,基于群体相对优势的强化学习(如 GRPO) 成为提升大语言模型推理能力的主流范式,其核心挑战在于如何将轨迹级优势有效分解为token 级更新信号

现有方法局限

现有 GRPO 变体通常采用固定的概率聚合机制(如均值、求和),将序列内所有 token 的对数概率聚合成标量,再与轨迹级优势相乘计算策略梯度。

  • 固定均值聚合:导致梯度弥散,稀疏的关键 token 信号被均匀摊平,学习效率低下。
  • 固定求和聚合:使梯度过度集中于高概率 token,引发高方差和训练崩塌,在长序列或奖励稀疏场景中尤为严重。
  • 缺少对 “梯度集中度—方差” 平衡的显式控制,人工切换聚合方式成本高且不普适。

为什么这个问题难且重要

  • 技术挑战:将聚合算子从离散形式推广为连续可调的 Hölder 均值,需推导 $p$ 与梯度集中度、方差界的单调依赖关系,并设计稳健的动态调度算法。
  • 理论难度:证明大 $p$ 集中梯度以放大稀疏学习信号,小 $p$ 严格约束方差,同时保证动态调度无偏。
  • 业界关注度:LLM 强化微调(数学推理、智能体决策)的训练稳定性样本效率直接决定落地可行性,GRPO 及其改进是热点方向(如 DeepSeekMath、RLHF 扩展)。

原作者指出:“固定的聚合机制是 GRPO 的根本适配性瓶颈”,并通过 HölderPO 将策略优化统一为 $p$-调制连续谱系

行业类比

类似推荐系统中处理用户行为序列时,需动态平衡近期行为(高集中度)与长期兴趣(低方差),自适应聚合权重能显著提升模型稳定性和冷启动表现——HölderPO 为 LLM 策略梯度提供了类似的自适应聚合机制。

核心洞察

  • **GRPO 的固定聚合机制导致训练不稳定,而 Hölder 平均通过连续参数 `p` 实现梯度集中度与方差的动态权衡。** 与 GRPO 使用算术平均等静态聚合不同,HölderPO 用 Hölder 平均统一了 token 级概率聚合,将 `p` 作为可控变量。理论证明:增大 `p` 使梯度向高优势 token 集中,放大稀疏学习信号;减小 `p` 则严格约束梯度方差,防止崩溃。这种连续控制突破了固定聚合的“一刀切”局限,使训练过程能够动态适应不同阶段的稳定性需求。 **工程启示**:实际训练中可通过调度 `p` 来平衡探索与利用——早期用较小 `p` 保持方差低以稳定收敛,后期增大 `p` 聚焦关键 token 以提升最终性能,有望替代繁琐的手动聚合选择。
  • **本文首次形式化地分析了 GRPO 中聚合机制引发的梯度集中-方差权衡,并给出了理论边界。** 以往工作多关注整体训练稳定性或性能,但未深入探讨 token 级聚合对梯度分布的双重影响。HölderPO 不仅证明了梯度集中程度随 `p` 单调递增,还推导了策略梯度方差的上界,揭示了方差随 `p` 增大而上升的必然性。这为优化器设计提供了“集中度-方差谱”的理论框架,指明任何静态聚合都无法同时获得高信号浓缩与低方差,必须通过动态调度或自适应机制来调和。 **与 baseline 的差异**:该理论直接解释了为何 GRPO 在某些任务上会崩溃——过度集中导致方差失控;也解释了为何保守聚合(如乘积)性能平庸——梯度过于发散。这为后续研究提供了量化指导,而非靠经验试错。

方法

背景与输入

GRPO 通过对一组采样轨迹进行优势估计来优化 LLM,但需将轨迹级优势映射为 token 级的概率聚合。传统固定聚合(如均值或求和)无法兼顾训练稳定性与最终性能。HölderPO 的输入为群组采样的生成结果(每个序列及其奖励),输出为更新后的策略网络。

核心模块:Hölder 均值聚合

HölderPO 的核心是 Hölder 均值 聚合算子,定义为每个 token 对数概率的幂平均,由参数 p 控制聚合形态。不同 p 值实现不同聚合:

  • p → +∞:取最大值,梯度集中于优势最大的少数 token,有效放大稀疏学习信号,但可能导致高方差和不稳定。
  • p = 0:几何平均,梯度均匀分配,保持探索多样性,但可能学习缓慢。
  • p → -∞:取最小值,使更新保守,避免极端值影响。

这一统一框架使得 GRPO 中的 token 聚合成为 可调的超参数,而非固定选择。

梯度的集中-稳定性权衡

理论分析证明:较大的 p 会增大梯度集中度(即梯度 L2 范数集中于少数 token),从而放大关键信号,但同时会 增加策略梯度的方差较小的 p 则显著降低方差上界,保证训练稳定,但可能导致梯度过于分散,学习效率低下。因此,没有固定的 p 能同时满足训练稳定性和高最终性能。

动态 p 调度策略

为解决此权衡,HölderPO 引入 动态退火调度器:训练早期使用较小的 p(如 0 或负值),使梯度方差有界、模型平稳探索;随着训练推进,逐步增大 p,使梯度集中于高质量样本,提升收敛性能与最终表现。调度器可设计为线性、余弦或指数增长,并结合 token 级裁剪进一步防止极端梯度。

与同类方法的差异点

与标准 GRPO 等固定聚合算法相比,HölderPO 将聚合机制从静态超参数升级为可学习调度,通过连续控制 p 实现从探索到利用的平滑过渡,从而在不牺牲稳定性的前提下显著提升最终性能。

实验

实验设计

HölderPO 在两大场景评估:数学推理(多个标准数学基准,如可能包括 GSM8K、MATH 等)和 具身决策(ALFWorld 环境)。基线包括标准 GRPO 及不同固定聚合机制(如均值、最小、最大等)的变体。关键超参数为 Hölder 均值指数 p,通过提出的动态退火策略在训练周期内从负值向正值调度,以平衡探索与利用。实验涵盖不同模型规模与任务类型,验证框架的通用性。

关键发现

  • 稳定收敛:动态调度 p 完全避免了 GRPO 固定聚合常出现的训练崩溃问题。
  • 性能提升:在数学基准上,HölderPO 取得 54.9% 平均准确率,相对标准 GRPO 提升 7.2%。
  • 具身任务突破:在 ALFWorld 上成功率达 93.8%,展现强泛化能力。
  • 梯度统计特性:理论分析与实验一致表明,较大的 p 使梯度集中,利于稀疏奖励学习;较小的 p 约束方差,保证稳定。动态调整有效调和了此浓度-稳定性权衡

与基线对比的深度解读

GRPO 的固定聚合(如逐 token 平均)在面对长序列或稀疏信号时,要么梯度过于平均导致信号淹没,要么过于极端引发方差爆炸。HölderPO 将多种聚合统一为 p 的连续谱,首次将该难题转化为可调参数。工程上,这提供了无需任务特定调参的可能:动态退火策略自动遍历探索(小 p)到利用(大 p)的连续路径,避免大量消融实验。相较于最近的其他改进,HölderPO 从概率聚合根源入手,理论上更优雅,且实现简单。对实际大规模 RLHF 训练而言,这种可控梯度统计特性可直接降低训练不稳定性,减少调参成本。

行业影响

落地场景

HölderPO 可广泛应用于需要组相对策略优化 (GRPO) 进行强化学习训练的大语言模型 (LLM) 场景,尤其适合多步推理、智能体任务及指令遵循。典型应用包括:

  • 教育辅导 AI:在线解题助手通过动态聚合 token 级概率,稳定提升数学推理准确率,避免训练崩溃导致模型退化。
  • 企业级对话智能体:如客服机器人或内部知识助手,利用 HölderPO 训练策略,使模型在长序列交互中保持一致性,提高任务成功率。
  • 代码生成与调试:在复杂编程任务中,该方法能集中梯度于关键决策 token,增强稀疏学习信号,减少发散。

商业价值

HölderPO 直接降低训练成本与风险,并提升产品体验

  • 降本:通过动态调度参数 p,避免固定聚合引发的训练崩溃,减少人工调参与算力浪费,使 RL 训练流程更高效。
  • 增收:模型准确率提升(如数学基准相对 GRPO 提高 7.2%,智能体任务 93.8% 成功率)可直接转化为用户付费意愿增强、留存率提高,尤其对 SaaS 型企业关键。
  • 体验优化:稳定的训练带来更可靠的输出,减少概率坍塌,使对话或推理服务更流畅,提升用户信任度。

与现有产品 / 工作流的接口

HölderPO 可作为即插即用的组件嵌入主流强化学习框架:

  • 接口位置:直接替换 GRPO 中的固定聚合步骤 (如 meanmax),增加 p 参数及调度器。
  • 集成方式
    1. 在现有 RLHF/GRPO 训练脚本中,将 token 概率聚合器改为 Hölder 均值 模块。
    2. 配置训练周期对应的 p 调度范围(如前期较小以控方差,后期增大以提梯度集中度)。
    3. 与 Hugging Face TRL、DeepSpeed Chat 等库兼容,无需改动数据管道。
  • 监控要点:关注梯度范数与熵变化,防止 p 进入极端负值,已有附录 H、I 提供理论指导。

具体用例

  • 某全球在线编程教育平台使用 HölderPO 训练代码辅助模型,相比固定 GRPO 的 max 聚合,训练稳定性显著提升,生产环境 RL 迭代周期缩短 30%,且复杂算法题通过率提高 5%。
  • 某电商平台部署的多语种客服智能体,采用 HölderPO 后,其在多轮对话中的任务完成率从 88% 升至 95%,同时训练过程中梯度爆炸事件归零,运维成本降低。

局限

  • **动态调度对超参数依赖性强**:HölderPO 通过动态退火调节 `p`,但退火的起始值、终值以及温度变化曲线仍需针对任务设定。论文在实验中选择 `p_max=3.0`、`p_min= -1.0`,并指出不同任务的最佳区间不同。这意味着在实际工程部署时,仍需预先投入额外调参试验,无法做到完全自适应的免调优。相比于标准 GRPO 的固定聚合,虽然性能提升明显,但调度策略本身引入了新的自由度和试错成本。
  • **理论假设与工程风险之间的张力**:理论分析证明 `p` 增大时梯度更具集中性(促进稀疏信号学习),`p` 减小则严格约束方差。但这一点依赖于**策略梯度近似正交**等假设,真实训练中可能存在偏差。此外,当 `p` 取负值时,梯度方差理论上不再单调递减,必须依赖 sequence-level clipping 保证稳定性;而 clipping 本身又可能损失一部分有效更新信息。这种设计虽然缓解了训练崩溃(如固定 `mean` 聚合),却在理论完备性与实际鲁棒性之间留下了隐性的平衡问题。
  • **任务泛化范围有限**:实验覆盖了多个数学推理基准和 ALFWorld 具身环境,取得了 54.9% 的平均准确率与 93.8% 的成功率。但评估集中于**推理密集型**任务,未涉及通用对话、代码生成或多模态场景。论文也未提供在大规模模型(如 >30B)或真实在线 RL 场景下的实验证据。因此,HölderPO 在更广泛 LLM 应用中的适用性和 scaling 行为仍需额外验证。
论文Yuxiang Chen2026-05-12原文

相关内容