STARE: 基于惊奇引导的令牌级优势重加权实现策略熵稳定性
基于可验证奖励的强化学习算法(如 GRPO)已成为大语言模型复杂推理的主流后训练范式,但常在训练中遭遇策略熵崩溃问题。本文对 GRPO 下令牌级熵动态进行一阶梯度分析,发现令牌级信用分配不匹配:每个令牌的熵变化可分解为轨迹级优势与下一个令牌分布上的熵敏感函数的乘积,形成优势-惊奇四象限结构及近临界属性。 为此,提出 STARE(Surprisal-guided Token-level Advantage Reweighting for policy Entropy stability),通过批次内惊奇分位数识别熵关键令牌子集,选择性重加权其有效优势,并引入目标熵闭环门控实现稳定熵调节。在 1.5B 至 32B 参数规模、三类任务(短 CoT、长 CoT、多轮工具使用)上,STARE 能在数千步内维持稳定 RL 训练,并使策略熵保持在目标带宽内。在 AIME24 与 AIME25 上,STARE 较 DAPO 等基线平均准确率提升 4%-8%,反思令牌与响应长度同步增长,表明探索-利用平衡持续,进一步释放 RL 训练潜力。代码已开源。
论文精读
TL;DR STARE 通过惊喜度分位数重加权 token 优势并引入目标熵闭环门控,解决 GRPO 训练 LLM 时的策略熵坍缩,在 AIME 等数学推理任务上稳定训练并提升准确率 4-8%。
问题
问题背景
LLM 后训练中,强化学习与可验证奖励 (RLVR) 算法(如 GRPO)已成为复杂推理任务的核心范式。然而,训练过程中策略熵崩溃(policy entropy collapse)普遍发生,导致模型探索能力丧失,最终限制性能提升。
现有方法局限
主流 GRPO 及其变体(如 DAPO、Dr. GRPO)试图通过裁剪、KL 正则化或全局熵约束来缓解熵崩溃,但这些手段均基于轨迹级(trajectory-level) 优势估计,忽略了 token 级别的信用分配(credit assignment)差异。具体技术局限包括:
- 脱节的信噪比:轨迹级优势对 token 熵变的影响被简单平均化,掩盖了高低惊奇度 token 在熵动力学中的异质性角色。
- 被动调节滞后:KL 惩罚或裁剪阈值通过全局超参数固定,无法自适应批次内 token 级惊奇度分布的变化。
- 训练不稳定性:随着模型规模扩大(1.5B 到 32B),长链思维(Long CoT)场景下熵崩溃呈加速趋势,现有方法难以在数千步训练中维持熵的稳定窗口。
为什么这个问题难/重要
策略熵稳定性直接决定 RL 训练的探索-利用平衡。崩溃意味着模型过早收敛到确定性策略,丧失生成多样化推理路径(如反思 token、多步工具调用)的能力。技术上,token 级熵变化可分解为轨迹优势与熵敏感函数的乘积,形成四象限结构并呈现近临界性(near-criticality)——即总熵变化接近零但极不稳定,微小扰动即可打破平衡向崩溃或爆发倾斜。在没有细粒度 reweighting 的条件下,全局正则化要么力度不足,要么过度抑制有效探索。业界对 RLVR 中 token 级优势重加权 的需求日益迫切,因为这直接关联到模型的长程推理可靠性和复杂工具使用等落地场景。
行业类比:类似推荐系统中,仅根据曝光转化(轨迹级)调整全局策略,而忽视具体商品点击(token 级)会导致冷门优质内容被埋没——GRPO 的全局优势分配同样压制了高风险高回报的探索行为。
核心洞察
- GRPO 训练中的策略熵坍塌源于 token 级信用分配不匹配:理论分析表明每 token 熵变化可分解为轨迹级优势与基于下一个 token 分布的熵敏感度函数之积,形成优势-惊异四象限,揭示了哪些 token 对熵损失贡献最大。该发现跳出了仅从轨迹级或 batch 级调控的局限,为 token 粒度自适应重加权提供了严谨的梯度视角。
- STARE 通过批内惊异分位数动态识别熵关键 token,并对正/负优势区域分别实施衰减与放大,配合闭环目标熵门控,在不增加辅助网络的前提下实现训练全程熵值稳定。相较于 DAPO 等基线,该方法无需离线统计或额外价值网络,能直接嵌入现有 GRPO 流程,且支撑 AIME24/25 精度提升 4%-8% 的同时自然涌现反思 token,展示出持续探索-利用平衡对 RL 训练潜力的释放作用。
方法
输入与准备
STARE 在 GRPO 训练框架下工作,每步输入一批 rollout 轨迹,包含每个 token 的 策略概率 和 轨迹级优势 $A$ 。对每条序列中的每个 token $t$ ,计算其 surprisal:$-\log \pi_{\theta}(y_t|\dots)$ ,反映模型在该 token 上的意外程度。
关键模块
熵关键 token 划分(基于高 surprisal 分位数)
- 在一个训练批次内,按 surprisal 从高到低排序,取前 $\alpha$ 分位数(如 top 10%)作为 高 surprisal token 。这些 token 对策略熵的下降贡献最大,是熵坍塌的主要推手。
- 低 surprisal token 则相反,它们容易在优势为正时被过度提升概率,却几乎不改变熵,导致 信用分配错配 。
优势条件下 token 级信用重平衡
- 对高 surprisal token,若与正向优势共存,则被视作有价值的探索,保留原始优势;若与负向优势共存,则削弱其优势幅度,抑制低概率错误 token 被错误惩罚。
- 对低 surprisal token,若优势为正,会削减其优势,防止反复强化确定性 token;若优势为负,则保留原始惩罚。
- 最终形成 四象限重加权规则 ,打破 GRPO 中 token 级优势被轨迹均值“抹平”的问题。
目标熵闭环门控
- 引入一个 目标熵区间 $[H_{\min}, H_{\max}]$ 和当前批次平均策略熵 $\bar{H}$ 。
- 当 $\bar{H} < H_{\min}$(熵过低),门控因子 $g<1$ ,压缩所有 token 优势幅度,减弱梯度更新,为熵留出恢复空间。
- 当 $\bar{H} > H_{\max}$(熵过高),$g>1$ ,适度放大了梯度,引导分布收敛。
- 门控实现为 平滑钳位函数 ,避免硬切换造成训练震荡。
输出与调度
重加权后的 token 级优势 $\tilde{A}_t = g \cdot w_t \cdot A$ (其中 $w_t$ 由四象限规则决定)代替 GRPO 的原始优势,用于策略梯度更新。STARE 默认使用 固定加权模式 ,也可切换为自适应策略,根据熵偏离程度动态调节 $\alpha$ 或门控强度,进一步简化超参。
与同类方法的差异
与 DAPO 等仅从序列级裁剪过长轨迹或限制 KL 的方式不同,STARE 首次在 token 粒度 上基于 surprisal 解耦优势效应,并通过闭环熵门实现无监督的熵自稳,避免了手动调整温度或奖励塑形的需要。
实验
实验设计
STARE 在 1.5B–32B 多个模型规模、三个任务家族(Short CoT, Long CoT, Multi-Turn Tool Use)上进行验证,基线包括 GRPO、DAPO 等竞争性方法。训练采用强化学习后训练范式,重点观察数千步训练过程中策略熵的稳定性与下游推理基准 AIME24 / AIME25 的平均准确率。
关键发现
传统 GRPO 训练中普遍出现策略熵崩塌,导致探索停滞。STARE 通过惊奇度引导的 token 级优势重加权与目标熵闭环门控,在整个训练期间将策略熵稳定控制在目标区间内,无一次崩塌。最终在 AIME24 与 AIME25 上的平均准确率比 DAPO 及最强基线高出 4%–8%。同时观察到反思 token 频率与响应长度同步增长,表明模型持续保持探索-利用平衡,释放了更深层的 RL 训练潜力。
与基线的对比解读
STARE 的核心不同在于它从 token 级熵的一阶梯度分解中发现了优势-惊奇度四象限结构,并据此识别高惊奇度 token 子集进行信用信号重平衡,而非像 DAPO 那样仅凭轨迹级优势或固定阈值低概率 token 重加权。
理论分析显示,GRPO 的 token 级信用分配错配使得高惊奇度且正向优势的 token 被无效稀释,STARE 通过 batch 内惊奇度分位数精准定位这些关键 token,放大其学习信号,并引入自适应目标熵门控抑制过度重加权。这一设计使 熵保持近乎中性的动态平衡,避免了手动退火或启发式熵奖励的超参数敏感性。实验结果印证了理论优势:STARE 不仅在准确率上超越 DAPO,其训练曲线更平滑,终局响应长度与反思行为的涌现也更为稳健,说明该方法为大规模推理模型的 RL 训练提供了一条更可靠且易于复现的路径。
行业影响
落地场景
STARE 专注于修复 GRPO 类强化学习训练中常见的策略熵崩溃问题。任何依赖 GRPO(或类似 PPO 变体)进行后训练的 LLM 工作流均可直接受益,典型场景包括:
- 数学推理与代码生成:训练模型在 CoT / 工具调用中保持探索与利用平衡,避免模式坍塌。
- 多轮对话与客服系统:需要稳定熵以维持回复多样性,防止生成千篇一律的模板化答案。
- 企业级微调平台:提供训练稳定性即服务(Stability-as-a-Service),减少客户因熵崩溃导致的训练失败。
商业价值
STARE 从三条线释放价值:
- 降本:熵崩溃会造成训练波动与步数浪费,STARE 通过稳定策略熵减少无效训练步和超参调优人力成本,使相同算力下能产出更优模型。
- 增收:更稳定的训练意味着最终模型在复杂推理任务(如 AIME24/25)上准确率提升 4-8%,直接转化为付费 API 调用增加或企业订阅竞争力。
- 体验提升:在对话式 AI 产品中,熵稳定保证了回答的多样性与创造性,同时避免“胡言乱语”(过高熵)和“复读机”(过低熵),提升用户留存。
与现有 RLHF 工具(如 DeepSpeed-Chat、OpenRLHF)不同的是,STARE 不需要全流程改动,只干预 token 级优势重加权,可模块化集成,商业迁移成本低。
与现有工作流的接口
STARE 可作为即插即用的优势重加权层,接入主流 RL 训练框架:
- 损失函数改造:在原 GRPO 损失中,将 token 级优势按 batch 内 surprisal 分位数重加权,并引入目标熵闭环门控
α_t,以动态调节正则强度。 - 监控指标:训练过程中需额外追踪策略熵、surprisal 分布,框架如 Weights & Biases 或 TensorBoard 可直接集成。
- 超参数:只需增加
surprisal_quantile、target_entropy等少量配置,对原有训练脚本侵入性低。
具体集成示例:在 veRL 或 trl 库的 GRPO 训练循环中,替换优势计算逻辑,增加一个 EntropyGate 类即可,无需改动模型架构或数据管线。
具体落地 Use Case
案例一:数学辅导 AI(EdTech)
一家在线教育平台训练自动解题助手,使用 GRPO 优化长链推理。引入 STARE 后,训练过程中策略熵始终保持在目标区间(如 0.2-0.5),最终 AIME 准确率提升 5%,且反思类 token 自然涌现,使模型能展示纠错步骤,学生更易理解解题过程。
案例二:多模态电商导购 Agent
构建多轮商品推荐 Agent 时,需频繁调用搜索引擎和商品 API(Multi-Turn Tool Use)。GRPO 训练容易陷入只推荐头部商品的熵坍塌。STARE 通过高 surprisal token 重加权,鼓励模型探索更多元化的商品组合,最终上线后点击率提升 3%,用户会话长度增加 12%。
局限
- **超参数敏感性与任务依赖**:STARE 引入多个关键超参数,如惊奇分位数阈值、目标熵范围、门控粒度等,这些需要针对不同任务和模型规模手动调节(附录 B.4、B.8、B.9 的消融实验表明对性能有显著影响)。论文未提供自动调参机制,在实际部署中可能增加工程师的调优负担,降低了开箱即用的易用性。此外,目标熵的设定依赖对任务熵分布的先验知识,若先验不准可能导致策略过早收敛或探索不足。
- **批次大小与统计稳定性**:方法核心依赖于批次内惊奇分位数来划分“熵关键”与“非关键” token,当批次大小较小时,分位数估计可能噪声较大,导致 token 分组不稳定,进而影响优势重加权和熵调节的效果。论文实验主要基于较大的批次设置(如 GRPO 通常使用较大批次),在资源受限或在线学习场景中,小批次下的性能衰退可能成为制约。
- **理论假设与实际实现的差距**:理论分析基于无 clipping 的 GRPO 更新,并假设轨迹级优势在 token 间均匀分配,而实际训练中常使用 PPO 式的 clipping 和更复杂的优势估计(如 GAE)。虽然实验表明 STARE 在 standard GRPO 设置下有效,但理论结果的严格性可能在实际实现中打折扣,对 clipping 或其他正则化手段的兼容性未做深入探讨。