ACL杰出论文从token级熵变揭示RLVR训练熵坍缩机制
本文从token级熵变解释了RLVR训练中熵坍缩的成因,并提出STEER方法维持探索与利用平衡,提升推理能力。
用可验证奖励训练大模型(RLVR)时,策略熵快速下降,模型输出趋同,形成熵坍缩。浙大等提出熵稳定方法STEER,通过分析token级熵变机制,在数学推理和代码任务上稳定提升性能。
正文摘录
.jpg)  基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。 不过,在 RLVR 训练过程中,一个值得关注的问题是:模型并不总是越训练越会探索。随着策略熵(policy entropy)快速下降,模型输出可能逐渐同质化,采样路径变窄,训练也可能提前停滞。 近日,浙江大学、腾讯等机构的论文《 Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective 》在刚刚结束的 ACL 2026 会议中获评 Outstanding Paper Award 。这项工作从 token-level 熵变出发,重新解释 RLVR 中的熵坍缩(entropy collapse),通过理论和实验分析对于熵动态的干预机制,并提出熵稳定方法 STEER,在数学推理和代码任务上都取得了稳定提升。