行业新闻

ACL杰出论文从token级熵变揭示RLVR训练熵坍缩机制

本文从token级熵变解释了RLVR训练中熵坍缩的成因,并提出STEER方法维持探索与利用平衡,提升推理能力。

用可验证奖励训练大模型(RLVR)时,策略熵快速下降,模型输出趋同,形成熵坍缩。浙大等提出熵稳定方法STEER,通过分析token级熵变机制,在数学推理和代码任务上稳定提升性能。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/c47e8b21-ccd5-4153-976d-5f1d53ec753c/0(2).jpg) ![Image](https://mmbiz.qpic.cn/mmbizjpg/5L8bhP5dIqFg0WfYlyqqeepLD4C3TibGpjf6FOH7EVuKjibcnDe74qjAU9XhgHylI3WghS7ricbx1ckkNhJHaQ2AnGqG5ZmOdwHJQLl99bxYHU/640?wxfmt=webp&from=appmsg&tp=wxpic&wxfrom=5&wxlazy=1imgIndex=0) 基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards,RLVR)正在成为大模型后训练的关键技术。数学题能判对错,代码能跑测试,可验证奖励让大模型可以通过强化学习持续提升推理能力。 不过,在 RLVR 训练过程中,一个值得关注的问题是:模型并不总是越训练越会探索。随着策略熵(policy entropy)快速下降,模型输出可能逐渐同质化,采样路径变窄,训练也可能提前停滞。 近日,浙江大学、腾讯等机构的论文《 Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective 》在刚刚结束的 ACL 2026 会议中获评 Outstanding Paper Award 。这项工作从 token-level 熵变出发,重新解释 RLVR 中的熵坍缩(entropy collapse),通过理论和实验分析对于熵动态的干预机制,并提出熵稳定方法 STEER,在数学推理和代码任务上都取得了稳定提升。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-07-15原文

相关内容