研究提出 RLSVR 框架,为开放式任务构造可验证奖励
把自监督学习的思路引入强化学习,让开放式任务也能自动生成可验证奖励,从而支持大模型自我进化。
RLVR(用可验证奖励做强化学习)在数学和代码任务上很有效,但创意写作、分析等开放式任务没有标准答案。新框架 RLSVR 通过任务变换,把原始任务改造成带隐藏变量和确定性规则的代理任务,让开放式任务也能产生自动可验证的奖励,不再依赖人工或裁判模型。
正文摘录
.31.49.png)  可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。 然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。 受到自监督学习的启发,作者提出了 RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。