行业新闻

研究提出 RLSVR 框架,为开放式任务构造可验证奖励

把自监督学习的思路引入强化学习,让开放式任务也能自动生成可验证奖励,从而支持大模型自我进化。

RLVR(用可验证奖励做强化学习)在数学和代码任务上很有效,但创意写作、分析等开放式任务没有标准答案。新框架 RLSVR 通过任务变换,把原始任务改造成带隐藏变量和确定性规则的代理任务,让开放式任务也能产生自动可验证的奖励,不再依赖人工或裁判模型。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/cb8424d4-e2d3-480c-bff9-bb604d8e7cd6/Screenshot2026-08-06at10(2).31.49.png) ![图片](https://mmbiz.qpic.cn/szmmbizpng/5L8bhP5dIqElqZ0GcgINP4V78xIEARSSDI7pRpUQpZAhGK6rr8zoMJM3icYLohdHNhq93gll1YkHwsYaOO3tolCuL5QN5gAtJc46PnNgECQI/640?wxfmt=png&from=appmsgimgIndex=0) 可验证奖励的强化学习(RLVR)逐渐成为提升大模型推理能力的重要技术路线。在数学和代码任务中,标准答案和编译器能够自动判断输出是否正确,从而为大规模强化学习提供准确、低成本的奖励信号。 然而,创意写作和研究分析等开放式任务通常不存在唯一正确答案。现有方法往往依赖人工偏好、奖励模型或 LLM Judge 评估输出质量,容易受到评估偏差和裁判模型能力的限制,同时还会增加训练阶段的推理成本。如何为开放式任务构造稳定、可扩展且能够自动验证的奖励,成为 RLVR 进一步扩展的关键障碍。 受到自监督学习的启发,作者提出了 RLSVR(Reinforcement Learning with Self-Verifiable Rewards)训练框架。自监督学习通过掩码预测、对比学习等代理任务,从数据本身生成训练标签;RLSVR 将类似的任务变换思想引入强化学习,通过构造带有环境隐藏变量和确定性规则的代理任务,让开放式任务也能够产生可验证奖励。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-08-06原文

相关内容