RLSVR以任务转换产生自验证奖励,无需评判器,提升写作、摘要与推理 AK转推 @Benjamin_eecs: 谢谢@_akhaliq!RLVR需要验证器,但开放式任务(写作、摘要)没有验证器,学习到的评判会被博弈。受多智能体辩论启发,我们将任务变成一个规则可验证赢家的游戏:信息不对称使得一个玩家真正处于劣势,因此奖励=正确找出他们。没有评判,没有可攻击的奖励模型。提升写作、摘要和推理:)) 动态AK2026-08-03原文 打开互动版