动态

当前RLVR只是特定离线训练,不能扩展能力

Yang Yue
你说得对——当前的RLVR只是一种特定的训练和离线设置。我们的工作关注的是这种当前的RLVR实践,而不是整个RL范式。所以我们并不是说“RL不能扩展能力”,只是今天的离线RLVR主要是在重新加权已有的东西。
动态Yang Yue2025-11-11原文

相关内容