当前RLVR只是特定离线训练,不能扩展能力 Yang Yue你说得对——当前的RLVR只是一种特定的训练和离线设置。我们的工作关注的是这种当前的RLVR实践,而不是整个RL范式。所以我们并不是说“RL不能扩展能力”,只是今天的离线RLVR主要是在重新加权已有的东西。 动态Yang Yue2025-11-11原文 打开互动版