动态

超越RL范式,模型能像人类数学家一样严谨论证

超越RL范式,模型能像人类数学家一样严谨论证
Alexander Wei
第四,我认为IMO提交材料是难以验证的多页证明。这方面的进展需要超越清晰可验证奖励的RL范式。通过这样做,我们获得了一个能够像人类数学家一样编写复杂、严谨论证的模型。
动态Alexander Wei2025-07-19原文

相关内容