后训练中RL扩展仍有效,多环境统一训练 Oleksii Kuchaiev1/4 我们在后训练中看不到瓶颈。扩展强化学习的软件、基础设施和数据持续带来重大能力提升。我们在30个RL环境中训练,每批次多达4000个实例——数学、代码、STEM、智能体工具使用、SWE、终端、安全——全部在统一的多环境RLVR设置中。 动态Oleksii Kuchaiev2026-03-11原文 打开互动版