动态

发布OpenReward,提供330+RL环境与450万+任务

发布OpenReward,提供330+RL环境与450万+任务
General Reasoning
推出OpenReward。

通过一个API提供330多个强化学习环境
自动扩缩的沙箱计算
450万+个独特的RL任务
与Tinker、Miles、Slime配合得天衣无缝

链接和线程如下。
动态General Reasoning2026-03-24原文

相关内容