发布OpenReward,提供330+RL环境与450万+任务 General Reasoning推出OpenReward。通过一个API提供330多个强化学习环境自动扩缩的沙箱计算450万+个独特的RL任务与Tinker、Miles、Slime配合得天衣无缝链接和线程如下。 动态General Reasoning2026-03-24原文 打开互动版