MiMo-V2.6正在进行RL训练,扩展计算、环境和评分器,将开源细节
沉寂了将近半年。我们在这段时间里研究一个问题:RL 究竟能扩展到多大。
MiMo-V2.6 目前正处于 RL 训练过程中。我们扩展了三件事:计算(每步约 2B tokens,1568 个 prompts × 16 次 rollout,完全异步)、环境与 harness(多任务 agentic RL,在一次运行中混合多个 harness),以及 grader 计算(agentic 组内 credit assignment,采用基于测试用例和 rubric 的奖励)。未来几周我们会逐步开源细节。
正在直播这次运行:https://t.co/ZSxahzJRju
MiMo-V2.6 目前正处于 RL 训练过程中。我们扩展了三件事:计算(每步约 2B tokens,1568 个 prompts × 16 次 rollout,完全异步)、环境与 harness(多任务 agentic RL,在一次运行中混合多个 harness),以及 grader 计算(agentic 组内 credit assignment,采用基于测试用例和 rubric 的奖励)。未来几周我们会逐步开源细节。
正在直播这次运行:https://t.co/ZSxahzJRju