MiMo-V2.6以大规模RL登顶开源模型,并开源蒸馏模型、7K环境与RL框架
MiMo-V2.6:扩展 RL 的艰难之路
MiMo-V2.6 很可能是迄今为止任何开源模型团队所进行的、按算力衡量的最大单次 RL 训练之一。在算力极度稀缺的时代,我们仍然选择在一个较长时期内投入数十人的团队,只为达成一个目标:扩展 RL。这需要的不仅仅是研究信念。它需要 AGI 愿景、对未知的敬畏,以及直面最难问题的胆识。
最终得到的模型,其潜力通过 mid-training 构建,并通过大规模 RL 被释放。今天,它是排名第一的开源模型。我强烈推荐阅读技术报告。我相信它会成为 Agent RL 实践者反复翻阅、每次都能发现新东西的论文之一。在我看来,其背后的研究创新与工程挑战,超过了我曾部分参与的 DeepSeek R1。
有人会问:为什么用 MixRL 而不是 MOPD?首先,它们并不是相互竞争的选择。我们在中等难度的可验证任务上运行 MixRL,包括代码及相关 agentic 任务,并发现所得模型泛化得非常好。其次,那些难以验证、极其长程,或单纯太难而无法纳入联合 RL 运行的任务,则单独训练。把它们纳入会大幅降低 rollout 效率,或引入显著的 rollout 陈旧性。随后,我们通过 MOPD 合并所得能力。游戏、3D 任务以及带有主观评估信号的任务都属于这一类。
还有第三个有点调皮的回答。我们的团队足够扁平,也足够没有组织孤岛,因此 MixRL 对我们来说根本不难。更重要的是,每个人都喜欢这种方式。来自不同领域的人每天聚在一起,受 AGI 以及能够持续自我提升的智能这一追求驱动,去面对并解决各个领域的 RL 瓶颈。我会永远记得这段时期的 RL 每日更新会。它们紧张而密集,智能实时涌现。
为帮助开源社区专注于解决真正的 Agentic RL 问题,我们发布了一个从 MiMo RL 轨迹中蒸馏出的 Qwen 模型,作为更强的 RL 起点,同时发布了 7K 个多样化环境和完整的 RL 训练框架。我们希望这些资源能推动 Agentic RL 研究向前发展。
MiMo-V2.6 只是开始。在智能易于复制的时代,我们仍然选择通往自我提升与 AGI 的艰难道路。前方许多事物仍未可知。但我们愿意持续投入所需的时间、算力和热情,去承担一个又一个难题,并把每一个都彻底做到底,直到智能跨越进入新的范式。
MiMo-V2.6 很可能是迄今为止任何开源模型团队所进行的、按算力衡量的最大单次 RL 训练之一。在算力极度稀缺的时代,我们仍然选择在一个较长时期内投入数十人的团队,只为达成一个目标:扩展 RL。这需要的不仅仅是研究信念。它需要 AGI 愿景、对未知的敬畏,以及直面最难问题的胆识。
最终得到的模型,其潜力通过 mid-training 构建,并通过大规模 RL 被释放。今天,它是排名第一的开源模型。我强烈推荐阅读技术报告。我相信它会成为 Agent RL 实践者反复翻阅、每次都能发现新东西的论文之一。在我看来,其背后的研究创新与工程挑战,超过了我曾部分参与的 DeepSeek R1。
有人会问:为什么用 MixRL 而不是 MOPD?首先,它们并不是相互竞争的选择。我们在中等难度的可验证任务上运行 MixRL,包括代码及相关 agentic 任务,并发现所得模型泛化得非常好。其次,那些难以验证、极其长程,或单纯太难而无法纳入联合 RL 运行的任务,则单独训练。把它们纳入会大幅降低 rollout 效率,或引入显著的 rollout 陈旧性。随后,我们通过 MOPD 合并所得能力。游戏、3D 任务以及带有主观评估信号的任务都属于这一类。
还有第三个有点调皮的回答。我们的团队足够扁平,也足够没有组织孤岛,因此 MixRL 对我们来说根本不难。更重要的是,每个人都喜欢这种方式。来自不同领域的人每天聚在一起,受 AGI 以及能够持续自我提升的智能这一追求驱动,去面对并解决各个领域的 RL 瓶颈。我会永远记得这段时期的 RL 每日更新会。它们紧张而密集,智能实时涌现。
为帮助开源社区专注于解决真正的 Agentic RL 问题,我们发布了一个从 MiMo RL 轨迹中蒸馏出的 Qwen 模型,作为更强的 RL 起点,同时发布了 7K 个多样化环境和完整的 RL 训练框架。我们希望这些资源能推动 Agentic RL 研究向前发展。
MiMo-V2.6 只是开始。在智能易于复制的时代,我们仍然选择通往自我提升与 AGI 的艰难道路。前方许多事物仍未可知。但我们愿意持续投入所需的时间、算力和热情,去承担一个又一个难题,并把每一个都彻底做到底,直到智能跨越进入新的范式。