动态

MiMo-V2.6 通过大规模 RL 成为开源第一,分享技术路线与团队思考

Fuli Luo
MiMo-V2.6:RL 扩展的艰难之路

MiMo-V2.6 很可能是迄今为止任何开源模型团队所进行过的、按算力衡量最大的单次 RL 运行之一。在一个算力极度稀缺的时代,我们仍然选择让一支数十人的团队在很长一段时间里专注于一个目标:扩展 RL。这需要的不仅是研究信念,还需要对 AGI 的愿景、对未知的敬畏,以及直面最难问题的勇气。

结果:用中期训练构建潜力,用重度 RL 释放潜力——如今成为排名第一的开源模型。我强烈建议阅读技术报告。我相信它会成为 Agent RL 从业者反复翻看、每次都能发现新东西的那类论文之一。在我看来,其背后的研究创新和工程挑战,超过了我曾部分参与的 DeepSeek R1。

有人会问:为什么用 MixRL 而不是 MOPD?首先,它们并不是相互竞争的选择。我们在中等难度的可验证任务——代码及相关 agentic 任务——上运行 MixRL,发现所得模型泛化得非常好。其次,对于那些难以验证、时间跨度极长,或困难到无法纳入联合 RL 运行的任务——纳入后会显著降低 rollout 效率或引入严重的 rollout 陈旧性——我们会单独训练它们,并通过 MOPD 合并所得能力。游戏、3D 任务,以及带有主观评估信号的任务都属于这一类。

然后还有第三个,略显调侃的答案:我们团队足够扁平,没有组织孤岛,因此 MixRL 对我们来说并不难。更重要的是,每个人都喜欢这种方式——来自不同领域的人每天聚在一起,被对 AGI——对能够不断自我提升的智能——的追求驱动,直面并解决各个领域的 RL 瓶颈。我会永远记得这一时期的 RL 每日更新会:紧张、密集,充满实时涌现的智能。

MiMo-V2.6 只是开始。在一个智能很容易被复制的时代,我们仍然选择艰难的道路——走向自我提升,走向 AGI。前方许多事情仍然未知。但我们愿意持续投入时间、算力和热情——攻克一个又一个难题,并把每一个都彻底做透,直到智能跨入新的范式。
动态Fuli Luo2026-09-21原文

相关内容