行业新闻

小米 MiMo 公开强化学习训练过程,每小时算力成本约 3 万美元

小米公开 MiMo 的 Agentic RL 训练全过程,讨论的核心是:模型与环境交互、产生经验再学习这条循环,能否像预训练一样靠算力持续扩展。

小米把 MiMo-V2.6 的强化学习训练做成了公开直播:花了多少钱、跑了多少步、奖励曲线有没有涨、哪块显卡出故障,都能实时看到。从 Pro 模型开始训练算起 36 小时,两款模型已花掉超 108 万美元,平均每小时约 3 万美元。

正文摘录

罗福莉沉寂半年官宣小米强化学习!直播新模型训练过程,一小时烧 3 万美元 点进去一看,这哪是训练现场啊,这就是烧钱现场,一眨眼就是 10 美刀,一分钟就是 4000 多元人民币出去了。 当然烧钱的速度可能不是均匀的,从 Pro 模型开始训练算起 36 小时,两款模型已经花了超过 108 万美元,平均每小时 3 万美元。 在这个页面上,训练花了多少钱、跑了多少步、奖励曲线涨没涨、哪个节点的显卡出了故障,全部公开可查。 见过开放权重、开放训练代码和开放训练数据的,开放训练过程的还真是没见过,围观群众纷纷大呼过瘾。 Pro 的 dynsam/avg@n 从第 1 步的约 0.565 提升至 0.614,Flash 则从约 0.514 提升至 0.603;最新公开的 DeepSWE v1.1 离线评测中,Pro 和 Flash 分别达到 62.24 和 60.77。(对比 DeepSeek-Flash v1.1 是 74.2%) Flash 从更低的起点快速追近,Pro 目前只保持小幅领先。不过 Pro 训练完一个 Step 更慢,所以最新的评分还没出来。 传统的预训练 scaling 很容易理解:更多数据 × 更多参数 × 更多算力 → 更强模型 MiMo-V2.6 系列每个训练 Step 大约会处理 20 亿 Token,配置为 1568 个 Prompt × 每个 Prompt 16 条 Rollout。 也就是说,同一道题并不是只让模型回答一次,而是让它尝试多条不同的解题和行动轨迹,再从这些尝试中获得强化学习信号。 1568×16 意味着一轮就可能产生超过 2.5 万条 Rollout。

阅读原文(qbitai.com)→

行业新闻梦晨2026-09-17原文

相关内容