行业新闻

小米发布 MiMo-V2.6 开源模型,Pro 版登顶开源榜单

小米发布 MiMo-V2.6 开源模型,Pro 版登顶开源榜单

小米用一次 350 万美元的大规模强化学习训练,把 MiMo-V2.6-Pro 送上了开源模型第一,还把单任务成本压到 0.13 美元量级,训练框架一并开源。

小米 MiMo-V2.6-Pro(1.02 万亿参数、420 亿激活)用 350 万美元跑完 30 个训练 Step,在 Artificial Analysis 智能指数上拿到 46 分,位列开源第一,多数 Agent 评测已逼近 Claude Opus 5 和 GPT-5.6 Sol。模型权重、技术报告、7000 多个 RL 任务环境和训练框架全部开源。

正文摘录

如今,MiMo-V2.6 的 Pro 和 Flash 双双跑完 30 个训练 Step,最终账单定格在 350 万美元(约合人民币 2344 万元)。 MiMo-V2.6-Pro,1.02 万亿参数,420 亿激活,在 Artificial Analysis Intelligence Index 上拿到 46 分,位列开源第一。 并且在多数 Agent 评测中,Pro 的成绩已经逼近 Claude Opus 5 和 GPT-5.6 Sol。 罗福莉将其称为「迄今为止任何开源模型团队所进行的规模最大的单次强化学习训练之一」。 还没完,更猛的还在后面,这位曾参与 DeepSeek-R1 研发的小米 MiMo 负责人直言: 在我看来,它背后的研究创新和工程挑战,超过了我曾参与其中的 DeepSeek-R1。 MiMo-V2.6-Pro 跑完 30 个 Step,用时 5 天 3 小时,花掉约 260 万美元; 每个 Step 包含 1568 个 Prompt,每道题让模型尝试 16 条不同路线,一轮就会产生超过 2.5 万条 Rollout。 按技术报告单步 2.7B3.7B training tokens 计算,Pro 全程累计处理约 81B111B Tokens,相当于塞满超过 8 万个百万 Token 上下文窗口。 30 个 Step 结束后,Flash 的平均通过率相对提升 25%,Pro 相对提升 12%。 DeepSWE v1.1 专门考察 Coding Agent 能不能在真实开源代码库中持续工作,OpenAI 和 Anthropic 也已将其列为前沿模型发布时的重点评测项。

阅读原文(qbitai.com)→

行业新闻一水2026-09-22原文

相关内容