论文

MiniMax-M2系列: 迷你激活释放最大现实世界智能

MiniMax-M2系列: 迷你激活释放最大现实世界智能

我们推出 MiniMax-M2 系列,这是一族基于迷你激活释放最大现实世界智能原则的混合专家语言模型。旗舰版 M2 总参数量 229.9B,每 token 仅激活 9.8B 参数。M2 系列专为智能体部署而端到端设计,包含三个核心组件: 1. 智能体驱动数据管道:在大规模智能体编码与协作用例中生成可验证轨迹,这些轨迹基于可执行工作空间和对齐产物的奖励。 2. Forge 系统:可扩展的智能体原生强化学习系统,适应长程智能体轨迹,结合窗口 FIFO 调度、前缀树合并、推理优化,以及干净的三元组解耦(训练-推理-智能体),同时支持白盒与黑盒智能体。 3. 自我进化:最新的 M2.7 检查点迈出了第一步——自主调试训练运行并修改自身脚手架。 从 M2 到 M2.7,这一组合将迷你激活足迹转化为在智能体编码、深度搜索、办公任务和推理基准上的前沿性能。

论文精读

TL;DR MiniMax-M2 系列 MoE 模型以每 token 仅 9.8B 激活参数,通过**智能体驱动的数据管线**、原生 RL 系统 Forge 和自进化机制,在编程、搜索、办公等真实智能体任务上达到前沿水平。

问题

问题背景

大语言模型正从单轮对话快速转向长周期智能体工作流,要求模型在多步交互中自主规划、使用工具、从环境反馈中学习并修正错误。

现有方法局限

  • 训练数据缺乏可验证性:传统对话数据不包含可执行 workspace,难以评估动作是否正确,导致模型在真实工具调用时泛化差。
  • RL 系统不适应长轨迹:现有强化学习框架通常针对短序列优化,面对智能体产生的长轨迹时奖励稀疏、信用分配困难,训练不稳定。
  • 训练-推理-智能体耦合:系统未将训练、推理和 agent 执行有效解耦,扩展性受限,也难以同时支持白盒黑盒智能体。
  • 小激活参数未充分释放智能:Mixture-of-Experts 模型每 token 激活参数少,但若训练数据与 RL 策略未针对性设计,其 agentic 能力往往远弱于同等总参数量但激活更多的模型。

技术挑战与重要性

智能体任务要求模型在真实执行环境(终端、浏览器、Office 套件)中产出可验证结果,错误的累积和状态空间组合爆炸使学习信号设计极为困难。同时,业界对能自主完成软件工程、深度搜索、办公任务的 AI 助手需求迫切,但部署超大规模模型推理成本高昂。如何用极少的每 token 激活参数(如 9.8B)达到前沿 agentic 智能,是模型架构、训练数据构建、RL 算法和基础设施共同面临的系统级挑战。

行业类比

类似 AI 编程助手 需在 IDE 中实时生成可运行代码,全能型智能体需在各种数字工作台中高成功率执行多步任务,模型的计算效率直接决定其能否从实验走向实际部署。

核心洞察

  • 小激活专家模型与智能体原生RL结合,实现低推理成本下的前沿智能体性能。MiniMax-M2通过每token仅9.8B激活参数支撑229.9B总容量,其核心差异在于并非采用通用大规模预训练-微调范式,而是围绕智能体部署设计全链路:智能体驱动数据产生可验证的长期轨迹,Forge RL系统专为此类轨迹优化训练效率,实现了激活参数最小化与真实任务效果最大化的平衡。
  • 自演化能力的初步落地,让模型能够自主调试训练过程并修改自身脚手架。M2.7检查点展示的自主错误诊断与修复能力,区别于常规固定流程的LLM训练,它降低了对人工干预的依赖,为训练、部署、维护全链条的自动化演进提供了可行路径,这在大规模RL工程实践中具有降低维护成本、加速迭代的潜在收益。

方法

输入与数据管线构建

MiniMax-M2 系列的核心输入是多源异构数据,通过三条管线转化为训练信号:

  • Agentic Coding 管线:基于真实软件工程任务(GitHub issues)和专家构造的应用开发任务(AppDev),利用可执行工作空间(executable workspace)生成代码、测试与调试轨迹,并通过 artifact-aligned reward(如语法正确性、测试通过率、环境状态匹配)提供稠密反馈。
  • Agentic Cowork 管线:覆盖深度搜索、知识工作者办公任务(表格操作、幻灯片生成等),在模拟环境中记录长程交互轨迹,同样以可执行 workspace 为锚点确保信号可验证。
  • 推理与通用对话:加入数学、科学推理及角色扮演等高质量文本,平衡能力分布。

关键模块:Forge RL 系统与模型架构

模型架构为 MoE,总参数 229.9B,每个 token 仅激活 9.8B,实现“mini activation”设计。训练核心是 Forge——一个面向 agent 的原生 RL 系统:

  • Agent RL 建模:将 agent 与环境的交互建模为 MDP,动作空间涵盖工具调用、代码执行、文件操作等,使用 policy optimization 优化 token 级生成,奖励函数融合环境反馈与任务完成度。
  • 训练基础设施创新
    • Windowed FIFO scheduling:按时间窗调度样本,平衡新旧数据分布。
    • Prefix-tree merging:将多条轨迹共享前缀压缩为树结构,加速训练。
    • 训练-推理-智能体解耦:支持白盒与黑盒 agent,训练阶段可替换不同 scaffold,提升泛化性。
  • 自进化初步尝试(M2.7 检查点):模型能自主调试训练运行错误并修改自身的 agent scaffold,形成闭环演进。

输出:前沿 Agent 性能

通过上述管线,M2 系列在 agentic coding、deep search、office-task 及推理基准上取得前沿水平,尤其以极低激活参数量实现高效推理,适合部署。

与同类工作的差异:不同于单纯依赖静态代码数据集或离线 RL 的方法,MiniMax-M2 强调可执行 workspace 驱动的在线轨迹生成与 artifact-aligned reward,使训练信号更贴近真实环境反馈,并结合 prefix-tree merging 等工程优化实现长程轨迹的高效训练。

实验

实验设计

MiniMax-M2 系列的评估围绕代理任务能力展开,覆盖四大类场景:

  • 代理编程 (Agentic Coding):在可执行工作空间下生成并验证代码轨迹。
  • 深度搜索 (Deep Search):开放式网络调研与信息综合。
  • 办公任务 (Office-Task):知识工作者日常操作,如表格、幻灯片处理。
  • 推理基准 (Reasoning Benchmarks):需要深层逻辑的学术/专业测试。

实验采用统一的评估设置,从 M2 基础版本到最新的 M2.7 检查点,所有模型均在端到端代理部署框架下测试。特别关注**“小激活参数量”**与性能的权衡——旗舰 M2 总参数 229.9B,仅 9.8B/token 被激活,通过与全参数模型对比,验证 MoE 架构的效率。

关键发现

  • 效率与性能兼得:M2 系列以仅 9.8B 的激活参数,在代理编码、深度搜索、办公任务等现实场景中达到前沿水平 (frontier-tier),表明精心设计的数据管道与 RL 训练可以弥补参数规模差距。
  • 代理原生 RL 的有效性:自研 Forge 系统支持长周期代理轨迹训练,配合窗口式 FIFO 调度与前缀树合并,显著提升了样本效率,使得 RL 能直接优化多步代理行为。
  • 自我进化的早期迹象:M2.7 检查点展示了自主调试训练运行和修改脚手架的初步能力,在 MLE Bench Lite 案例中验证了自我优化的可能性。
  • 可验证轨迹驱动:通过代理编码与代理协作生成的大规模、可验证轨迹数据,辅以工件对齐奖励 (artifact-aligned reward),有效缓解了奖励稀疏问题。

基线对比与深度解读

虽然论文明细表未在摘录中给出,但摘要强调 M2 系列“将小激活足迹转化为前沿水平性能”。这意味着 M2 在与同等规模激活的密集模型或同类 MoE 模型较量时,具有显著优势。其核心差异在于:

  • 数据闭环:不只是依赖静态数据集,而是通过代理交互持续产生可执行验证的轨迹,形成反馈循环。
  • 训练–推理–代理解耦:Forge 系统的白盒/黑盒代理支持,使训练管线能独立于推理引擎演进,加速迭代。
  • 长期视野优化:标准 RLHF 往往局限于单轮或短序列,而 M2 的 RL 建模直接对准多步代理任务,提升了实际部署的鲁棒性。

这种设计思路为后续 MoE 模型在代理场景的落地提供了重要参考:激活参数只是杠杆,真正的智能增益来自任务对齐的数据、奖励与训练框架的深度耦合。

行业影响

落地场景

MiniMax-M2 系列以极低激活参数实现 agent 长程任务能力,可嵌入多种产品形态:

  • 开发者工具:作为 agentic coding 引擎,自动完成 GitHub issue 修复、PR 生成,支持终端环境交互的 Terminal-Gym 合成任务。
  • 办公协作平台:在 幻灯片生成、表格分析、深度搜索与开放网页研究 等场景中,提供知识工作者辅助,自动产出报告与演示文稿。
  • 企业自动化:面向 金融分析客服系统招聘流程 等需要多步推理与工具调用的长周期 workflow,直接作为 agent 后端。

商业价值

模型 每 token 仅激活 9.8B 参数,显著低于同规模全激活模型,带来三重收益:

  • 降本:推理成本逼近小模型,使大规模 agent 部署在经济上可行;Forge RL 系统prefix-tree mergingwindowed-FIFO 调度 进一步优化训练与推理效率。
  • 增收:在 SWE-bench、MLE-bench 等真实代理任务上达到前沿分数,可直接替代部分人工软件工程与数据分析工作,释放高价值人力。
  • 体验提升interleaved thinking自主调试训练运行 的 self-evolution 能力,使 agent 能在无人工干预下修正错误,提升任务成功率和用户粘性。

与现有产品/工作流的接口

  • 云端 API 集成:提供标准 REST 或 gRPC 接口,支持 白盒(直接操作模型权重)与黑盒(仅通过文本接口)agent,易于接入现有 CI/CD 管道或 RPA 框架。
  • 执行环境对接agentic coding 依赖可执行 workspace,可容器化部署,通过沙箱连接 GitHub、文件系统等;agentic cowork 任务则通过浏览器自动化或办公套件 API 交互。
  • 数据衔接agent-driven data pipeline 可复用组织内部的 issue tracker、文档库作为 seed 数据,通过 artifact-aligned reward 不断优化。

具体落地用例

  1. 电商推荐与商品优化:利用 agentic cowork 自动抓取竞品价格、用户评论,生成价格策略报告与商品详情页文案,每天可节省运营团队 4-6 小时。
  2. 医疗影像报告自动化:结合 office-task 能力,从医院 PACS 系统获取影像,agent 结构化提取病灶信息并生成初版诊断报告,辅助放射科医生提速 30%。

以上场景均不限定地域,全球 AI 技术团队可将 MiniMax-M2 作为 私有化部署或 SaaS 组件 替换现有大模型,显著降低长程任务的服务成本。

局限

  • 模型规模与部署成本:MiniMax-M2 总参数量高达 229.9B,即使通过 MoE 将每 token 激活参数压缩到 9.8B,在训练和推理阶段仍需庞大的硬件集群和工程优化,这可能限制其在资源受限环境下的应用。论文未详细讨论推理延迟、吞吐量或能耗,而长 horizon 的 agentic 工作流本身对延迟敏感,实际部署可行性有待验证。
  • 数据与评估生态的闭环依赖:agent-driven data pipeline 强依赖于可执行环境(executable workspace)和 artifact-aligned reward,这使得高质量训练数据的生成范围被限于可自动化验证的任务(如 coding、office tasks)。对于开放域知识工作、模糊目标的多步交互等场景,轨迹收集和奖励设计难度剧增,可能导致模型在这些领域的泛化能力不足。论文仅报告了特定 benchmark 结果,缺少对更广泛 agentic 任务(如 web 端到端导航、复杂工具使用)的深入分析。
  • 自演化机制的成熟度与安全性:M2.7 展现的 self-evolution 能力仅涉及训练调试和 scaffold 修改,距离真正的自主改进尚远。该类自修改行为可能引入不可控的训练动力学,论文未分析安全对齐策略在自演化过程中如何保持,也未讨论可能的风险案例。与直接通过 RL 微调外部工具不同,修改自身代码库的范式对沙箱环境、审计机制和回滚策略要求极高,实际生产环境中长时间运行可能导致累积偏差或隐性错误。
论文MiniMax2026-05-26原文

相关内容