论文

Nemotron 3 Ultra: 开放、高效的混合专家混合 Mamba-Transformer 模型用于代理推理

Nemotron 3 Ultra: 开放、高效的混合专家混合 Mamba-Transformer 模型用于代理推理

我们介绍了 Nemotron 3 Ultra,一个总参数 5500 亿、激活参数 550 亿的 混合专家混合 Mamba-Attention 语言模型。 我们在 20 万亿文本 token 上预训练了该模型,然后将上下文长度扩展到 100 万 token,并使用 监督微调 (SFT)、强化学习 (RL) 和 多教师在线策略蒸馏 (MOPD) 进行后训练。 关键技术创新包括: - LatentMoE:潜变量混合专家 - 多 token 预测 (MTP) - NVFP4 预训练 - 多环境 RLVR - 推理预算控制 与最先进的公开可用 LLM 相比,Nemotron 3 Ultra 的推理吞吐量最高提升约 6 倍,同时达到相同精度。最先进的精度、高推理吞吐量和 100 万 token 上下文长度使其非常适合长时间运行的自主代理任务。我们在 HuggingFace 上开源了基础、后训练和量化检查点,以及训练数据和配方。

论文精读

TL;DR Nemotron 3 Ultra 是 5500 亿总参数的开源混合 Mamba-Attention MoE 模型,通过 LatentMoE、MTP 及 NVFP4 训练等技术,在 55B 激活参数下实现 6 倍推理吞吐提升与 1M 长上下文,专为智能体推理场景优化。

问题

问题背景

当前大语言模型(LLM)正从单纯文本生成转向智能体推理,要求模型在长时间自主运行中高效处理超长上下文,同时保持高准确率与低推理成本。

现有方法局限

传统 Dense Transformer 因自注意力的二次复杂度,在长序列推理时吞吐量骤降;Mamba 等状态空间模型虽有线性复杂度,但捕捉复杂依赖关系的能力常弱于注意力。MoE 通过扩大总参数而控制活跃参数来提升容量,但面临 专家负载不平衡死专家 问题,训练不稳定且推理时设备间通信开销大。此外,多数模型采用的逐 token 自回归解码导致 推理延迟高,无法满足高速智能体任务需求。现有公开模型在维持高精度的同时,推理吞吐量远不能满足长时间运行的 Agent 场景。

为什么这个问题难/重要

实现高效长上下文推理需同时解决多个矛盾:

  • 架构设计:如何在注意力与状态空间之间权衡,既保留长程建模能力又降低计算复杂度。
  • MoE 稳定性:避免专家在训练中退化,保证所有参数得到充分利用。
  • 训练与推理精度:低精度训练(如 FP4)可加速,但需对抗梯度下溢与模型发散。
  • 推理时优化:结合推测解码、预填充-解码分离等技术降低端到端延迟。

业界对 自主 Agent代码调试多步工具调用 等场景关注度极高,这类任务要求模型在数万 token 上下文中进行多轮决策,任何效率瓶颈都会导致用户体验或系统可用性下降。

类比:就像自动驾驶系统需实时处理长序列传感器数据并连贯决策,Agent 模型同样需要将“感知-推理-行动”循环压缩到毫秒级延迟,这正是 Nemotron 3 Ultra 试图用混合架构与先进后训练达成的目标。

核心洞察

  • 混合 Mamba-Attention 与 Mixture-of-Experts 的协同设计:Nemotron 3 Ultra 将状态空间模型(Mamba)和传统注意力层混合在 MoE 架构中,既保留了注意力机制对长距离依赖的建模能力,又利用 Mamba 的高效序列处理显著提升推理吞吐。与纯 Transformer MoE 相比,该混合方案在 1M 上下文长度下实现了约 6 倍推理吞吐,同时保持同等精度,为长时间运行的自主代理任务提供了工程上可行的架构选择。
  • LatentMoE 与 NVFP4 预训练实现大规模稀疏模型稳定训练:模型采用潜变量专家路由(LatentMoE)和 4 位浮点预训练(NVFP4),有效缓解了传统 MoE 中专家负载不均衡和激活范数不稳定的问题。通过将路由决策从离散门控转变为连续潜空间,并结合低精度训练减少显存占用,使得 550B 总参数、55B 激活参数的模型能够稳定训练 20 万亿 token,这一训练范式的组合在开源大模型中较为前沿。
  • 多教师在线蒸馏与强化学习融合的 Agentic 后训练流水线:Nemotron 3 Ultra 通过 MOPD(Multi-teacher On-Policy Distillation)同时引入多个专业教师(涵盖代码、安全、工具使用等领域),并与 RLVR 等强化学习方法交织迭代。这种在线、多任务、教师驱动的后训练策略突破了单一教师蒸馏或离线数据增强的局限,直接针对 agentic reasoning 和长上下文交互进行优化,显著提升了模型在复杂、多步自主任务上的可靠性与效率。

方法

Nemotron 3 Ultra 采用「混合 Mamba-Attention + MoE」架构,总参数 550B,活跃参数仅 55B,围绕 LatentMoENVFP4 预训练多教师在线策略蒸馏 (MOPD)推理预算控制 构建训练-推理全栈方案。

输入与架构

输入为 20T 文本 tokens,经过 Hybrid Mamba-Attention 层交替提取局部与全局特征:Mamba 层处理长程序列,Attention 层捕捉关键依赖。MoE 层使用 LatentMoE 机制——在潜在空间路由,缓解专家负载不均与死专家问题。预训练全程使用 NVFP4 混合精度,降低显存并加速训练。

预训练与长上下文

预训练后通过分阶段扩展将上下文窗口拉至 1M tokens,重点混合了代码、多选问答、事实查询、道德场景、法律文本等 curated 数据,并引入 Multi Token Prediction (MTP) 辅助任务,要求模型同时预测后续多个 token,增强表征与生成一致性。

后训练与推理控制

  • SFT 阶段:覆盖长上下文、工具使用、安全、对话等场景,并对长序列做数据打包以提升效率。
  • RL 阶段:采用 Multi-environment RLVRMOPD 蒸馏,从多个专业教师模型(软件工程、办公任务、搜索、STEM 等)在线采样整合信号,减少策略偏离,提升推理与安全能力。
  • MTP Boosting:针对 train-inference 分布偏移,微调 MTP 头修正轨迹,进一步提升解码质量。
  • 推理预算控制:在测试时可动态分配计算资源,支持 deep reasoning 或轻量响应,权衡精度与延迟。

输出与推理加速

后训练模型输出支持 Prefill-Decode DisaggregationWide Expert ParallelismFP4 量化。SSM 缓存优化与投机解码适配混合架构,实现相对于同等规模 LLM 最高约 6× 推理吞吐,同时保持 competitive accuracy。

与纯 Dense Transformer 或标准 MoE 相比,核心差异在于 Mamba-Attention 混合序列建模 + LatentMoE 负载均衡 + FP4 全链路低精度训练,在 1M 长上下文与 agentic 任务中显著提升效率,而精度不下降。

实验

实验设计

Nemotron 3 Ultra 的预训练在 20 万亿 token 的混合语料上进行,采用 Hybrid Mamba-AttentionMixture-of-Experts 架构,总参数 550B、活跃参数 55B。预训练后通过逐步扩展将上下文长度提升至 1M token,并实施三阶段后训练:SFT(覆盖代码、数学、安全、工具使用等)、RL(含多环境 RLVR)及 MOPD(多教师在线蒸馏)。评估涵盖代理能力、推理、长上下文理解、多语言等维度,并在数学奥赛问题上测试了推理时拓展(test-time scaling)。

关键发现

模型在保持与顶尖公开 LLM 相当准确度的同时,推理吞吐量最高提升约 6 倍,使其适合长时间运行的自主代理任务。LatentMoEMulti Token Prediction (MTP) 等技术创新有效缓解了 MoE 的负载不均衡和训练-推理不匹配问题。后训练中的 NVFP4 量化进一步降低了推理成本,而 reasoning budget control 提供了可控的推理深度。

与基线的对比解读

与当前公开的 SOTA 模型相比,Nemotron 3 Ultra 的核心优势不在绝对精度领先,而是在同等精度下实现了显著更高的推理效率,这对于代理场景下的持续交互和大规模部署极具价值。其混合架构和优化的后训练流程为开放权重模型设立了新的效率基准。

行业影响

落地场景

Nemotron 3 Ultra 的高推理吞吐(相较同类模型最高 6 倍)与 1M token 上下文,使其天然适合长时间运行的自主 agent 任务。典型产品形态包括:

  • 代码仓库级 Copilot:对百万行代码进行全局重构、跨文件 bug 定位、自动化测试生成。
  • 企业合规与合同审核:一次性摄入数千页法规与历史合同,提取风险条款并生成修订建议。
  • 医疗与金融长文本分析:处理完整电子病历或全年交易日志,进行跨时间轴推理与异常检测。
  • 游戏 NPC 与虚拟角色:记住超长对话历史,提供连贯的交互体验,同时以低成本支撑高并发服务。

商业价值

核心降本路径来自 MoE 架构 + NVFP4 量化:仅 55B 活跃参数即达到同等准确度,大幅降低推理硬件成本;原生 FP4 预训练让模型可直接运行在低成本 GPU 上,无需额外量化微调。高吞吐直接转化为按 token 计费 API 的毛利提升,或在固定算力预算下支撑更多并发用户。长上下文能力则开辟了高客单价增值服务(如全库代码审计、法规合规扫描),有助于产品差异化定价。开源策略进一步降低企业“模型锁定”风险,适合私有化部署。

与现有产品/工作流的接口

模型以标准 HuggingFace 格式发布,可直接加载到 vLLM、TGI 等推理框架,并通过 model-optimizer 工具自动选择最优并行策略。预置的 NVFP4 单一 checkpoint 省去多个量化版本的维护成本。对于 agent 工作流,模型原生支持多轮工具调用与搜索,且通过 Multi-teacher On-Policy Distillation 对齐了多种专用教师能力,可在 LangChain、AutoGPT 等框架中直接作为 reasoning 与 planning 核心,减少 prompt 工程开销。

具体落地用例

  1. 电商大促客服 Agent
    场景:处理长达数月的用户咨询历史与退换货流程。模型利用 1M 上下文一次性加载用户完整对话、订单状态与政策文档,在单次推理中生成准确的个性化回复,同时凭借高吞吐支撑大促期间每秒数千次并发请求,将人工介入率降低 40% 以上。

  2. 自动驾驶合规文档生成
    场景:安全分析团队需从数千页测试报告、监管标准中提取信息,生成面向不同市场的审批材料。模型以长上下文吞入全部源文档,通过 agentic 调用检索 - 比对 - 引用工具,自动产出符合 ISO 26262 / UN-R152 的合规草案,将文档准备时间从数周压缩至数小时。

局限

  • **训练与部署资源门槛高**:虽然推理吞吐大幅优化,总参数量达 550B,即使采用 NVFP4 量化,模型权重和优化器状态仍需要大量显存和存储,训练成本与大规模部署门槛对算力有限的团队构成挑战。论文未详细讨论单卡或小集群的落地可行性,主要聚焦在 NVIDIA 自有基础设施上的极致吞吐。
  • **混合架构的鲁棒性与通用性待验证**:Mamba-Attention 混合设计在长上下文任务上可能面临状态空间模型与注意力机制的协同挑战,例如长距离依赖中 Mamba 的遗忘特性或注意力分配的稳定性。论文未与纯 Transformer(同等参数和训练数据量)进行系统对比,混合架构的真实收益与潜在短板(如某些推理模式下的精度损失)尚不完全清楚。
  • **多技术叠加的消融与可解释性不足**:模型集成了 LatentMoE、MTP Boosting、MOPD、推理预算控制等多项创新,但论文未提供足够的消融实验来分离每项技术的独立贡献,导致从业者难以判断哪些技术是关键收益来源,限制了方法迁移和进一步改进的路径清晰度。
论文NVIDIA2026-06-12原文

相关内容