行业新闻

英伟达开源NeMo AutoModel,MoE微调吞吐提升3.7倍

英伟达通过专家并行和通信优化,让MoE微调效率大幅提升,且兼容主流Transformers API,无需大改代码。

英伟达开源NeMo AutoModel,在HuggingFace Transformers v5基础上仅需添加一行import,即可在混合专家模型(MoE,一种将模型分为多个专家子网络的路由架构)微调中实现3.4-3.7倍训练吞吐提升和29%-32%显存降低,例如Qwen3-30B-A3B在8卡H100上吞吐从3075升至11340 TPS/GPU。

正文摘录

英伟达 MoE 新开源:一行 import,微调加速 3.7 倍 在 Transformers v5 的基础上,增加了专家并行、DeepEP 和 TransformerEngine 英伟达最新研究成果现已开源: NeMo AutoModel ,专为大规模构建和微调生成式 AI 模型而打造。 在 Hugging Face Transformers v5 的基础之上,NeMo AutoModel 能做到不改代码 API,只添一行 import,就实现对 MoE 模型更快速的微调。 实验显示,相比 Hugging Face 原版 Transformers v5,英伟达 NeMo AutoModel 能在 MoE 微调中实现 3.4-3.7 倍训练吞吐提升,并减少 29%-32% GPU 显存占用 。 在单节点 8xH100 80GB GPU 上,以 Qwen3-30B-A3B 为例,NeMo AutoModel 直接把 TPS/GPU(每 GPU 每秒吞吐量)从 3075 拉到 11340,提升达到 3.69 倍。 HuggingFace 的 Transformers v5 是目前被用得比较多的 MoE 训练“通用底座”。v5 增强了对 MoE 的原生支持,引入了 expert backends、dynamic weight loading、分布式执行等 MoE 基础能力。 这一次,英伟达的思路就是站在前辈的肩膀上, 兼容 HuggingFace Transformers 的 API ,让大家能 不大改代码,就在 MoE 微调里获得更高训练吞吐和更低显存占用 。 具体来说,NeMo AutoModel 在 Transformers v5 的基础上,增加了 专家并行(EP) 、 DeepEP 和 TransformerEngine 。

阅读原文(qbitai.com)→

行业新闻鱼羊2026-06-26原文

相关内容