开源项目

Model-Optimizer

Model-Optimizer

面向 LLM/VLM 的模型压缩与推理加速库,把量化(PTQ/QAT)、剪枝、蒸馏、NAS、投机解码、稀疏化等技术收敛到一套 Python API,导出可直接部署到 TensorRT-LLM、vLLM、SGLang 的量化 checkpoint。亮点是与 NVIDIA 自有训练栈(Megatron-Bridge、Megatron-LM、HF Accelerate)打通,NVFP4/FP8 方案能在保持精度的前提下换来约 1.3x 以上吞吐与数倍更小的权重,官方还放出大量预量化权重省去自己跑一遍流程。安装会拉取第三方开源依赖,使用前需先确认各自许可条款。

README

Banner image

NVIDIA Model Optimizer

Documentation version license

Documentation | Roadmap | Announcement Blogs


NVIDIA Model Optimizer(简称 Model Optimizer 或 ModelOpt)是一个模型优化库,涵盖当前最前沿的模型优化技术,包括量化(quantization)、剪枝(pruning)、神经架构搜索(Neural Architecture Search, NAS)、蒸馏(distillation)、投机解码(speculative decoding)和稀疏化(sparsity),用于加速模型。

[输入] Model Optimizer 目前支持输入 Hugging Face、PyTorch 或 ONNX 模型。

[优化] Model Optimizer 提供 Python API,用户可以轻松组合上述模型优化技术,并导出优化后的量化 checkpoint。 Model Optimizer 还与 NVIDIA Megatron-Bridge、Megatron-LM 和 Hugging Face Accelerate 集成,以支持需要训练的推理优化技术。

[导出以部署] Model Optimizer 与 NVIDIA AI 软件生态无缝集成,其生成的量化 checkpoint 可直接在下游推理框架中部署,例如 SGLang、TensorRT-LLM、TensorRT 或 vLLM。统一的 Hugging Face 导出 API 现已同时支持 transformers 与 diffusers 模型。

最新动态

历史动态

安装

如需通过 pip 从 PyPI 安装 Model Optimizer 的稳定发行版:

pip install -U nvidia-modelopt[all]

Model Optimizer 会下载并安装额外的第三方开源软件项目。使用前请审阅这些开源项目的许可条款。

如需以可编辑模式从源码安装(包含全部开发依赖),或使用最新功能,请运行:

# Clone the Model Optimizer repository
git clone git@github.com:NVIDIA/Model-Optimizer.git
cd Model-Optimizer

pip install -e .[dev]

你也可以直接使用已预装 Model Optimizer 的 NVIDIA 容器镜像:

  • nvcr.io/nvidia/pytorch:<version>-py3
  • nvcr.io/nvidia/nemo:<version>
  • nvcr.io/nvidia/tensorrt-llm/release:<version>

在拉取和使用这些容器镜像之前,请先审阅各自对应的许可条款。 请务必按上文所述将 Model Optimizer 升级到最新版本。 如需更精细地控制所安装的依赖,或想了解其他 docker 镜像与环境变量配置方式,请访问我们的安装指南。

技术

技术 说明 示例 文档
Post Training Quantization 将模型体积压缩 2 倍至 4 倍,在保持模型质量的同时加速推理! [HF LLMs / VLMs] [Megatron-Bridge LLMs / VLMs] [Diffusers] [ONNX] [Windows] [docs]
Quantization Aware Training / Distillation 仅需少量训练步骤,即可进一步精修量化模型的精度! [Hugging Face] [Megatron-Bridge] [docs]
Pruning 移除冗余权重,减少模型参数量或内存占用并加速推理! [General] [Megatron-Bridge]
Distillation 让小模型学会像大模型一样工作,从而缩减部署模型体积! [Hugging Face] [Megatron-Bridge] [Megatron-LM] [docs]
Speculative Decoding 训练 draft 模块,在推理过程中预测额外的 token! [Hugging Face] [Megatron-LM] [docs]
Sparsity 仅存储非零参数值及其位置,高效压缩模型 [Hugging Face] [docs]

预量化 Checkpoint

资源

模型支持矩阵

模型类型 支持矩阵
LLM / VLM 量化 查看支持矩阵
Diffusers 量化 查看支持矩阵
ONNX 量化 查看支持矩阵
Windows 量化 查看支持矩阵
量化感知训练 查看支持矩阵
剪枝 查看支持矩阵
蒸馏 查看支持矩阵
投机解码 查看支持矩阵

弃用政策

Model Optimizer 采用结构化的方式来管理已弃用的功能:

  • 沟通告知: 弃用通知会记录在 Changelog 中。被弃用的条目会在源码中包含说明弃用时间的语句,并在使用时发出运行时警告。
  • 迁移期: 由于 Model Optimizer 仍处于 1.0 之前,我们在弃用后提供 1 个版本(约 1 个月)的迁移期。在此期间,被弃用的功能仍可继续使用,但会发出警告。
  • 范围: 该政策同时涵盖完全弃用(整个 API 被移除)和部分弃用(移除特定参数而方法保留)。
  • 移除: 迁移期结束后,被弃用的元素将按照语义化版本规范移除;由于 Model Optimizer 仍处于 0.x 阶段,次要版本更新中可能包含破坏性变更。

引用

如果你在研究中使用了 NVIDIA Model Optimizer,请按如下方式引用:

@misc{nvidia-modelopt,
  author       = {{NVIDIA Corporation}},
  title        = {{NVIDIA Model Optimizer}},
  howpublished = {\url{https://github.com/NVIDIA/Model-Optimizer}},
  year         = {2024--2026},
  note         = {GitHub repository}
}

贡献

Model Optimizer 现已开源!我们欢迎任何反馈、功能需求与 PR。 关于如何为本项目做贡献的详细信息,请阅读我们的贡献指南。

AI Agents

ModelOpt 的 agent skills 可以直接从本仓库安装,并在任意工作区中使用。

Claude Code

claude plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git
claude plugin install modelopt@modelopt

Codex

codex plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git

然后打开 /plugins,选择 modelopt marketplace,并安装 modelopt。 贡献者也可以直接在本地代码检出中使用这些 skills。参见 agent 工具说明。

主要贡献者

Contributors

祝优化愉快!

开源项目NVIDIA2026-09-24原文

相关内容