📌 项目地址:NVIDIA/Model-Optimizer | ⭐ 3,982 颗星 | 🔧 Python | 📜 未标注
一个实际问题:FP4 量化掉精度怎么办
现在做 LLM 部署的团队基本都要面对量化。PTQ(后训练量化)便宜,几条命令就能把 BF16 模型压成 INT8 甚至 FP4,但压到 W4A4 这种级别,精度损失就很明显了。要恢复精度,主流做法是量化感知蒸馏(QAD):拿原始模型当老师,把量化后的模型重新蒸馏一遍。这需要训练框架、需要多卡、需要把量化算子插进训练流程,工程量不小。
NVIDIA 的 Model Optimizer(简称 ModelOpt)就是干这个的。它把量化、QAD、剪枝、NAS、蒸馏、投机解码、稀疏化这些压缩技术打包成一个 Python 库,输入 Hugging Face / PyTorch / ONNX 模型,输出量化后的 checkpoint,可以直接给 vLLM、SGLang、TensorRT-LLM、TensorRT 部署。目前 3,982 个 star,Python 写的。
用真实数字看它做到了什么
README 里的教程很有说服力。2026 年 9 月,官方放出了 Qwen3.6-35B-A3B 的端到端教程(在仓库 examples/megatron_bridge/tutorials/Qwen3.6-35B-A3B 目录):先做 NVFP4 W4A4 的 PTQ,再跑量化感知蒸馏。结果是三个数字:
- vLLM 吞吐相比 BF16 最高 1.30x
- checkpoint 缩小 3.1 倍
- W4A4 损失的精度被蒸馏恢复回来
35B 的 MoE 模型压到 3.1 倍小,意味着原本放不下的卡现在放得下了。这个流程不是纸面演示,NVIDIA 自家的 Nemotron 3 Ultra 和 Nemotron 3.5 Lightning 的 NVFP4 checkpoint 就是用 ModelOpt 做的(官方博客有记录)。
三段式工作流
ModelOpt 的用法可以概括成输入、优化、导出三步:
- 输入:Hugging Face、PyTorch 或 ONNX 模型
- 优化:用 Python API 组合各种优化技术,训练类技术(QAT/QAD)可以跑在 Megatron-Bridge、Megatron-LM 或 Hugging Face Accelerate 里
- 导出:统一的 Hugging Face 导出 API,transformers 和 diffusers 模型都支持;产出的 checkpoint 直接给 SGLang、TensorRT-LLM、TensorRT 或 vLLM 用,TensorRT-LLM 的
examples/quantization目录有现成示例
安装包在 PyPI 上,包名 nvidia-modelopt,具体 API 用法看官方文档。
第三步是它和一般量化工具拉开差距的地方。很多量化库的产出还得自己折腾转换格式才能上线推理,ModelOpt 直接对接四个主流推理框架,省掉中间的胶水代码。
最近的技术动态
从博客节奏看,这个项目的重心在 NVFP4 的精度优化上:
- Local-Hessian 权重缩放(2026/09):不训练也能改善 NVFP4 精度的方法
- AutoQuantize(2026/08):自动混合精度分配,跑得快的自动搜精度配置
- QAD 实战(2026/08/17):Nemotron 3.5 Lightning NVFP4 checkpoint 的完整开发过程
Local-Hessian 这条路线值得注意,如果 PTQ 配上更好的权重缩放就能达标,那没有训练资源的团队也能吃到 FP4 的红利。
用之前想清楚两件事
第一,NVFP4 吃硬件。 FP4 格式需要较新的 NVIDIA GPU 架构支持,vLLM 和 SGLang 虽然能跑 ModelOpt 的产出,但最佳收益路径(NVFP4 + TensorRT-LLM)在 NVIDIA 自己的生态里。AMD 或老卡用户能用的子集有限。
第二,QAD 要训练资源。 PTQ 便宜,QAT 和 QAD 需要多卡跑蒸馏。只有单卡或者纯推理环境的团队,能用的主要是 PTQ 这部分。当然 PTQ 本身也不是不能用,上面提到的 Local-Hessian 就是在给 PTQ 补精度。
另外项目迭代很快,Roadmap 挂在 issue #1699,API 可能有变动。许可证看仓库的 LICENSE 文件,商用前自己确认一遍。
我的看法
如果你已经在用 vLLM 或 TensorRT-LLM,想往 INT8/FP4 量化走,ModelOpt 是目前链路最完整的选择之一:从量化算法到蒸馏训练再到部署导出,一条线串下来,而且 NVIDIA 自己在用。如果你的需求只是“快速量化一个模型试试水”,AutoAWQ 这类单一工具上手更快,没必要一上来就接训练框架。
真正值得关注的是 QAD 这条路径。PTQ 在 FP4 级别的精度瓶颈是行业共识,QAD 用教师模型把精度买回来,代价是训练成本。ModelOpt 把这个流程做成了 Megatron-Bridge 里的现成教程,等于把门槛降到了“照着跑一遍”的程度。