
轻松搞定模型优化TensorRT Model Optimizer API完全参考手册【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-OptimizerTensorRT Model Optimizer是一个集成了量化、稀疏化等前沿模型优化技术的统一库能够为TensorRT-LLM或TensorRT等下游部署框架压缩深度学习模型从而在NVIDIA GPU上优化推理速度。本文将为您提供这份API完全参考手册助您轻松掌握模型优化的关键技能。核心API概览 TensorRT Model Optimizer的核心功能通过modelopt.torch和modelopt.onnx两大模块提供涵盖了从模型量化、校准到压缩的完整工作流。以下是三个最常用的核心API1. 模型量化mtq.quantize()mtq.quantize()是实现模型量化的核心接口支持Block-wise Int4和FP8等高级量化格式。它能将模型中的模块替换为量化版本并根据指定算法进行校准。import modelopt.torch.quantization as mtq # 选择量化配置 quant_config mtq.QuantizationConfig( weight_quantizermtq.INT4WeightQuantizer(block_size32), algorithmawq ) # 量化模型 quantized_model mtq.quantize(model, quant_config, forward_loopcalibration_loop)2. 模型校准mtq.calibrate()mtq.calibrate()用于根据选定的算法调整权重和缩放因子支持AWQ、SmoothQuant、SVDQuant或max等校准算法。# 校准模型 calibrated_model mtq.calibrate( model, algorithmsmoothquant, forward_loopcalibration_loop )3. 模型压缩mtq.compress()mtq.compress()能进一步减小已量化模型的内存占用通过更高效的内存布局存储权重特别适用于大型语言模型。目前支持FP8和NVFP4等量化格式的压缩。# 压缩模型 compressed_model mtq.compress(quantized_model)量化格式全解析 TensorRT Model Optimizer支持多种量化格式以满足不同场景的需求FP8提供良好的精度与性能平衡适用于大多数深度学习模型INT8在保持较高精度的同时显著降低计算复杂度INT4极致压缩率适用于对内存要求极高的大型语言模型NVFP4NVIDIA专用格式通过高效打包进一步优化存储图FP16精度模型效果图INT8量化模型效果内存占用减少50%完整工作流程示例 以下是使用TensorRT Model Optimizer进行模型优化的典型流程准备模型与数据加载预训练模型和校准数据集配置量化参数选择合适的量化格式和算法执行量化校准调用mtq.quantize()完成模型量化压缩优化模型使用mtq.compress()进一步减小模型体积导出部署格式导出到TensorRT-LLM或vLLM等部署框架图TensorRT Model Optimizer API工作流程示意图部署框架兼容性 优化后的模型可无缝部署到多种框架TensorRT-LLM支持fp8和nvfp4量化模型需v0.17.0vLLM支持fp8量化模型需v0.6.5SGLang支持fp8量化模型需2025年1月6日后的主分支部署示例vLLMfrom vllm import LLM llm LLM(modelnvidia/Llama-3.1-8B-Instruct-FP8, quantizationmodelopt)高级技巧与最佳实践 选择合适的量化算法AWQ适用于LLMSmoothQuant在CV模型上表现优异分层量化策略对不同层应用不同的量化配置平衡精度与性能量化感知训练QAT通过微调恢复量化导致的精度损失更多详细示例和最佳实践请参考examples/llm_ptq目录下的教程。总结TensorRT Model Optimizer提供了简洁而强大的API让模型优化过程变得前所未有的简单。通过mtq.quantize()、mtq.calibrate()和mtq.compress()这三个核心函数您可以轻松实现模型的量化、校准和压缩为部署到各种框架做好准备。无论您是深度学习新手还是经验丰富的开发者这份API参考手册都能帮助您快速掌握模型优化的关键技能充分发挥NVIDIA GPU的推理性能。要开始使用TensorRT Model Optimizer请克隆仓库git clone https://gitcode.com/gh_mirrors/te/Model-Optimizer更多API细节请参考官方文档docs/source/reference/1_modelopt_api.rst。【免费下载链接】Model-OptimizerA unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.项目地址: https://gitcode.com/GitHub_Trending/te/Model-Optimizer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考