<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>Model Optimization on Producthunt daily</title>
        <link>https://producthunt.programnotes.cn/en/tags/model-optimization/</link>
        <description>Recent content in Model Optimization on Producthunt daily</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>en</language>
        <lastBuildDate>Thu, 24 Sep 2026 20:48:54 +0800</lastBuildDate><atom:link href="https://producthunt.programnotes.cn/en/tags/model-optimization/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>Model-Optimizer</title>
        <link>https://producthunt.programnotes.cn/en/p/model-optimizer/</link>
        <pubDate>Thu, 24 Sep 2026 20:48:54 +0800</pubDate>
        
        <guid>https://producthunt.programnotes.cn/en/p/model-optimizer/</guid>
        <description>&lt;img src="https://images.unsplash.com/photo-1486122676632-ad1b5681fe33?ixid=M3w0NjAwMjJ8MHwxfHJhbmRvbXx8fHx8fHx8fDE3OTAyNTM5NDF8&amp;ixlib=rb-4.1.0" alt="Featured image of post Model-Optimizer" /&gt;&lt;h1 id=&#34;nvidiamodel-optimizer&#34;&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA/Model-Optimizer&lt;/a&gt;
&lt;/h1&gt;&lt;div align=&#34;center&#34;&gt;
&lt;p&gt;&lt;img src=&#34;https://producthunt.programnotes.cn/docs/source/assets/model-optimizer-banner.png&#34;
	
	
	
	loading=&#34;lazy&#34;
	
		alt=&#34;Banner image&#34;
	
	
&gt;&lt;/p&gt;
&lt;h1 id=&#34;nvidia-model-optimizer&#34;&gt;NVIDIA Model Optimizer
&lt;/h1&gt;&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;&lt;img src=&#34;https://img.shields.io/badge/Documentation-latest-brightgreen.svg?style=flat&#34;
	
	
	
	loading=&#34;lazy&#34;
	
		alt=&#34;Documentation&#34;
	
	
&gt;&lt;/a&gt;
&lt;a class=&#34;link&#34; href=&#34;https://pypi.org/project/nvidia-modelopt/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;&lt;img src=&#34;https://img.shields.io/pypi/v/nvidia-modelopt?label=Release&#34;
	
	
	
	loading=&#34;lazy&#34;
	
		alt=&#34;version&#34;
	
	
&gt;&lt;/a&gt;
[&lt;/p&gt;
&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Documentation&lt;/a&gt; |
&lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer/issues/1699&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Roadmap&lt;/a&gt; |
&lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/#announcements&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Announcement Blogs&lt;/a&gt;&lt;/p&gt;
&lt;/div&gt;
&lt;hr&gt;
&lt;p&gt;&lt;strong&gt;NVIDIA Model Optimizer&lt;/strong&gt; (referred to as &lt;strong&gt;Model Optimizer&lt;/strong&gt;, or &lt;strong&gt;ModelOpt&lt;/strong&gt;) is a library comprising state-of-the-art model optimization &lt;a class=&#34;link&#34; href=&#34;#techniques&#34; &gt;techniques&lt;/a&gt; including quantization, pruning, Neural Architecture Search (NAS), distillation, speculative decoding and sparsity to accelerate models.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;[Input]&lt;/strong&gt; Model Optimizer currently supports inputs of a &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hugging Face&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://github.com/pytorch/pytorch&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;PyTorch&lt;/a&gt; or &lt;a class=&#34;link&#34; href=&#34;https://github.com/onnx/onnx&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;ONNX&lt;/a&gt; model.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;[Optimize]&lt;/strong&gt; Model Optimizer provides Python APIs for users to easily compose the above model optimization techniques and export an optimized quantized checkpoint.
Model Optimizer is also integrated with &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA-NeMo/Megatron-Bridge&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Megatron-Bridge&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Megatron-LM&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Megatron-LM&lt;/a&gt; and &lt;a class=&#34;link&#34; href=&#34;https://github.com/huggingface/accelerate&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Hugging Face Accelerate&lt;/a&gt; for training required inference optimization techniques.&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;[Export for deployment]&lt;/strong&gt; Seamlessly integrated within the NVIDIA AI software ecosystem, the quantized checkpoint generated from Model Optimizer is ready for deployment in downstream inference frameworks like &lt;a class=&#34;link&#34; href=&#34;https://github.com/sgl-project/sglang&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;SGLang&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/TensorRT-LLM/tree/main/examples/quantization&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;TensorRT-LLM&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/TensorRT&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;TensorRT&lt;/a&gt;, or &lt;a class=&#34;link&#34; href=&#34;https://github.com/vllm-project/vllm&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;vLLM&lt;/a&gt;. The unified Hugging Face export API now supports both transformers and diffusers models.&lt;/p&gt;
&lt;h2 id=&#34;latest-news&#34;&gt;Latest News
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;[2026/09/16] &lt;a class=&#34;link&#34; href=&#34;./examples/megatron_bridge/tutorials/Qwen3.6-35B-A3B&#34; &gt;&lt;strong&gt;End-to-end W4A4 NVFP4 + QAD tutorial for Qwen3.6-35B-A3B&lt;/strong&gt;&lt;/a&gt;: NVFP4 W4A4 PTQ plus quantization-aware distillation, reaching up to 1.30x vLLM throughput over BF16 and 3.1x smaller checkpoints while recovering the accuracy W4A4 costs.&lt;/li&gt;
&lt;li&gt;[2026/09/09] &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/announcements/local-hessian.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Improving NVFP4 Accuracy with Local-Hessian Weight Scales&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2026/08/24] &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/announcements/autoquantize.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: AutoQuantize: A Fast Automatic Mixed-Precision Assignment&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2026/08/17] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/developing-nemotron-3-5-lightning-nvfp4-with-qad-using-nvidia-model-optimizer/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Developing Nemotron 3.5 Lightning NVFP4 with QAD Using NVIDIA Model Optimizer&lt;/a&gt;: Learn how quantization-aware distillation recovers accuracy from aggressive NVFP4 quantization while reducing model size and increasing throughput.&lt;/li&gt;
&lt;li&gt;[2026/06/26] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/creating-the-nvidia-nemotron-3-ultra-nvfp4-checkpoint-with-nvidia-model-optimizer/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Creating the NVIDIA Nemotron 3 Ultra NVFP4 Checkpoint with NVIDIA Model Optimizer&lt;/a&gt;: How we quantized Nemotron 3 Ultra (550B) to NVFP4 with Model Optimizer — up to 5.9× higher decode-heavy inference throughput than GLM-5.1 754B FP4 while matching BF16 accuracy. &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVFP4 Checkpoint&lt;/a&gt; on Hugging Face.&lt;/li&gt;
&lt;li&gt;[2026/05/27] &lt;a class=&#34;link&#34; href=&#34;./examples/megatron_bridge/tutorials/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16&#34; &gt;&lt;strong&gt;End-to-end Optimization tutorial for Nemotron-3-Nano-30B-A3B&lt;/strong&gt;&lt;/a&gt;: Pruning + two-phase distillation + FP8 quantization achieving 2.6× vLLM throughput and 2.6× memory reduction.&lt;/li&gt;
&lt;li&gt;[2026/05/13] &lt;a class=&#34;link&#34; href=&#34;./examples/puzzletron&#34; &gt;&lt;strong&gt;Puzzletron&lt;/strong&gt;&lt;/a&gt;: A new algorithm for heterogeneous pruning &amp;amp; NAS of LLM and VLM models.&lt;/li&gt;
&lt;li&gt;[2026/04/15] Customer story: &lt;a class=&#34;link&#34; href=&#34;https://www.domyn.com/blog/domyn-large-the-journey-of-a-european-sovereign-ai-model-for-regulated-industries&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Domyn compresses Colosseum-355B → 260B using ModelOpt&amp;rsquo;s Minitron pruning + distillation&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2026/03/17] Customer story: &lt;a class=&#34;link&#34; href=&#34;https://bielik.ai/en/nvidia-gtc-bielik-minitron-premiere/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Bielik.AI builds Bielik Minitron 7B (33% smaller, 50% faster, 90% quality retained) using ModelOpt&amp;rsquo;s Minitron pruning + distillation&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2026/03/11] Model Optimizer quantized Nemotron-3-Super checkpoints are available on Hugging Face for download: &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;FP8&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-NVFP4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVFP4&lt;/a&gt;. Learn more in the &lt;a class=&#34;link&#34; href=&#34;https://blogs.nvidia.com/blog/nemotron-3-super-agentic-ai/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Nemotron 3 Super release blog&lt;/a&gt;. Check out how to quantize Nemotron 3 models for deployment acceleration &lt;a class=&#34;link&#34; href=&#34;./examples/hf_ptq/README.md&#34; &gt;here&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2026/03/11] &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA-NeMo/Megatron-Bridge&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NeMo Megatron Bridge&lt;/a&gt; now supports Nemotron-3-Super quantization (PTQ and QAT) and export workflows using the Model Optimizer library. See the &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA-NeMo/Megatron-Bridge/blob/super-v3/docs/models/llm/nemotron3-super.md#quantization-ptq-and-qat&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Quantization (PTQ and QAT) guide&lt;/a&gt; for FP8/NVFP4 quantization and HF export instructions.&lt;/li&gt;
&lt;li&gt;[2025/12/11] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/top-5-ai-model-optimization-techniques-for-faster-smarter-inference/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Top 5 AI Model Optimization Techniques for Faster, Smarter Inference&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/12/08] NVIDIA TensorRT Model Optimizer is now officially rebranded as NVIDIA Model Optimizer.&lt;/li&gt;
&lt;li&gt;[2025/10/07] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/pruning-and-distilling-llms-using-nvidia-tensorrt-model-optimizer/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Pruning and Distilling LLMs Using NVIDIA Model Optimizer&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/09/17] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/an-introduction-to-speculative-decoding-for-reducing-latency-in-ai-inference/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: An Introduction to Speculative Decoding for Reducing Latency in AI Inference&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/09/11] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/how-quantization-aware-training-enables-low-precision-accuracy-recovery/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: How Quantization Aware Training Enables Low-Precision Accuracy Recovery&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/08/29] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/fine-tuning-gpt-oss-for-accuracy-and-performance-with-quantization-aware-training/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Fine-Tuning gpt-oss for Accuracy and Performance with Quantization Aware Training&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/08/01] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/optimizing-llms-for-performance-and-accuracy-with-post-training-quantization/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Optimizing LLMs for Performance and Accuracy with Post-Training Quantization&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/06/24] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/introducing-nvfp4-for-efficient-and-accurate-low-precision-inference/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;BLOG: Introducing NVFP4 for Efficient and Accurate Low-Precision Inference&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/05/14] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/nvidia-tensorrt-unlocks-fp4-image-generation-for-nvidia-blackwell-geforce-rtx-50-series-gpus/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA TensorRT Unlocks FP4 Image Generation for NVIDIA Blackwell GeForce RTX 50 Series GPUs&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/04/21] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/optimizing-transformer-based-diffusion-models-for-video-generation-with-nvidia-tensorrt/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Adobe optimized deployment using Model-Optimizer + TensorRT leading to a 60% reduction in diffusion latency, a 40% reduction in total cost of ownership&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/04/05] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/nvidia-accelerates-inference-on-meta-llama-4-scout-and-maverick/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;NVIDIA Accelerates Inference on Meta Llama 4 Scout and Maverick&lt;/a&gt;. Check out how to quantize Llama4 for deployment acceleration &lt;a class=&#34;link&#34; href=&#34;./examples/hf_ptq/README.md#support-matrix&#34; &gt;here&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/03/18] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/nvidia-blackwell-delivers-world-record-deepseek-r1-inference-performance/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;World&amp;rsquo;s Fastest DeepSeek-R1 Inference with Blackwell FP4 &amp;amp; Increasing Image Generation Efficiency on Blackwell&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/02/25] Model Optimizer quantized NVFP4 models available on Hugging Face for download: &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/DeepSeek-R1-FP4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;DeepSeek-R1-FP4&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/Llama-3.3-70B-Instruct-FP4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Llama-3.3-70B-Instruct-FP4&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/Llama-3.1-405B-Instruct-FP4&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Llama-3.1-405B-Instruct-FP4&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2025/01/28] Model Optimizer has added support for NVFP4. Check out an example of NVFP4 PTQ &lt;a class=&#34;link&#34; href=&#34;./examples/hf_ptq/README.md#getting-started&#34; &gt;here&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;[2025/01/28] Model Optimizer is now open source!&lt;/li&gt;
&lt;/ul&gt;
&lt;details close&gt;
&lt;summary&gt;Previous News&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;[2024/10/23] Model Optimizer quantized FP8 Llama-3.1 Instruct models available on Hugging Face for download: &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/Llama-3.1-8B-Instruct-FP8&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;8B&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/Llama-3.1-70B-Instruct-FP8&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;70B&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://huggingface.co/nvidia/Llama-3.1-405B-Instruct-FP8&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;405B&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;[2024/09/10] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/post-training-quantization-of-llms-with-nvidia-nemo-and-nvidia-tensorrt-model-optimizer/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Post-Training Quantization of LLMs with NVIDIA NeMo and Model Optimizer&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;[2024/08/28] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/boosting-llama-3-1-405b-performance-by-up-to-44-with-nvidia-tensorrt-model-optimizer-on-nvidia-h200-gpus/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Boosting Llama 3.1 405B Performance up to 44% with Model Optimizer on NVIDIA H200 GPUs&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/08/28] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/low-latency-inference-chapter-1-up-to-1-9x-higher-llama-3-1-performance-with-medusa-on-nvidia-hgx-h200-with-nvlink-switch/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Up to 1.9X Higher Llama 3.1 Performance with Medusa&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/08/15] New features in recent releases: &lt;a class=&#34;link&#34; href=&#34;./examples/diffusers/cache_diffusion&#34; &gt;Cache Diffusion&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://docs.nvidia.com/nemo-framework/user-guide/24.09/sft_peft/qlora.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;QLoRA workflow with NVIDIA NeMo&lt;/a&gt;, and more. Check out &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/nvidia-tensorrt-model-optimizer-v0-15-boosts-inference-performance-and-expands-model-support/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;our blog&lt;/a&gt; for details.&lt;/li&gt;
&lt;li&gt;[2024/06/03] Model Optimizer now has an experimental feature to deploy to vLLM as part of our effort to support popular deployment frameworks. Check out the workflow &lt;a class=&#34;link&#34; href=&#34;./examples/hf_ptq/README.md#vllm&#34; &gt;here&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/05/08] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/accelerate-generative-ai-inference-performance-with-nvidia-tensorrt-model-optimizer-now-publicly-available/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Announcement: Model Optimizer Now Formally Available to Further Accelerate GenAI Inference Performance&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/03/27] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/nvidia-h200-tensor-core-gpus-and-nvidia-tensorrt-llm-set-mlperf-llm-inference-records/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Model Optimizer supercharges TensorRT-LLM to set MLPerf LLM inference records&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/03/18] &lt;a class=&#34;link&#34; href=&#34;https://www.nvidia.com/en-us/on-demand/session/gtc24-s63213/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;GTC Session: Optimize Generative AI Inference with Quantization in TensorRT-LLM and TensorRT&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/03/07] &lt;a class=&#34;link&#34; href=&#34;https://developer.nvidia.com/blog/tensorrt-accelerates-stable-diffusion-nearly-2x-faster-with-8-bit-post-training-quantization/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Model Optimizer&amp;rsquo;s 8-bit Post-Training Quantization enables TensorRT to accelerate Stable Diffusion to nearly 2x faster&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;[2024/02/01] &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/TensorRT-LLM/blob/main/docs/source/blogs/quantization-in-TRT-LLM.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Speed up inference with Model Optimizer quantization techniques in TRT-LLM&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;h2 id=&#34;install&#34;&gt;Install
&lt;/h2&gt;&lt;p&gt;To install stable release packages for Model Optimizer with &lt;code&gt;pip&lt;/code&gt; from &lt;a class=&#34;link&#34; href=&#34;https://pypi.org/project/nvidia-modelopt/&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;PyPI&lt;/a&gt;:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install -U nvidia-modelopt&lt;span class=&#34;o&#34;&gt;[&lt;/span&gt;all&lt;span class=&#34;o&#34;&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;Model Optimizer will download and install additional third-party open source software projects. Review the license terms of these open source projects before use.&lt;/p&gt;
&lt;p&gt;To install from source in editable mode with all development dependencies or to use the latest features, run:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;c1&#34;&gt;# Clone the Model Optimizer repository&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;git clone git@github.com:NVIDIA/Model-Optimizer.git
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;nb&#34;&gt;cd&lt;/span&gt; Model-Optimizer
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;pip install -e .&lt;span class=&#34;o&#34;&gt;[&lt;/span&gt;dev&lt;span class=&#34;o&#34;&gt;]&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;You can also directly use NVIDIA container images, which have Model Optimizer pre-installed:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;nvcr.io/nvidia/pytorch:&amp;lt;version&amp;gt;-py3&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;nvcr.io/nvidia/nemo:&amp;lt;version&amp;gt;&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;nvcr.io/nvidia/tensorrt-llm/release:&amp;lt;version&amp;gt;&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Before pulling and using the container images, please review their respective license terms.
Make sure to upgrade Model Optimizer to the latest version as described above.
Visit our &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/getting_started/2_installation.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;installation guide&lt;/a&gt; for
more fine-grained control on installed dependencies or for alternative docker images and environment variables to setup.&lt;/p&gt;
&lt;h2 id=&#34;techniques&#34;&gt;Techniques
&lt;/h2&gt;&lt;div align=&#34;center&#34;&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style=&#34;text-align: center&#34;&gt;&lt;strong&gt;Technique&lt;/strong&gt;&lt;/th&gt;
					&lt;th style=&#34;text-align: center&#34;&gt;&lt;strong&gt;Description&lt;/strong&gt;&lt;/th&gt;
					&lt;th style=&#34;text-align: center&#34;&gt;&lt;strong&gt;Examples&lt;/strong&gt;&lt;/th&gt;
					&lt;th style=&#34;text-align: center&#34;&gt;&lt;strong&gt;Docs&lt;/strong&gt;&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Post Training Quantization&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Compress model size by 2x-4x, speeding up inference while preserving model quality!&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[HF LLMs / VLMs](./examples/hf_ptq/)\] \[[Megatron-Bridge LLMs / VLMs](./examples/megatron_bridge/)\] \[[Diffusers](./examples/diffusers/)\] \[[ONNX](./examples/onnx_ptq/)\] \[[Windows](./examples/windows/)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[docs](https://nvidia.github.io/Model-Optimizer/guides/1_quantization.html)\]&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Quantization Aware Training / Distillation&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Refine accuracy of quantized models even further with a few training steps!&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[Hugging Face](./examples/llm_qat/)\] \[[Megatron-Bridge](./examples/megatron_bridge)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[docs](https://nvidia.github.io/Model-Optimizer/guides/1_quantization.html)\]&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Pruning&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Reduce your model parameters or memory footprint and accelerate inference by removing unnecessary weights!&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[General](./examples/pruning/)\] \[[Megatron-Bridge](./examples/megatron_bridge/)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Distillation&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Reduce deployment model size by teaching small models to behave like larger models!&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[Hugging Face](./examples/llm_distill/)\] \[[Megatron-Bridge](./examples/megatron_bridge/)\] \[[Megatron-LM](./examples/llm_distill/README.md#knowledge-distillation-kd-in-nvidia-megatron-lm-framework)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[docs](https://nvidia.github.io/Model-Optimizer/guides/4_distillation.html)\]&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Speculative Decoding&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Train draft modules to predict extra tokens during inference!&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[Hugging Face](./examples/speculative_decoding/)\] \[[Megatron-LM](./examples/speculative_decoding#mlm-example)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[docs](https://nvidia.github.io/Model-Optimizer/guides/5_speculative_decoding.html)\]&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Sparsity&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;Efficiently compress your model by storing only its non-zero parameter values and their locations&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[Hugging Face](./examples/llm_sparsity/)\]&lt;/td&gt;
					&lt;td style=&#34;text-align: center&#34;&gt;\[[docs](https://nvidia.github.io/Model-Optimizer/guides/6_sparsity.html)\]&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;/div&gt;
&lt;h2 id=&#34;pre-quantized-checkpoints&#34;&gt;Pre-Quantized Checkpoints
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;Ready-to-deploy checkpoints
\[[🤗 Hugging Face - Nvidia Model Optimizer Collection](https://huggingface.co/collections/nvidia/inference-optimized-checkpoints-with-model-optimizer)\]&lt;/li&gt;
&lt;li&gt;Deployable on &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/TensorRT-LLM&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;TensorRT-LLM&lt;/a&gt;, &lt;a class=&#34;link&#34; href=&#34;https://github.com/vllm-project/vllm&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;vLLM&lt;/a&gt; and &lt;a class=&#34;link&#34; href=&#34;https://github.com/sgl-project/sglang&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;SGLang&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;More models coming soon!&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;resources&#34;&gt;Resources
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;📅 &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer/issues/1699&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Roadmap&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;📖 &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Documentation&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;🎯 &lt;a class=&#34;link&#34; href=&#34;./examples/benchmark.md&#34; &gt;Benchmarks&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;💡 &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/reference/0_changelog.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Release Notes&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;🐛 &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer/issues/new?template=1_bug_report.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;File a bug&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;✨ &lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer/issues/new?template=2_feature_request.md&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;File a Feature Request&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;model-support-matrix&#34;&gt;Model Support Matrix
&lt;/h2&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th&gt;Model Type&lt;/th&gt;
					&lt;th&gt;Support Matrix&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td&gt;LLM / VLM Quantization&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/hf_ptq/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Diffusers Quantization&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/diffusers/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;ONNX Quantization&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/torch_onnx/README.md#onnx-export-supported-llm-models&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Windows Quantization&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/windows/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Quantization Aware Training&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/llm_qat/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Pruning&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/pruning/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Distillation&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/llm_distill/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td&gt;Speculative Decoding&lt;/td&gt;
					&lt;td&gt;&lt;a class=&#34;link&#34; href=&#34;./examples/speculative_decoding/README.md#support-matrix&#34; &gt;View Support Matrix&lt;/a&gt;&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h2 id=&#34;deprecation-policy&#34;&gt;Deprecation Policy
&lt;/h2&gt;&lt;p&gt;Model Optimizer follows a structured approach to managing deprecated features:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Communication:&lt;/strong&gt; Deprecation notices are documented in the &lt;a class=&#34;link&#34; href=&#34;https://nvidia.github.io/Model-Optimizer/reference/0_changelog.html&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;Changelog&lt;/a&gt;. Deprecated items include source code statements indicating deprecation timing, with runtime warnings issued upon use.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Migration Period:&lt;/strong&gt; Since Model Optimizer is still pre-1.0, we provide a 1-release (~1-month) migration period after deprecation. During this window, deprecated features continue functioning while issuing warnings.&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Scope:&lt;/strong&gt; The policy addresses both complete deprecations (entire APIs removed) and partial ones (specific parameters removed while methods remain).&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Removal:&lt;/strong&gt; Following the migration period, deprecated elements are removed in alignment with semantic versioning standards, potentially including breaking changes in minor version updates while Model Optimizer remains in 0.x.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;citation&#34;&gt;Citation
&lt;/h2&gt;&lt;p&gt;If you use NVIDIA Model Optimizer in your research, please cite it as follows:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;6
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;7
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bibtex&#34; data-lang=&#34;bibtex&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;nc&#34;&gt;@misc&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;{&lt;/span&gt;&lt;span class=&#34;nl&#34;&gt;nvidia-modelopt&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;na&#34;&gt;author&lt;/span&gt;       &lt;span class=&#34;p&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;s&#34;&gt;{{NVIDIA Corporation}}&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;na&#34;&gt;title&lt;/span&gt;        &lt;span class=&#34;p&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;s&#34;&gt;{{NVIDIA Model Optimizer}}&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;na&#34;&gt;howpublished&lt;/span&gt; &lt;span class=&#34;p&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;s&#34;&gt;{\url{https://github.com/NVIDIA/Model-Optimizer}}&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;na&#34;&gt;year&lt;/span&gt;         &lt;span class=&#34;p&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;s&#34;&gt;{2024--2026}&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;na&#34;&gt;note&lt;/span&gt;         &lt;span class=&#34;p&#34;&gt;=&lt;/span&gt; &lt;span class=&#34;s&#34;&gt;{GitHub repository}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;p&#34;&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h2 id=&#34;contributing&#34;&gt;Contributing
&lt;/h2&gt;&lt;p&gt;Model Optimizer is now open source! We welcome any feedback, feature requests and PRs.
Please read our &lt;a class=&#34;link&#34; href=&#34;./CONTRIBUTING.md&#34; &gt;Contributing&lt;/a&gt; guidelines for details on how to contribute to this project.&lt;/p&gt;
&lt;h2 id=&#34;ai-agents&#34;&gt;AI Agents
&lt;/h2&gt;&lt;p&gt;ModelOpt&amp;rsquo;s agent skills can be installed from this repository and used in any
workspace.&lt;/p&gt;
&lt;h3 id=&#34;claude-code&#34;&gt;Claude Code
&lt;/h3&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;claude plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;claude plugin install modelopt@modelopt
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;h3 id=&#34;codex&#34;&gt;Codex
&lt;/h3&gt;&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-bash&#34; data-lang=&#34;bash&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;codex plugin marketplace add https://github.com/NVIDIA/Model-Optimizer.git
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;Then open &lt;code&gt;/plugins&lt;/code&gt;, select the &lt;code&gt;modelopt&lt;/code&gt; marketplace, and install &lt;code&gt;modelopt&lt;/code&gt;.
Contributors can also use the skills directly from a checkout. See the
&lt;a class=&#34;link&#34; href=&#34;./.agents/TOOLING.md&#34; &gt;agent tooling notes&lt;/a&gt;.&lt;/p&gt;
&lt;h3 id=&#34;top-contributors&#34;&gt;Top Contributors
&lt;/h3&gt;&lt;p&gt;&lt;a class=&#34;link&#34; href=&#34;https://github.com/NVIDIA/Model-Optimizer/graphs/contributors&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;&lt;img src=&#34;https://contrib.rocks/image?repo=NVIDIA/Model-Optimizer&#34;
	
	
	
	loading=&#34;lazy&#34;
	
		alt=&#34;Contributors&#34;
	
	
&gt;&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Happy optimizing!&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
