NVIDIA comprime redes de inteligência artificial em 3,1 vezes com Model Optimizer
A biblioteca aberta reduz o tamanho de arquivos pesados e eleva a velocidade de resposta sem sacrificar a precisão dos cálculos.
A biblioteca aberta reduz o tamanho de arquivos pesados e eleva a velocidade de resposta sem sacrificar a precisão dos cálculos.
O Model Optimizer é uma biblioteca aberta em Python criada pela NVIDIA em 23 de abril de 2024 para encolher redes neurais pesadas. O programa comprime modelos em até 3,1 vezes e eleva a velocidade no motor vLLM em 1,30 vez sem perder exatidão técnica. A ferramenta corta gastos com servidores. O código atende engenheiros que colocam modelos de linguagem em produção sem estourar a memória das placas gráficas.
A biblioteca recebe arquivos estruturados nos formatos Hugging Face, PyTorch ou ONNX e executa transformações direto no computador local. O código junta quantização, poda de conexões, busca de arquitetura, destilação de conhecimento, esparsidade e decodificação especulativa para enxugar os pesos da rede. Para treinar essas etapas em redes gigantescas, o pacote integra as rotinas aos projetos Megatron-Bridge, Megatron-LM e Hugging Face Accelerate. Tudo roda na máquina local.
Depois de ajustar os parâmetros, o sistema exporta arquivos prontos para motores de execução rápida como SGLang, TensorRT-LLM, TensorRT e vLLM. A API unificada da Hugging Face gera saídas tanto para modelos de texto da biblioteca transformers quanto para geradores de imagens do pacote diffusers. Em testes com a rede Qwen3.6-35B-A3B, a combinação do formato NVFP4 W4A4 com destilação e escalas por Hessiana Local recuperou a precisão que a compressão costuma tirar. O sistema recupera a qualidade original.
Na versão 0.47.0, lançada em 23 de setembro de 2026, os desenvolvedores incluíram um conversor em fluxo contínuo para a rede Kimi-K3 de 2,8 trilhões de parâmetros. O módulo lê especialistas roteados em NVFP4 com input_scale=1.0 e pesos de atenção em bloco FP8 de 128x128 fatia por fatia, sem carregar o arquivo bruto inteiro na memória do sistema. A atualização traz a receita Muse Glimmer a 5,5 bits efetivos e o script examples/alpamayo/qad.py, que usa FSDP2 em múltiplos aceleradores para reconstruir o modelo AlpamayoR1. O quantizador ONNX descarta mudanças que não alcancem ganho de 1,02x no TensorRT.
Para começar o trabalho, quem desenvolve instala os pacotes estáveis do índice PyPI com o comando pip install -U nvidia-modelopt[all]. Quem planeja programar melhorias ou testar recursos recentes clona o repositório no GitHub e roda pip install -e .[dev] em modo editável. Como caminho alternativo, a NVIDIA publica imagens de contêiner prontas no registro NVCR para os ambientes PyTorch, NeMo e TensorRT-LLM. O processo baixa programas de terceiros com termos próprios de uso. A primeira execução gera o arquivo calibrado.
Com 885 dias de atividade, o repositório reúne 4.403 estrelas, 645 forks e 418 problemas abertos no GitHub. A equipe da empresa mantém o código ativo e registrou o commit mais recente em 25 de setembro de 2026. A licença Apache-2.0 libera o uso comercial e autoriza alterações no código-fonte, mas o programa não ajuda quem roda inferência apenas em processadores comuns de computador. O trabalho depende de aceleradores gráficos compatíveis.