Intel lança AutoRound, ferramenta que reduz o tamanho de modelos de IA sem perder qualidade
A técnica de quantização da Intel promete encolher modelos de linguagem grandes até quatro vezes, mantendo a precisão e facilitando o uso em dispositivos comuns
A Intel lançou o AutoRound, uma ferramenta gratuita que comprime modelos de inteligência artificial usando quantização (um método que reduz a precisão numérica interna do modelo). Ela diminui o tamanho de LLMs e VLMs até quatro vezes, mantendo a qualidade das respostas e permitindo que rodem em computadores comuns, sem necessidade de servidores potentes.

A Intel apresentou o AutoRound, uma ferramenta de código aberto que comprime modelos de inteligência artificial — tanto os de linguagem (LLMs, sistemas que geram texto como o ChatGPT) quanto os de visão e linguagem combinadas (VLMs, que processam imagens e texto ao mesmo tempo). A técnica se chama quantização (um método que reduz a precisão dos números usados internamente pelo modelo para diminuir o espaço que ele ocupa e acelerar o processamento) e foi desenvolvida nos laboratórios da Intel em parceria com a Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados).
Segundo informou a Hugging Face em seu blog oficial, o AutoRound consegue reduzir modelos para formatos de 4 bits (uma representação numérica bem mais compacta que os 16 bits padrão) sem comprometer a qualidade das respostas. Na prática, isso significa que um modelo de linguagem grande pode ocupar até um quarto do espaço original e rodar mais rápido, inclusive em hardware comum, sem perder precisão nos resultados.
A ferramenta usa uma abordagem chamada quantização baseada em otimização por sinal (SignRound), que ajusta os pesos do modelo (os milhões de parâmetros internos que definem como a IA responde) de forma iterativa, minimizando a perda de informação. O processo é mais lento que métodos tradicionais de quantização, mas compensa com melhor desempenho final — especialmente em tarefas complexas como geração de texto longo ou interpretação de imagens.
O AutoRound já foi testado em modelos populares como o Llama 3.1 (um modelo de linguagem da Meta com versões de até 405 bilhões de parâmetros) e o Qwen2-VL (um modelo multimodal da Alibaba que processa texto e imagem). A Intel disponibilizou a ferramenta gratuitamente no GitHub e integrou suporte nativo em bibliotecas como o Intel Neural Compressor (um kit de ferramentas para otimizar modelos de IA em processadores Intel) e no ecossistema da Hugging Face, facilitando o uso por desenvolvedores sem necessidade de ajustes manuais profundos.
A empresa também destacou que o AutoRound é compatível com aceleradores como as GPUs Intel Arc e Data Center (chips gráficos da Intel usados para treinar e rodar modelos de IA) e funciona bem em conjunto com outras técnicas de otimização, como GPTQ (um método de quantização desenvolvido para modelos GPT). A proposta é tornar modelos de IA de ponta acessíveis a quem não tem acesso a servidores de alta performance, ampliando o uso de IA em aplicações locais e dispositivos de borda (equipamentos que processam dados sem depender da nuvem, como câmeras inteligentes ou assistentes pessoais).


