Como um modelo de IA comprimido para 4 bits ficou melhor que o original completo
Pesquisadores criaram uma técnica que comprime modelos de linguagem em 75% do tamanho original e, ao mesmo tempo, melhora o desempenho — contrariando a lógica de que comprimir sempre piora a qualidade.
Pesquisadores desenvolveram uma técnica chamada quantization-aware healing que comprime modelos de linguagem (LLMs, a família de modelos que inclui ChatGPT) para 4 bits — 75% menores — e depois aplica um treinamento curto para recuperar a qualidade. O resultado surpreendeu: o modelo comprimido teve desempenho superior ao original em testes de raciocínio e compreensão de texto.

Uma equipe da Multiverse Computing (uma empresa espanhola especializada em IA para o setor financeiro) e do Artificial and Natural Intelligence Toulouse Institute desenvolveu uma técnica chamada quantization-aware healing (algo como "cura consciente da compressão") que resolve um dos problemas mais persistentes da inteligência artificial: como deixar modelos menores sem perder qualidade. O resultado surpreendeu até os próprios autores — o modelo comprimido ficou melhor que o original em tarefas de raciocínio e compreensão de texto.
A técnica funciona em duas etapas. Primeiro, os pesquisadores comprimem um modelo de linguagem de grande porte (LLM, a família de modelos que inclui ChatGPT e similares) reduzindo a precisão dos números que ele usa internamente — em vez de 16 bits por parâmetro (os valores que o modelo ajusta durante o treinamento para aprender padrões), passam a usar apenas 4 bits. Isso reduz o tamanho do modelo em cerca de 75%. Depois, aplicam um treinamento adicional curto para "curar" a perda de qualidade causada pela compressão, usando uma fração minúscula dos dados originais (menos de 0,1% do conjunto de treinamento inicial).
Os testes foram feitos com o SmolLM2-1.7B (um modelo de linguagem compacto da Hugging Face com 1,7 bilhão de parâmetros, criado para rodar em dispositivos com pouca memória). Depois de comprimido e "curado", o modelo alcançou 55,5% de precisão média em nove tarefas de avaliação — contra 54,3% da versão original em precisão total. A melhora foi especialmente clara em raciocínio matemático e compreensão de texto, embora algumas tarefas específicas tenham tido pequenas quedas de desempenho.
Segundo os autores, a técnica não apenas economiza memória e acelera a execução dos modelos (importante para rodar IA em celulares, dispositivos embarcados ou data centers com orçamento limitado), mas também pode funcionar como uma forma não intencional de regularização (um truque matemático que força o modelo a generalizar melhor, evitando que ele decore os dados de treino). Eles especulam que o processo de "cura" elimina informações redundantes ou ruidosas que o modelo original carregava, deixando apenas os padrões mais úteis.
O código e os modelos estão disponíveis publicamente na plataforma Hugging Face, e os pesquisadores já aplicaram a mesma abordagem a outros modelos, incluindo versões maiores do SmolLM2 e o Llama 3.2 (um modelo de pesos abertos da Meta, isto é, cujos parâmetros treinados podem ser baixados e modificados livremente). A técnica pode ser especialmente útil para aplicações em dispositivos de borda (edge computing, quando o processamento acontece no próprio aparelho, sem enviar dados para a nuvem) e em setores com orçamentos apertados, como educação e pesquisa acadêmica.


