Como rodar um assistente de IA mais rápido em notebooks comuns
Técnica desenvolvida pela Hugging Face e Intel acelera modelos de linguagem em computadores sem GPU dedicada, usando versões menores como rascunho.

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA já treinados) anunciou uma técnica que torna modelos de linguagem até 2,4 vezes mais rápidos em notebooks comuns. A solução usa "decodificação especulativa" — um truque em que um modelo pequeno e rápido gera respostas rascunho, que um modelo maior valida em paralelo. Isso reduz o tempo de espera sem perder qualidade, especialmente em processadores Intel Core Ultra equipados com NPU (uma unidade neural dedicada a tarefas de IA).
O projeto focou no Qwen 2.5 de 8 bilhões de parâmetros (um LLM — modelo de linguagem grande — desenvolvido pela chinesa Alibaba e capaz de raciocinar e usar ferramentas). Para gerar os rascunhos, a equipe criou versões compactas cortando camadas internas do modelo original, em vez de treinar do zero. Essas versões "podadas" têm entre 4 e 6 bilhões de parâmetros e mantêm boa parte do vocabulário e estrutura do modelo-pai, o que acelera a geração inicial sem exigir retreinamento custoso.
Os testes mostraram ganhos reais: em notebooks com Intel Core Ultra série 2, o modelo acelerou 2,4 vezes em tarefas de uso de ferramentas (como buscar informações ou executar comandos) e 1,8 vez em conversas simples. A técnica funciona melhor quando o modelo pequeno consegue prever corretamente várias palavras seguidas — quanto mais acertos, menos vezes o modelo grande precisa intervir e mais rápido fica o resultado final.
A solução está disponível para qualquer pessoa testar: todos os modelos podados foram publicados no Hugging Face com licença aberta, e o código-fonte está no GitHub. A Hugging Face fornece também um ambiente gratuito temporário (chamado Space) onde desenvolvedores podem experimentar a técnica sem instalar nada. Segundo a empresa, a abordagem pode ser aplicada a outros modelos de linguagem além do Qwen, desde que tenham arquitetura compatível.


