Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog1 min

Como rodar um assistente de IA mais rápido em notebooks comuns

Técnica desenvolvida pela Hugging Face e Intel acelera modelos de linguagem em computadores sem GPU dedicada, usando versões menores como rascunho.

Por Redação1 min
Compartilhar
Como rodar um assistente de IA mais rápido em notebooks comuns
Modelos de IA · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA já treinados) anunciou uma técnica que torna modelos de linguagem até 2,4 vezes mais rápidos em notebooks comuns. A solução usa "decodificação especulativa" — um truque em que um modelo pequeno e rápido gera respostas rascunho, que um modelo maior valida em paralelo. Isso reduz o tempo de espera sem perder qualidade, especialmente em processadores Intel Core Ultra equipados com NPU (uma unidade neural dedicada a tarefas de IA).

O projeto focou no Qwen 2.5 de 8 bilhões de parâmetros (um LLM — modelo de linguagem grande — desenvolvido pela chinesa Alibaba e capaz de raciocinar e usar ferramentas). Para gerar os rascunhos, a equipe criou versões compactas cortando camadas internas do modelo original, em vez de treinar do zero. Essas versões "podadas" têm entre 4 e 6 bilhões de parâmetros e mantêm boa parte do vocabulário e estrutura do modelo-pai, o que acelera a geração inicial sem exigir retreinamento custoso.

Os testes mostraram ganhos reais: em notebooks com Intel Core Ultra série 2, o modelo acelerou 2,4 vezes em tarefas de uso de ferramentas (como buscar informações ou executar comandos) e 1,8 vez em conversas simples. A técnica funciona melhor quando o modelo pequeno consegue prever corretamente várias palavras seguidas — quanto mais acertos, menos vezes o modelo grande precisa intervir e mais rápido fica o resultado final.

A solução está disponível para qualquer pessoa testar: todos os modelos podados foram publicados no Hugging Face com licença aberta, e o código-fonte está no GitHub. A Hugging Face fornece também um ambiente gratuito temporário (chamado Space) onde desenvolvedores podem experimentar a técnica sem instalar nada. Segundo a empresa, a abordagem pode ser aplicada a outros modelos de linguagem além do Qwen, desde que tenham arquitetura compatível.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA