Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Hugging Face adiciona suporte nativo a modelos GGUF no Transformers

A biblioteca agora roda arquivos quantizados do llama.cpp direto no notebook, usando os mesmos kernels de desempenho e sem precisar descompactar os pesos do modelo.

Por Redação2 min
Em resumo

A Hugging Face integrou o formato GGUF (arquivos de modelos quantizados criados pelo llama.cpp, um sistema de inferência local) diretamente no Transformers. Agora é possível carregar esses modelos compactados com a função from_pretrained e rodar localmente em Macs com Apple Silicon, usando os mesmos kernels de alto desempenho do llama.cpp e alcançando velocidade similar.

Compartilhar
Hugging Face adiciona suporte nativo a modelos GGUF no Transformers
Ferramentas · Hugging Face Blog

A Hugging Face anunciou que sua biblioteca Transformers (o framework mais usado para trabalhar com modelos de linguagem em Python) passou a rodar nativamente arquivos GGUF, o formato de modelos quantizados criado pela equipe do llama.cpp (um sistema de inferência que permite rodar modelos de IA localmente, sem enviar dados para a nuvem). Até agora, quem queria usar esses modelos compactados precisava de ferramentas como Ollama ou LM Studio — agora basta chamar from_pretrained, a função-padrão do Transformers, e passar o nome do arquivo.

GGUF é um formato que empacota os pesos do modelo, o tokenizador (o componente que transforma texto em números que a IA entende) e até o template de conversação em um único arquivo. Ele oferece quantização (uma técnica que reduz a precisão numérica dos pesos do modelo para economizar memória) em vários níveis: uma versão Q4_K_M de 4 bits ocupa cerca de um terço do espaço da versão original em BF16, permitindo que modelos maiores rodem em laptops comuns. A Hugging Face recomenda começar por Q4_K_M e subir para Q5_K_M ou Q6_K se houver memória disponível — variantes mais agressivas cabem melhor, mas podem perder qualidade dependendo da tarefa.

Para alcançar desempenho próximo ao do llama.cpp, o Transformers agora reutiliza os kernels ggml (as rotinas de baixo nível que fazem os cálculos do modelo) por meio da biblioteca kernels e reduziu a sobrecarga interna da função generate. O foco inicial está em chips Apple Silicon (os processadores M1, M2, M3 e M4 usados nos Macs mais recentes), começando pela arquitetura Qwen3.5. Nos testes da Hugging Face em um MacBook Pro M2 Max, o Transformers ficou praticamente empatado com o llama.cpp em três modelos de referência: um denso pequeno, um denso maior e um modelo mixture-of-experts (uma arquitetura que divide o trabalho entre vários submodelos especializados).

Além do uso direto em código Python, o Transformers também ganhou o comando transformers serve, que sobe um servidor compatível com a API da OpenAI. Isso significa que você pode conectar clientes como Jan ou Pi ao modelo rodando localmente no seu Mac, usando a interface de chat que preferir enquanto os dados ficam na máquina. A sintaxe é simples: basta rodar transformers serve "unsloth/Qwen3.5-4B-GGUF:Qwen3.5-4B-Q4_K_M.gguf" no terminal, onde a parte antes dos dois-pontos é o repositório no Hub da Hugging Face e a parte depois é o arquivo específico de quantização.

Fonte original
Hugging Face Blog
Etiquetas
Mais em · Ferramentas
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Hugging Face Blog

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão