Hugging Face adiciona suporte nativo a modelos GGUF no Transformers
A biblioteca agora roda arquivos quantizados do llama.cpp direto no notebook, usando os mesmos kernels de desempenho e sem precisar descompactar os pesos do modelo.
A Hugging Face integrou o formato GGUF (arquivos de modelos quantizados criados pelo llama.cpp, um sistema de inferência local) diretamente no Transformers. Agora é possível carregar esses modelos compactados com a função from_pretrained e rodar localmente em Macs com Apple Silicon, usando os mesmos kernels de alto desempenho do llama.cpp e alcançando velocidade similar.

A Hugging Face anunciou que sua biblioteca Transformers (o framework mais usado para trabalhar com modelos de linguagem em Python) passou a rodar nativamente arquivos GGUF, o formato de modelos quantizados criado pela equipe do llama.cpp (um sistema de inferência que permite rodar modelos de IA localmente, sem enviar dados para a nuvem). Até agora, quem queria usar esses modelos compactados precisava de ferramentas como Ollama ou LM Studio — agora basta chamar from_pretrained, a função-padrão do Transformers, e passar o nome do arquivo.
GGUF é um formato que empacota os pesos do modelo, o tokenizador (o componente que transforma texto em números que a IA entende) e até o template de conversação em um único arquivo. Ele oferece quantização (uma técnica que reduz a precisão numérica dos pesos do modelo para economizar memória) em vários níveis: uma versão Q4_K_M de 4 bits ocupa cerca de um terço do espaço da versão original em BF16, permitindo que modelos maiores rodem em laptops comuns. A Hugging Face recomenda começar por Q4_K_M e subir para Q5_K_M ou Q6_K se houver memória disponível — variantes mais agressivas cabem melhor, mas podem perder qualidade dependendo da tarefa.
Para alcançar desempenho próximo ao do llama.cpp, o Transformers agora reutiliza os kernels ggml (as rotinas de baixo nível que fazem os cálculos do modelo) por meio da biblioteca kernels e reduziu a sobrecarga interna da função generate. O foco inicial está em chips Apple Silicon (os processadores M1, M2, M3 e M4 usados nos Macs mais recentes), começando pela arquitetura Qwen3.5. Nos testes da Hugging Face em um MacBook Pro M2 Max, o Transformers ficou praticamente empatado com o llama.cpp em três modelos de referência: um denso pequeno, um denso maior e um modelo mixture-of-experts (uma arquitetura que divide o trabalho entre vários submodelos especializados).
Além do uso direto em código Python, o Transformers também ganhou o comando transformers serve, que sobe um servidor compatível com a API da OpenAI. Isso significa que você pode conectar clientes como Jan ou Pi ao modelo rodando localmente no seu Mac, usando a interface de chat que preferir enquanto os dados ficam na máquina. A sintaxe é simples: basta rodar transformers serve "unsloth/Qwen3.5-4B-GGUF:Qwen3.5-4B-Q4_K_M.gguf" no terminal, onde a parte antes dos dois-pontos é o repositório no Hub da Hugging Face e a parte depois é o arquivo específico de quantização.


