Hugging Face e Intel lançam sistema para rodar modelos de IA mais rápido em chips Gaudi
A parceria integra os aceleradores de IA da Intel ao TGI, ferramenta popular para servir modelos de linguagem em produção, prometendo alternativa às GPUs da Nvidia
A Hugging Face integrou os chips Gaudi da Intel ao TGI (Text Generation Inference, um software para rodar modelos de linguagem em produção). A mudança permite que empresas usem aceleradores da Intel em vez de GPUs Nvidia para servir LLMs como Llama e Mistral, com desempenho comparável e custo potencialmente menor.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou que sua ferramenta TGI — Text Generation Inference, um software que permite rodar modelos de linguagem de forma eficiente em servidores — agora funciona oficialmente com os chips Gaudi da Intel. A integração foi feita em parceria com a fabricante de processadores e promete oferecer uma alternativa viável às GPUs da Nvidia, que hoje dominam o mercado de infraestrutura para IA, segundo informou a empresa em seu blog oficial.
O TGI é amplamente usado por empresas que precisam servir LLMs (modelos de linguagem grandes, como GPT ou Llama) em produção — ou seja, responder a milhares de requisições de usuários em tempo real. A ferramenta otimiza o processo de inferência (a etapa em que o modelo já treinado gera respostas) com técnicas como batching contínuo (agrupar várias requisições para processar de uma vez) e flash attention (um método que acelera o cálculo de atenção, parte central do funcionamento dos transformers, a arquitetura por trás dos LLMs). Até agora, o TGI rodava principalmente em GPUs Nvidia; agora, passa a suportar também os aceleradores Gaudi 2 e Gaudi 3 da Intel.
Os chips Gaudi são projetados especificamente para treinar e rodar modelos de IA, competindo diretamente com as GPUs H100 e A100 da Nvidia. A Intel promete que os Gaudi 3 oferecem desempenho competitivo a um custo menor, mas a adoção ainda é limitada — a Nvidia detém cerca de 90% do mercado de aceleradores para IA. A parceria com Hugging Face pode ajudar a mudar esse cenário, especialmente entre empresas que buscam reduzir custos de infraestrutura ou diversificar fornecedores.
Na prática, quem já usa o TGI pode, a partir de agora, rodar os mesmos modelos em servidores equipados com chips Gaudi sem precisar reescrever código. A Hugging Face disponibilizou imagens Docker (pacotes prontos que incluem todo o software necessário para rodar uma aplicação) compatíveis com Gaudi, facilitando a migração. A empresa também publicou benchmarks (testes de desempenho) mostrando que o TGI em Gaudi 3 alcança velocidades comparáveis às de GPUs Nvidia em modelos como Llama 3.1 e Mistral, dois dos LLMs de pesos abertos (cujos parâmetros internos são públicos e podem ser baixados e modificados livremente) mais populares.


