Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Hugging Face e Intel lançam sistema para rodar modelos de IA mais rápido em chips Gaudi

A parceria integra os aceleradores de IA da Intel ao TGI, ferramenta popular para servir modelos de linguagem em produção, prometendo alternativa às GPUs da Nvidia

Por Redação2 min
Em resumo

A Hugging Face integrou os chips Gaudi da Intel ao TGI (Text Generation Inference, um software para rodar modelos de linguagem em produção). A mudança permite que empresas usem aceleradores da Intel em vez de GPUs Nvidia para servir LLMs como Llama e Mistral, com desempenho comparável e custo potencialmente menor.

Compartilhar
Hugging Face e Intel lançam sistema para rodar modelos de IA mais rápido em chips Gaudi
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou que sua ferramenta TGI — Text Generation Inference, um software que permite rodar modelos de linguagem de forma eficiente em servidores — agora funciona oficialmente com os chips Gaudi da Intel. A integração foi feita em parceria com a fabricante de processadores e promete oferecer uma alternativa viável às GPUs da Nvidia, que hoje dominam o mercado de infraestrutura para IA, segundo informou a empresa em seu blog oficial.

O TGI é amplamente usado por empresas que precisam servir LLMs (modelos de linguagem grandes, como GPT ou Llama) em produção — ou seja, responder a milhares de requisições de usuários em tempo real. A ferramenta otimiza o processo de inferência (a etapa em que o modelo já treinado gera respostas) com técnicas como batching contínuo (agrupar várias requisições para processar de uma vez) e flash attention (um método que acelera o cálculo de atenção, parte central do funcionamento dos transformers, a arquitetura por trás dos LLMs). Até agora, o TGI rodava principalmente em GPUs Nvidia; agora, passa a suportar também os aceleradores Gaudi 2 e Gaudi 3 da Intel.

Os chips Gaudi são projetados especificamente para treinar e rodar modelos de IA, competindo diretamente com as GPUs H100 e A100 da Nvidia. A Intel promete que os Gaudi 3 oferecem desempenho competitivo a um custo menor, mas a adoção ainda é limitada — a Nvidia detém cerca de 90% do mercado de aceleradores para IA. A parceria com Hugging Face pode ajudar a mudar esse cenário, especialmente entre empresas que buscam reduzir custos de infraestrutura ou diversificar fornecedores.

Na prática, quem já usa o TGI pode, a partir de agora, rodar os mesmos modelos em servidores equipados com chips Gaudi sem precisar reescrever código. A Hugging Face disponibilizou imagens Docker (pacotes prontos que incluem todo o software necessário para rodar uma aplicação) compatíveis com Gaudi, facilitando a migração. A empresa também publicou benchmarks (testes de desempenho) mostrando que o TGI em Gaudi 3 alcança velocidades comparáveis às de GPUs Nvidia em modelos como Llama 3.1 e Mistral, dois dos LLMs de pesos abertos (cujos parâmetros internos são públicos e podem ser baixados e modificados livremente) mais populares.

Fonte original
Hugging Face Blog
Mais em · Ferramentas