Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

NegóciosHugging Face Blog2 min

Servidor da Google Cloud roda modelos de IA de código aberto com 70% menos custo

Intel e Hugging Face mostram que é possível rodar grandes modelos de linguagem em CPUs comuns, sem depender de placas gráficas caras

Por Redação2 min
Compartilhar
Servidor da Google Cloud roda modelos de IA de código aberto com 70% menos custo
Negócios · Hugging Face Blog

A Intel, em parceria com a Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), demonstrou que é possível rodar grandes modelos de linguagem de código aberto com 70% menos custo total de propriedade usando servidores tradicionais da Google Cloud. O teste foi feito com a linha C4, equipada com processadores Intel Xeon (chips de servidor comuns, usados em datacenters do mundo inteiro), em vez das GPUs (placas gráficas especializadas em cálculos de IA, muito mais caras) que costumam ser exigidas para esse tipo de tarefa.

O experimento rodou modelos como o Llama 3.1 (um LLM de pesos abertos desenvolvido pela Meta, ou seja, um grande modelo de linguagem cujo código e parâmetros internos podem ser baixados e modificados por qualquer um) e o Qwen (outro modelo de linguagem criado pela chinesa Alibaba). Os engenheiros usaram técnicas de otimização como quantização (reduzir a precisão dos números internos do modelo para economizar memória e acelerar cálculos) e kernels personalizados (pequenos programas que fazem o processador executar operações de IA de forma mais eficiente).

Segundo informou a Hugging Face em seu blog oficial, o custo por token gerado (a menor unidade de texto que um modelo processa, equivalente a cerca de quatro letras) caiu drasticamente em comparação com arquiteturas baseadas apenas em GPU. A empresa argumenta que, para muitas aplicações do mundo real — como chatbots corporativos, assistentes de atendimento ao cliente ou sistemas de análise de documentos —, a velocidade de resposta de uma CPU moderna já é suficiente, e o investimento em hardware especializado acaba sendo desnecessário.

A demonstração faz parte de um esforço mais amplo da Intel para reconquistar espaço no mercado de IA, dominado hoje por fabricantes de GPU como a Nvidia. Para empresas e startups que querem rodar seus próprios modelos sem depender de serviços de nuvem pagos por uso (como o ChatGPT da OpenAI ou o Claude da Anthropic), a possibilidade de usar servidores comuns pode representar uma diferença enorme de custo — especialmente em países como o Brasil, onde o dólar alto encarece qualquer infraestrutura importada.

Fonte original
Hugging Face Blog
Mais em · Negócios