Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog1 min

Hugging Face acelera modelos de IA com nova integração ao vLLM

Parceria entre Hugging Face e a equipe do vLLM promete rodar modelos de linguagem até duas vezes mais rápido, mantendo a compatibilidade com milhares de modelos já existentes.

Por Redação1 min
Compartilhar
Hugging Face acelera modelos de IA com nova integração ao vLLM
Ferramentas · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma integração nativa com o vLLM (software otimizado para rodar modelos de linguagem de forma muito mais rápida e eficiente). A novidade permite que modelos hospedados na plataforma rodem em velocidade máxima sem precisar de adaptações manuais — algo que antes exigia trabalho técnico considerável.

Segundo informou a Hugging Face em seu blog oficial, a integração foi desenvolvida em parceria com a equipe do vLLM e traz ganhos de desempenho significativos: em testes internos, alguns modelos rodaram até duas vezes mais rápido do que nas versões anteriores. O segredo está na forma como o vLLM gerencia a memória da GPU (o chip especializado que processa a IA) durante a inferência (o processo de gerar respostas ou previsões a partir de um modelo já treinado).

Na prática, isso significa que desenvolvedores e empresas que usam modelos da Hugging Face — como LLMs (large language models, os modelos de linguagem de grande escala que alimentam chatbots e assistentes de IA) ou modelos de visão computacional — poderão processar mais solicitações por segundo, gastando menos com infraestrutura de servidor. A mudança é especialmente importante para quem roda modelos em produção, onde cada milissegundo e cada centavo contam.

A integração já está disponível e funciona com milhares de modelos compatíveis com a biblioteca Transformers (o framework de código aberto mantido pela Hugging Face que virou padrão para trabalhar com modelos de linguagem). Não é preciso reescrever código: basta atualizar para a versão mais recente do vLLM e da biblioteca Transformers. Para desenvolvedores brasileiros que rodam modelos localmente ou em nuvem, a novidade pode significar economias reais de tempo e dinheiro.

Fonte original
Hugging Face Blog
Mais em · Ferramentas