Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Hugging Face lança comando único para rodar servidores de IA na nuvem

Plataforma simplifica deploy de modelos de linguagem com vLLM, permitindo que desenvolvedores subam servidores em minutos sem configurar infraestrutura.

Por Redação2 min
Compartilhar
Hugging Face lança comando único para rodar servidores de IA na nuvem
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma integração que permite subir um servidor de inferência (o sistema que responde às perguntas feitas a um modelo de IA) com um único comando. A novidade conecta o vLLM (uma ferramenta popular para rodar modelos de linguagem de forma rápida e eficiente) ao Hugging Face Jobs, o serviço de computação em nuvem da empresa.

Até agora, quem queria usar modelos de linguagem grandes (LLMs, sigla em inglês para Large Language Models — os sistemas de IA que entendem e geram texto, como o GPT) em produção precisava configurar servidores, ajustar bibliotecas e montar infraestrutura do zero. Com a nova integração, basta uma linha de código para escolher um modelo, definir a capacidade de processamento e colocar o servidor no ar. A Hugging Face cuida da configuração, das GPUs (chips especializados que aceleram o processamento de IA) e do dimensionamento automático conforme o uso cresce.

O vLLM se tornou referência no setor porque consegue servir respostas de modelos grandes com baixa latência (ou seja, responde rápido) e aproveita melhor a memória das GPUs, permitindo atender mais usuários ao mesmo tempo. A empresa afirma que a integração é compatível com centenas de modelos já disponíveis na plataforma, de versões pequenas que rodam em notebooks até sistemas do tamanho do Llama 3 (um dos modelos de pesos abertos mais usados, desenvolvido pela Meta).

A iniciativa mira principalmente equipes que precisam testar protótipos ou escalar aplicações de IA sem montar um time de infraestrutura. Segundo a Hugging Face, o serviço cobra por hora de uso das GPUs, com preços que variam conforme o poder de processamento escolhido. A empresa compete diretamente com ofertas similares da Amazon (AWS), Google Cloud e Microsoft Azure, mas aposta na simplicidade e na integração nativa com seu ecossistema de modelos abertos.

Fonte original
Hugging Face Blog
Mais em · Ferramentas