Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog1 min

Novo pacote do Hugging Face permite combinar texto, imagem e áudio em um único modelo de busca

Atualização do Sentence Transformers facilita criar sistemas que entendem perguntas em qualquer formato — e pode rodar até em notebooks comuns.

Por Redação1 min
Compartilhar
Novo pacote do Hugging Face permite combinar texto, imagem e áudio em um único modelo de busca
Ferramentas · Hugging Face Blog

O Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou uma atualização importante do Sentence Transformers, uma biblioteca de código aberto que ajuda a criar sistemas de busca inteligentes. A novidade é que agora ele trabalha com dados multimodais — ou seja, consegue processar e comparar textos, imagens e áudio ao mesmo tempo, tudo dentro de um único modelo.

Na prática, isso significa que você pode fazer uma busca usando uma pergunta em texto e receber como resposta imagens relevantes, ou vice-versa. Também dá para combinar diferentes tipos de entrada: procurar vídeos usando uma descrição falada, por exemplo. A biblioteca gera embeddings (representações numéricas que capturam o significado de uma informação) para cada tipo de dado e permite que eles sejam comparados diretamente, mesmo sendo de formatos diferentes.

A atualização também traz suporte para modelos de reranking multimodal, que ajudam a reorganizar os resultados de uma busca para colocar os mais relevantes no topo. Segundo informou o Hugging Face, esses modelos funcionam bem mesmo em hardware modesto — os testes mostraram que é possível rodar inferência (o processo de usar um modelo já treinado para gerar resultados) em GPUs (chips gráficos especializados em cálculos paralelos) de notebooks comuns, sem precisar de servidores caros.

O post oficial inclui exemplos de código para quem quiser experimentar: desde treinar um modelo do zero até usar modelos prontos como o CLIP (um modelo da OpenAI que entende imagens e textos juntos) ou o Jina CLIP (uma versão otimizada feita pela empresa Jina AI). Tudo pode ser ajustado para tarefas específicas, como busca de produtos em e-commerce ou organização de bibliotecas de mídia. A biblioteca está disponível gratuitamente no GitHub e pode ser instalada via pip, o gerenciador de pacotes do Python.

Fonte original
Hugging Face Blog
Mais em · Ferramentas