Como a Hugging Face turbinou a busca do Papers with Code com IA
A plataforma de artigos científicos adotou três ferramentas da Hugging Face para tornar sua busca mais rápida e inteligente, usando embeddings e modelos de linguagem.
A Hugging Face forneceu três ferramentas (Inference Endpoints, Jobs e Buckets) que permitiram ao Papers with Code criar um sistema de busca baseado em embeddings (representações matemáticas de texto). O sistema processa buscas em menos de 200 milissegundos, entendendo melhor a intenção do usuário mesmo quando ele usa termos diferentes dos artigos.

O Papers with Code (um site que reúne artigos científicos de inteligência artificial junto com o código usado nos experimentos) renovou seu sistema de busca usando três ferramentas da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados): Inference Endpoints, Jobs e Buckets. A mudança tornou a busca mais rápida e capaz de entender melhor o que o usuário realmente quer encontrar, segundo informou a Hugging Face em artigo publicado esta semana.
A base do novo sistema são os embeddings (representações matemáticas de texto que capturam o significado das palavras), gerados por um modelo chamado Snowflake Arctic Embed. Esse modelo transforma cada artigo científico em um conjunto de números que a máquina consegue comparar rapidamente. Com isso, quando alguém busca por "redes neurais para processamento de imagens médicas", o sistema encontra artigos relevantes mesmo que eles usem termos ligeiramente diferentes.
Para processar os milhões de artigos da plataforma, a equipe usou os Inference Jobs (um serviço que roda modelos de IA em grande escala, processando muitos dados de uma vez só) e armazenou os embeddings resultantes nos Buckets (um sistema de armazenamento na nuvem otimizado para dados de machine learning). Já os Inference Endpoints (servidores dedicados que mantêm um modelo sempre disponível para responder requisições) ficam responsáveis por processar as buscas em tempo real.
A arquitetura foi desenhada para ser escalável: quando o volume de buscas aumenta, novos Endpoints entram automaticamente em ação. A equipe também implementou cache (armazenamento temporário de resultados frequentes) e compressão de dados para reduzir custos e melhorar o tempo de resposta. O resultado é um sistema que processa buscas em menos de 200 milissegundos, mantendo a precisão alta mesmo em consultas complexas.


