Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas
Com 260 milhões ou 800 milhões de parâmetros, o modelo foi treinado do zero e supera alternativas maiores em busca visual de documentos, enquanto ocupa até 255 vezes menos espaço no disco.
A Hugging Face lançou o NeoMME, um modelo de inteligência artificial com 260 milhões ou 800 milhões de parâmetros (os pesos ajustáveis que definem o comportamento de uma rede neural) que processa texto e imagem ao mesmo tempo usando um único transformer bidirecional, sem precisar de uma torre de visão separada nem de um modelo de linguagem causal como a maioria dos sistemas atuais.

A Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou o NeoMME, uma família de modelos que entendem texto e imagem ao mesmo tempo usando uma arquitetura diferente da maioria dos sistemas atuais. Enquanto modelos como o GPT-4o ou o Gemini combinam uma "torre de visão" pré-treinada (um modelo separado que processa imagens) com um modelo de linguagem causal (que gera texto palavra por palavra), o NeoMME usa um único transformer bidirecional (arquitetura que lê o texto inteiro de uma vez, sem ordem fixa) treinado desde o início. Segundo a empresa, isso elimina camadas desnecessárias e torna o sistema mais eficiente para tarefas que não exigem gerar texto, como busca ou classificação.
O modelo existe em duas versões: uma com 260 milhões de parâmetros (os pesos ajustáveis que definem o comportamento de uma rede neural) e outra com 800 milhões. Ambas aceitam imagens de qualquer tamanho e formato, dividem cada imagem em blocos de 32×32 pixels e processam esses blocos junto com palavras no mesmo caminho computacional. O contexto é de 16.384 tokens (unidades mínimas de texto ou imagem), suficiente para duas imagens em resolução 4K. A Hugging Face treinou o NeoMME com 524 bilhões de tokens vindos de textos multilíngues, código, matemática e imagens de documentos, usando uma técnica chamada "difusão mascarada discreta" — o modelo aprende a reconstruir palavras escondidas enquanto vê a imagem completa, forçando-o a buscar pistas visuais em vez de adivinhar pelo contexto textual.
A empresa ajustou o NeoMME especificamente para busca visual de documentos, criando o NeoMME-Retriever. Ao contrário de sistemas tradicionais que extraem texto de PDFs com OCR (software de reconhecimento óptico de caracteres) e depois buscam nos trechos escritos, o NeoMME-Retriever trata cada página como uma captura de tela e a compara diretamente com a pergunta do usuário. Isso preserva layout, tabelas, gráficos e até o estilo da fonte — informações que um OCR perfeito jamais capturaria. O modelo tem duas cabeças de saída: uma gera um vetor denso (uma representação compacta da página inteira), útil para busca rápida em grandes bancos de dados; a outra gera vetores individuais para cada pedaço de texto ou região da imagem, uma técnica chamada "late-interaction" (interação tardia) que permite comparar detalhes finos entre a pergunta e partes específicas da página.
No benchmark ViDoRe v3 (conjunto de testes para busca visual de documentos), o NeoMME-Retriever de 260 milhões de parâmetros alcançou nDCG@10 (métrica que mede quão bem o sistema ordena os resultados) de 0,523, o melhor desempenho entre modelos abaixo de 800 milhões de parâmetros — ficando a apenas 0,002 pontos do ColQwen2.5, que tem 14 vezes mais parâmetros. A versão de 800 milhões chegou a 0,556, quase empatando com o Vultron Retriever Flash, de tamanho similar. Em velocidade, o modelo menor processa cerca de 51 páginas por segundo em resolução de 2048×2048 pixels numa GPU NVIDIA L40S (processador gráfico usado em servidores de IA), o dobro da velocidade do ColModernVBERT. A Hugging Face também desenvolveu técnicas de compressão que reduzem o espaço de armazenamento de cada página de 1,5 MB para 6 kB (255 vezes menor) mantendo mais de 95% da precisão original.
Todos os checkpoints do NeoMME (versões salvas do modelo em diferentes estágios de treinamento) estão disponíveis sob licença Apache 2.0 (licença de código aberto que permite uso comercial sem restrições) na plataforma Hugging Face, prontos para uso com a biblioteca Transformers. A empresa disponibilizou também um relatório técnico completo e uma demonstração interativa de busca visual usando RAG (Retrieval-Augmented Generation, técnica que combina busca em documentos com geração de texto). O modelo foi desenhado para funcionar em múltiplos idiomas, incluindo português, e suporta tarefas além de busca, como classificação de imagens e rotulação de tokens.


