Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog3 min

Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas

Com 260 milhões ou 800 milhões de parâmetros, o modelo foi treinado do zero e supera alternativas maiores em busca visual de documentos, enquanto ocupa até 255 vezes menos espaço no disco.

Por Redação3 min
Em resumo

A Hugging Face lançou o NeoMME, um modelo de inteligência artificial com 260 milhões ou 800 milhões de parâmetros (os pesos ajustáveis que definem o comportamento de uma rede neural) que processa texto e imagem ao mesmo tempo usando um único transformer bidirecional, sem precisar de uma torre de visão separada nem de um modelo de linguagem causal como a maioria dos sistemas atuais.

Compartilhar
Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas
Modelos de IA · Hugging Face Blog

A Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou o NeoMME, uma família de modelos que entendem texto e imagem ao mesmo tempo usando uma arquitetura diferente da maioria dos sistemas atuais. Enquanto modelos como o GPT-4o ou o Gemini combinam uma "torre de visão" pré-treinada (um modelo separado que processa imagens) com um modelo de linguagem causal (que gera texto palavra por palavra), o NeoMME usa um único transformer bidirecional (arquitetura que lê o texto inteiro de uma vez, sem ordem fixa) treinado desde o início. Segundo a empresa, isso elimina camadas desnecessárias e torna o sistema mais eficiente para tarefas que não exigem gerar texto, como busca ou classificação.

O modelo existe em duas versões: uma com 260 milhões de parâmetros (os pesos ajustáveis que definem o comportamento de uma rede neural) e outra com 800 milhões. Ambas aceitam imagens de qualquer tamanho e formato, dividem cada imagem em blocos de 32×32 pixels e processam esses blocos junto com palavras no mesmo caminho computacional. O contexto é de 16.384 tokens (unidades mínimas de texto ou imagem), suficiente para duas imagens em resolução 4K. A Hugging Face treinou o NeoMME com 524 bilhões de tokens vindos de textos multilíngues, código, matemática e imagens de documentos, usando uma técnica chamada "difusão mascarada discreta" — o modelo aprende a reconstruir palavras escondidas enquanto vê a imagem completa, forçando-o a buscar pistas visuais em vez de adivinhar pelo contexto textual.

A empresa ajustou o NeoMME especificamente para busca visual de documentos, criando o NeoMME-Retriever. Ao contrário de sistemas tradicionais que extraem texto de PDFs com OCR (software de reconhecimento óptico de caracteres) e depois buscam nos trechos escritos, o NeoMME-Retriever trata cada página como uma captura de tela e a compara diretamente com a pergunta do usuário. Isso preserva layout, tabelas, gráficos e até o estilo da fonte — informações que um OCR perfeito jamais capturaria. O modelo tem duas cabeças de saída: uma gera um vetor denso (uma representação compacta da página inteira), útil para busca rápida em grandes bancos de dados; a outra gera vetores individuais para cada pedaço de texto ou região da imagem, uma técnica chamada "late-interaction" (interação tardia) que permite comparar detalhes finos entre a pergunta e partes específicas da página.

No benchmark ViDoRe v3 (conjunto de testes para busca visual de documentos), o NeoMME-Retriever de 260 milhões de parâmetros alcançou nDCG@10 (métrica que mede quão bem o sistema ordena os resultados) de 0,523, o melhor desempenho entre modelos abaixo de 800 milhões de parâmetros — ficando a apenas 0,002 pontos do ColQwen2.5, que tem 14 vezes mais parâmetros. A versão de 800 milhões chegou a 0,556, quase empatando com o Vultron Retriever Flash, de tamanho similar. Em velocidade, o modelo menor processa cerca de 51 páginas por segundo em resolução de 2048×2048 pixels numa GPU NVIDIA L40S (processador gráfico usado em servidores de IA), o dobro da velocidade do ColModernVBERT. A Hugging Face também desenvolveu técnicas de compressão que reduzem o espaço de armazenamento de cada página de 1,5 MB para 6 kB (255 vezes menor) mantendo mais de 95% da precisão original.

Todos os checkpoints do NeoMME (versões salvas do modelo em diferentes estágios de treinamento) estão disponíveis sob licença Apache 2.0 (licença de código aberto que permite uso comercial sem restrições) na plataforma Hugging Face, prontos para uso com a biblioteca Transformers. A empresa disponibilizou também um relatório técnico completo e uma demonstração interativa de busca visual usando RAG (Retrieval-Augmented Generation, técnica que combina busca em documentos com geração de texto). O modelo foi desenhado para funcionar em múltiplos idiomas, incluindo português, e suporta tarefas além de busca, como classificação de imagens e rotulação de tokens.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Hugging Face Blog

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão