Salamandra Visual, o novo modelo multimodal espanhol que entende imagens e texto
Pesquisadores do Barcelona Supercomputing Center lançaram um modelo de inteligência artificial treinado em catalão, espanhol e inglês, capaz de analisar tanto textos quanto imagens com desempenho competitivo.
O Visual Salamandra 7B é um modelo de inteligência artificial criado pelo Barcelona Supercomputing Center que consegue processar imagens e texto simultaneamente em catalão, espanhol e inglês. Foi treinado a partir do Llama 3.2 Vision da Meta com 600 mil exemplos adicionais em línguas ibéricas e está disponível gratuitamente.

O Barcelona Supercomputing Center (BSC, um dos principais centros de pesquisa em computação da Europa) acaba de lançar o Visual Salamandra 7B, segundo informou o Hugging Face. Trata-se de um modelo multimodal de inteligência artificial — ou seja, um sistema que consegue processar e entender tanto texto quanto imagens ao mesmo tempo — otimizado para três idiomas: catalão, espanhol e inglês. O modelo tem 7 bilhões de parâmetros (os valores ajustáveis que definem como uma IA processa informação), o que o torna relativamente leve e viável de rodar em hardware mais acessível.
O Visual Salamandra foi construído a partir do Llama 3.2 Vision (um modelo multimodal da Meta, empresa dona do Facebook e Instagram), mas passou por um processo chamado continued pretraining — ou seja, os pesquisadores pegaram um modelo já treinado e continuaram a alimentá-lo com novos dados, desta vez focados em catalão e espanhol. Isso permitiu que a IA ganhasse fluência nessas línguas sem perder suas capacidades originais em inglês. O treinamento incluiu 600 mil pares de imagens e textos em catalão e espanhol, além de 400 mil exemplos em inglês.
Em testes de benchmark (avaliações padronizadas usadas para comparar o desempenho de diferentes modelos), o Visual Salamandra alcançou resultados próximos ou superiores aos do Llama 3.2 Vision original em tarefas que envolvem raciocínio visual, como responder perguntas sobre o conteúdo de uma imagem ou descrever cenas complexas. O modelo está disponível publicamente no Hugging Face com licença aberta, o que significa que qualquer pessoa pode baixá-lo, usá-lo ou adaptá-lo sem pagar.
A iniciativa faz parte de um esforço mais amplo do BSC para desenvolver modelos de IA que funcionem bem em idiomas europeus além do inglês. Enquanto a maioria dos grandes modelos comerciais é treinada principalmente em inglês — o que limita sua precisão em outras línguas —, projetos como o Visual Salamandra buscam democratizar o acesso a ferramentas de IA de qualidade para falantes de espanhol e catalão. O modelo pode ser útil em aplicações que vão desde assistentes virtuais até sistemas de moderação de conteúdo visual em redes sociais.


