Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Salamandra Visual, o novo modelo multimodal espanhol que entende imagens e texto

Pesquisadores do Barcelona Supercomputing Center lançaram um modelo de inteligência artificial treinado em catalão, espanhol e inglês, capaz de analisar tanto textos quanto imagens com desempenho competitivo.

Por Redação2 min
Em resumo

O Visual Salamandra 7B é um modelo de inteligência artificial criado pelo Barcelona Supercomputing Center que consegue processar imagens e texto simultaneamente em catalão, espanhol e inglês. Foi treinado a partir do Llama 3.2 Vision da Meta com 600 mil exemplos adicionais em línguas ibéricas e está disponível gratuitamente.

Compartilhar
Salamandra Visual, o novo modelo multimodal espanhol que entende imagens e texto
Pesquisa · Hugging Face Blog

O Barcelona Supercomputing Center (BSC, um dos principais centros de pesquisa em computação da Europa) acaba de lançar o Visual Salamandra 7B, segundo informou o Hugging Face. Trata-se de um modelo multimodal de inteligência artificial — ou seja, um sistema que consegue processar e entender tanto texto quanto imagens ao mesmo tempo — otimizado para três idiomas: catalão, espanhol e inglês. O modelo tem 7 bilhões de parâmetros (os valores ajustáveis que definem como uma IA processa informação), o que o torna relativamente leve e viável de rodar em hardware mais acessível.

O Visual Salamandra foi construído a partir do Llama 3.2 Vision (um modelo multimodal da Meta, empresa dona do Facebook e Instagram), mas passou por um processo chamado continued pretraining — ou seja, os pesquisadores pegaram um modelo já treinado e continuaram a alimentá-lo com novos dados, desta vez focados em catalão e espanhol. Isso permitiu que a IA ganhasse fluência nessas línguas sem perder suas capacidades originais em inglês. O treinamento incluiu 600 mil pares de imagens e textos em catalão e espanhol, além de 400 mil exemplos em inglês.

Em testes de benchmark (avaliações padronizadas usadas para comparar o desempenho de diferentes modelos), o Visual Salamandra alcançou resultados próximos ou superiores aos do Llama 3.2 Vision original em tarefas que envolvem raciocínio visual, como responder perguntas sobre o conteúdo de uma imagem ou descrever cenas complexas. O modelo está disponível publicamente no Hugging Face com licença aberta, o que significa que qualquer pessoa pode baixá-lo, usá-lo ou adaptá-lo sem pagar.

A iniciativa faz parte de um esforço mais amplo do BSC para desenvolver modelos de IA que funcionem bem em idiomas europeus além do inglês. Enquanto a maioria dos grandes modelos comerciais é treinada principalmente em inglês — o que limita sua precisão em outras línguas —, projetos como o Visual Salamandra buscam democratizar o acesso a ferramentas de IA de qualidade para falantes de espanhol e catalão. O modelo pode ser útil em aplicações que vão desde assistentes virtuais até sistemas de moderação de conteúdo visual em redes sociais.

Fonte original
Hugging Face Blog
Mais em · Pesquisa