Aya Vision: o modelo de IA que entende imagens em 23 idiomas, incluindo português
Pesquisadores da Cohere for AI lançam um modelo multimodal de pesos abertos capaz de analisar imagens e responder perguntas em dezenas de línguas, com desempenho competitivo em português e outras línguas pouco representadas na IA.
A Cohere for AI lançou o Aya Vision, um modelo de inteligência artificial de pesos abertos (disponível gratuitamente para download e modificação) que consegue analisar imagens e responder perguntas sobre elas em 23 idiomas, incluindo português, árabe, hindi e turco, com desempenho competitivo frente a modelos maiores como GPT-4o e Gemini.

A Cohere for AI (braço de pesquisa sem fins lucrativos da empresa canadense Cohere) lançou o Aya Vision, um modelo de inteligência artificial que consegue "ver" imagens e conversar sobre elas em 23 idiomas, incluindo português, espanhol, árabe, hindi, chinês e turco. Diferente da maioria dos modelos multimodais (sistemas que processam texto e imagem ao mesmo tempo), o Aya Vision foi treinado desde o início para funcionar bem em línguas além do inglês — um avanço importante, já que os grandes modelos do mercado costumam ter desempenho fraco ou nulo em idiomas que não sejam inglês ou chinês.
O modelo foi construído sobre o Llama 3.2 Vision (um modelo da Meta que combina compreensão de texto e imagem) e treinado com um dataset (conjunto de dados de treinamento) criado pela própria comunidade Aya, com mais de 1,4 milhão de pares de imagem e texto em múltiplas línguas. Segundo informou a Cohere for AI, o Aya Vision tem 8 bilhões de parâmetros (valores ajustáveis que definem o comportamento de um modelo de IA) e está disponível com licença de pesos abertos (ou seja, qualquer pessoa pode baixar, usar e modificar o modelo gratuitamente) no Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados).
Nos testes de benchmark (conjuntos padronizados de perguntas usados para comparar modelos), o Aya Vision superou ou ficou próximo de modelos bem maiores, como o Gemini 1.5 Pro (do Google) e o GPT-4o (da OpenAI), em tarefas que envolvem idiomas como árabe, hindi e turco. Em português, o modelo conseguiu identificar objetos em imagens, responder perguntas sobre gráficos e até interpretar memes com referências culturais locais — algo que modelos treinados apenas em inglês raramente fazem bem.
Para treinar o Aya Vision, os pesquisadores usaram uma técnica chamada LoRA (Low-Rank Adaptation, ou adaptação de baixo rank, um método que permite ajustar apenas uma pequena parte dos parâmetros de um modelo, economizando tempo e recursos computacionais) aplicada aos módulos de projeção de imagem do Llama 3.2 Vision. O treinamento foi feito em GPUs H100 (chips de processamento gráfico de última geração, fabricados pela Nvidia, especializados em rodar modelos de IA) e levou cerca de 24 horas. O código, os pesos do modelo e os dados de treinamento estão todos disponíveis publicamente, o que permite que outros pesquisadores reproduzam ou adaptem o trabalho.
A equipe da Cohere for AI destacou que o Aya Vision ainda tem limitações — ele não foi otimizado para tarefas de OCR (reconhecimento óptico de caracteres, a capacidade de extrair texto de imagens) e pode cometer erros em perguntas que exigem raciocínio visual complexo. Mesmo assim, o lançamento marca um passo importante na democratização da IA multimodal: pela primeira vez, um modelo desse tipo, competitivo e de pesos abertos, foi desenhado desde o início para funcionar bem em dezenas de idiomas, e não apenas traduzido ou adaptado depois do fato.


