Google lança PaliGemma 2 Mix, modelos de IA que entendem imagens e seguem instruções
Nova família de modelos combina visão computacional com linguagem natural e já está disponível gratuitamente para download, com versões otimizadas para rodar em computadores comuns
O Google lançou o PaliGemma 2 Mix, modelos de inteligência artificial que processam imagens e respondem perguntas seguindo instruções em linguagem natural. Disponíveis gratuitamente em três tamanhos (3, 10 e 28 bilhões de parâmetros, números que medem a complexidade de um modelo), incluem versões otimizadas para rodar em computadores comuns sem placas de vídeo caras.

O Google lançou o PaliGemma 2 Mix, uma nova geração de modelos de inteligência artificial que conseguem processar imagens e responder perguntas sobre elas seguindo instruções em linguagem natural. Os modelos foram treinados especificamente para entender comandos complexos e já estão disponíveis na Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), segundo informou a empresa no blog oficial da plataforma.
A família PaliGemma 2 Mix vem em três tamanhos — 3 bilhões, 10 bilhões e 28 bilhões de parâmetros (números que medem a capacidade e complexidade de um modelo de IA) — e todos podem ser baixados gratuitamente. O Google também disponibilizou versões quantizadas (uma técnica que reduz o tamanho do modelo para que ele rode mais rápido e com menos memória) em 4 e 8 bits, permitindo que os modelos funcionem até em hardware mais modesto, como laptops ou computadores de mesa sem placas de vídeo caras.
Diferente dos modelos anteriores da linha PaliGemma, que eram mais generalistas, esta versão foi treinada com datasets de instrução (conjuntos de dados onde cada exemplo inclui um comando específico e a resposta esperada). Isso significa que o modelo entende melhor o que você está pedindo — por exemplo, se você mostrar uma foto de uma receita e perguntar "quantas xícaras de farinha?", ele consegue extrair a informação exata em vez de apenas descrever a imagem de forma geral.
Os modelos já estão integrados ao Transformers (a biblioteca de código aberto mais usada para trabalhar com modelos de linguagem e visão), o que facilita o uso por desenvolvedores. O Google também publicou demonstrações interativas no Hugging Face Spaces, onde qualquer pessoa pode testar os modelos diretamente no navegador, sem precisar instalar nada. A empresa destacou que os resultados em tarefas de compreensão visual e seguimento de instruções superaram modelos similares de mesmo tamanho, embora não tenha divulgado benchmarks (testes padronizados que medem o desempenho de modelos de IA) detalhados na publicação inicial.


