Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas
La nueva familia de modelos de inteligencia artificial combina procesamiento de imágenes y texto en español, alemán, japonés y otros seis idiomas, y ya está disponible para descarga gratuita en Hugging Face.
Google lanzó PaliGemma 2 Mix, tres modelos de visión y lenguaje (sistemas de IA que analizan imágenes y texto) que funcionan en nueve idiomas incluido el español. Vienen en versiones de 3, 10 y 28 mil millones de parámetros (valores ajustables del modelo), están disponibles en Hugging Face y permiten uso comercial sin restricciones.

Google ha lanzado PaliGemma 2 Mix, una nueva generación de modelos de visión y lenguaje (sistemas de IA capaces de analizar tanto imágenes como texto) que operan nativamente en nueve idiomas, incluido el español. Estos modelos, disponibles para descarga en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), representan una evolución significativa respecto a la versión anterior, que funcionaba principalmente en inglés.
La familia PaliGemma 2 Mix incluye tres variantes de distinto tamaño: 3 mil millones, 10 mil millones y 28 mil millones de parámetros (valores ajustables que determinan el comportamiento del modelo). Los tres han sido entrenados con una mezcla equilibrada de datos en inglés, español, francés, alemán, italiano, portugués, hindi, japonés y coreano, lo que les permite responder a instrucciones y describir imágenes en cualquiera de estos idiomas sin necesidad de traducción previa.
Según Google, estos modelos destacan especialmente en tareas como el OCR (reconocimiento óptico de caracteres, es decir, extraer texto de imágenes), la detección de objetos y la respuesta a preguntas sobre contenido visual. La versión de 28 mil millones de parámetros alcanza un rendimiento comparable al de modelos líderes del sector en benchmarks multilingües (pruebas estandarizadas para medir capacidades de IA), algo inusual para un modelo de visión de pesos abiertos (cuya arquitectura interna es pública y modificable).
Los tres modelos están licenciados bajo Gemma Terms of Use, lo que permite su uso comercial sin restricciones de escala. Google ha publicado también el código de entrenamiento y las recetas de fine-tuning (ajuste fino, proceso de adaptar un modelo preentrenado a una tarea específica) para facilitar que otros equipos los personalicen. La disponibilidad en Hugging Face, combinada con su capacidad multilingüe nativa, podría acelerar el desarrollo de aplicaciones de visión por computadora en mercados no anglófonos.


