Aya Vision: el modelo multimodal que entiende 23 idiomas y busca democratizar la IA más allá del inglés
Un equipo internacional liderado por Cohere for AI presenta Aya Vision, un modelo de inteligencia artificial capaz de procesar texto e imágenes en 23 lenguas, incluyendo español, árabe, turco y tailandés, con rendimiento comparable a modelos comerciales como GPT-4V.
Aya Vision es un modelo de inteligencia artificial que entiende texto e imágenes en 23 idiomas, desarrollado por Cohere for AI y liberado con pesos abiertos (cualquiera puede descargarlo y modificarlo). Alcanza rendimiento similar a GPT-4V o Gemini en tareas multilingües y multimodales, con especial fuerza en español, árabe y turco.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado un análisis detallado de Aya Vision, un modelo multimodal (capaz de entender tanto texto como imágenes) desarrollado por Cohere for AI que funciona en 23 idiomas. El modelo, cuyos pesos están liberados bajo licencia abierta (cualquiera puede descargarlo y modificarlo sin pagar), alcanza un rendimiento comparable al de GPT-4V de OpenAI o Gemini 1.5 Pro de Google en tareas que combinan visión y lenguaje, pero con una particularidad: funciona igual de bien en turco, árabe, español o tailandés que en inglés.
Según el artículo, Aya Vision se entrenó con una combinación de datos multilingües públicos y un conjunto de datos sintéticos generados específicamente para esta tarea. El equipo utilizó una técnica llamada SFT (supervised fine-tuning, o ajuste supervisado), que consiste en tomar un modelo ya entrenado y refinarlo con ejemplos humanos etiquetados. Para evitar que el modelo perdiera calidad en inglés al entrenar en otros idiomas —un problema común en modelos multilingües—, los desarrolladores mezclaron datos en inglés con traducciones de alta calidad y emplearon un método de re-muestreo (técnica que equilibra la cantidad de ejemplos de cada idioma durante el entrenamiento) basado en la raíz cuadrada del tamaño de cada dataset.
El modelo se basa en la arquitectura Llama 3.2 Vision de Meta (un modelo de lenguaje y visión de código abierto lanzado en 2024), que procesa imágenes dividiéndolas en bloques de píxeles y transformándolas en secuencias de números que el modelo puede interpretar como si fueran palabras. El entrenamiento de Aya Vision requirió 512 GPUs (procesadores especializados en cálculos de IA) durante 18 horas, un coste computacional muy inferior al de entrenar un modelo desde cero.
Los evaluadores probaron Aya Vision en ocho benchmarks multilingües (conjuntos de pruebas estandarizadas que miden el rendimiento de un modelo en tareas concretas), incluyendo traducción automática de imágenes, respuesta a preguntas visuales y comprensión de escenas. En idiomas como el español, el modelo superó en algunas tareas a Gemini 1.5 Flash; en árabe y turco, igualó o mejoró el desempeño de modelos comerciales en test de razonamiento visual. Sin embargo, en idiomas con menos recursos de entrenamiento disponibles, como el swahili, el rendimiento fue notablemente inferior.
El equipo detrás de Aya Vision publicó también el código de entrenamiento, los datos sintéticos generados y una serie de herramientas para evaluar modelos multimodales en idiomas distintos al inglés. Según Cohere for AI, la intención es que otros investigadores puedan replicar el proceso y adaptar el modelo a lenguas no cubiertas en la versión actual. El modelo está disponible en Hugging Face bajo licencia Llama 3.2 Community, que permite uso comercial con algunas restricciones.


