En directo
[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Aya Vision: el modelo multimodal que entiende 23 idiomas y busca democratizar la IA más allá del inglés

Un equipo internacional liderado por Cohere for AI presenta Aya Vision, un modelo de inteligencia artificial capaz de procesar texto e imágenes en 23 lenguas, incluyendo español, árabe, turco y tailandés, con rendimiento comparable a modelos comerciales como GPT-4V.

Por Redacción2 min
En resumen

Aya Vision es un modelo de inteligencia artificial que entiende texto e imágenes en 23 idiomas, desarrollado por Cohere for AI y liberado con pesos abiertos (cualquiera puede descargarlo y modificarlo). Alcanza rendimiento similar a GPT-4V o Gemini en tareas multilingües y multimodales, con especial fuerza en español, árabe y turco.

Compartir
Aya Vision: el modelo multimodal que entiende 23 idiomas y busca democratizar la IA más allá del inglés
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado un análisis detallado de Aya Vision, un modelo multimodal (capaz de entender tanto texto como imágenes) desarrollado por Cohere for AI que funciona en 23 idiomas. El modelo, cuyos pesos están liberados bajo licencia abierta (cualquiera puede descargarlo y modificarlo sin pagar), alcanza un rendimiento comparable al de GPT-4V de OpenAI o Gemini 1.5 Pro de Google en tareas que combinan visión y lenguaje, pero con una particularidad: funciona igual de bien en turco, árabe, español o tailandés que en inglés.

Según el artículo, Aya Vision se entrenó con una combinación de datos multilingües públicos y un conjunto de datos sintéticos generados específicamente para esta tarea. El equipo utilizó una técnica llamada SFT (supervised fine-tuning, o ajuste supervisado), que consiste en tomar un modelo ya entrenado y refinarlo con ejemplos humanos etiquetados. Para evitar que el modelo perdiera calidad en inglés al entrenar en otros idiomas —un problema común en modelos multilingües—, los desarrolladores mezclaron datos en inglés con traducciones de alta calidad y emplearon un método de re-muestreo (técnica que equilibra la cantidad de ejemplos de cada idioma durante el entrenamiento) basado en la raíz cuadrada del tamaño de cada dataset.

El modelo se basa en la arquitectura Llama 3.2 Vision de Meta (un modelo de lenguaje y visión de código abierto lanzado en 2024), que procesa imágenes dividiéndolas en bloques de píxeles y transformándolas en secuencias de números que el modelo puede interpretar como si fueran palabras. El entrenamiento de Aya Vision requirió 512 GPUs (procesadores especializados en cálculos de IA) durante 18 horas, un coste computacional muy inferior al de entrenar un modelo desde cero.

Los evaluadores probaron Aya Vision en ocho benchmarks multilingües (conjuntos de pruebas estandarizadas que miden el rendimiento de un modelo en tareas concretas), incluyendo traducción automática de imágenes, respuesta a preguntas visuales y comprensión de escenas. En idiomas como el español, el modelo superó en algunas tareas a Gemini 1.5 Flash; en árabe y turco, igualó o mejoró el desempeño de modelos comerciales en test de razonamiento visual. Sin embargo, en idiomas con menos recursos de entrenamiento disponibles, como el swahili, el rendimiento fue notablemente inferior.

El equipo detrás de Aya Vision publicó también el código de entrenamiento, los datos sintéticos generados y una serie de herramientas para evaluar modelos multimodales en idiomas distintos al inglés. Según Cohere for AI, la intención es que otros investigadores puedan replicar el proceso y adaptar el modelo a lenguas no cubiertas en la versión actual. El modelo está disponible en Hugging Face bajo licencia Llama 3.2 Community, que permite uso comercial con algunas restricciones.

Fuente original
Hugging Face Blog
Más en · Modelos de IA