QIMMA, el primer ranking de modelos de IA en árabe que prioriza la calidad sobre el tamaño
Una iniciativa del Technology Innovation Institute de Abu Dabi busca evaluar modelos de lenguaje en árabe con criterios más rigurosos que las tablas tradicionales.

El Technology Innovation Institute (TII, un centro de investigación con sede en los Emiratos Árabes Unidos) ha lanzado QIMMA, una clasificación de modelos de lenguaje especializados en árabe que rompe con la tendencia de medir únicamente el rendimiento bruto. Según informó el equipo del TII en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), este nuevo ranking evalúa los modelos por su utilidad real, no solo por su tamaño o cantidad de parámetros (los valores numéricos internos que determinan cómo responde un modelo).
La mayoría de rankings de modelos de IA, como el conocido LMSYS Chatbot Arena, ordenan los sistemas por su capacidad de generar respuestas convincentes en pruebas generales, lo que tiende a favorecer modelos enormes entrenados por grandes empresas. QIMMA adopta un enfoque distinto: mide qué tan bien los modelos entienden dialectos árabes específicos, detectan contenido problemático, razonan en contextos culturales propios de la región y evitan sesgos lingüísticos. El objetivo, explican desde el TII, es identificar qué modelo funciona mejor para aplicaciones reales en el mundo árabe, independientemente de si tiene 7.000 millones o 400.000 millones de parámetros.
El ranking incluye tests de comprensión de lectura en árabe clásico y dialectal, tareas de razonamiento matemático adaptadas culturalmente, y evaluaciones de seguridad que detectan si el modelo reproduce estereotipos o información errónea frecuente en la región. También penaliza a los modelos que dependen excesivamente de traducciones automáticas del inglés en lugar de generar respuestas idiomáticas en árabe. Los primeros puestos de la tabla están ocupados por modelos de pesos abiertos (aquellos cuyos archivos internos pueden descargarse y modificarse libremente) como Qwen 2.5 de Alibaba y Llama 3.1 de Meta, aunque varios modelos más pequeños y especializados superan a sistemas comerciales más grandes en categorías específicas.
Para los desarrolladores que trabajan con lenguas minoritarias o regionales, QIMMA representa un modelo a seguir: en lugar de asumir que los rankings diseñados para inglés son universales, el proyecto demuestra que es posible construir métricas de evaluación que reflejen las necesidades reales de comunidades lingüísticas específicas. El código de las pruebas y los resultados completos están disponibles de forma abierta en Hugging Face, lo que permite a cualquier equipo replicar el sistema para otros idiomas.


