En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

QIMMA, el primer ranking de modelos de IA en árabe que prioriza la calidad sobre el tamaño

Una iniciativa del Technology Innovation Institute de Abu Dabi busca evaluar modelos de lenguaje en árabe con criterios más rigurosos que las tablas tradicionales.

Por Redacción2 min
Compartir
QIMMA, el primer ranking de modelos de IA en árabe que prioriza la calidad sobre el tamaño
Investigación · Hugging Face Blog

El Technology Innovation Institute (TII, un centro de investigación con sede en los Emiratos Árabes Unidos) ha lanzado QIMMA, una clasificación de modelos de lenguaje especializados en árabe que rompe con la tendencia de medir únicamente el rendimiento bruto. Según informó el equipo del TII en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), este nuevo ranking evalúa los modelos por su utilidad real, no solo por su tamaño o cantidad de parámetros (los valores numéricos internos que determinan cómo responde un modelo).

La mayoría de rankings de modelos de IA, como el conocido LMSYS Chatbot Arena, ordenan los sistemas por su capacidad de generar respuestas convincentes en pruebas generales, lo que tiende a favorecer modelos enormes entrenados por grandes empresas. QIMMA adopta un enfoque distinto: mide qué tan bien los modelos entienden dialectos árabes específicos, detectan contenido problemático, razonan en contextos culturales propios de la región y evitan sesgos lingüísticos. El objetivo, explican desde el TII, es identificar qué modelo funciona mejor para aplicaciones reales en el mundo árabe, independientemente de si tiene 7.000 millones o 400.000 millones de parámetros.

El ranking incluye tests de comprensión de lectura en árabe clásico y dialectal, tareas de razonamiento matemático adaptadas culturalmente, y evaluaciones de seguridad que detectan si el modelo reproduce estereotipos o información errónea frecuente en la región. También penaliza a los modelos que dependen excesivamente de traducciones automáticas del inglés en lugar de generar respuestas idiomáticas en árabe. Los primeros puestos de la tabla están ocupados por modelos de pesos abiertos (aquellos cuyos archivos internos pueden descargarse y modificarse libremente) como Qwen 2.5 de Alibaba y Llama 3.1 de Meta, aunque varios modelos más pequeños y especializados superan a sistemas comerciales más grandes en categorías específicas.

Para los desarrolladores que trabajan con lenguas minoritarias o regionales, QIMMA representa un modelo a seguir: en lugar de asumir que los rankings diseñados para inglés son universales, el proyecto demuestra que es posible construir métricas de evaluación que reflejen las necesidades reales de comunidades lingüísticas específicas. El código de las pruebas y los resultados completos están disponibles de forma abierta en Hugging Face, lo que permite a cualquier equipo replicar el sistema para otros idiomas.

Fuente original
Hugging Face Blog
Más en · Investigación