Hugging Face estrena tres rankings para evaluar modelos de IA en árabe
La plataforma acaba de publicar tablas de clasificación que miden cómo siguen instrucciones, generan texto y razonan los modelos de lenguaje en árabe, un idioma históricamente infrarrepresentado en inteligencia artificial.
Hugging Face publico tres rankings para evaluar modelos de lenguaje en arabe: IFEval Arabic mide si siguen instrucciones complejas, AraGen evalua la generacion de texto abierto, y ArabMMLU pone a prueba conocimientos generales mediante examenes de opcion multiple. Los primeros puestos los ocupan modelos de Meta, Alibaba y DeepSeek.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar tres nuevos rankings públicos dedicados exclusivamente a evaluar modelos de lenguaje en árabe. La iniciativa llega en un momento en que la mayoría de las pruebas de referencia (benchmarks, o conjuntos de tareas estandarizadas que sirven para comparar modelos) siguen centradas en inglés, dejando en un segundo plano a idiomas hablados por cientos de millones de personas.
El primer ranking, llamado IFEval Arabic, mide la capacidad de los modelos para seguir instrucciones complejas en árabe: por ejemplo, si pueden cumplir restricciones sobre la longitud del texto generado, el uso de palabras específicas o el formato de la respuesta. Es una traducción y adaptación cultural del conocido test IFEval original en inglés, realizada por expertos nativos para mantener la intención de cada tarea. Los primeros puestos los ocupan Meta Llama 3.3 70B Instruct (un modelo de código abierto entrenado por Meta, la empresa matriz de Facebook) y Qwen2.5 72B Instruct (desarrollado por Alibaba, el gigante chino del comercio electrónico).
El segundo ranking, AraGen, se actualiza ahora con una versión mejorada que evalúa cómo generan texto abierto en árabe estos modelos. La nueva versión corrige problemas de la anterior —como que algunos modelos se negaban a responder ciertas preguntas— y añade una métrica más sofisticada para medir la calidad del texto generado, llamada BLEU (un algoritmo que compara la salida del modelo con respuestas de referencia escritas por humanos). Aquí lideran también modelos de Alibaba y DeepSeek (una empresa china especializada en razonamiento matemático).
El tercer ranking, ArabMMLU, mide conocimientos generales y capacidad de razonamiento mediante un examen de opción múltiple que cubre desde literatura árabe hasta ciencias naturales. Los modelos tienen que responder en árabe estándar moderno, la variante formal del idioma que se usa en medios de comunicación y educación en todo el mundo árabe. Según informó Hugging Face en su blog oficial, todos estos rankings están abiertos: cualquiera puede subir su propio modelo y ver cómo se comporta frente a la competencia.
La iniciativa forma parte de un esfuerzo más amplio por reducir el sesgo anglocéntrico de la IA. Aunque existen modelos multilingües, su rendimiento suele caer en picado fuera del inglés, especialmente en tareas que requieren comprensión cultural o seguimiento de instrucciones precisas. Con estos rankings, Hugging Face busca que desarrolladores y empresas puedan identificar qué modelos funcionan realmente bien en árabe, sin tener que hacer pruebas caseras o depender de anécdotas.


