Hugging Face lanza una nueva tabla de clasificación para medir qué modelos entienden mejor el árabe
La plataforma actualiza su sistema de evaluación con pruebas más exigentes y detectores de trampas para saber qué IA domina realmente el idioma hablado por más de 400 millones de personas.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar la segunda versión de su tabla de clasificación especializada en árabe. El objetivo es simple: medir con rigor qué modelos de lenguaje (LLMs, programas de IA capaces de entender y generar texto) funcionan mejor cuando trabajan con uno de los idiomas más hablados del mundo, pero históricamente menos atendido por la industria tecnológica.
La nueva tabla incluye ocho pruebas diferentes que evalúan desde comprensión lectora hasta razonamiento matemático, pasando por conocimiento cultural específico del mundo árabe. A diferencia de la versión anterior, esta incorpora un detector de contaminación: un sistema que identifica si un modelo ha 'hecho trampa' memorizando las respuestas de los exámenes durante su entrenamiento, en lugar de aprender realmente a razonar. Según explicó Hugging Face en su blog, varios modelos que obtenían puntuaciones altas resultaron estar contaminados y fueron marcados en la clasificación.
Entre los resultados destaca que los modelos de Meta (Llama 3.3, por ejemplo) siguen liderando el ranking en la mayoría de categorías, mientras que algunos modelos más pequeños y especializados en árabe, como Jais de la empresa emiratí G42, compiten de cerca en tareas culturales específicas. La tabla también revela una brecha importante: muchos modelos que funcionan bien en inglés obtienen resultados mediocres cuando se les pregunta en árabe, incluso en dialectos ampliamente utilizados como el egipcio o el levantino.
La clasificación es relevante más allá del mundo académico. Empresas, gobiernos y desarrolladores de la región MENA (Medio Oriente y Norte de África) que quieren integrar asistentes virtuales, chatbots o herramientas educativas necesitan saber qué modelos funcionan realmente en su idioma, sin depender de traducciones automáticas que suelen perder matices culturales. Hugging Face ha dejado el código y los datos completamente abiertos para que cualquiera pueda replicar las pruebas o añadir nuevas.
La iniciativa forma parte de un movimiento más amplio: exigir que la IA funcione en todos los idiomas, no solo en inglés. Otras organizaciones como Masader y AceGPT también han lanzado recientemente benchmarks (conjuntos de pruebas estandarizadas) similares para lenguas infrarrepresentadas. Hugging Face planea actualizar la tabla trimestralmente conforme aparezcan nuevos modelos y mejores métodos de evaluación.


