En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face lanza una nueva tabla de clasificación para medir qué modelos entienden mejor el árabe

La plataforma actualiza su sistema de evaluación con pruebas más exigentes y detectores de trampas para saber qué IA domina realmente el idioma hablado por más de 400 millones de personas.

Por Redacción2 min
Compartir
Hugging Face lanza una nueva tabla de clasificación para medir qué modelos entienden mejor el árabe
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar la segunda versión de su tabla de clasificación especializada en árabe. El objetivo es simple: medir con rigor qué modelos de lenguaje (LLMs, programas de IA capaces de entender y generar texto) funcionan mejor cuando trabajan con uno de los idiomas más hablados del mundo, pero históricamente menos atendido por la industria tecnológica.

La nueva tabla incluye ocho pruebas diferentes que evalúan desde comprensión lectora hasta razonamiento matemático, pasando por conocimiento cultural específico del mundo árabe. A diferencia de la versión anterior, esta incorpora un detector de contaminación: un sistema que identifica si un modelo ha 'hecho trampa' memorizando las respuestas de los exámenes durante su entrenamiento, en lugar de aprender realmente a razonar. Según explicó Hugging Face en su blog, varios modelos que obtenían puntuaciones altas resultaron estar contaminados y fueron marcados en la clasificación.

Entre los resultados destaca que los modelos de Meta (Llama 3.3, por ejemplo) siguen liderando el ranking en la mayoría de categorías, mientras que algunos modelos más pequeños y especializados en árabe, como Jais de la empresa emiratí G42, compiten de cerca en tareas culturales específicas. La tabla también revela una brecha importante: muchos modelos que funcionan bien en inglés obtienen resultados mediocres cuando se les pregunta en árabe, incluso en dialectos ampliamente utilizados como el egipcio o el levantino.

La clasificación es relevante más allá del mundo académico. Empresas, gobiernos y desarrolladores de la región MENA (Medio Oriente y Norte de África) que quieren integrar asistentes virtuales, chatbots o herramientas educativas necesitan saber qué modelos funcionan realmente en su idioma, sin depender de traducciones automáticas que suelen perder matices culturales. Hugging Face ha dejado el código y los datos completamente abiertos para que cualquiera pueda replicar las pruebas o añadir nuevas.

La iniciativa forma parte de un movimiento más amplio: exigir que la IA funcione en todos los idiomas, no solo en inglés. Otras organizaciones como Masader y AceGPT también han lanzado recientemente benchmarks (conjuntos de pruebas estandarizadas) similares para lenguas infrarrepresentadas. Hugging Face planea actualizar la tabla trimestralmente conforme aparezcan nuevos modelos y mejores métodos de evaluación.

Fuente original
Hugging Face Blog
Más en · Modelos de IA