En directo
[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA[Negocios]Generalist, la startup de robots con IA, alcanza una valoración de 3.000 millones de dólares[Herramientas]Cuatro millones de modelos de IA escaneados en busca de vulnerabilidades[Negocios]OpenAI pierde a otro alto cargo: se va el responsable de sus centros de datos[Regulación]OpenAI desactiva cuentas rusas que usaban IA para difundir propaganda pro-Kremlin[Negocios]OpenAI explica cómo reduce los costes de su IA mientras mejora su rendimiento[Investigación]Co-Scientist, la IA de Google que ya diseña experimentos y redacta artículos científicos[Negocios]Una antigua fundición de aluminio en Kentucky será el próximo gran centro de datos de Anthropic[Negocios]La inteligencia artificial ahorra tres horas de trabajo a la semana, pero solo a la mitad de los empleados[Investigación]Una IA de OpenAI ayuda a diagnosticar 18 enfermedades raras infantiles que llevaban años sin identificar[Investigación]OpenAI presenta un examen de biología avanzada para medir qué tan bien razonan sus modelos de IA
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face estrena tres rankings para evaluar modelos de IA en árabe

La plataforma acaba de publicar tablas de clasificación que miden cómo siguen instrucciones, generan texto y razonan los modelos de lenguaje en árabe, un idioma históricamente infrarrepresentado en inteligencia artificial.

Por Redacción2 min
En resumen

Hugging Face publico tres rankings para evaluar modelos de lenguaje en arabe: IFEval Arabic mide si siguen instrucciones complejas, AraGen evalua la generacion de texto abierto, y ArabMMLU pone a prueba conocimientos generales mediante examenes de opcion multiple. Los primeros puestos los ocupan modelos de Meta, Alibaba y DeepSeek.

Compartir
Hugging Face estrena tres rankings para evaluar modelos de IA en árabe
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar tres nuevos rankings públicos dedicados exclusivamente a evaluar modelos de lenguaje en árabe. La iniciativa llega en un momento en que la mayoría de las pruebas de referencia (benchmarks, o conjuntos de tareas estandarizadas que sirven para comparar modelos) siguen centradas en inglés, dejando en un segundo plano a idiomas hablados por cientos de millones de personas.

El primer ranking, llamado IFEval Arabic, mide la capacidad de los modelos para seguir instrucciones complejas en árabe: por ejemplo, si pueden cumplir restricciones sobre la longitud del texto generado, el uso de palabras específicas o el formato de la respuesta. Es una traducción y adaptación cultural del conocido test IFEval original en inglés, realizada por expertos nativos para mantener la intención de cada tarea. Los primeros puestos los ocupan Meta Llama 3.3 70B Instruct (un modelo de código abierto entrenado por Meta, la empresa matriz de Facebook) y Qwen2.5 72B Instruct (desarrollado por Alibaba, el gigante chino del comercio electrónico).

El segundo ranking, AraGen, se actualiza ahora con una versión mejorada que evalúa cómo generan texto abierto en árabe estos modelos. La nueva versión corrige problemas de la anterior —como que algunos modelos se negaban a responder ciertas preguntas— y añade una métrica más sofisticada para medir la calidad del texto generado, llamada BLEU (un algoritmo que compara la salida del modelo con respuestas de referencia escritas por humanos). Aquí lideran también modelos de Alibaba y DeepSeek (una empresa china especializada en razonamiento matemático).

El tercer ranking, ArabMMLU, mide conocimientos generales y capacidad de razonamiento mediante un examen de opción múltiple que cubre desde literatura árabe hasta ciencias naturales. Los modelos tienen que responder en árabe estándar moderno, la variante formal del idioma que se usa en medios de comunicación y educación en todo el mundo árabe. Según informó Hugging Face en su blog oficial, todos estos rankings están abiertos: cualquiera puede subir su propio modelo y ver cómo se comporta frente a la competencia.

La iniciativa forma parte de un esfuerzo más amplio por reducir el sesgo anglocéntrico de la IA. Aunque existen modelos multilingües, su rendimiento suele caer en picado fuera del inglés, especialmente en tareas que requieren comprensión cultural o seguimiento de instrucciones precisas. Con estos rankings, Hugging Face busca que desarrolladores y empresas puedan identificar qué modelos funcionan realmente bien en árabe, sin tener que hacer pruebas caseras o depender de anécdotas.

Fuente original
Hugging Face Blog
Más en · Modelos de IA