En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

QIMMA, el primer ranking de modelos de IA en árabe que prioriza la calidad sobre el tamaño

Una iniciativa del Technology Innovation Institute de Abu Dabi busca evaluar modelos de lenguaje en árabe con criterios más rigurosos que las tablas tradicionales.

Por Redacción2 min
Compartir
QIMMA, el primer ranking de modelos de IA en árabe que prioriza la calidad sobre el tamaño
Investigación · Hugging Face Blog

El Technology Innovation Institute (TII, un centro de investigación con sede en los Emiratos Árabes Unidos) ha lanzado QIMMA, una clasificación de modelos de lenguaje especializados en árabe que rompe con la tendencia de medir únicamente el rendimiento bruto. Según informó el equipo del TII en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), este nuevo ranking evalúa los modelos por su utilidad real, no solo por su tamaño o cantidad de parámetros (los valores numéricos internos que determinan cómo responde un modelo).

La mayoría de rankings de modelos de IA, como el conocido LMSYS Chatbot Arena, ordenan los sistemas por su capacidad de generar respuestas convincentes en pruebas generales, lo que tiende a favorecer modelos enormes entrenados por grandes empresas. QIMMA adopta un enfoque distinto: mide qué tan bien los modelos entienden dialectos árabes específicos, detectan contenido problemático, razonan en contextos culturales propios de la región y evitan sesgos lingüísticos. El objetivo, explican desde el TII, es identificar qué modelo funciona mejor para aplicaciones reales en el mundo árabe, independientemente de si tiene 7.000 millones o 400.000 millones de parámetros.

El ranking incluye tests de comprensión de lectura en árabe clásico y dialectal, tareas de razonamiento matemático adaptadas culturalmente, y evaluaciones de seguridad que detectan si el modelo reproduce estereotipos o información errónea frecuente en la región. También penaliza a los modelos que dependen excesivamente de traducciones automáticas del inglés en lugar de generar respuestas idiomáticas en árabe. Los primeros puestos de la tabla están ocupados por modelos de pesos abiertos (aquellos cuyos archivos internos pueden descargarse y modificarse libremente) como Qwen 2.5 de Alibaba y Llama 3.1 de Meta, aunque varios modelos más pequeños y especializados superan a sistemas comerciales más grandes en categorías específicas.

Para los desarrolladores que trabajan con lenguas minoritarias o regionales, QIMMA representa un modelo a seguir: en lugar de asumir que los rankings diseñados para inglés son universales, el proyecto demuestra que es posible construir métricas de evaluación que reflejen las necesidades reales de comunidades lingüísticas específicas. El código de las pruebas y los resultados completos están disponibles de forma abierta en Hugging Face, lo que permite a cualquier equipo replicar el sistema para otros idiomas.

Fuente original
Hugging Face Blog
Más en · Investigación