Hugging Face amplía su tabla de clasificación de reconocimiento de voz con el primer idioma del Sur Global
La plataforma añade el suajili a su ranking de modelos de voz, un paso clave para medir el rendimiento de sistemas de inteligencia artificial en lenguas africanas que cuentan con millones de hablantes pero pocos recursos tecnológicos.
Hugging Face añadió el suajili a su Open ASR Leaderboard, la tabla de clasificación que compara modelos de reconocimiento automático de voz (sistemas que convierten audio en texto). Es el primer idioma del Sur Global que entra en este ranking, hasta ahora centrado en inglés y lenguas europeas, y se evalúa con el dataset FLEURS usando la métrica WER (tasa de error por palabra).

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de incorporar el suajili a su Open ASR Leaderboard, la tabla de clasificación que compara el rendimiento de modelos de reconocimiento automático de voz (ASR, por sus siglas en inglés, sistemas que convierten audio en texto). Es la primera lengua del Sur Global —término que agrupa a países de África, América Latina, Asia y Oceanía con menor desarrollo económico— que entra en este ranking, hasta ahora centrado exclusivamente en inglés y otros idiomas europeos.
El suajili es la lengua materna de entre 16 y 20 millones de personas en África Oriental y se usa como segunda lengua por más de 80 millones, especialmente en Tanzania, Kenia, Uganda y la República Democrática del Congo. Sin embargo, los modelos de reconocimiento de voz entrenados principalmente con inglés suelen funcionar mal con este idioma: muchos confunden palabras porque aplican patrones fonéticos de lenguas germánicas o romances que no se ajustan a la estructura del suajili.
Según informó Hugging Face en su blog oficial, la nueva categoría del ranking usa el dataset FLEURS (un conjunto de datos de audio etiquetado en múltiples idiomas, creado por Google para entrenar y evaluar modelos multilingües). Los modelos se evalúan con la métrica WER (Word Error Rate o tasa de error por palabra: el porcentaje de palabras que el sistema transcribe mal), que mide cuántas palabras el modelo falla al transcribir respecto al total del audio analizado.
La incorporación del suajili forma parte de un esfuerzo más amplio para que los sistemas de IA funcionen en idiomas que cuentan con menos recursos digitales, como grabaciones etiquetadas o corpus de texto. Hugging Face adelantó que planea añadir más lenguas del Sur Global al ranking en los próximos meses, aunque no especificó cuáles ni cuándo. La comunidad de código abierto (desarrolladores que comparten sus modelos y herramientas de forma pública y gratuita) podrá enviar sus sistemas de reconocimiento de voz en suajili para ser evaluados y comparados en la tabla.
Este tipo de iniciativas buscan corregir un desequilibrio histórico: la mayoría de los avances en IA de voz se concentran en inglés, chino mandarín y un puñado de lenguas europeas, mientras que miles de millones de personas hablan idiomas para los que no existen herramientas de calidad. La inclusión del suajili en un ranking visible y técnicamente riguroso puede incentivar a más equipos a trabajar en modelos para lenguas africanas, que representan más de 2.000 idiomas diferentes y una enorme diversidad lingüística.


