Hugging Face lanza dos nuevas categorías en su ranking de modelos de reconocimiento de voz
La plataforma añade pruebas multilingües y de audio largo para medir mejor qué modelos entienden idiomas diversos y conversaciones reales

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de ampliar su Open ASR Leaderboard, el ranking público que mide la precisión de modelos de reconocimiento automático de voz. La novedad son dos categorías nuevas: una para audio multilingüe, que evalúa cómo los modelos transcriben idiomas que no sean inglés, y otra para audio de formato largo, que pone a prueba su capacidad de entender conversaciones, entrevistas o podcasts completos sin perder el hilo.
Hasta ahora, la clasificación se centraba principalmente en inglés y en fragmentos cortos de audio. Eso dejaba fuera casos de uso reales como subtitular un vídeo en español de media hora o transcribir una reunión en francés. Según explica Hugging Face en su anuncio, los nuevos tests usan conjuntos de datos abiertos como FLEURS (que cubre más de 100 idiomas) y Earnings-22 (grabaciones largas de llamadas corporativas en inglés), lo que permite comparar modelos en condiciones más parecidas a las que encontrarán en producción.
Los primeros resultados muestran que los modelos más grandes, como Whisper Large de OpenAI (un sistema de transcripción entrenado con cientos de miles de horas de audio en varios idiomas), siguen dominando las categorías multilingües. Pero en audio largo aparecen sorpresas: algunos modelos más pequeños y recientes, optimizados para mantener contexto a lo largo del tiempo, obtienen tasas de error (WER, o Word Error Rate, que mide el porcentaje de palabras mal transcritas) comparables a las de gigantes como Whisper, con una fracción del tamaño y coste computacional.
La iniciativa forma parte de un esfuerzo más amplio por democratizar la IA de voz. A diferencia de los sistemas propietarios de Google o Microsoft, todos los modelos del ranking tienen pesos abiertos (es decir, cualquiera puede descargarlos y usarlos sin restricciones) y se evalúan con datasets públicos, lo que hace posible reproducir los resultados. Eso importa especialmente fuera del mundo anglosajón: muchos idiomas carecen de herramientas comerciales fiables, y estos rankings ayudan a identificar qué modelos funcionan mejor para catalán, quechua o swahili.
Hugging Face indica que seguirá añadiendo categorías según la demanda de la comunidad, incluyendo tests de ruido de fondo, acentos regionales o jerga técnica. El objetivo es que el leaderboard se convierta en referencia no solo para investigadores, sino también para empresas que buscan integrar transcripción automática en productos reales sin depender de APIs de pago.


