En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face lanza dos nuevas categorías en su ranking de modelos de reconocimiento de voz

La plataforma añade pruebas multilingües y de audio largo para medir mejor qué modelos entienden idiomas diversos y conversaciones reales

Por Redacción2 min
Compartir
Hugging Face lanza dos nuevas categorías en su ranking de modelos de reconocimiento de voz
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de ampliar su Open ASR Leaderboard, el ranking público que mide la precisión de modelos de reconocimiento automático de voz. La novedad son dos categorías nuevas: una para audio multilingüe, que evalúa cómo los modelos transcriben idiomas que no sean inglés, y otra para audio de formato largo, que pone a prueba su capacidad de entender conversaciones, entrevistas o podcasts completos sin perder el hilo.

Hasta ahora, la clasificación se centraba principalmente en inglés y en fragmentos cortos de audio. Eso dejaba fuera casos de uso reales como subtitular un vídeo en español de media hora o transcribir una reunión en francés. Según explica Hugging Face en su anuncio, los nuevos tests usan conjuntos de datos abiertos como FLEURS (que cubre más de 100 idiomas) y Earnings-22 (grabaciones largas de llamadas corporativas en inglés), lo que permite comparar modelos en condiciones más parecidas a las que encontrarán en producción.

Los primeros resultados muestran que los modelos más grandes, como Whisper Large de OpenAI (un sistema de transcripción entrenado con cientos de miles de horas de audio en varios idiomas), siguen dominando las categorías multilingües. Pero en audio largo aparecen sorpresas: algunos modelos más pequeños y recientes, optimizados para mantener contexto a lo largo del tiempo, obtienen tasas de error (WER, o Word Error Rate, que mide el porcentaje de palabras mal transcritas) comparables a las de gigantes como Whisper, con una fracción del tamaño y coste computacional.

La iniciativa forma parte de un esfuerzo más amplio por democratizar la IA de voz. A diferencia de los sistemas propietarios de Google o Microsoft, todos los modelos del ranking tienen pesos abiertos (es decir, cualquiera puede descargarlos y usarlos sin restricciones) y se evalúan con datasets públicos, lo que hace posible reproducir los resultados. Eso importa especialmente fuera del mundo anglosajón: muchos idiomas carecen de herramientas comerciales fiables, y estos rankings ayudan a identificar qué modelos funcionan mejor para catalán, quechua o swahili.

Hugging Face indica que seguirá añadiendo categorías según la demanda de la comunidad, incluyendo tests de ruido de fondo, acentos regionales o jerga técnica. El objetivo es que el leaderboard se convierta en referencia no solo para investigadores, sino también para empresas que buscan integrar transcripción automática en productos reales sin depender de APIs de pago.

Fuente original
Hugging Face Blog
Más en · Modelos de IA