En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Hugging Face lanza dos nuevas categorías en su ranking de modelos de reconocimiento de voz

La plataforma añade pruebas multilingües y de audio largo para medir mejor qué modelos entienden idiomas diversos y conversaciones reales

Por Redacción2 min
Compartir
Hugging Face lanza dos nuevas categorías en su ranking de modelos de reconocimiento de voz
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de ampliar su Open ASR Leaderboard, el ranking público que mide la precisión de modelos de reconocimiento automático de voz. La novedad son dos categorías nuevas: una para audio multilingüe, que evalúa cómo los modelos transcriben idiomas que no sean inglés, y otra para audio de formato largo, que pone a prueba su capacidad de entender conversaciones, entrevistas o podcasts completos sin perder el hilo.

Hasta ahora, la clasificación se centraba principalmente en inglés y en fragmentos cortos de audio. Eso dejaba fuera casos de uso reales como subtitular un vídeo en español de media hora o transcribir una reunión en francés. Según explica Hugging Face en su anuncio, los nuevos tests usan conjuntos de datos abiertos como FLEURS (que cubre más de 100 idiomas) y Earnings-22 (grabaciones largas de llamadas corporativas en inglés), lo que permite comparar modelos en condiciones más parecidas a las que encontrarán en producción.

Los primeros resultados muestran que los modelos más grandes, como Whisper Large de OpenAI (un sistema de transcripción entrenado con cientos de miles de horas de audio en varios idiomas), siguen dominando las categorías multilingües. Pero en audio largo aparecen sorpresas: algunos modelos más pequeños y recientes, optimizados para mantener contexto a lo largo del tiempo, obtienen tasas de error (WER, o Word Error Rate, que mide el porcentaje de palabras mal transcritas) comparables a las de gigantes como Whisper, con una fracción del tamaño y coste computacional.

La iniciativa forma parte de un esfuerzo más amplio por democratizar la IA de voz. A diferencia de los sistemas propietarios de Google o Microsoft, todos los modelos del ranking tienen pesos abiertos (es decir, cualquiera puede descargarlos y usarlos sin restricciones) y se evalúan con datasets públicos, lo que hace posible reproducir los resultados. Eso importa especialmente fuera del mundo anglosajón: muchos idiomas carecen de herramientas comerciales fiables, y estos rankings ayudan a identificar qué modelos funcionan mejor para catalán, quechua o swahili.

Hugging Face indica que seguirá añadiendo categorías según la demanda de la comunidad, incluyendo tests de ruido de fondo, acentos regionales o jerga técnica. El objetivo es que el leaderboard se convierta en referencia no solo para investigadores, sino también para empresas que buscan integrar transcripción automática en productos reales sin depender de APIs de pago.

Fuente original
Hugging Face Blog
Más en · Modelos de IA