Un modelo de 100 millones de parámetros identifica quién habló en cada momento de una conversación
NVIDIA Nemotron 3 Diarization, que funciona sin conexión a internet y reconoce hasta ocho voces simultáneas, lidera la clasificación de VoiceArena con un 14,72% de error en conversaciones grabadas y en directo.
NVIDIA presentó Nemotron 3 Diarization, un modelo de inteligencia artificial de pesos abiertos con 100 millones de parámetros que identifica quién habló en cada momento de una conversación. Reconoce hasta ocho voces simultáneas en grabaciones o en directo, funciona sin conexión a internet y lidera la clasificación Diarization-Bench de VoiceArena con una tasa de error del 14,72 por ciento.

Transcribir una conversación palabra por palabra es útil, pero si no sabes quién dijo cada frase, pierdes información crucial: quién hizo una promesa, quién interrumpió a quién o quién se comprometió a enviar un documento. NVIDIA acaba de publicar Nemotron 3 Diarization, un modelo de inteligencia artificial de pesos abiertos (es decir, puedes descargarlo y ejecutarlo en tu propio hardware sin pagar licencias recurrentes) que resuelve precisamente ese problema: identifica los intervalos de tiempo en los que cada persona habla, incluso cuando varias personas se solapan. Según informó la compañía en su blog oficial, el modelo ocupa el primer puesto en la clasificación Diarization-Bench de VoiceArena (una plataforma independiente que compara sistemas de IA) con una tasa de error del 14,72%, frente al 19,3% del segundo clasificado.
El modelo tiene 100 millones de parámetros (valores ajustables que determinan cómo funciona una red neuronal) y puede procesar conversaciones grabadas o en directo con hasta ocho participantes. A diferencia de sistemas anteriores que sólo manejaban cuatro voces, Nemotron 3 Diarization ordena a los hablantes según cuándo intervienen por primera vez: la primera voz nueva se convierte en el canal uno, la segunda en el canal dos, y así sucesivamente. Este orden por llegada mantiene estables las etiquetas genéricas que asigna el modelo (speaker_1, speaker_2, etc.) a lo largo de toda la conversación, incluso después de silencios largos o interrupciones. Esas etiquetas son anónimas; el modelo no sabe que speaker_2 es María García, sólo que esa voz concreta habló en determinados momentos. Las aplicaciones pueden vincular después esas etiquetas con nombres reales usando metadatos de la reunión o sistemas de verificación de voz.
El proceso técnico es relativamente directo: el modelo acepta audio de un solo canal a 16 kHz (la calidad habitual de una llamada de teléfono), lo convierte en un espectrograma Mel (una representación visual de las frecuencias sonoras) y lo procesa con un codificador Transformer de 31 capas (una arquitectura de red neuronal diseñada para entender secuencias). El resultado es una matriz de probabilidades que indica, para cada instante de 10 milisegundos, qué tan probable es que cada uno de los ocho canales esté activo. Si dos personas hablan al mismo tiempo, dos canales pueden estar activos simultáneamente en el mismo cuadro temporal. Un procesamiento posterior convierte esas probabilidades en etiquetas de hablante con marcas de tiempo de inicio y fin.
Para trabajar en tiempo real, el modelo usa dos tipos de memoria: una caché que retiene información sobre voces detectadas en fragmentos anteriores, y una cola que guarda los últimos cuadros de audio como contexto inmediato. También puede incluir contexto derecho, es decir, audio justo después del fragmento actual; más contexto mejora la precisión, pero aumenta la espera antes de producir un resultado. NVIDIA ofrece configuraciones recomendadas con latencias de entrada de 30,4, 1,04, 0,64 y 0,32 segundos (sin contar el tiempo de cómputo, red o transcripción posterior). El procesamiento por fragmentos elimina cualquier límite fijo de duración máxima, aunque el rendimiento puede degradarse con grabaciones muy largas o audio con ruido extremo.
Es importante entender que la diarización (identificar quién habló cuándo) y el reconocimiento automático de voz o ASR (convertir audio en texto) son tareas distintas. Este modelo sólo produce etiquetas de hablante y marcas de tiempo, no las palabras pronunciadas. Para crear una transcripción completa con atribución de hablante, hay que combinar su salida con un sistema ASR separado. NVIDIA entrenó el modelo con datos públicos y licenciados, incluyendo conversaciones reales con múltiples hablantes anotadas por David AI (una empresa que proporciona datos de voz) y mezclas simuladas en 21 idiomas. Añadir esos datos licenciados redujo la tasa de error compuesta del 11,19% al 10,42% en configuraciones tanto de procesamiento completo como de latencia ultrabaja. La evaluación de VoiceArena cubrió 139 conversaciones en inglés que sumaban unas 22 horas, incluyendo grabaciones en persona y en línea, y Nemotron 3 mantuvo el primer puesto con márgenes de tolerancia de 100 y 250 milisegundos en los límites de cada intervención.


