Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Modelo de IA da NVIDIA identifica quem fala em conversas com várias pessoas ao mesmo tempo

O Nemotron 3 Diarization consegue separar até oito vozes em tempo real, inclusive quando as pessoas falam simultaneamente, e lidera o ranking do VoiceArena com 14,72% de erro.

Por Redação2 min
Em resumo

A NVIDIA lançou o Nemotron 3 Diarization, um modelo de IA de pesos abertos que identifica quando até oito pessoas falam em uma conversa, inclusive simultaneamente, em tempo real ou gravações. Ele alcançou 14,72% de erro no ranking VoiceArena, 24% melhor que o segundo colocado, e permite criar transcrições que indicam quem disse cada frase.

Compartilhar
Modelo de IA da NVIDIA identifica quem fala em conversas com várias pessoas ao mesmo tempo
Modelos de IA · Hugging Face Blog

A NVIDIA lançou o Nemotron 3 Diarization, um modelo de inteligência artificial com 100 milhões de parâmetros (os valores ajustáveis que definem como uma rede neural processa informações) que identifica quem está falando em cada momento de uma conversa gravada ou ao vivo. Segundo informou a empresa no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), o sistema alcançou o primeiro lugar no ranking Diarization-Bench do VoiceArena, com uma taxa de erro de 14,72% — cerca de 24% a menos que o segundo colocado, que registrou 19,3%.

A diarização de voz (speaker diarization, o processo de identificar intervalos de tempo em que cada pessoa fala) resolve um problema comum: uma transcrição pode capturar todas as palavras ditas numa reunião ou podcast, mas sem identificar quem disse o quê, perde-se boa parte da informação útil. Fica impossível saber quem assumiu um compromisso, quem levantou uma objeção ou quem interrompeu a conversa. O Nemotron 3 Diarization gera marcações de tempo (timestamps) que indicam quando cada participante está ativo, inclusive quando duas ou mais pessoas falam ao mesmo tempo, permitindo combiná-las depois com sistemas de reconhecimento automático de fala (ASR, que converte áudio em texto) para criar transcrições atribuídas por falante.

O modelo funciona tanto com gravações completas quanto em transmissão contínua (streaming), processando áudio em pequenos pedaços. Ele aceita áudio de canal único a 16 kHz, converte em espectrogramas Mel (representações visuais da frequência do som ao longo do tempo) e usa um codificador Transformer de 31 camadas para gerar probabilidades de atividade de até oito canais de fala. Esses canais são rótulos genéricos — o sistema informa que "falante_2" falou entre tal e tal segundo, mas não identifica quem é essa pessoa. Aplicações podem depois associar esses rótulos a nomes reais usando dados de perfil ou outros sistemas de verificação.

A NVIDIA treinou o modelo com dados públicos e licenciados, incluindo conversas reais anotadas e mixagens simuladas em 21 idiomas fornecidas pela David AI. A empresa testou o sistema em 139 conversas em inglês totalizando cerca de 22 horas, contabilizando fala sobreposta e sem margem de tolerância (collar) para erros de fronteira entre turnos. O modelo oferece quatro configurações de latência recomendadas — de 0,32 a 30,4 segundos de buffer de áudio antes do processamento — permitindo ajustar o equilíbrio entre velocidade de resposta e precisão conforme a aplicação.

O Nemotron 3 Diarization tem pesos abertos (open-weight, ou seja, os parâmetros do modelo estão disponíveis para download, embora não necessariamente o código de treinamento completo) e sucede modelos anteriores da NVIDIA como o Streaming Sortformer, que suportava até quatro falantes. A principal inovação técnica é ordenar os canais de saída pela ordem de chegada: a primeira voz nova vira o canal 1, a segunda vira o canal 2, e assim por diante. Isso estabiliza os rótulos ao longo do tempo e evita que o sistema precise recalcular qual canal corresponde a qual pessoa a cada novo trecho de áudio.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA