Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Hugging Face lança ferramenta para medir o quanto assistentes de voz parecem humanos

O Real World VoiceEQ avalia áudios de IA em cinco dimensões da fala natural, de prosódia a sotaques regionais.

Por Redação2 min
Compartilhar
Hugging Face lança ferramenta para medir o quanto assistentes de voz parecem humanos
Ferramentas · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou o Real World VoiceEQ, uma ferramenta aberta para medir o quão natural soa a voz gerada por sistemas de inteligência artificial. Diferente de métricas tradicionais que se limitam a comparar áudio original com áudio sintético, o novo método avalia cinco aspectos da fala humana: prosódia (o ritmo e a entonação natural), clareza da pronúncia, precisão das palavras, diversidade de sotaques e a presença ou ausência de ruídos e distorções.

A equipe criou um conjunto de dados chamado VoiceEQ-5K, com cinco mil gravações reais de pessoas falando em inglês — incluindo sotaques americanos, britânicos, indianos e de outras regiões — capturadas em condições do mundo real, como chamadas telefônicas e ambientes barulhentos. Cada áudio foi avaliado por anotadores humanos em cada uma das cinco dimensões. Com isso, treinaram um modelo de aprendizado de máquina (machine learning, a técnica que permite à IA aprender padrões a partir de exemplos) capaz de dar notas de zero a cem para qualquer áudio novo.

Segundo a Hugging Face, o objetivo é ajudar empresas e desenvolvedores a testar assistentes de voz, chatbots por telefone e outros sistemas de IA conversacional de forma mais realista, sem depender apenas de laboratórios. A ferramenta está disponível para uso gratuito e pode ser integrada a pipelines de desenvolvimento por meio de APIs (interfaces que permitem a diferentes softwares conversarem entre si). O código e os dados também foram liberados com licenças abertas, permitindo que qualquer um replique ou melhore o sistema.

A novidade chega em um momento em que empresas como Google, OpenAI e ElevenLabs competem para criar vozes sintéticas cada vez mais convincentes, mas ainda enfrentam críticas pela falta de diversidade de sotaques e pela dificuldade em lidar com ruídos ou interrupções naturais da fala. O Real World VoiceEQ oferece um caminho para medir essas lacunas de forma sistemática e comparável entre diferentes sistemas.

Fonte original
Hugging Face Blog
Mais em · Ferramentas