Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Hugging Face lança ranking que mede como reconhecimento de voz funciona em condições reais

Novo leaderboard testa modelos de ASR em cenários do dia a dia, com sotaques, ruído de fundo e áudio de baixa qualidade — e mostra que os melhores em laboratório nem sempre lideram fora dele.

Por Redação2 min
Compartilhar
Hugging Face lança ranking que mede como reconhecimento de voz funciona em condições reais
Pesquisa · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou nesta semana o FFASR Leaderboard, um ranking que avalia sistemas de reconhecimento automático de fala — ou ASR (sigla em inglês para Automatic Speech Recognition, a tecnologia que transforma áudio em texto) — em condições próximas às do mundo real. Ao contrário dos benchmarks tradicionais, que usam gravações limpas e controladas, o novo leaderboard inclui áudio com ruído de fundo, sotaques variados, microfones ruins e situações comuns em podcasts, ligações ou ambientes barulhentos.

O objetivo é responder a uma pergunta que incomoda quem trabalha com voz: por que um modelo que lidera um ranking tradicional muitas vezes falha quando você tenta usá-lo com áudio do dia a dia? Segundo a Hugging Face, a maioria dos benchmarks de ASR usa datasets limpos e bem editados, que não representam conversas reais. O FFASR (sigla para Foundational Few-Shot ASR, ou "ASR fundamental com poucos exemplos") foi desenhado para testar justamente isso — como os modelos se comportam quando o áudio não é perfeito.

O leaderboard usa datasets públicos que incluem áudio gravado em condições adversas, com falantes de diferentes regiões e níveis variados de qualidade técnica. A métrica principal é a WER (Word Error Rate, ou taxa de erro por palavra), que mede quantas palavras o modelo erra ao transcrever. Quanto menor a WER, melhor o desempenho. A Hugging Face também está aceitando submissões da comunidade, permitindo que qualquer desenvolvedor envie seu modelo para ser avaliado — desde que ele esteja disponível publicamente na plataforma.

Nos primeiros resultados, alguns modelos que dominam rankings tradicionais apareceram mais abaixo na lista, enquanto outros, menos conhecidos, tiveram desempenho melhor em áudio desafiador. A Hugging Face não revelou detalhes sobre quais modelos lideram o ranking no lançamento, mas enfatizou que a ideia é criar um padrão mais útil para empresas e desenvolvedores que precisam escolher um sistema de ASR para aplicações reais — de legendas automáticas a assistentes de voz.

O FFASR Leaderboard está disponível no site da Hugging Face e será atualizado conforme novos modelos forem enviados. A iniciativa faz parte de um movimento maior no setor de IA para criar benchmarks que reflitam melhor os desafios práticos, não apenas o desempenho em laboratório.

Fonte original
Hugging Face Blog
Mais em · Pesquisa