Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Hugging Face muda ranking de IA de voz para barrar modelos que só decoram respostas

Plataforma adiciona dados privados ao Open ASR Leaderboard para impedir que desenvolvedores treinem modelos especificamente para subir no ranking sem melhorar de verdade.

Por Redação2 min
Compartilhar
Hugging Face muda ranking de IA de voz para barrar modelos que só decoram respostas
Pesquisa · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma mudança importante no Open ASR Leaderboard, o ranking que avalia a qualidade de modelos de reconhecimento automático de fala (ASR, a sigla em inglês para a tecnologia que transcreve áudio em texto). A partir de agora, os modelos serão testados também com dados que nunca foram divulgados publicamente — uma resposta direta ao problema de equipes que treinam seus modelos especificamente para os conjuntos de teste do ranking, fazendo com que subam na classificação sem que isso signifique um desempenho melhor no mundo real.

O Open ASR Leaderboard existe há mais de um ano e avalia modelos usando 14 conjuntos de dados públicos, cobrindo diferentes sotaques, condições de áudio e idiomas. O problema é que esses dados são todos conhecidos: qualquer desenvolvedor pode baixá-los e treinar seu modelo para reconhecer exatamente aqueles áudios, inflando artificialmente o resultado. Esse comportamento, conhecido como "benchmaxxing" (quando alguém otimiza um sistema só para se sair bem em testes específicos, não para funcionar bem de verdade), vinha distorcendo o ranking e dificultando que empresas e pesquisadores identificassem quais modelos são realmente bons.

Agora, segundo informou a Hugging Face, parte da avaliação será feita com dados privados: áudios que ninguém pode acessar de antemão. A ideia é que um modelo só consiga uma boa pontuação se tiver aprendido a transcrever fala de forma geral, não apenas decorado as respostas dos testes públicos. A plataforma não revelou quais conjuntos de dados privados está usando, justamente para que ninguém tente buscá-los e treinar modelos em cima deles. A nota da empresa deixa claro que a mudança visa "garantir que o ranking reflita capacidade real de generalização, não apenas ajuste fino aos benchmarks" (benchmarks são os conjuntos de dados usados para testar e comparar modelos).

A medida deve tornar o ranking mais confiável para quem precisa escolher um modelo de ASR para usar em produtos reais — como aplicativos de transcrição, assistentes de voz ou sistemas de atendimento automático. Também pressiona os desenvolvedores a focarem em melhorias genuínas, como lidar melhor com ruído de fundo, sotaques variados ou vocabulário técnico, em vez de simplesmente treinar o modelo para acertar as perguntas da prova. A Hugging Face afirmou que continuará atualizando os dados privados ao longo do tempo, para evitar que alguém tente adivinhar quais são e volte a trapacear no ranking.

Fonte original
Hugging Face Blog
Mais em · Pesquisa