Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Hugging Face muda ranking de IA de voz para barrar modelos que só decoram respostas

Plataforma adiciona dados privados ao Open ASR Leaderboard para impedir que desenvolvedores treinem modelos especificamente para subir no ranking sem melhorar de verdade.

Por Redação2 min
Compartilhar
Hugging Face muda ranking de IA de voz para barrar modelos que só decoram respostas
Pesquisa · Hugging Face Blog

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma mudança importante no Open ASR Leaderboard, o ranking que avalia a qualidade de modelos de reconhecimento automático de fala (ASR, a sigla em inglês para a tecnologia que transcreve áudio em texto). A partir de agora, os modelos serão testados também com dados que nunca foram divulgados publicamente — uma resposta direta ao problema de equipes que treinam seus modelos especificamente para os conjuntos de teste do ranking, fazendo com que subam na classificação sem que isso signifique um desempenho melhor no mundo real.

O Open ASR Leaderboard existe há mais de um ano e avalia modelos usando 14 conjuntos de dados públicos, cobrindo diferentes sotaques, condições de áudio e idiomas. O problema é que esses dados são todos conhecidos: qualquer desenvolvedor pode baixá-los e treinar seu modelo para reconhecer exatamente aqueles áudios, inflando artificialmente o resultado. Esse comportamento, conhecido como "benchmaxxing" (quando alguém otimiza um sistema só para se sair bem em testes específicos, não para funcionar bem de verdade), vinha distorcendo o ranking e dificultando que empresas e pesquisadores identificassem quais modelos são realmente bons.

Agora, segundo informou a Hugging Face, parte da avaliação será feita com dados privados: áudios que ninguém pode acessar de antemão. A ideia é que um modelo só consiga uma boa pontuação se tiver aprendido a transcrever fala de forma geral, não apenas decorado as respostas dos testes públicos. A plataforma não revelou quais conjuntos de dados privados está usando, justamente para que ninguém tente buscá-los e treinar modelos em cima deles. A nota da empresa deixa claro que a mudança visa "garantir que o ranking reflita capacidade real de generalização, não apenas ajuste fino aos benchmarks" (benchmarks são os conjuntos de dados usados para testar e comparar modelos).

A medida deve tornar o ranking mais confiável para quem precisa escolher um modelo de ASR para usar em produtos reais — como aplicativos de transcrição, assistentes de voz ou sistemas de atendimento automático. Também pressiona os desenvolvedores a focarem em melhorias genuínas, como lidar melhor com ruído de fundo, sotaques variados ou vocabulário técnico, em vez de simplesmente treinar o modelo para acertar as perguntas da prova. A Hugging Face afirmou que continuará atualizando os dados privados ao longo do tempo, para evitar que alguém tente adivinhar quais são e volte a trapacear no ranking.

Fonte original
Hugging Face Blog
Mais em · Pesquisa