Hugging Face lança ranking de modelos de reconhecimento de voz com categorias multilíngue e transcrições longas
Plataforma apresenta tabela de classificação atualizada que mede qualidade de modelos ASR em 14 idiomas, incluindo português brasileiro, e introduz teste para conversas de até 20 minutos.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e testam modelos de inteligência artificial) lançou uma versão renovada do Open ASR Leaderboard, um ranking que compara a qualidade de modelos de reconhecimento automático de fala — ou ASR, na sigla em inglês (sistemas que transformam áudio em texto, como o que o WhatsApp usa para transcrever mensagens de voz). A novidade principal é a criação de duas novas categorias: uma para medir o desempenho em 14 idiomas diferentes, incluindo português brasileiro, e outra focada em transcrever conversas e áudios longos, de até 20 minutos.
Segundo informou a Hugging Face em seu blog oficial, o ranking original avaliava os modelos apenas em inglês e com trechos curtos de áudio. Agora, a categoria multilíngue usa bases de dados como Common Voice (um projeto da Mozilla com gravações de falantes nativos) e FLEURS (um conjunto de áudio criado pelo Google) para testar os modelos em línguas que vão do mandarim ao suaíli. A categoria de formato longo, por sua vez, usa entrevistas e gravações reais para medir se o modelo consegue manter a precisão em transcrições extensas — algo fundamental para aplicações como legendagem automática de podcasts ou transcrição de reuniões.
A plataforma mostra que modelos maiores nem sempre vencem: o Whisper v3 Turbo, da OpenAI (uma versão otimizada do modelo de transcrição mais popular do mercado), aparece bem posicionado em várias categorias mesmo sendo menor e mais rápido que concorrentes. Já em idiomas com menos dados de treinamento disponíveis, como vietnamita e swahili, os resultados ainda ficam bem abaixo do inglês — o que reflete uma desigualdade conhecida no setor, onde línguas faladas por centenas de milhões de pessoas recebem menos investimento em IA do que o inglês.
O ranking é público e qualquer pessoa pode enviar um modelo para ser testado, desde que ele esteja disponível com pesos abertos (ou seja, que qualquer um possa baixar e rodar, sem depender de uma API paga). A Hugging Face cobra uma taxa única de credibilidade, como explica no anúncio: os modelos precisam passar por uma validação manual antes de entrar oficialmente na tabela, para evitar que alguém envie resultados falsos ou manipulados. O objetivo declarado é dar transparência a um mercado onde empresas frequentemente anunciam melhorias sem compartilhar os testes completos.


