Hugging Face promete transcrever áudio dez vezes mais rápido com nova versão do Whisper
A plataforma lançou endpoints de inferência otimizados que aceleram o Whisper, modelo de transcrição de voz da OpenAI, permitindo processar horas de áudio em segundos usando hardware mais simples.
A Hugging Face lançou uma versão otimizada do Whisper (modelo de IA da OpenAI que transforma fala em texto) que transcreve áudio até dez vezes mais rápido. A novidade usa técnicas como o Faster-Whisper e o CTranslate2 para acelerar o processamento e está disponível como serviço pago na nuvem.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou uma nova implementação do Whisper que promete transcrever áudio até dez vezes mais rápido que a versão original. O Whisper é um modelo de inteligência artificial criado pela OpenAI para converter fala em texto escrito, amplamente usado para legendar vídeos, transcrever reuniões e processar podcasts.
A velocidade extra vem de uma combinação de técnicas de otimização. A empresa usou o Faster-Whisper (uma versão reescrita do modelo que consome menos memória e processa dados de forma mais eficiente) e o CTranslate2 (um framework que acelera a inferência, ou seja, o momento em que o modelo já treinado processa novos dados). Segundo informou a Hugging Face em post oficial, a implementação roda em GPUs Nvidia (chips especializados em processar grandes volumes de cálculos em paralelo) e permite transcrever uma hora de áudio em menos de um minuto, dependendo do hardware escolhido.
A novidade está disponível nos Inference Endpoints da Hugging Face, um serviço pago que permite rodar modelos de IA na nuvem sem precisar configurar servidores ou gerenciar infraestrutura. Qualquer pessoa com uma conta pode criar um endpoint (um endereço na internet que recebe arquivos de áudio e devolve texto transcrito) e escolher entre diferentes tamanhos do Whisper, desde versões compactas para testes até o modelo grande, mais preciso mas também mais pesado.
A otimização é especialmente útil para quem precisa processar grandes volumes de áudio, como empresas de legendagem, aplicativos de acessibilidade ou plataformas de educação a distância. A Hugging Face cobra por tempo de uso do hardware — quanto mais potente a GPU escolhida, mais rápida a transcrição, mas também mais caro o serviço. A empresa não divulgou valores exatos, mas afirmou que a nova versão reduz custos porque permite usar GPUs menores para o mesmo volume de trabalho.


