TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum
Instituto de Abu Dhabi disponibiliza modelo de reconhecimento de fala que funciona em computadores normais e não depende de serviços pagos na nuvem
O TII lançou o Falcon ASR, um modelo de inteligência artificial que transforma áudio em texto e pode rodar em computadores comuns, sem precisar de GPUs caras (chips especializados em IA) ou serviços pagos na nuvem. Foi treinado com mais de 180 mil horas de áudio em inglês e está disponível gratuitamente sob licença aberta.

O Technology Innovation Institute (um centro de pesquisa financiado pelo governo de Abu Dhabi, nos Emirados Árabes) lançou o Falcon ASR, um modelo de inteligência artificial que transcreve áudio em texto e pode ser rodado em hardware comum, sem precisar de GPUs caras ou serviços de nuvem pagos. O modelo está disponível gratuitamente no Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) sob licença aberta Apache 2.0, permitindo uso comercial e adaptações.
O Falcon ASR foi treinado com mais de 180 mil horas de áudio em inglês, incluindo conversas telefônicas, podcasts, vídeos do YouTube e gravações médicas. Segundo informou o TII, o modelo consegue lidar bem com diferentes sotaques, ambientes ruidosos e termos técnicos — áreas em que modelos de transcrição costumam ter dificuldade. A arquitetura se baseia no Whisper (um modelo de transcrição desenvolvido pela OpenAI), mas foi retreinada do zero com um conjunto de dados maior e mais diverso.
O diferencial está na eficiência: enquanto modelos concorrentes exigem GPUs de última geração (chips especializados em processar IA, que custam milhares de dólares), o Falcon ASR funciona em processadores comuns ou GPUs mais baratas, como uma RTX 3060. Isso torna a tecnologia acessível para pequenas empresas, desenvolvedores independentes e projetos em países onde hardware caro é difícil de conseguir.
O TII disponibilizou três versões do modelo, com diferentes tamanhos e níveis de precisão: uma leve (para dispositivos com pouca memória), uma média e uma grande (mais precisa, mas que exige mais recursos). A documentação completa, exemplos de código e ferramentas para testar o modelo estão disponíveis no repositório oficial. O lançamento reforça a tendência de modelos abertos competindo diretamente com alternativas comerciais, como o serviço de transcrição da Google ou da OpenAI, mas sem custos recorrentes nem dependência de internet.


