Fish Audio levanta US$ 52 milhões para criar vozes de IA personalizadas
Startup chinesa atrai 8 milhões de usuários em um ano com modelos de voz abertos e planeja expansão global

A Fish Audio, startup chinesa especializada em síntese de voz por inteligência artificial, acabou de fechar uma rodada semente (o primeiro grande investimento que uma empresa recebe) de US$ 52 milhões. A empresa desenvolve modelos de IA capazes de clonar vozes humanas e criar narrações personalizadas — tecnologia usada tanto por criadores de conteúdo quanto por grandes empresas que precisam de locução em escala.
Desde o lançamento, há pouco mais de um ano, a Fish Audio já soma 8 milhões de usuários que usam seus modelos de voz, seja na versão de código aberto (que qualquer pessoa pode baixar e rodar no próprio computador) ou na versão hospedada na nuvem (onde a empresa processa as vozes em seus próprios servidores). Segundo informou o TechCrunch, a receita recorrente anual da startup já chegou a US$ 21 milhões — um crescimento raro para uma empresa tão jovem.
O diferencial da Fish Audio está em oferecer modelos que funcionam tanto de forma gratuita e aberta quanto como serviço pago. Criadores individuais podem usar a tecnologia para dublar vídeos, gerar podcasts ou criar personagens com vozes únicas, enquanto empresas maiores contratam a plataforma para automatizar atendimento ao cliente, produzir audiolivros ou localizar conteúdo em diversos idiomas. A estratégia de manter uma versão open source (de código aberto, que qualquer desenvolvedor pode modificar e usar livremente) ajudou a atrair uma comunidade ativa e a testar melhorias rapidamente.
A rodada de investimento deve acelerar a expansão internacional da Fish Audio, especialmente nos mercados americano e europeu, onde a concorrência com empresas como ElevenLabs (outra startup de clonagem de voz) e as divisões de IA de gigantes como Google e Amazon é intensa. A empresa também planeja melhorar a qualidade emocional das vozes geradas — um dos principais desafios técnicos da área, já que vozes sintéticas ainda soam artificiais em contextos que exigem sutileza ou dramaticidade.
O setor de voz sintética vive um momento de rápida evolução, mas também enfrenta questões éticas e legais: desde o uso indevido de vozes de pessoas reais sem consentimento até a disseminação de deepfakes (vídeos ou áudios falsos criados com IA) em campanhas de desinformação. A Fish Audio afirma que implementa controles de segurança para evitar abusos, mas a eficácia dessas medidas ainda será testada conforme a base de usuários cresce.


