Nvidia lança modelo de voz gratuito que roda no seu computador e fala 25 idiomas
Magpie TTS permite criar assistentes de voz em tempo real sem enviar dados para a nuvem — e funciona até em máquinas modestas.

A Nvidia lançou o Magpie TTS (um modelo de inteligência artificial que transforma texto em fala com voz natural), disponível gratuitamente com pesos abertos (ou seja, qualquer pessoa pode baixar, modificar e usar sem pagar licenças). O modelo foi desenvolvido para criar assistentes de voz que funcionam em tempo real, suportam 25 idiomas — incluindo português — e rodam inteiramente no computador do usuário, sem precisar enviar áudio ou texto para servidores na nuvem. Segundo a Nvidia, o Magpie consegue processar cada segundo de áudio em menos de 70 milissegundos, rápido o suficiente para conversas fluidas.
O diferencial está no controle total que o modelo oferece. Diferentemente de serviços como o da OpenAI ou Google, que exigem conexão com a internet e processam tudo em seus servidores, o Magpie roda localmente — inclusive em hardware acessível como o Jetson Orin Nano (um computador compacto da Nvidia feito para rodar IA em dispositivos pequenos). Isso importa para empresas que lidam com dados sensíveis, como clínicas ou escritórios de advocacia, que não querem enviar conversas de clientes para fora. Também permite criar produtos que funcionam sem internet, como assistentes para carros ou robôs industriais.
A Nvidia disponibilizou o modelo na Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) e publicou um guia completo para integração com outros sistemas de código aberto, como os modelos de linguagem Llama (LLMs, ou modelos de linguagem de grande escala, capazes de entender e gerar texto) e ferramentas de transcrição como o Whisper (um modelo que converte fala em texto). A empresa também oferece uma versão otimizada para rodar com TensorRT (uma biblioteca que acelera a execução de modelos de IA em chips da Nvidia), reduzindo ainda mais o tempo de resposta.
O modelo foi treinado com mais de 1 milhão de horas de áudio em 25 línguas e usa uma arquitetura baseada em transformers (o mesmo tipo de tecnologia por trás do ChatGPT), adaptada para gerar fala de forma eficiente. Além do português, ele suporta inglês, espanhol, francês, mandarim, hindi, árabe e outros idiomas amplamente falados. A Nvidia afirma que o Magpie pode ser ajustado (fine-tuned) para adotar vozes específicas ou sotaques regionais, embora essa personalização exija conhecimento técnico e acesso a GPUs (chips especializados em processar IA rapidamente).
Para quem quer testar, a Nvidia montou um tutorial completo mostrando como rodar o modelo em um Jetson Orin Nano, combinando transcrição de fala, processamento de linguagem com um LLM e síntese de voz — tudo localmente. O código está disponível no GitHub (uma plataforma onde programadores compartilham projetos) e pode ser adaptado para outros hardwares compatíveis. A empresa não cobra pelo uso do modelo, mas ele exige pelo menos 8 GB de memória de vídeo para rodar com desempenho aceitável.


