Hugging Face lança biblioteca em Python para chamadas de vídeo com IA em tempo real
FastRTC promete simplificar a criação de assistentes de voz e vídeo ao conectar modelos de linguagem diretamente a conversas ao vivo, sem precisar de servidores intermediários
A Hugging Face lançou a FastRTC, uma biblioteca gratuita em Python que permite criar assistentes de voz e vídeo com inteligência artificial em tempo real. A ferramenta conecta LLMs (modelos de linguagem como o ChatGPT) diretamente a chamadas de vídeo usando WebRTC (a tecnologia padrão de videochamadas), sem precisar de servidores intermediários.

A Hugging Face (a plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) lançou a FastRTC, uma biblioteca gratuita em Python para criar aplicações de comunicação em tempo real com inteligência artificial. A ferramenta permite que qualquer pessoa com conhecimento intermediário de programação construa assistentes de voz ou vídeo capazes de responder em tempo real, como se estivessem em uma chamada de vídeo comum, segundo informou a empresa em seu blog oficial.
A principal novidade é que a FastRTC conecta modelos de linguagem grandes, os LLMs (programas treinados para entender e gerar texto, como o ChatGPT), diretamente a chamadas de voz e vídeo. Até agora, criar um assistente que conversa ao vivo exigia arquiteturas complexas, com servidores intermediários processando áudio e texto separadamente. Com a nova biblioteca, o fluxo fica direto: a voz entra, o modelo processa e a resposta sai, tudo dentro do mesmo código.
A biblioteca funciona com WebRTC (a tecnologia padrão usada por aplicativos de videochamada como Google Meet e Zoom) e oferece suporte nativo a modelos multimodais (aqueles que processam texto, áudio e imagem ao mesmo tempo) e a técnicas como RAG (um método que permite ao modelo buscar informações atualizadas em documentos externos antes de responder). Isso significa que um assistente criado com FastRTC pode, por exemplo, responder perguntas sobre documentos internos da empresa ou acessar dados em tempo real durante a conversa.
A Hugging Face disponibilizou exemplos prontos para uso, incluindo integrações com modelos populares como o GPT-4o da OpenAI e o Gemini do Google. A biblioteca é de código aberto (qualquer pessoa pode baixar, usar e modificar gratuitamente) e está disponível no repositório oficial da empresa. O lançamento acontece em um momento em que grandes empresas de tecnologia, como OpenAI e Google, têm investido pesado em interfaces de voz para IA — mas até agora essas tecnologias ficavam restritas a quem tinha acesso a APIs pagas ou infraestrutura própria.


