Novo modelo de IA cria cenários 3D interativos em computadores comuns
Waypoint 1.5 gera mundos virtuais navegáveis a partir de texto ou fotos, rodando em placas de vídeo de consumo sem depender da nuvem.

A Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados) anunciou o Waypoint 1.5, um modelo de inteligência artificial que cria ambientes tridimensionais interativos — cenários completos por onde é possível caminhar e olhar ao redor — a partir de comandos de texto ou de uma única foto. A novidade é que ele roda em placas de vídeo comuns, como uma RTX 4090 (uma GPU — unidade de processamento gráfico — de alta performance acessível a entusiastas), sem exigir servidores na nuvem ou equipamentos de data center.
Modelos anteriores de geração de mundos 3D, como o Sora da OpenAI ou o Veo do Google, produzem vídeos impressionantes mas estáticos: você assiste, não interage. O Waypoint 1.5 é diferente porque permite que o usuário controle a câmera em tempo real, explorando o cenário como se estivesse dentro dele. Segundo informou a Hugging Face, o modelo consegue manter coerência espacial — ou seja, objetos que aparecem à esquerda continuam no lugar certo quando você vira a cabeça — e gerar novos detalhes conforme você se move, tudo isso a aproximadamente 30 quadros por segundo em hardware doméstico.
A versão 1.5 traz melhorias significativas em relação à anterior: maior fidelidade visual (cenas mais detalhadas e realistas), controle mais preciso da câmera, geração de ambientes externos (antes o modelo só funcionava bem em interiores) e suporte a condicionamento por imagem, permitindo que você carregue uma foto de referência para guiar a criação do mundo. O modelo usa uma técnica chamada diffusion-based world modeling (modelagem de mundos baseada em difusão, um método que gera imagens refinando gradualmente ruído aleatório) e foi treinado com vídeos em primeira pessoa de jogos e simulações.
A Hugging Face disponibilizou o Waypoint 1.5 com pesos abertos (ou seja, qualquer pessoa pode baixar, modificar e usar o modelo sem pagar licenças), tanto a versão completa quanto variantes menores otimizadas para GPUs com menos memória. A empresa vê aplicações práticas em jogos procedurais (que geram conteúdo automaticamente em vez de desenhá-lo à mão), treinamento de agentes de IA (sistemas autônomos que precisam navegar em ambientes simulados), visualização arquitetônica e prototipagem criativa. O código, pesos e uma demonstração interativa estão disponíveis no repositório oficial da plataforma.


