Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog3 min

Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente

Após o impacto do Sora da OpenAI, surgiram diversos modelos abertos de geração de vídeo, mas requisitos de memória e limitações de qualidade ainda dificultam uso em larga escala

Por Redação3 min
Em resumo

Diversos modelos abertos de geração de vídeo por IA surgiram após o Sora da OpenAI, como CogVideoX, Mochi-1 e HunyuanVideo. Eles funcionam transformando texto em tokens 3D (pedaços de informação com dados espaciais e temporais) e depois reconstruindo o vídeo, mas exigem entre 18 e 60 GB de memória de placa de vídeo e ainda têm problemas de qualidade.

Compartilhar
Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Modelos de IA · Hugging Face Blog

Quando a OpenAI mostrou o Sora no ano passado, ficou claro que gerar vídeos com inteligência artificial tinha dado um salto enorme. A repercussão foi imediata: Google, Runway, Pika Labs e outras empresas lançaram seus próprios modelos, enquanto projetos de código aberto como CogVideoX, Mochi-1 e Hunyuan Video começaram a aparecer. Será que a comunidade de vídeo está vivendo seu "momento Stable Diffusion" — quando modelos de imagem abertos explodiram em popularidade? Segundo informou o blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), a resposta é: quase, mas não ainda.

O principal obstáculo é o hardware. Gerar vídeos de qualidade exige modelos enormes, que consomem quantidades absurdas de memória de computador. O Hugging Face mediu quanto de memória RAM (a memória temporária que o computador usa enquanto trabalha) três modelos populares precisam para rodar com configurações razoáveis — 121 frames (quadros de vídeo), resolução de 512x768 pixels. O HunyuanVideo, da Tencent, pede 60 GB de memória. O CogVideoX 1.5 (versão com 5 bilhões de parâmetros, os números ajustáveis que definem o comportamento do modelo), 36 GB. O LTX-Video, o mais leve, ainda assim exige quase 18 GB. Para efeito de comparação, a maioria das placas de vídeo para gamers tem entre 8 e 12 GB.

Além do custo computacional, os modelos abertos atuais têm problemas de qualidade. Vários não generalizam bem — ou seja, funcionam mal com dados diferentes dos usados no treinamento — e pedem prompts (instruções em texto) muito específicos para gerar bons resultados. O LTX-Video, por exemplo, só produz vídeos decentes se você descrever a cena em detalhes minuciosos, como "uma mulher de cabelo castanho comprido e pele clara sorri para outra de cabelo loiro, a primeira veste jaqueta preta e tem uma pinta quase invisível na bochecha direita, ângulo de câmera em close, luz quente e natural do pôr do sol". Sem esse nível de detalhe, o resultado decepciona.

A arquitetura desses modelos segue um padrão parecido com o dos geradores de imagem: um codificador de texto (geralmente o T5, um modelo de linguagem do Google) transforma o prompt em representações numéricas; um encoder (codificador) comprime o vídeo em tokens 3D (pedaços de informação que capturam espaço e tempo); uma rede de denoising (remoção de ruído) vai limpando esses tokens ao longo de várias etapas; e um decoder (decodificador) reconstrói o vídeo final. A novidade é que esses tokens 3D carregam informação espacial e temporal ao mesmo tempo, permitindo que o modelo entenda movimento e coerência entre frames — algo muito mais difícil do que gerar uma imagem estática.

A boa notícia é que a biblioteca Diffusers, mantida pela Hugging Face, já suporta esses modelos e oferece otimizações para reduzir o consumo de memória. Você pode, por exemplo, comprimir os pesos do modelo com quantização (trocar números de alta precisão por versões menores), usar tipos de dados mais leves (como bfloat16 em vez de float32) ou descarregar partes do modelo para a memória RAM comum quando a GPU (placa de vídeo) estiver cheia. Com essas técnicas, é possível rodar o HunyuanVideo em uma placa com 24 GB, embora a geração fique bem mais lenta. O time da Hugging Face está trabalhando para facilitar ainda mais o acesso, mas por enquanto gerar vídeos com IA em casa ainda é privilégio de quem tem máquinas poderosas.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Hugging Face Blog

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão