Novo modelo de IA aprende a gerar imagens e dados complexos usando menos memória
DiScoFormer combina duas técnicas de geração em um único transformer, reduzindo o custo computacional pela metade.

Pesquisadores do Allen Institute for AI (um instituto de pesquisa sem fins lucrativos fundado pelo cofundador da Microsoft, Paul Allen) desenvolveram o DiScoFormer, um modelo de inteligência artificial que consegue gerar imagens, texto e outros tipos de dados de forma mais eficiente. A novidade está em como ele funciona: em vez de usar dois modelos separados para calcular a distribuição de probabilidade dos dados (uma técnica chamada "density estimation", que ajuda o modelo a entender padrões) e gerar novos exemplos (usando "score matching", que guia o modelo na criação de conteúdo inédito), o DiScoFormer faz as duas coisas com uma única arquitetura transformer (o tipo de rede neural que está por trás de modelos como o ChatGPT).
Segundo informou o Hugging Face Blog, essa abordagem reduz pela metade o uso de memória e o tempo de treinamento em comparação com métodos tradicionais, que exigem modelos distintos para cada tarefa. O DiScoFormer foi testado em diferentes tipos de dados — incluindo imagens, tabelas e conjuntos de informações científicas — e conseguiu resultados comparáveis aos melhores modelos especializados, mas gastando menos recursos computacionais. Isso é especialmente relevante para laboratórios e empresas menores, que muitas vezes não têm acesso a grandes clusters de GPUs (processadores gráficos usados para treinar modelos de IA).
O modelo usa uma técnica chamada "autoregressive diffusion" (difusão autoregressiva), que combina a geração sequencial de dados (como quando um modelo de linguagem escreve uma palavra de cada vez) com a suavização gradual típica dos modelos de difusão (usados, por exemplo, para criar imagens a partir de texto). Essa fusão permite que o DiScoFormer aprenda tanto a estrutura interna dos dados quanto a forma de gerar novos exemplos, sem precisar de dois conjuntos de pesos (os parâmetros ajustáveis do modelo).
Os pesquisadores disponibilizaram o código e os pesos do modelo no Hugging Face, permitindo que outros desenvolvedores testem e adaptem a tecnologia. A expectativa é que arquiteturas como essa se tornem mais comuns à medida que o custo de treinar modelos grandes continua sendo uma barreira para muitos projetos de IA. Para quem trabalha com geração de dados sintéticos, simulações ou criação de conteúdo, o DiScoFormer representa uma alternativa mais acessível sem grandes perdas de qualidade.


