Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Como treinar um modelo de IA que cria imagens a partir de texto: lições de quem fez na prática

A Photoroom publicou os resultados de centenas de testes para descobrir o que funciona de verdade ao treinar um modelo capaz de transformar descrições em imagens realistas.

Por Redação2 min
Compartilhar
Como treinar um modelo de IA que cria imagens a partir de texto: lições de quem fez na prática
Pesquisa · Hugging Face Blog

Treinar um modelo de inteligência artificial capaz de gerar imagens a partir de texto — como o DALL-E ou o Midjourney fazem — não é só uma questão de ter dados e poder de computação. A Photoroom (uma empresa que desenvolve ferramentas de IA para edição de fotos) acaba de publicar uma série de experimentos que mostram, na prática, quais decisões fazem diferença real no resultado final. O estudo, chamado PRX, testa desde o tamanho das imagens usadas no treinamento até a forma como o modelo recebe as instruções de texto.

Um dos achados mais importantes: começar o treinamento com imagens pequenas e aumentar a resolução aos poucos — uma técnica chamada progressive training — acelera o processo e economiza recursos, mas pode prejudicar a qualidade final se a transição não for bem calibrada. Segundo a equipe da Photoroom, treinar direto com imagens em resolução alta desde o início produz resultados melhores, mesmo que demore mais e custe mais caro. O ganho em detalhes e coerência compensa, especialmente em aplicações comerciais onde a qualidade da imagem é crítica.

Outro ponto testado foi o uso de descrições sintéticas — ou seja, legendas geradas automaticamente por outro modelo de IA, em vez de textos escritos por humanos. A conclusão: descrições sintéticas funcionam bem, mas só se forem muito detalhadas e precisas. Modelos que produzem legendas curtas ou genéricas prejudicam o aprendizado. A Photoroom também testou diferentes formas de representar o texto dentro do modelo — usando encoders (componentes que traduzem palavras em números que a IA entende) de tamanhos variados — e descobriu que encoders maiores e mais sofisticados, como o T5-XXL, melhoram bastante a capacidade do modelo de entender instruções complexas.

O artigo também explora ajustes mais técnicos, como a quantidade de ruído adicionada durante o treinamento — uma técnica usada em modelos de difusão (o tipo de IA que gera imagens removendo ruído progressivamente de uma imagem borrada) — e a forma como o modelo aprende a lidar com diferentes níveis de detalhe. A equipe da Photoroom compartilhou tanto os resultados quanto o código usado nos experimentos, disponível na plataforma Hugging Face, para que outros desenvolvedores possam replicar ou adaptar os testes. É uma contribuição rara num campo onde muitas empresas guardam suas descobertas a sete chaves.

Fonte original
Hugging Face Blog
Mais em · Pesquisa