Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado
Desenvolvedor mostra como usou o ML Intern, um agente de IA da Hugging Face, para criar sete modelos especializados em poucos dias, gastando entre US$ 2 e US$ 24 por projeto
O ML Intern é um agente de IA (sistema que planeja e executa tarefas sozinho) da Hugging Face que permite criar modelos personalizados automaticamente. Você descreve o que quer, define o orçamento e ele planeja o trabalho, treina o modelo em servidores da Hugging Face e publica o resultado. Um desenvolvedor criou sete modelos especializados em dias, gastando entre US$ 2 e US$ 24 cada.

Um desenvolvedor construiu sete modelos de inteligência artificial personalizados em menos de uma semana, gastando entre US$ 2 e US$ 24 por projeto. A ferramenta que tornou isso possível é o ML Intern, um agente de IA (um sistema que planeja e executa tarefas complexas de forma autônoma) disponível no HuggingChat da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). Segundo relatou o próprio desenvolvedor no blog da Hugging Face, cada projeto começou como uma mensagem de texto descrevendo o que ele queria e terminou com um modelo público pronto para usar, incluindo avaliação de desempenho.
O método funciona assim: você escreve um prompt (uma instrução detalhada) explicando qual modelo quer criar, qual dataset (conjunto de dados de treinamento) usar, qual modelo base adaptar e quanto pode gastar. O ML Intern então planeja o trabalho, pede autorização antes de gastar qualquer centavo, faz um teste pequeno antes do treinamento completo e, por fim, treina, avalia e publica o modelo nos servidores da Hugging Face. O desenvolvedor recomenda incluir duas instruções críticas: pedir uma avaliação do modelo base antes do treinamento (para saber se houve melhora real) e solicitar um teste rápido com poucas iterações antes de rodar o treinamento completo.
Entre os modelos criados está um especialista em doenças de plantas cítricas. Usando um dataset com 3.017 fotos anotadas de 21 problemas diferentes (pragas, deficiências nutricionais, doenças), o agente fez o fine-tuning (ajuste fino de um modelo pré-treinado com dados específicos) do modelo de visão Qwen3.5-2B. O modelo original acertava o diagnóstico correto em 14,9% das fotos de teste; depois de duas épocas de treinamento (duas passagens completas pelos dados) em uma GPU A10G, a taxa subiu para 52,8%. O custo de processamento ficou em US$ 1,90.
Outro exemplo foi uma LoRA (Low-Rank Adaptation, uma técnica que adiciona habilidades a um modelo de imagem sem retreiná-lo por completo) para ensinar o modelo FLUX.2 a desenhar o mascote Huggy no estilo da marca Hugging Face. O agente treinou usando 84 desenhos legendados, salvando checkpoints (versões intermediárias) a cada 100 passos. O desenvolvedor escolheu o checkpoint do passo 200, quando o mascote ficou fiel ao original — nos passos seguintes, o estilo do Huggy começou a "contaminar" imagens que não tinham nada a ver com ele. Custo: US$ 7,60.
O projeto mais complexo foi uma LoRA de ângulos de câmera para o modelo Qwen-Image 2.1, que permite pedir "mostre esse objeto 45 graus à esquerda". Como nenhum dataset existia, o ML Intern renderizou 1.030 objetos domésticos escaneados em 24 ângulos cada (24.722 imagens com fundo transparente) em trabalhos de CPU que custaram centavos. Depois separou 461 objetos para treinamento e 40 para teste, totalizando 1.844 pares de antes-e-depois. O treinamento rodou 2.000 passos em 90 minutos numa GPU A100, custando US$ 3,75. O projeto inteiro levou meio dia e 48 trabalhos (contando os que falharam e precisaram ser refeitos), com custo total de US$ 16.
Também foi criado um modelo reescritor de prompts compacto — uma versão de 0,8 bilhão de parâmetros do reescritor oficial de 9 bilhões que acompanha o Qwen-Image 2.1. O original precisa de 20 GB de memória e processa milhares de tokens (unidades de texto que o modelo lê) antes de escrever um parágrafo; a versão compacta roda em CPU, retorna saída válida 99,7% das vezes e usa cerca de um quarto dos tokens. O ML Intern gerou 8.797 pedidos curtos de imagem com um modelo menor, pediu ao modelo de 9B para reescrevê-los (2 horas e 37 minutos numa A100, US$ 6,50), filtrou os melhores 1.840 exemplos e treinou os modelos de 0,8B e 2B em 12 e 18 minutos numa A10G. Custo total do projeto, incluindo a geração dos dados: US$ 16.


