Como treinar IA em máquinas separadas sem perder velocidade
Uma nova técnica usa adaptadores minúsculos e um balde de armazenamento compartilhado para acelerar o treinamento de modelos de linguagem sem precisar de clusters caros
A Hugging Face lançou uma técnica que treina modelos de IA em máquinas separadas usando LoRA (método que treina apenas uma camada pequena sobre o modelo original). Em vez de enviar o modelo inteiro entre servidores a cada atualização, só o adaptador de poucos megabytes viaja por um balde de armazenamento compartilhado, reduzindo o tempo de treinamento em 75%.

Uma equipe da Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) mostrou como é possível treinar modelos de linguagem grandes em máquinas separadas sem os cabos de alta velocidade que normalmente conectam servidores em data centers. A técnica, que acaba de ser lançada na versão 1.14 do TRL (biblioteca de código aberto para treinar modelos com feedback humano), conseguiu reduzir o tempo de treinamento de 3 horas e 27 minutos para 53 minutos em testes reais.
O segredo está em usar LoRA (Low-Rank Adaptation, um método que treina apenas uma camada pequena em cima do modelo original em vez de modificar o modelo inteiro). Com rank 1 (a versão mais enxuta possível), o adaptador resultante ocupa apenas alguns megabytes, enquanto o modelo completo tem cerca de 3 gigabytes. Isso significa que, a cada atualização, só é preciso enviar o adaptador pequeno entre as máquinas, não o modelo inteiro.
A arquitetura funciona assim: uma máquina roda o treinamento usando AsyncGRPOTrainer (ferramenta que treina modelos com aprendizado por reforço de forma assíncrona), duas outras máquinas rodam vLLM (servidor otimizado para gerar texto com modelos grandes) e todas se conectam a um Storage Bucket (espaço de armazenamento na nuvem) montado como se fosse um disco local em cada uma. Sempre que o treinador atualiza o adaptador, ele simplesmente salva o arquivo no balde compartilhado e avisa o vLLM para carregar a nova versão. Não há troca de dados direta entre as máquinas.
Um servidor proxy pequeno fica na frente das réplicas de vLLM para resolver dois problemas. Primeiro, ele direciona cada solicitação para a réplica que provavelmente já tem em memória o prefixo do texto que está sendo gerado, evitando recalcular isso do zero. Segundo, ele transmite comandos de carregar adaptador para todas as réplicas ao mesmo tempo. O vLLM pode manter até seis versões do adaptador carregadas simultaneamente, o que permite que rollouts antigos (sequências de texto geradas para treinar o modelo) terminem com a política que começaram enquanto novos rollouts já usam a versão mais recente.
A técnica é especialmente adequada para aprendizado por reforço porque, segundo pesquisas da Thinking Machines, cada episódio de treinamento só oferece cerca de um bit de informação útil — um adaptador de rank 1 tem capacidade suficiente para absorver isso. Os testes foram feitos com o modelo Qwen2.5-Math-1.5B usando GPUs H200, e todo o código está disponível como software livre. A abordagem mostra que é possível escalar treinamento de IA sem investir em infraestrutura de rede de alta velocidade entre servidores, bastando usar armazenamento compartilhado simples.


