Ao vivo
[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente[Ferramentas]Como treinar IA em máquinas separadas sem perder velocidade[Pesquisa]Seu agente de IA acertou uma vez — mas vai acertar de novo?[Pesquisa]Instituto britânico de segurança em IA adota sistema que torna testes de modelos reproduzíveis[Ferramentas]Hugging Face reconstrói interface do AUTOMATIC1111 como um grafo visual de 73 nós[Pesquisa]Por que filtros de segurança em IA bloqueiam perguntas legítimas — e como consertar isso[Modelos de IA]Hugging Face lança NeoMME, modelo de IA que processa texto e imagem sem precisar de peças separadas[Ferramentas]Ferramenta dá memória permanente aos agentes de código que você já usa[Ferramentas]Hugging Face adiciona suporte nativo a modelos GGUF no Transformers[Pesquisa]Como ensinar um modelo pequeno de IA a gerar texto estruturado sem erros[Modelos de IA]Modelos de vídeo por IA começam a ficar acessíveis — mas ainda exigem hardware potente
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

Como treinar IA em máquinas separadas sem perder velocidade

Uma nova técnica usa adaptadores minúsculos e um balde de armazenamento compartilhado para acelerar o treinamento de modelos de linguagem sem precisar de clusters caros

Por Redação2 min
Em resumo

A Hugging Face lançou uma técnica que treina modelos de IA em máquinas separadas usando LoRA (método que treina apenas uma camada pequena sobre o modelo original). Em vez de enviar o modelo inteiro entre servidores a cada atualização, só o adaptador de poucos megabytes viaja por um balde de armazenamento compartilhado, reduzindo o tempo de treinamento em 75%.

Compartilhar
Como treinar IA em máquinas separadas sem perder velocidade
Ferramentas · Hugging Face Blog

Uma equipe da Hugging Face (plataforma onde desenvolvedores compartilham modelos de IA) mostrou como é possível treinar modelos de linguagem grandes em máquinas separadas sem os cabos de alta velocidade que normalmente conectam servidores em data centers. A técnica, que acaba de ser lançada na versão 1.14 do TRL (biblioteca de código aberto para treinar modelos com feedback humano), conseguiu reduzir o tempo de treinamento de 3 horas e 27 minutos para 53 minutos em testes reais.

O segredo está em usar LoRA (Low-Rank Adaptation, um método que treina apenas uma camada pequena em cima do modelo original em vez de modificar o modelo inteiro). Com rank 1 (a versão mais enxuta possível), o adaptador resultante ocupa apenas alguns megabytes, enquanto o modelo completo tem cerca de 3 gigabytes. Isso significa que, a cada atualização, só é preciso enviar o adaptador pequeno entre as máquinas, não o modelo inteiro.

A arquitetura funciona assim: uma máquina roda o treinamento usando AsyncGRPOTrainer (ferramenta que treina modelos com aprendizado por reforço de forma assíncrona), duas outras máquinas rodam vLLM (servidor otimizado para gerar texto com modelos grandes) e todas se conectam a um Storage Bucket (espaço de armazenamento na nuvem) montado como se fosse um disco local em cada uma. Sempre que o treinador atualiza o adaptador, ele simplesmente salva o arquivo no balde compartilhado e avisa o vLLM para carregar a nova versão. Não há troca de dados direta entre as máquinas.

Um servidor proxy pequeno fica na frente das réplicas de vLLM para resolver dois problemas. Primeiro, ele direciona cada solicitação para a réplica que provavelmente já tem em memória o prefixo do texto que está sendo gerado, evitando recalcular isso do zero. Segundo, ele transmite comandos de carregar adaptador para todas as réplicas ao mesmo tempo. O vLLM pode manter até seis versões do adaptador carregadas simultaneamente, o que permite que rollouts antigos (sequências de texto geradas para treinar o modelo) terminem com a política que começaram enquanto novos rollouts já usam a versão mais recente.

A técnica é especialmente adequada para aprendizado por reforço porque, segundo pesquisas da Thinking Machines, cada episódio de treinamento só oferece cerca de um bit de informação útil — um adaptador de rank 1 tem capacidade suficiente para absorver isso. Os testes foram feitos com o modelo Qwen2.5-Math-1.5B usando GPUs H200, e todo o código está disponível como software livre. A abordagem mostra que é possível escalar treinamento de IA sem investir em infraestrutura de rede de alta velocidade entre servidores, bastando usar armazenamento compartilhado simples.

Fonte original
Hugging Face Blog
Mais em · Ferramentas
Seu agente de IA acertou uma vez — mas vai acertar de novo?
Hugging Face Blog

Seu agente de IA acertou uma vez — mas vai acertar de novo?

Pesquisadores da IBM descobriram que agentes de inteligência artificial podem ter desempenho variável na mesma tarefa e criaram uma ferramenta que reduz pela metade essa instabilidade sem perder precisão