Por que treinar modelos de IA com reforço pode dar errado — e como evitar isso
Pesquisadores da ServiceNow descobriram que uma ferramenta popular para treinar modelos de linguagem pode introduzir erros silenciosos que comprometem o aprendizado.

Uma equipe de pesquisadores da ServiceNow (empresa canadense de software corporativo) descobriu um problema sério em uma das ferramentas mais usadas para treinar modelos de inteligência artificial: a vLLM (biblioteca de código aberto que acelera a execução de grandes modelos de linguagem). O problema está na forma como a versão antiga da ferramenta lida com aprendizado por reforço (técnica em que o modelo aprende tentando e recebendo recompensas por acertos), segundo informou a empresa em artigo publicado no blog da Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados).
O erro acontece porque a vLLM V0 não garante que o modelo sempre produza exatamente a mesma saída para a mesma entrada — um requisito básico para que o aprendizado por reforço funcione. Imagine ensinar um cachorro a sentar: se você dá petisco numa vez e ignora na outra para o mesmo comportamento, ele não aprende direito. Com modelos de IA, essa inconsistência faz o treinamento virar um tiro no escuro, desperdiçando tempo e recursos de computação (que costumam ser caros, especialmente em nuvem).
A equipe testou a nova versão da ferramenta, a vLLM V1, e confirmou que ela corrige o problema ao garantir resultados consistentes. Eles treinaram modelos usando GRPO (uma técnica de aprendizado por reforço em grupo) e mostraram que, com a versão antiga, os modelos não melhoravam de forma confiável — às vezes até pioravam. Com a V1, o treinamento funciona como esperado, com o modelo aprendendo de fato a partir das recompensas que recebe.
O alerta é especialmente relevante porque muitos desenvolvedores e empresas usam a vLLM para afinar modelos de linguagem (processo de treinar um modelo já existente para uma tarefa específica) sem saber que podem estar introduzindo erros invisíveis. A ServiceNow recomenda que quem trabalha com aprendizado por reforço migre imediatamente para a vLLM V1 e refaça experimentos anteriores para garantir que os resultados sejam válidos. A descoberta reforça uma lição básica da engenharia de software: antes de otimizar velocidade, é preciso garantir que o sistema funciona corretamente.


