Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Por que treinar modelos de IA com reforço pode dar errado — e como evitar isso

Pesquisadores da ServiceNow descobriram que uma ferramenta popular para treinar modelos de linguagem pode introduzir erros silenciosos que comprometem o aprendizado.

Por Redação2 min
Compartilhar
Por que treinar modelos de IA com reforço pode dar errado — e como evitar isso
Pesquisa · Hugging Face Blog

Uma equipe de pesquisadores da ServiceNow (empresa canadense de software corporativo) descobriu um problema sério em uma das ferramentas mais usadas para treinar modelos de inteligência artificial: a vLLM (biblioteca de código aberto que acelera a execução de grandes modelos de linguagem). O problema está na forma como a versão antiga da ferramenta lida com aprendizado por reforço (técnica em que o modelo aprende tentando e recebendo recompensas por acertos), segundo informou a empresa em artigo publicado no blog da Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados).

O erro acontece porque a vLLM V0 não garante que o modelo sempre produza exatamente a mesma saída para a mesma entrada — um requisito básico para que o aprendizado por reforço funcione. Imagine ensinar um cachorro a sentar: se você dá petisco numa vez e ignora na outra para o mesmo comportamento, ele não aprende direito. Com modelos de IA, essa inconsistência faz o treinamento virar um tiro no escuro, desperdiçando tempo e recursos de computação (que costumam ser caros, especialmente em nuvem).

A equipe testou a nova versão da ferramenta, a vLLM V1, e confirmou que ela corrige o problema ao garantir resultados consistentes. Eles treinaram modelos usando GRPO (uma técnica de aprendizado por reforço em grupo) e mostraram que, com a versão antiga, os modelos não melhoravam de forma confiável — às vezes até pioravam. Com a V1, o treinamento funciona como esperado, com o modelo aprendendo de fato a partir das recompensas que recebe.

O alerta é especialmente relevante porque muitos desenvolvedores e empresas usam a vLLM para afinar modelos de linguagem (processo de treinar um modelo já existente para uma tarefa específica) sem saber que podem estar introduzindo erros invisíveis. A ServiceNow recomenda que quem trabalha com aprendizado por reforço migre imediatamente para a vLLM V1 e refaça experimentos anteriores para garantir que os resultados sejam válidos. A descoberta reforça uma lição básica da engenharia de software: antes de otimizar velocidade, é preciso garantir que o sistema funciona corretamente.

Fonte original
Hugging Face Blog
Mais em · Pesquisa