Ao vivo
[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude[Ferramentas]Como adicionar marcas d'água em imagens de IA com uma linha de código[Ferramentas]LeRobot lança formato de dataset que facilita treinar robôs com milhões de exemplos[Ferramentas]Três truques da OpenAI para rodar modelos de IA muito mais rápido (que você pode usar hoje)[Modelos de IA]Writer lança modelos de IA compactos que raciocinam sem precisar de servidores potentes[Ferramentas]Hugging Face e Together AI facilitam o ajuste fino de qualquer modelo de linguagem[Ferramentas]ServiceNow cria framework que gera dados de treino para qualquer modelo de IA[Pesquisa]Hugging Face lança ferramentas para qualquer um estudar agentes de IA[Ferramentas]Hugging Face passa a oferecer servidores franceses da Scaleway para rodar modelos de IA[Regulação]Mulher acusa padrasto de usar Grok para criar imagem sexual a partir de foto de infância[Modelos de IA]Anthropic detalha como vão funcionar as marcas d'água do Claude
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Por que treinar modelos de IA com reforço pode dar errado — e como evitar isso

Pesquisadores da ServiceNow descobriram que uma ferramenta popular para treinar modelos de linguagem pode introduzir erros silenciosos que comprometem o aprendizado.

Por Redação2 min
Compartilhar
Por que treinar modelos de IA com reforço pode dar errado — e como evitar isso
Pesquisa · Hugging Face Blog

Uma equipe de pesquisadores da ServiceNow (empresa canadense de software corporativo) descobriu um problema sério em uma das ferramentas mais usadas para treinar modelos de inteligência artificial: a vLLM (biblioteca de código aberto que acelera a execução de grandes modelos de linguagem). O problema está na forma como a versão antiga da ferramenta lida com aprendizado por reforço (técnica em que o modelo aprende tentando e recebendo recompensas por acertos), segundo informou a empresa em artigo publicado no blog da Hugging Face (plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados).

O erro acontece porque a vLLM V0 não garante que o modelo sempre produza exatamente a mesma saída para a mesma entrada — um requisito básico para que o aprendizado por reforço funcione. Imagine ensinar um cachorro a sentar: se você dá petisco numa vez e ignora na outra para o mesmo comportamento, ele não aprende direito. Com modelos de IA, essa inconsistência faz o treinamento virar um tiro no escuro, desperdiçando tempo e recursos de computação (que costumam ser caros, especialmente em nuvem).

A equipe testou a nova versão da ferramenta, a vLLM V1, e confirmou que ela corrige o problema ao garantir resultados consistentes. Eles treinaram modelos usando GRPO (uma técnica de aprendizado por reforço em grupo) e mostraram que, com a versão antiga, os modelos não melhoravam de forma confiável — às vezes até pioravam. Com a V1, o treinamento funciona como esperado, com o modelo aprendendo de fato a partir das recompensas que recebe.

O alerta é especialmente relevante porque muitos desenvolvedores e empresas usam a vLLM para afinar modelos de linguagem (processo de treinar um modelo já existente para uma tarefa específica) sem saber que podem estar introduzindo erros invisíveis. A ServiceNow recomenda que quem trabalha com aprendizado por reforço migre imediatamente para a vLLM V1 e refaça experimentos anteriores para garantir que os resultados sejam válidos. A descoberta reforça uma lição básica da engenharia de software: antes de otimizar velocidade, é preciso garantir que o sistema funciona corretamente.

Fonte original
Hugging Face Blog
Mais em · Pesquisa