Pesquisadora da Anthropic mostra sistema de IA que se corrige sozinho
Experimento automatizado conseguiu melhorar o comportamento de modelos de linguagem em dez métricas diferentes sem prejudicar o desempenho geral, segundo relatou a TechCrunch.
Uma pesquisadora da Anthropic (empresa por trás do chatbot Claude) mostrou um sistema automatizado que conseguiu corrigir comportamentos indesejados em modelos de linguagem (LLMs, os sistemas por trás de ferramentas como ChatGPT) em dez testes diferentes, sem piorar o desempenho geral — algo considerado difícil até agora.

Uma pesquisadora da Anthropic (empresa por trás do chatbot Claude) compartilhou resultados de um experimento com sistemas automatizados capazes de corrigir comportamentos indesejados em modelos de inteligência artificial. Segundo informou a TechCrunch, os testes envolveram dez benchmarks (conjuntos de testes padronizados usados para medir a qualidade de um modelo de IA) focados em comportamentos específicos considerados problemáticos.
O mais notável é que os sistemas automatizados conseguiram melhorar o desempenho do modelo em todas as dez métricas avaliadas, sem comprometer a performance geral em outras tarefas. Isso é importante porque, até agora, ajustar um modelo de linguagem (LLM, na sigla em inglês — os sistemas por trás de ferramentas como ChatGPT e Claude) para corrigir um problema específico costuma piorar o desempenho em outras áreas, um dilema conhecido como "degradação".
A revelação foi feita de forma informal pela pesquisadora, sem um artigo científico completo publicado ainda, mas chama atenção porque sugere avanços na chamada "auto-melhoria" de IA — a ideia de que modelos possam identificar e corrigir seus próprios erros sem intervenção humana constante. Esse é um dos objetivos de longo prazo da pesquisa em segurança de IA, já que modelos cada vez mais complexos se tornam difíceis de monitorar manualmente.
A Anthropic não detalhou quais comportamentos específicos foram corrigidos nem como exatamente o sistema automatizado funciona. A empresa é conhecida por investir pesadamente em pesquisa de alinhamento (técnicas para garantir que modelos de IA sigam instruções humanas de forma confiável e segura), e esse tipo de experimento faz parte desse esforço. Por enquanto, trata-se de pesquisa de laboratório, sem previsão de quando ou se a tecnologia chegará aos produtos comerciais da empresa.

