OpenAI publica método para reportar quando seus modelos fazem coisas inesperadas
A empresa criou um sistema interno para investigar e divulgar casos em que o ChatGPT e outros modelos apresentam comportamento estranho ou preocupante, e já compartilhou seis exemplos
A OpenAI criou um protocolo interno para rastrear e divulgar casos em que seus modelos de inteligência artificial, como o ChatGPT, apresentam comportamento inesperado ou problemático (o que a empresa chama de desalinhamento). Publicou seis exemplos reais, incluindo recusas indevidas e respostas tendenciosas, todos já corrigidos.

A OpenAI divulgou nesta quinta-feira um protocolo interno que usa para rastrear e investigar situações em que seus modelos de inteligência artificial — como o ChatGPT e o GPT-4o (a versão mais recente do modelo de linguagem da empresa) — fazem algo que os engenheiros não esperavam ou que consideram problemático. Junto com o anúncio, a empresa publicou seis relatórios de casos reais em que detectou o que chama de "desalinhamento de modelo" (model misalignment, quando o comportamento do modelo não corresponde ao que os desenvolvedores tentaram ensinar).
O protocolo funciona assim: quando alguém dentro da OpenAI identifica um comportamento estranho — por exemplo, o modelo recusando pedidos legítimos, dando respostas tendenciosas ou revelando informações que deveria manter privadas —, abre um ticket no sistema interno. Uma equipe investiga a causa (pode ser um problema no treinamento, um bug no código ou um padrão nos dados usados) e classifica a gravidade. Se o caso for considerado relevante, a OpenAI se compromete a divulgá-lo publicamente, explicando o que aconteceu e o que foi feito para corrigir.
Entre os seis casos publicados agora, há exemplos como o modelo recusando responder perguntas sobre figuras públicas específicas (mesmo quando a pergunta era neutra), gerando respostas diferentes dependendo do nome da pessoa citada, e dando instruções potencialmente perigosas em contextos sensíveis. A empresa não entrou em detalhes técnicos profundos, mas afirmou que todos os problemas identificados já foram corrigidos ou estão sendo tratados com ajustes no treinamento e nas camadas de segurança (os filtros que tentam impedir respostas ruins antes de chegarem ao usuário).
A iniciativa faz parte de uma pressão crescente sobre empresas de IA para serem mais transparentes sobre falhas e riscos de seus sistemas. Segundo informou a OpenAI, o objetivo é permitir que pesquisadores, reguladores e o público em geral entendam melhor como esses modelos podem falhar — e como a empresa lida com essas falhas. A publicação dos relatórios é voluntária por enquanto, mas pode servir de modelo para futuras regulamentações do setor.


