OpenAI encontra bug de 18 anos usando análise em massa de travamentos
Engenheiros da empresa analisaram milhares de registros de falhas do sistema para rastrear problemas raros de infraestrutura e descobriram tanto uma falha de hardware quanto um erro antigo no código
A OpenAI usou análise em larga escala de core dumps (arquivos que registram o estado de programas quando falham) para investigar travamentos raros em sua infraestrutura. A técnica revelou simultaneamente uma falha de hardware e um bug de software presente no código há 18 anos, que só se manifestava em condições muito específicas.

Engenheiros da OpenAI usaram uma técnica de análise em larga escala de core dumps (arquivos que registram o estado de um programa no momento em que ele falha) para investigar travamentos raros em sua infraestrutura. O método permitiu identificar simultaneamente uma falha de hardware e um bug de software que estava no código há 18 anos, segundo informou a empresa em comunicado oficial.
A abordagem funciona como uma espécie de epidemiologia aplicada a sistemas de computação: em vez de investigar cada travamento individualmente, os engenheiros analisaram padrões em milhares de core dumps para identificar causas comuns. Isso é especialmente útil quando as falhas acontecem de forma imprevisível ou só em condições muito específicas, que seriam difíceis de reproduzir em um ambiente de teste controlado.
A técnica revelou que alguns travamentos eram causados por um problema físico em componentes de hardware — peças defeituosas que falhavam de vez em quando. Mas a análise também expôs um erro de programação que estava presente no código há quase duas décadas, provavelmente porque só se manifestava em situações muito raras e, por isso, nunca havia sido detectado em testes convencionais.
A OpenAI opera uma infraestrutura gigantesca para treinar e executar seus modelos de IA, como o GPT-4 (o modelo de linguagem por trás do ChatGPT). Qualquer travamento inesperado pode interromper experimentos que levam dias ou semanas para rodar, o que torna esse tipo de depuração em grande escala especialmente valioso. A empresa não detalhou qual era o bug específico nem qual componente de hardware apresentava falhas.


