OpenAI lança GeneBench-Pro, teste que mede como IAs lidam com genética e biologia
Novo benchmark usa dados reais e complexos para avaliar se modelos de inteligência artificial conseguem resolver problemas científicos de verdade, não só responder perguntas teóricas.
A OpenAI lançou o GeneBench-Pro, um conjunto de testes padronizados que mede o desempenho de modelos de inteligência artificial em tarefas reais de genômica e biologia, como interpretar DNA e prever comportamento de proteínas. Diferente de benchmarks tradicionais, usa dados complexos do cotidiano científico, não perguntas teóricas simplificadas.

A OpenAI (empresa americana criadora do ChatGPT) anunciou o GeneBench-Pro, um novo benchmark (conjunto de testes padronizados usado para medir o desempenho de modelos de IA) focado em genômica, biologia e pesquisa científica. Diferente de testes tradicionais, que costumam usar perguntas de múltipla escolha ou tarefas simplificadas, o GeneBench-Pro trabalha com dados reais e complexos do tipo que cientistas enfrentam no dia a dia de laboratório.
O objetivo é avaliar se modelos de linguagem (LLMs, ou Large Language Models — programas de IA treinados para entender e gerar texto, como o GPT-4) e outras ferramentas de inteligência artificial conseguem de fato ajudar em descobertas científicas, não apenas repetir informações que decoraram durante o treinamento. Segundo informou a OpenAI, o benchmark inclui tarefas como interpretar sequências de DNA (a molécula que carrega informação genética), prever o comportamento de proteínas e analisar resultados de experimentos biológicos.
A escolha por genômica reflete uma aposta de que a IA pode acelerar pesquisas em áreas como desenvolvimento de medicamentos, agricultura e medicina personalizada. Mas também expõe uma limitação atual: a maioria dos modelos de IA foi treinada principalmente com texto da internet, não com dados científicos especializados. O GeneBench-Pro serve justamente para mostrar onde esses modelos ainda falham — e onde precisam melhorar.
A iniciativa se soma a outros benchmarks científicos lançados recentemente, como o GPQA (Graduate-Level Google-Proof Q&A, um teste com perguntas de nível universitário avançado criado para ser difícil até com ajuda de buscadores) e o MedQA (focado em medicina). Todos compartilham a mesma ideia: é hora de testar se a IA realmente entende ciência ou só finge bem.
Por enquanto, a OpenAI não divulgou resultados de desempenho de seus próprios modelos no GeneBench-Pro, nem especificou se o benchmark será aberto para que outras empresas e pesquisadores possam usá-lo. O anúncio funciona mais como uma carta de intenções: a empresa quer deixar claro que está de olho em aplicações científicas, não só em chatbots para o público geral.


