Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaOpenAI News2 min

OpenAI lança GeneBench-Pro, teste que mede como IAs lidam com genética e biologia

Novo benchmark usa dados reais e complexos para avaliar se modelos de inteligência artificial conseguem resolver problemas científicos de verdade, não só responder perguntas teóricas.

Por Redação2 min
Em resumo

A OpenAI lançou o GeneBench-Pro, um conjunto de testes padronizados que mede o desempenho de modelos de inteligência artificial em tarefas reais de genômica e biologia, como interpretar DNA e prever comportamento de proteínas. Diferente de benchmarks tradicionais, usa dados complexos do cotidiano científico, não perguntas teóricas simplificadas.

Compartilhar
OpenAI lança GeneBench-Pro, teste que mede como IAs lidam com genética e biologia
Pesquisa · OpenAI News

A OpenAI (empresa americana criadora do ChatGPT) anunciou o GeneBench-Pro, um novo benchmark (conjunto de testes padronizados usado para medir o desempenho de modelos de IA) focado em genômica, biologia e pesquisa científica. Diferente de testes tradicionais, que costumam usar perguntas de múltipla escolha ou tarefas simplificadas, o GeneBench-Pro trabalha com dados reais e complexos do tipo que cientistas enfrentam no dia a dia de laboratório.

O objetivo é avaliar se modelos de linguagem (LLMs, ou Large Language Models — programas de IA treinados para entender e gerar texto, como o GPT-4) e outras ferramentas de inteligência artificial conseguem de fato ajudar em descobertas científicas, não apenas repetir informações que decoraram durante o treinamento. Segundo informou a OpenAI, o benchmark inclui tarefas como interpretar sequências de DNA (a molécula que carrega informação genética), prever o comportamento de proteínas e analisar resultados de experimentos biológicos.

A escolha por genômica reflete uma aposta de que a IA pode acelerar pesquisas em áreas como desenvolvimento de medicamentos, agricultura e medicina personalizada. Mas também expõe uma limitação atual: a maioria dos modelos de IA foi treinada principalmente com texto da internet, não com dados científicos especializados. O GeneBench-Pro serve justamente para mostrar onde esses modelos ainda falham — e onde precisam melhorar.

A iniciativa se soma a outros benchmarks científicos lançados recentemente, como o GPQA (Graduate-Level Google-Proof Q&A, um teste com perguntas de nível universitário avançado criado para ser difícil até com ajuda de buscadores) e o MedQA (focado em medicina). Todos compartilham a mesma ideia: é hora de testar se a IA realmente entende ciência ou só finge bem.

Por enquanto, a OpenAI não divulgou resultados de desempenho de seus próprios modelos no GeneBench-Pro, nem especificou se o benchmark será aberto para que outras empresas e pesquisadores possam usá-lo. O anúncio funciona mais como uma carta de intenções: a empresa quer deixar claro que está de olho em aplicações científicas, não só em chatbots para o público geral.

Fonte original
OpenAI News
Mais em · Pesquisa