Novo benchmark testa se modelos de IA conseguem raciocinar em várias etapas com dados reais
O DABStep, criado por pesquisadores da Hugging Face e outras instituições, avalia a capacidade de LLMs de resolver problemas complexos que exigem múltiplos passos de raciocínio sobre tabelas e bases de dados.
O DABStep é um benchmark (conjunto de testes padronizados) criado para avaliar se LLMs (modelos de linguagem grandes, como o ChatGPT) conseguem resolver problemas complexos que exigem várias etapas de raciocínio sobre dados estruturados, como tabelas. Ele contém 10 mil exemplos anotados manualmente e revelou que até os modelos mais avançados ainda têm dificuldade com tarefas de três ou mais passos.

Pesquisadores da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), em parceria com universidades dos Estados Unidos e da China, lançaram o DABStep, um novo benchmark (conjunto de testes padronizados) para medir como modelos de linguagem grandes, ou LLMs (sistemas de IA como o ChatGPT, treinados em enormes volumes de texto para gerar respostas), lidam com problemas que exigem raciocínio em múltiplas etapas sobre dados estruturados. A ideia é avaliar se esses modelos conseguem, de fato, planejar e executar tarefas complexas — como responder perguntas que exigem filtrar, agrupar e calcular informações em tabelas — sem se perder no meio do caminho.
O DABStep contém 10 mil exemplos de perguntas e tarefas baseadas em conjuntos de dados públicos, como estatísticas de vendas, registros governamentais e informações geográficas. Cada pergunta foi anotada manualmente para indicar quais passos intermediários são necessários para chegar à resposta correta. Isso permite medir não apenas se o modelo acerta a resposta final, mas se ele segue uma sequência lógica de raciocínio — essencial para saber se a IA está realmente "entendendo" o problema ou apenas adivinhando.
Os testes mostraram que até os modelos mais avançados, como o GPT-4 da OpenAI e o Claude da Anthropic, ainda têm dificuldade com tarefas que exigem três ou mais passos de raciocínio encadeados. Segundo informou o blog da Hugging Face, a taxa de acerto cai significativamente quando a complexidade aumenta, revelando que essas ferramentas ainda não dominam o raciocínio lógico profundo que seria esperado de um agente de IA (um sistema capaz de planejar e executar tarefas de forma autônoma) confiável.
O benchmark está disponível publicamente e pode ser usado por desenvolvedores e empresas que queiram avaliar seus próprios modelos antes de colocá-los em produção. Para o público geral, o DABStep é um lembrete de que, apesar dos avanços rápidos, os LLMs atuais ainda precisam evoluir muito antes de substituir decisões humanas em contextos que exigem análise cuidadosa e raciocínio passo a passo com dados reais.


