Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

PesquisaHugging Face Blog2 min

Novo benchmark testa se modelos de IA conseguem raciocinar em várias etapas com dados reais

O DABStep, criado por pesquisadores da Hugging Face e outras instituições, avalia a capacidade de LLMs de resolver problemas complexos que exigem múltiplos passos de raciocínio sobre tabelas e bases de dados.

Por Redação2 min
Em resumo

O DABStep é um benchmark (conjunto de testes padronizados) criado para avaliar se LLMs (modelos de linguagem grandes, como o ChatGPT) conseguem resolver problemas complexos que exigem várias etapas de raciocínio sobre dados estruturados, como tabelas. Ele contém 10 mil exemplos anotados manualmente e revelou que até os modelos mais avançados ainda têm dificuldade com tarefas de três ou mais passos.

Compartilhar
Novo benchmark testa se modelos de IA conseguem raciocinar em várias etapas com dados reais
Pesquisa · Hugging Face Blog

Pesquisadores da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), em parceria com universidades dos Estados Unidos e da China, lançaram o DABStep, um novo benchmark (conjunto de testes padronizados) para medir como modelos de linguagem grandes, ou LLMs (sistemas de IA como o ChatGPT, treinados em enormes volumes de texto para gerar respostas), lidam com problemas que exigem raciocínio em múltiplas etapas sobre dados estruturados. A ideia é avaliar se esses modelos conseguem, de fato, planejar e executar tarefas complexas — como responder perguntas que exigem filtrar, agrupar e calcular informações em tabelas — sem se perder no meio do caminho.

O DABStep contém 10 mil exemplos de perguntas e tarefas baseadas em conjuntos de dados públicos, como estatísticas de vendas, registros governamentais e informações geográficas. Cada pergunta foi anotada manualmente para indicar quais passos intermediários são necessários para chegar à resposta correta. Isso permite medir não apenas se o modelo acerta a resposta final, mas se ele segue uma sequência lógica de raciocínio — essencial para saber se a IA está realmente "entendendo" o problema ou apenas adivinhando.

Os testes mostraram que até os modelos mais avançados, como o GPT-4 da OpenAI e o Claude da Anthropic, ainda têm dificuldade com tarefas que exigem três ou mais passos de raciocínio encadeados. Segundo informou o blog da Hugging Face, a taxa de acerto cai significativamente quando a complexidade aumenta, revelando que essas ferramentas ainda não dominam o raciocínio lógico profundo que seria esperado de um agente de IA (um sistema capaz de planejar e executar tarefas de forma autônoma) confiável.

O benchmark está disponível publicamente e pode ser usado por desenvolvedores e empresas que queiram avaliar seus próprios modelos antes de colocá-los em produção. Para o público geral, o DABStep é um lembrete de que, apesar dos avanços rápidos, os LLMs atuais ainda precisam evoluir muito antes de substituir decisões humanas em contextos que exigem análise cuidadosa e raciocínio passo a passo com dados reais.

Fonte original
Hugging Face Blog
Mais em · Pesquisa