DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad
Investigadores de Hugging Face y otras instituciones han creado DABStep, una prueba que evalúa si los agentes de IA (programas que pueden usar herramientas y tomar decisiones de forma autónoma) son capaces de completar tareas reales de análisis de datos que requieren varios pasos, no solo responder preguntas sencillas.
DABStep es un test creado por Hugging Face y otras instituciones para evaluar si los agentes de IA (programas que usan herramientas de forma autónoma) pueden resolver tareas complejas de análisis de datos que requieren varios pasos encadenados, como lo haría un analista humano. Incluye 500 preguntas basadas en datos reales.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado DABStep, un nuevo test diseñado para evaluar la capacidad de los agentes de IA en tareas de análisis de datos que requieren múltiples pasos y razonamiento complejo. Según explican en su blog oficial, la mayoría de pruebas actuales miden si un modelo puede responder preguntas simples o ejecutar una orden concreta, pero no si puede planificar, usar herramientas y tomar decisiones encadenadas como haría un analista de datos humano.
El test incluye 500 preguntas basadas en conjuntos de datos reales y cada una exige entre dos y siete pasos de razonamiento. Por ejemplo, el agente podría tener que cargar una tabla, filtrar filas según varios criterios, calcular promedios, comparar resultados y justificar una conclusión. DABStep no solo mide si el agente llega a la respuesta correcta, sino también si el proceso que siguió tiene sentido: si los pasos intermedios son lógicos y si usó las herramientas adecuadas en cada momento.
Los investigadores probaron DABStep con varios modelos de lenguaje de gran tamaño (LLM, los sistemas de IA que procesan y generan texto como ChatGPT o Claude) configurados como agentes, es decir, con acceso a herramientas externas como pandas (una librería de Python para manejar tablas de datos) o calculadoras. Los resultados mostraron que incluso los modelos más avanzados tienen dificultades: muchos cometen errores en pasos intermedios, usan herramientas de forma incorrecta o se pierden cuando la tarea requiere más de tres o cuatro decisiones encadenadas.
El equipo detrás de DABStep, formado por investigadores de Hugging Face, la Universidad de Washington y otras instituciones, ha liberado el conjunto de datos completo y el código de evaluación bajo licencia abierta. La intención es que otros equipos puedan usarlo para medir el progreso de sus propios agentes y comparar resultados de forma transparente. El test está pensado para ser realista: las preguntas reflejan el tipo de tareas que un científico de datos junior podría recibir en su trabajo diario, no problemas artificiales creados solo para demostrar capacidades de un modelo.
Este tipo de pruebas es importante porque los agentes de IA se están empezando a usar en entornos reales, desde análisis empresarial hasta investigación científica. Si no sabemos con precisión qué saben hacer y dónde fallan, corremos el riesgo de confiar en ellos para tareas que aún no dominan. DABStep ofrece una forma de medir ese límite de forma clara y reproducible, algo que hasta ahora no existía para tareas de análisis de datos complejas.


