En directo
[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial[Modelos de IA]Google lanza PaliGemma 2 Mix, modelos de visión multilingües que entienden imágenes en nueve idiomas[Investigación]DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad[Investigación]OpenAI cuestiona la fiabilidad de un test de referencia para medir la habilidad de programación de los modelos de IA[Investigación]Científicos usan AlphaFold para diseñar cultivos resistentes al calor[Herramientas]OpenAI lanza ChatGPT Work, un asistente que completa proyectos enteros por ti[Modelos de IA]Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad[Investigación]AlphaFold desvela la estructura de una proteína clave en las enfermedades cardíacas[Herramientas]Microsoft y Hugging Face profundizan su alianza para facilitar el despliegue de modelos de IA[Modelos de IA]Falcon-Edge: modelos de lenguaje de 1,58 bits que caben en un móvil[Herramientas]Hugging Face y Kaggle facilitan el uso compartido de modelos de inteligencia artificial
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad

Investigadores de Hugging Face y otras instituciones han creado DABStep, una prueba que evalúa si los agentes de IA (programas que pueden usar herramientas y tomar decisiones de forma autónoma) son capaces de completar tareas reales de análisis de datos que requieren varios pasos, no solo responder preguntas sencillas.

Por Redacción2 min
En resumen

DABStep es un test creado por Hugging Face y otras instituciones para evaluar si los agentes de IA (programas que usan herramientas de forma autónoma) pueden resolver tareas complejas de análisis de datos que requieren varios pasos encadenados, como lo haría un analista humano. Incluye 500 preguntas basadas en datos reales.

Compartir
DABStep, un nuevo test para medir si los agentes de IA resuelven tareas complejas de verdad
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado DABStep, un nuevo test diseñado para evaluar la capacidad de los agentes de IA en tareas de análisis de datos que requieren múltiples pasos y razonamiento complejo. Según explican en su blog oficial, la mayoría de pruebas actuales miden si un modelo puede responder preguntas simples o ejecutar una orden concreta, pero no si puede planificar, usar herramientas y tomar decisiones encadenadas como haría un analista de datos humano.

El test incluye 500 preguntas basadas en conjuntos de datos reales y cada una exige entre dos y siete pasos de razonamiento. Por ejemplo, el agente podría tener que cargar una tabla, filtrar filas según varios criterios, calcular promedios, comparar resultados y justificar una conclusión. DABStep no solo mide si el agente llega a la respuesta correcta, sino también si el proceso que siguió tiene sentido: si los pasos intermedios son lógicos y si usó las herramientas adecuadas en cada momento.

Los investigadores probaron DABStep con varios modelos de lenguaje de gran tamaño (LLM, los sistemas de IA que procesan y generan texto como ChatGPT o Claude) configurados como agentes, es decir, con acceso a herramientas externas como pandas (una librería de Python para manejar tablas de datos) o calculadoras. Los resultados mostraron que incluso los modelos más avanzados tienen dificultades: muchos cometen errores en pasos intermedios, usan herramientas de forma incorrecta o se pierden cuando la tarea requiere más de tres o cuatro decisiones encadenadas.

El equipo detrás de DABStep, formado por investigadores de Hugging Face, la Universidad de Washington y otras instituciones, ha liberado el conjunto de datos completo y el código de evaluación bajo licencia abierta. La intención es que otros equipos puedan usarlo para medir el progreso de sus propios agentes y comparar resultados de forma transparente. El test está pensado para ser realista: las preguntas reflejan el tipo de tareas que un científico de datos junior podría recibir en su trabajo diario, no problemas artificiales creados solo para demostrar capacidades de un modelo.

Este tipo de pruebas es importante porque los agentes de IA se están empezando a usar en entornos reales, desde análisis empresarial hasta investigación científica. Si no sabemos con precisión qué saben hacer y dónde fallan, corremos el riesgo de confiar en ellos para tareas que aún no dominan. DABStep ofrece una forma de medir ese límite de forma clara y reproducible, algo que hasta ahora no existía para tareas de análisis de datos complejas.

Fuente original
Hugging Face Blog
Más en · Investigación