En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas

ThinkingBox evalúa agentes de IA no por lo que dicen, sino por los registros que dejan en bases de datos reales, y les pide hacerlo correctamente en veinte intentos consecutivos

Por Redacción2 min
En resumen

ThinkingBox es un benchmark de Microsoft que evalúa agentes de IA midiendo los registros que dejan en bases de datos reales, no sus respuestas en lenguaje natural. Cada tarea se ejecuta veinte veces para distinguir entre modelos que pueden hacerlo alguna vez y los que lo hacen de forma consistente. Está disponible en Hugging Face.

Compartir
Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas
Herramientas · Hugging Face Blog

Microsoft ha publicado ThinkingBox, un benchmark (un conjunto de pruebas para medir el rendimiento de sistemas de IA) que evalúa agentes de inteligencia artificial de una forma distinta a la mayoría: no se fija en si sus respuestas suenan correctas ni en si invocan las herramientas adecuadas, sino en los registros que dejan en bases de datos y sistemas backend (los sistemas internos donde se guardan pedidos, tickets de soporte, reservas y otros datos). El benchmark está ahora disponible en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), según informó la compañía en su blog oficial.

El problema que detecta ThinkingBox es que un agente puede ejecutar herramientas correctamente, cerrar un ticket de soporte y responder con educación al cliente, pero dejar el estado de la base de datos equivocado. En un ejemplo real del benchmark, un agente de atención al cliente gestiona nueve llamadas a herramientas de forma impecable para atender una queja por un pedido atrasado, pero cierra el ticket como resuelto cuando debería haberlo dejado en espera hasta que se solucionara la incidencia con el transportista. Un evaluador que solo revisara las llamadas a herramientas o la respuesta final no detectaría el fallo; la base de datos sí.

Cada tarea del benchmark se ejecuta veinte veces desde cero, con backends idénticos y aislados, para separar lo que un modelo puede hacer alguna vez de lo que hace de forma consistente. ThinkingBox mide tres cosas: pass@1 (el porcentaje de intentos únicos que tienen éxito, la métrica habitual en otros benchmarks), pass@20 (qué proporción de tareas se resuelve al menos una vez en veinte intentos) y observed 20/20 (cuántas tareas se superan las veinte veces sin fallar ninguna). En un análisis de 121.680 intentos válidos con doce modelos de lenguaje (LLM, sistemas de IA que generan y entienden texto), casi 80.000 fallaron las comprobaciones ejecutables; de esos fallos, el 67% terminaron sin errores aparentes y más del 77% dejaron valores incorrectos en campos de la base de datos.

Los resultados muestran que la brecha entre hacer algo una vez y hacerlo siempre es enorme. Claude Opus 5.5 lidera el pass@1 general con un 67,16%, pero solo retiene el 71% de esa puntuación cuando se exige que funcione veinte veces seguidas. GPT-6 Astra retiene el 78%, la mejor tasa de consistencia entre modelos propietarios. Kimi-K3, el modelo de pesos abiertos (modelos cuyos parámetros internos se publican para que cualquiera pueda usarlos o modificarlos) con mayor cobertura, resuelve el 93,89% de las 507 tareas al menos una vez, pero solo mantiene consistencia en una fracción de ellas. Otros modelos como GLM-5.1 o DeepSeek-V4-Pro conservan apenas el 8% de su puntuación inicial. Microsoft publicó ThinkingBox junto con OpenEnv, una herramienta que permite ejecutar el benchmark localmente con servidores MCP (Model Context Protocol, un estándar para que agentes de IA interactúen con herramientas y bases de datos externas) aislados.

Fuente original
Hugging Face Blog
Más en · Herramientas