
Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas
ThinkingBox evalúa agentes de IA no por lo que dicen, sino por los registros que dejan en bases de datos reales, y les pide hacerlo correctamente en veinte intentos consecutivos

















