Cómo saber si un modelo de IA es lo bastante «agéntico» para tus herramientas
Hugging Face publica una guía práctica para medir si los modelos de lenguaje abiertos pueden usar bien las funciones y APIs de tu propia aplicación.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de publicar una guía técnica para resolver un problema cada vez más común: cómo evaluar si un modelo de lenguaje es capaz de usar correctamente las herramientas y funciones propias de tu proyecto. La pregunta, según explican en su blog oficial, no es tanto si un LLM (siglas en inglés de «modelo de lenguaje grande», sistemas como GPT o Llama capaces de generar texto) es bueno en general, sino si es lo bastante «agéntico» —es decir, capaz de actuar de forma autónoma y llamar a APIs o ejecutar código— en tu caso concreto.
El documento propone crear benchmarks personalizados (pruebas de rendimiento a medida) que midan si un modelo puede, por ejemplo, leer correctamente la documentación de una API interna de tu empresa, llamarla con los parámetros correctos y manejar errores sin intervención humana. Esto es especialmente relevante porque los modelos con pesos abiertos (aquellos cuyos parámetros internos se pueden descargar y modificar libremente, a diferencia de sistemas cerrados como GPT-4) son cada vez más populares en empresas que quieren controlar sus datos y costes, pero necesitan saber si rinden tan bien como las alternativas comerciales en tareas prácticas.
La guía incluye ejemplos de código para automatizar estas pruebas usando la librería de Hugging Face y recomienda evaluar no solo si el modelo devuelve la respuesta correcta, sino también si entiende cuándo debe preguntar al usuario, cuándo debe buscar información adicional y cuándo debe admitir que no sabe algo. Según los autores, muchos equipos evalúan modelos con datasets (conjuntos de datos de entrenamiento o prueba) públicos que no reflejan las particularidades de sus propias herramientas, lo que lleva a decepciones cuando el modelo falla en producción.
El enfoque de Hugging Face coincide con una tendencia más amplia en la industria: medir la «agenticidad» (la capacidad de un modelo para actuar como un agente autónomo que toma decisiones y ejecuta acciones) en lugar de solo su precisión lingüística. Empresas como Anthropic y OpenAI también han empezado a publicar benchmarks centrados en el uso de herramientas, pero esta guía destaca por poner el foco en evaluar modelos abiertos con las APIs y bases de datos reales de cada proyecto, no con ejemplos genéricos.


