En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo saber si un modelo de IA es lo bastante «agéntico» para tus herramientas

Hugging Face publica una guía práctica para medir si los modelos de lenguaje abiertos pueden usar bien las funciones y APIs de tu propia aplicación.

Por Redacción2 min
Compartir
Cómo saber si un modelo de IA es lo bastante «agéntico» para tus herramientas
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de publicar una guía técnica para resolver un problema cada vez más común: cómo evaluar si un modelo de lenguaje es capaz de usar correctamente las herramientas y funciones propias de tu proyecto. La pregunta, según explican en su blog oficial, no es tanto si un LLM (siglas en inglés de «modelo de lenguaje grande», sistemas como GPT o Llama capaces de generar texto) es bueno en general, sino si es lo bastante «agéntico» —es decir, capaz de actuar de forma autónoma y llamar a APIs o ejecutar código— en tu caso concreto.

El documento propone crear benchmarks personalizados (pruebas de rendimiento a medida) que midan si un modelo puede, por ejemplo, leer correctamente la documentación de una API interna de tu empresa, llamarla con los parámetros correctos y manejar errores sin intervención humana. Esto es especialmente relevante porque los modelos con pesos abiertos (aquellos cuyos parámetros internos se pueden descargar y modificar libremente, a diferencia de sistemas cerrados como GPT-4) son cada vez más populares en empresas que quieren controlar sus datos y costes, pero necesitan saber si rinden tan bien como las alternativas comerciales en tareas prácticas.

La guía incluye ejemplos de código para automatizar estas pruebas usando la librería de Hugging Face y recomienda evaluar no solo si el modelo devuelve la respuesta correcta, sino también si entiende cuándo debe preguntar al usuario, cuándo debe buscar información adicional y cuándo debe admitir que no sabe algo. Según los autores, muchos equipos evalúan modelos con datasets (conjuntos de datos de entrenamiento o prueba) públicos que no reflejan las particularidades de sus propias herramientas, lo que lleva a decepciones cuando el modelo falla en producción.

El enfoque de Hugging Face coincide con una tendencia más amplia en la industria: medir la «agenticidad» (la capacidad de un modelo para actuar como un agente autónomo que toma decisiones y ejecuta acciones) en lugar de solo su precisión lingüística. Empresas como Anthropic y OpenAI también han empezado a publicar benchmarks centrados en el uso de herramientas, pero esta guía destaca por poner el foco en evaluar modelos abiertos con las APIs y bases de datos reales de cada proyecto, no con ejemplos genéricos.

Fuente original
Hugging Face Blog
Más en · Herramientas