En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog3 min

Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA

La popular plataforma de modelos abiertos añade soporte para entornos de aprendizaje por refuerzo, permitiendo que distintos frameworks compartan tareas y evaluaciones sin necesidad de convertirlas manualmente

Por Redacción3 min
En resumen

Hugging Face permite ahora alojar entornos de aprendizaje por refuerzo, que son conjuntos de tareas para entrenar y evaluar agentes de IA. La novedad es que un mismo repositorio puede ser usado por múltiples frameworks (Harbor, Verifiers, OpenEnv, NeMo Gym) sin necesidad de convertir los archivos, resolviendo la fragmentación que obligaba a reimplementar manualmente cada tarea para cada herramienta.

Compartir
Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA
Herramientas · Hugging Face Blog

Hugging Face, la plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados, acaba de incorporar un nuevo tipo de contenido: entornos de aprendizaje por refuerzo (RL, por sus siglas en inglés). Un entorno de RL es básicamente un conjunto de tareas que un agente de IA (un programa capaz de ejecutar acciones y tomar decisiones) debe resolver, junto con un sistema que evalúa su rendimiento y le asigna una puntuación. Hasta ahora, cada framework de desarrollo tenía su propio registro de entornos, lo que significaba que si alguien publicaba una tarea para un framework concreto, los usuarios de otros tres no podían utilizarla sin reescribir el código a mano.

La solución de Hugging Face es sencilla pero potente: cualquier dataset (conjunto de datos) etiquetado como rl-environment aparece ahora en un nuevo filtro específico y puede ser cargado por múltiples frameworks sin necesidad de conversión. La plataforma ya alberga entornos de Harbor (un framework para ejecutar agentes en contenedores Docker), Verifiers (un sistema para verificar y puntuar resultados), OpenEnv y NVIDIA NeMo Gym (un framework de entrenamiento desarrollado por NVIDIA). No hay registro centralizado ni proceso de aprobación: basta con subir las tareas como un dataset normal y añadir las etiquetas correspondientes en el archivo de metadatos del repositorio.

La arquitectura separa claramente dos partes: las tareas y los datos viven en Hugging Face, mientras que el código que ejecuta esas tareas y calcula las puntuaciones (el runtime y el verificador) queda en manos de cada framework. Cuando un desarrollador quiere usar un entorno, el framework descarga los archivos del repositorio y los ejecuta localmente o en un backend en la nube compatible, como Hugging Face Jobs o Sandboxes (servicios que permiten ejecutar código de forma aislada y bajo demanda). El agente intercambia acciones y observaciones con el entorno, y al final un verificador evalúa el resultado y asigna una recompensa que puede usarse para medir el rendimiento o para entrenar el modelo.

Lo interesante es que un mismo repositorio puede llevar etiquetas de varios frameworks a la vez, lo que significa que una tarea publicada una sola vez puede ser utilizada por desarrolladores de distintas herramientas sin modificaciones. Según explica Hugging Face en su anuncio, esto resuelve un problema de fragmentación: hasta ahora, muchos entornos publicados en papers académicos o proyectos de investigación quedaban encerrados en un único framework, obligando a otros equipos a reimplementarlos desde cero. Ahora, si alguien detecta un error en una tarea, la corrección llega automáticamente a todos los frameworks en la siguiente descarga.

Para usar un entorno, basta con elegir el framework deseado y ejecutar el comando que aparece en el botón Use this dataset de cada repositorio. Hugging Face no ha creado un nuevo tipo de repositorio ni un sistema de registro aparte: simplemente ha añadido un filtro y unas etiquetas a la infraestructura de datasets que ya existía. Los desarrolladores que quieran publicar su propio entorno solo necesitan subir las tareas como un dataset normal, abrir el archivo de metadatos y añadir la etiqueta rl-environment junto con las etiquetas de los frameworks compatibles. Si un framework aún no está registrado, pueden proponer su inclusión mediante una pull request al repositorio de configuración de Hugging Face.

Fuente original
Hugging Face Blog
Más en · Herramientas