En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog3 min

Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar

El Allen Institute for AI reemplazó su sistema de colas por turnos con uno que asigna presupuestos de tiempo de GPU a cada equipo, haciendo que los propios investigadores prioricen sus proyectos en lugar de negociar caso por caso con soporte técnico.

Por Redacción3 min
En resumen

El Allen Institute for AI implementó un sistema de presupuestos jerárquicos de tiempo de GPU en lugar de prioridades por trabajo. Cada equipo tiene asignado un porcentaje de la capacidad total del cluster según decisiones estratégicas previas de sus directivos, y cualquier solicitud debe gastar de ese presupuesto o puede ser interrumpida. Así eliminaron problemas como la ocupación fantasma de GPUs y la inflación de prioridades.

Compartir
Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar
Investigación · Hugging Face Blog

El Allen Institute for AI (Ai2) gestiona miles de GPUs NVIDIA H100, B200 y B300 (los procesadores más potentes del mercado para entrenar modelos de inteligencia artificial) organizadas en clusters de entre 88 y 1024 unidades. Estos recursos sirven a unos 150 investigadores internos que trabajan en entrenar modelos de lenguaje (LLM, sistemas como ChatGPT que generan texto), visión artificial y robótica. El problema: la demanda de tiempo de GPU supera la oferta por un factor de dos o tres. En cualquier momento, cada GPU disponible tiene entre dos y tres proyectos de investigación compitiendo por usarla.

Durante años, según explica el equipo de infraestructura de Ai2 en un artículo publicado en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), usaron un sistema clásico de prioridades: cada trabajo podía marcarse como de prioridad ALTA, MEDIA o BAJA, y algunos podían declararse no interrumpibles. Pero esto generó patologías predecibles. Los investigadores empezaron a «ocupar» GPUs con trabajos vacíos que no hacían nada, simplemente para tener una GPU reservada por si la necesitaban. Eventualmente, el 100% de los trabajos usaban prioridad ALTA, haciendo el sistema inútil. Y como muchos trabajos eran no interrumpibles, el equipo de soporte pasaba la mayor parte de su tiempo negociando el apagado voluntario de experimentos para poder hacer mantenimiento.

El instituto reconoce que estos problemas eran un ejemplo clásico de la «tragedia de los comunes»: individuos compitiendo por un recurso escaso y, al intentar maximizar su beneficio personal, consiguiendo un resultado global pésimo. Inicialmente intentaron soluciones parciales, como asignar monopolios de GPUs a proyectos importantes, pero esto dejaba GPUs inactivas cuando esos equipos no tenían experimentos listos. Estaban resolviendo manualmente un problema de optimización imposible: encajar necesidades cambiantes de investigación en un calendario fijo.

La solución que implementaron invierte el modelo: en lugar de asignar GPUs físicas, asignan presupuestos de tiempo de GPU. Los directivos del instituto deciden de antemano, como inversores, qué porcentaje del tiempo total de cómputo merece cada programa de investigación. Esto se organiza jerárquicamente: un proyecto concreto puede tener asignado el 35% de la capacidad total del cluster, independientemente de cuántos otros proyectos estén esperando. Cada solicitud de GPU debe estar respaldada por presupuesto, o es susceptible de ser interrumpida. Ahora, trucos como «ocupar» una GPU con un trabajo vacío gastan el presupuesto del equipo en nada, así que ya no tiene sentido hacerlo.

Este enfoque no es enteramente nuevo: algoritmos de fair-share jerárquico (reparto equitativo según cuotas predefinidas) existen desde 2009 en sistemas como Hadoop Fair Scheduler, y se usan hoy en SLURM (un gestor de trabajos común en supercomputación) y YARN (el sistema de gestión de recursos de Hadoop). La novedad está en los datos de entrada: la jerarquía refleja la estructura real de programas de investigación del instituto, y los pesos son presupuestos definidos por gestores en lugar de prioridades ad-hoc. El resultado: el debate sobre cuánto tiempo de GPU merece cada proyecto pasó de ser una tarea operativa caso por caso a un proceso de presupuestación administrativo transparente.

Fuente original
Hugging Face Blog
Más en · Investigación