En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo entrenar modelos gigantes de IA sin quedarte sin espacio en el disco duro

Hugging Face lanza Delta Weight Sync, una técnica que permite ajustar modelos enormes guardando solo los cambios, no el modelo entero cada vez.

Por Redacción2 min
Compartir
Cómo entrenar modelos gigantes de IA sin quedarte sin espacio en el disco duro
Herramientas · Hugging Face Blog

Entrenar un modelo de inteligencia artificial grande es caro y lento, pero guardar todas las versiones intermedias puede ser peor: un modelo como Llama 3.1 de 405.000 millones de parámetros (los valores numéricos que definen cómo funciona una red neuronal) ocupa más de 700 gigabytes. Si lo ajustas varias veces y guardas cada versión, necesitas terabytes de almacenamiento. Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar Delta Weight Sync, una solución que reduce drásticamente ese problema.

La idea es simple pero efectiva: en lugar de guardar el modelo completo cada vez que lo entrenas, el sistema solo guarda las diferencias —los "deltas"— entre la versión original y la nueva. Imagina que partes de un modelo base y lo ajustas con tus propios datos mediante fine-tuning (un proceso donde adaptas un modelo ya entrenado a una tarea específica). Delta Weight Sync calcula qué parámetros cambiaron, guarda solo esos cambios en un archivo mucho más pequeño, y los sincroniza automáticamente con el Hub de Hugging Face cada cierto número de pasos de entrenamiento. Según la empresa, esto puede reducir el espacio necesario hasta un 99% en algunos casos.

La tecnología se integra directamente en TRL (Transformer Reinforcement Learning), una librería de código abierto que Hugging Face mantiene para entrenar modelos de lenguaje con técnicas avanzadas como RLHF (aprendizaje por refuerzo con retroalimentación humana, el método que se usa para que modelos como ChatGPT respondan de forma útil y segura). Los desarrolladores solo tienen que activar una opción en su configuración de entrenamiento y el sistema se encarga del resto: sube los deltas, permite recuperar versiones anteriores y facilita colaborar con equipos distribuidos sin duplicar archivos gigantes.

Hugging Face destaca que esta funcionalidad es especialmente útil para quienes trabajan con modelos muy grandes o necesitan experimentar con muchas configuraciones distintas. En lugar de llenar servidores con copias casi idénticas de un modelo de 400.000 millones de parámetros, puedes mantener una sola versión base y decenas de conjuntos de deltas ligeros. La compañía también señala que Delta Weight Sync es compatible con sus herramientas existentes de versionado y compartición de modelos, lo que facilita la adopción sin cambiar flujos de trabajo completos.

El anuncio llega en un momento en que entrenar modelos cada vez más grandes se ha convertido en norma, pero el coste de infraestructura sigue siendo una barrera para muchos equipos de investigación y startups. Soluciones como esta no hacen que entrenar un modelo gigante sea barato, pero al menos evitan que el almacenamiento se convierta en un cuello de botella adicional.

Fuente original
Hugging Face Blog
Más en · Herramientas