Cómo entrenar modelos gigantes de IA sin quedarte sin espacio en el disco duro
Hugging Face lanza Delta Weight Sync, una técnica que permite ajustar modelos enormes guardando solo los cambios, no el modelo entero cada vez.

Entrenar un modelo de inteligencia artificial grande es caro y lento, pero guardar todas las versiones intermedias puede ser peor: un modelo como Llama 3.1 de 405.000 millones de parámetros (los valores numéricos que definen cómo funciona una red neuronal) ocupa más de 700 gigabytes. Si lo ajustas varias veces y guardas cada versión, necesitas terabytes de almacenamiento. Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de lanzar Delta Weight Sync, una solución que reduce drásticamente ese problema.
La idea es simple pero efectiva: en lugar de guardar el modelo completo cada vez que lo entrenas, el sistema solo guarda las diferencias —los "deltas"— entre la versión original y la nueva. Imagina que partes de un modelo base y lo ajustas con tus propios datos mediante fine-tuning (un proceso donde adaptas un modelo ya entrenado a una tarea específica). Delta Weight Sync calcula qué parámetros cambiaron, guarda solo esos cambios en un archivo mucho más pequeño, y los sincroniza automáticamente con el Hub de Hugging Face cada cierto número de pasos de entrenamiento. Según la empresa, esto puede reducir el espacio necesario hasta un 99% en algunos casos.
La tecnología se integra directamente en TRL (Transformer Reinforcement Learning), una librería de código abierto que Hugging Face mantiene para entrenar modelos de lenguaje con técnicas avanzadas como RLHF (aprendizaje por refuerzo con retroalimentación humana, el método que se usa para que modelos como ChatGPT respondan de forma útil y segura). Los desarrolladores solo tienen que activar una opción en su configuración de entrenamiento y el sistema se encarga del resto: sube los deltas, permite recuperar versiones anteriores y facilita colaborar con equipos distribuidos sin duplicar archivos gigantes.
Hugging Face destaca que esta funcionalidad es especialmente útil para quienes trabajan con modelos muy grandes o necesitan experimentar con muchas configuraciones distintas. En lugar de llenar servidores con copias casi idénticas de un modelo de 400.000 millones de parámetros, puedes mantener una sola versión base y decenas de conjuntos de deltas ligeros. La compañía también señala que Delta Weight Sync es compatible con sus herramientas existentes de versionado y compartición de modelos, lo que facilita la adopción sin cambiar flujos de trabajo completos.
El anuncio llega en un momento en que entrenar modelos cada vez más grandes se ha convertido en norma, pero el coste de infraestructura sigue siendo una barrera para muchos equipos de investigación y startups. Soluciones como esta no hacen que entrenar un modelo gigante sea barato, pero al menos evitan que el almacenamiento se convierta en un cuello de botella adicional.


