En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Por qué entrenar IA con refuerzo humano es tan lento (y cómo acelerarlo)

Investigadores de Hugging Face compararon 16 librerías de código abierto para entrenar modelos de lenguaje con refuerzo humano y descubrieron que la mayoría desaprovecha hasta el 90% del tiempo de computación esperando.

Por Redacción2 min
Compartir
Por qué entrenar IA con refuerzo humano es tan lento (y cómo acelerarlo)
Investigación · Hugging Face Blog

Entrenar un modelo de inteligencia artificial con refuerzo humano —el método que usa ChatGPT para aprender a dar respuestas útiles y no solo gramaticalmente correctas— es un proceso caro y lento. Según un análisis publicado por investigadores de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), la mayoría de las herramientas de código abierto que existen para este tipo de entrenamiento pierden entre el 70% y el 90% del tiempo de computación simplemente esperando. Es como tener un superordenador encendido todo el día, pero que solo trabaje 10 minutos cada hora.

El problema está en cómo están diseñadas estas librerías. El aprendizaje por refuerzo con retroalimentación humana, o RLHF por sus siglas en inglés (un proceso donde el modelo genera texto, un evaluador —humano o automático— le dice si estuvo bien, y el modelo ajusta sus parámetros internos para mejorar), implica varios pasos que normalmente se ejecutan uno detrás de otro: generar texto, evaluarlo, calcular recompensas, actualizar el modelo. Mientras uno de esos pasos corre, el resto de los recursos —procesadores gráficos o GPUs, memoria, ancho de banda— están parados.

Los investigadores probaron 16 librerías populares de código abierto, incluyendo TRL (una herramienta de Hugging Face para entrenar modelos con refuerzo), OpenRLHF, Mosaic AI y otras menos conocidas. Midieron cuánto tiempo pasaban realmente computando —generando tokens, actualizando pesos del modelo— frente a cuánto tiempo estaban inactivas. El resultado: incluso las librerías más eficientes apenas superan el 30% de utilización. Mosaic AI Trainer, una de las pocas optimizadas para trabajar en paralelo (ejecutar varios pasos al mismo tiempo), logró el mejor rendimiento, pero sigue lejos de ser ideal.

La solución no es sencilla, pero Hugging Face sugiere que las herramientas futuras deberían diseñarse desde cero pensando en arquitecturas asíncronas (donde la generación de texto, la evaluación y la actualización del modelo ocurren en paralelo, sin esperar a que el paso anterior termine). También proponen usar técnicas como el procesamiento en lotes (agrupar muchas peticiones para procesarlas juntas y aprovechar mejor la GPU) y almacenamiento en caché de respuestas ya evaluadas. Algunas librerías, como Scaling RLHF y RLHFlow, ya empiezan a aplicar estas ideas, pero todavía queda camino por recorrer.

¿Por qué importa esto? Porque entrenar un modelo grande con RLHF puede costar cientos de miles de dólares en infraestructura cloud. Si una librería mejor optimizada pudiera reducir ese tiempo a la mitad, no solo abarataría el coste: también aceleraría el desarrollo de nuevos modelos de código abierto, permitiendo que más equipos e investigadores experimenten sin necesidad de presupuestos multimillonarios. Según informó Hugging Face en su blog oficial, el objetivo de este análisis es ayudar a la comunidad a elegir mejor sus herramientas y presionar a los desarrolladores para que prioricen la eficiencia.

Fuente original
Hugging Face Blog
Etiquetas
Más en · Investigación