En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo entrenar modelos de IA con millones de palabras de contexto sin quedarte sin memoria

Hugging Face presenta Ulysses, una técnica que permite a modelos de lenguaje procesar textos larguísimos repartiendo el trabajo entre varias GPUs de forma más eficiente.

Por Redacción2 min
Compartir
Cómo entrenar modelos de IA con millones de palabras de contexto sin quedarte sin memoria
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado una nueva técnica llamada Ulysses Sequence Parallelism que permite entrenar modelos de lenguaje con contextos de hasta un millón de tokens (unidades de texto que equivalen más o menos a palabras o fragmentos de palabras). Para ponerlo en perspectiva: un millón de tokens es aproximadamente el tamaño de tres novelas largas juntas, algo que hasta ahora resultaba extremadamente difícil de procesar sin quedarse sin memoria RAM en las GPUs (las tarjetas gráficas especializadas que se usan para entrenar estos modelos).

El problema que resuelve Ulysses es técnico pero importante: cuando un modelo de IA procesa un texto muy largo, debe calcular qué palabras están relacionadas entre sí mediante un mecanismo llamado atención (attention), que consume cantidades brutales de memoria. La técnica tradicional para manejar textos largos es dividir el trabajo entre varias GPUs, pero esto creaba un cuello de botella al transferir datos entre ellas. Ulysses reorganiza ese reparto de forma más inteligente: en lugar de dividir el texto en bloques consecutivos, distribuye las operaciones de cálculo de manera que cada GPU tenga que transferir menos información.

Según los experimentos de Hugging Face, Ulysses reduce el tiempo de entrenamiento hasta un 47% comparado con métodos anteriores cuando se usan 32 GPUs trabajando en paralelo. Además, se integra bien con otras técnicas de paralelización (formas de repartir el trabajo entre procesadores) como DeepSpeed ZeRO (un sistema de Microsoft para entrenar modelos gigantes de forma eficiente) y el tensor parallelism (otra técnica que divide las operaciones matemáticas del modelo), lo que permite combinar varias estrategias a la vez para exprimir al máximo el hardware disponible.

La técnica ya está disponible en el framework Transformers de Hugging Face (la librería de código abierto más usada para trabajar con modelos de lenguaje) y puede activarse con una sola línea de configuración. Aunque Ulysses no resuelve todos los problemas del entrenamiento con contextos largos —todavía hace falta mucha memoria y muchas GPUs—, representa un paso relevante para hacer viable entrenar modelos que puedan procesar documentos largos, bases de código completas o conversaciones extensas sin perder el hilo.

Fuente original
Hugging Face Blog
Más en · Investigación