En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

InvestigaciónHugging Face Blog2 min

Cómo entrenar modelos de IA con millones de palabras de contexto sin quedarte sin memoria

Hugging Face presenta Ulysses, una técnica que permite a modelos de lenguaje procesar textos larguísimos repartiendo el trabajo entre varias GPUs de forma más eficiente.

Por Redacción2 min
Compartir
Cómo entrenar modelos de IA con millones de palabras de contexto sin quedarte sin memoria
Investigación · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado una nueva técnica llamada Ulysses Sequence Parallelism que permite entrenar modelos de lenguaje con contextos de hasta un millón de tokens (unidades de texto que equivalen más o menos a palabras o fragmentos de palabras). Para ponerlo en perspectiva: un millón de tokens es aproximadamente el tamaño de tres novelas largas juntas, algo que hasta ahora resultaba extremadamente difícil de procesar sin quedarse sin memoria RAM en las GPUs (las tarjetas gráficas especializadas que se usan para entrenar estos modelos).

El problema que resuelve Ulysses es técnico pero importante: cuando un modelo de IA procesa un texto muy largo, debe calcular qué palabras están relacionadas entre sí mediante un mecanismo llamado atención (attention), que consume cantidades brutales de memoria. La técnica tradicional para manejar textos largos es dividir el trabajo entre varias GPUs, pero esto creaba un cuello de botella al transferir datos entre ellas. Ulysses reorganiza ese reparto de forma más inteligente: en lugar de dividir el texto en bloques consecutivos, distribuye las operaciones de cálculo de manera que cada GPU tenga que transferir menos información.

Según los experimentos de Hugging Face, Ulysses reduce el tiempo de entrenamiento hasta un 47% comparado con métodos anteriores cuando se usan 32 GPUs trabajando en paralelo. Además, se integra bien con otras técnicas de paralelización (formas de repartir el trabajo entre procesadores) como DeepSpeed ZeRO (un sistema de Microsoft para entrenar modelos gigantes de forma eficiente) y el tensor parallelism (otra técnica que divide las operaciones matemáticas del modelo), lo que permite combinar varias estrategias a la vez para exprimir al máximo el hardware disponible.

La técnica ya está disponible en el framework Transformers de Hugging Face (la librería de código abierto más usada para trabajar con modelos de lenguaje) y puede activarse con una sola línea de configuración. Aunque Ulysses no resuelve todos los problemas del entrenamiento con contextos largos —todavía hace falta mucha memoria y muchas GPUs—, representa un paso relevante para hacer viable entrenar modelos que puedan procesar documentos largos, bases de código completas o conversaciones extensas sin perder el hilo.

Fuente original
Hugging Face Blog
Más en · Investigación