Por qué los modelos de lenguaje se ralentizan cuando varias personas los usan a la vez
Un análisis técnico explica cómo los grandes modelos de lenguaje dividen su trabajo en dos fases muy distintas y por qué eso complica atender a muchos usuarios al mismo tiempo sin perder velocidad.
Los modelos de lenguaje grandes dividen su trabajo en dos fases: el prefill (cuando procesan la pregunta completa, saturando el procesador) y el decode (cuando generan la respuesta palabra a palabra, necesitando acceso rápido a memoria). Mezclar ambas fases en un mismo servidor reduce el rendimiento hasta un 40 por ciento porque el hardware alterna entre tipos de carga incompatibles.

Cuando usas ChatGPT o cualquier otro chatbot basado en un modelo de lenguaje grande (LLM, el tipo de inteligencia artificial que genera texto coherente a partir de una pregunta), la respuesta no aparece de golpe: el sistema va escribiendo palabra a palabra, como si estuviera pensando en voz alta. Lo que no ves es que, internamente, ese proceso se divide en dos fases muy diferentes que exigen recursos distintos del hardware: el prefill (la fase en la que el modelo lee y procesa tu pregunta completa antes de empezar a responder) y el decode (la fase en la que genera cada nueva palabra, una tras otra, basándose en lo que ya escribió).
Según explica un artículo técnico publicado en el blog de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), el prefill es una operación breve pero muy intensiva en cálculo: el modelo tiene que procesar cientos o miles de palabras de golpe, lo que satura la GPU (el chip especializado que hace los cálculos matemáticos necesarios para que funcione la IA). El decode, en cambio, es más lento y ligero: genera palabra a palabra, pero cada paso depende del anterior, así que no puede acelerarse simplemente añadiendo más potencia de cálculo. Lo que sí necesita el decode es acceso rápido y constante a la memoria donde el modelo guarda sus parámetros (los pesos aprendidos durante el entrenamiento).
El problema surge cuando un mismo servidor tiene que atender a varios usuarios a la vez. Si mezclas peticiones en fase de prefill con otras en fase de decode, el sistema oscila entre dos tipos de carga completamente distintos: unas veces satura el procesador, otras veces satura la memoria. Eso genera cuellos de botella (momentos en los que el hardware no puede trabajar a plena capacidad) y hace que todas las respuestas se ralenticen. La solución, según el análisis, pasa por separar ambas fases en recursos diferentes o coordinar mejor el orden en que se atienden las peticiones, de forma que el servidor no cambie constantemente de un tipo de trabajo al otro.
El artículo incluye mediciones reales en un chip Nvidia H100 (una de las GPUs más potentes del mercado para inteligencia artificial) con modelos como Llama 3.1 de 8.000 millones de parámetros. Los resultados muestran que, cuando el sistema alterna entre prefill y decode sin control, el rendimiento cae hasta un 40% comparado con un escenario donde todas las peticiones están en la misma fase. Para empresas que ofrecen servicios de IA a miles de usuarios simultáneos, esa pérdida de eficiencia se traduce directamente en más servidores, más consumo energético y más coste económico.
Aunque el análisis está pensado para ingenieros que diseñan infraestructuras de IA, el mensaje de fondo es claro: escalar estos sistemas no es solo cuestión de comprar más hardware, sino de entender cómo funcionan por dentro y organizar el trabajo de forma inteligente. A medida que más aplicaciones dependen de modelos de lenguaje grandes, optimizar estos detalles será clave para que la IA generativa siga siendo rápida y accesible sin disparar los costes.


