vLLM ahora es hasta cuatro veces más rápido gracias a un cambio en su arquitectura
Hugging Face ha reescrito parte del sistema vLLM para que procese peticiones de modelos de lenguaje con mucha más velocidad, sin perder compatibilidad.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de anunciar una actualización importante en vLLM, una herramienta muy popular para ejecutar modelos de lenguaje grandes o LLMs (los sistemas de IA que entienden y generan texto, como ChatGPT) de forma eficiente en servidores. El cambio principal es que vLLM ahora usa directamente el código de la librería Transformers (el framework de código abierto que usan la mayoría de modelos de lenguaje modernos), en lugar de tener su propia capa de traducción intermedia. Esto puede sonar técnico, pero el resultado práctico es claro: según informó Hugging Face, el sistema ahora es entre dos y cuatro veces más rápido procesando peticiones, dependiendo del modelo.
Hasta ahora, vLLM tenía su propia forma de interpretar los modelos, lo que significaba que cada vez que salía un nuevo tipo de arquitectura o actualización en Transformers, alguien tenía que reescribir manualmente el código equivalente para vLLM. Eso ralentizaba la adopción de nuevos modelos y generaba incompatibilidades ocasionales. Con este cambio, vLLM delega esa responsabilidad directamente en Transformers, lo que reduce el trabajo de mantenimiento y garantiza que cualquier modelo nuevo funcione sin retraso.
La mejora de velocidad se nota especialmente en tareas como la inferencia (el proceso de generar respuestas a partir de un modelo ya entrenado): en pruebas internas, modelos como Llama 3.1 (un LLM de código abierto desarrollado por Meta) procesaron peticiones hasta tres veces más rápido que con la versión anterior de vLLM. Esto es relevante sobre todo para empresas que ejecutan estos modelos en sus propios servidores, donde cada milisegundo de respuesta cuenta cuando hay miles de usuarios haciendo preguntas a la vez.
El cambio también hace que vLLM sea más fácil de mantener a largo plazo. Según la entrada del blog de Hugging Face, el equipo de desarrollo ha reducido significativamente la cantidad de código que necesita actualizar manualmente, lo que libera tiempo para trabajar en otras optimizaciones. Para quien usa vLLM, esto significa menos errores inesperados y mejor compatibilidad con modelos recién publicados, sin tener que esperar semanas a que alguien los adapte.
Esta actualización ya está disponible en la versión más reciente de vLLM y no requiere cambios en el código de quien ya la esté usando: los modelos existentes funcionan igual que antes, solo que más rápido. Para desarrolladores que ejecutan sus propios LLMs en servidores locales o en la nube, este tipo de mejoras de rendimiento pueden traducirse en costes más bajos (menos tiempo de computación significa menos gasto en servidores) y mejor experiencia de usuario, especialmente en aplicaciones donde la velocidad de respuesta es crítica, como chatbots de atención al cliente o asistentes virtuales.


