En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

vLLM ahora es hasta cuatro veces más rápido gracias a un cambio en su arquitectura

Hugging Face ha reescrito parte del sistema vLLM para que procese peticiones de modelos de lenguaje con mucha más velocidad, sin perder compatibilidad.

Por Redacción2 min
Compartir
vLLM ahora es hasta cuatro veces más rápido gracias a un cambio en su arquitectura
Herramientas · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de anunciar una actualización importante en vLLM, una herramienta muy popular para ejecutar modelos de lenguaje grandes o LLMs (los sistemas de IA que entienden y generan texto, como ChatGPT) de forma eficiente en servidores. El cambio principal es que vLLM ahora usa directamente el código de la librería Transformers (el framework de código abierto que usan la mayoría de modelos de lenguaje modernos), en lugar de tener su propia capa de traducción intermedia. Esto puede sonar técnico, pero el resultado práctico es claro: según informó Hugging Face, el sistema ahora es entre dos y cuatro veces más rápido procesando peticiones, dependiendo del modelo.

Hasta ahora, vLLM tenía su propia forma de interpretar los modelos, lo que significaba que cada vez que salía un nuevo tipo de arquitectura o actualización en Transformers, alguien tenía que reescribir manualmente el código equivalente para vLLM. Eso ralentizaba la adopción de nuevos modelos y generaba incompatibilidades ocasionales. Con este cambio, vLLM delega esa responsabilidad directamente en Transformers, lo que reduce el trabajo de mantenimiento y garantiza que cualquier modelo nuevo funcione sin retraso.

La mejora de velocidad se nota especialmente en tareas como la inferencia (el proceso de generar respuestas a partir de un modelo ya entrenado): en pruebas internas, modelos como Llama 3.1 (un LLM de código abierto desarrollado por Meta) procesaron peticiones hasta tres veces más rápido que con la versión anterior de vLLM. Esto es relevante sobre todo para empresas que ejecutan estos modelos en sus propios servidores, donde cada milisegundo de respuesta cuenta cuando hay miles de usuarios haciendo preguntas a la vez.

El cambio también hace que vLLM sea más fácil de mantener a largo plazo. Según la entrada del blog de Hugging Face, el equipo de desarrollo ha reducido significativamente la cantidad de código que necesita actualizar manualmente, lo que libera tiempo para trabajar en otras optimizaciones. Para quien usa vLLM, esto significa menos errores inesperados y mejor compatibilidad con modelos recién publicados, sin tener que esperar semanas a que alguien los adapte.

Esta actualización ya está disponible en la versión más reciente de vLLM y no requiere cambios en el código de quien ya la esté usando: los modelos existentes funcionan igual que antes, solo que más rápido. Para desarrolladores que ejecutan sus propios LLMs en servidores locales o en la nube, este tipo de mejoras de rendimiento pueden traducirse en costes más bajos (menos tiempo de computación significa menos gasto en servidores) y mejor experiencia de usuario, especialmente en aplicaciones donde la velocidad de respuesta es crítica, como chatbots de atención al cliente o asistentes virtuales.

Fuente original
Hugging Face Blog
Más en · Herramientas