Liquid AI acelera su modelo de visión e imagen con decodificación especulativa
La empresa publica un modelo auxiliar que acelera hasta tres veces la generación de texto en su modelo LFM2.5-VL sin cambiar la calidad de las respuestas ni apenas aumentar la memoria.
Liquid AI lanzó LFM2.5-VL-DSpark, un modelo auxiliar de 280 millones de parámetros que acelera hasta tres veces la generación de texto en su modelo de visión-lenguaje LFM2.5-VL-3B mediante decodificación especulativa (una técnica donde un modelo pequeño propone respuestas que el modelo principal verifica), sin cambiar la calidad de las respuestas ni apenas aumentar la memoria.

Liquid AI ha publicado un modelo experimental llamado LFM2.5-VL-DSpark que acelera la velocidad de respuesta de su modelo de visión-lenguaje LFM2.5-VL-3B (un modelo de IA capaz de procesar tanto imágenes como texto) mediante una técnica llamada decodificación especulativa. Según informó la compañía en su blog, este sistema auxiliar logra multiplicar por tres la velocidad de generación de texto en ciertos dispositivos sin modificar la calidad de las respuestas, añadiendo solo 280 millones de parámetros (un 8,9% más) al modelo original de 3.000 millones.
La decodificación especulativa funciona como un asistente que propone bloques de tokens (fragmentos de texto) que el modelo principal verifica después. El modelo auxiliar observa los estados internos del modelo principal en capas intermedias y genera hasta nueve candidatos a la vez. Como las imágenes y el texto se convierten en un mismo tipo de representación antes de esas capas, el sistema funciona igual independientemente de si procesa una foto o palabras.
Las mejoras de velocidad varían según el hardware y la tarea. En un chip M5 Max de Apple, la generación de texto (decode) se acelera entre 2,3 y 3,13 veces, mientras que el tiempo total de respuesta (de principio a fin) mejora entre 1,56 y 2,62 veces. En una GPU H100 (un acelerador de inteligencia artificial de Nvidia usado en centros de datos), la velocidad de generación aumenta hasta 2,66 veces y el tiempo total hasta 2,27 veces. Estas cifras se midieron en seis tareas distintas: preguntas sobre imágenes generales, preguntas sobre texto en imágenes, descripción de fotos, análisis de gráficos, razonamiento complejo y conversaciones de múltiples turnos.
La aceleración es menos espectacular en el tiempo total porque la decodificación especulativa solo mejora la fase de generación de texto, no el procesamiento inicial de la imagen ni la lectura del prompt (la pregunta o instrucción del usuario). En dispositivos con menos potencia de cálculo, esas fases iniciales consumen una parte importante del tiempo total, lo que limita la ganancia global según la ley de Amdahl (un principio que establece que la mejora total de un sistema está limitada por la parte que no se acelera).
Liquid AI ha publicado el modelo con soporte inmediato para tres herramientas populares entre desarrolladores: llama.cpp (un framework para ejecutar modelos en CPUs), MLX-VLM (optimizado para chips de Apple) y SGLang (un servidor de inferencia, es decir, un software para ejecutar modelos ya entrenados). Los modelos están disponibles en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA) en formatos Safetensors y GGUF, con licencia de pesos abiertos (cualquiera puede descargarlos, modificarlos y desplegarlos sin restricciones).


