En directo
[Modelos de IA]Liquid AI acelera su modelo de visión e imagen con decodificación especulativa[Modelos de IA]Un modelo de 100 millones de parámetros identifica quién habló en cada momento de una conversación[Herramientas]Cómo simular miles de robots a la vez con MJWarp, la herramienta de Nvidia para entrenar IA física[Investigación]El instituto de seguridad de IA del Reino Unido publica sus resultados de evaluación en abierto[Herramientas]Hugging Face ficha al creador de oMLX para reforzar la IA local en dispositivos Apple[Herramientas]Google lanza Fairwind, un programa exclusivo para que gobiernos corrijan vulnerabilidades con IA[Modelos de IA]Google lanza Gemini 3.8 Flash, su modelo más rápido para programar y detectar vulnerabilidades[Modelos de IA]Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible[Modelos de IA]Liquid AI acelera su modelo de visión e imagen con decodificación especulativa[Modelos de IA]Un modelo de 100 millones de parámetros identifica quién habló en cada momento de una conversación[Herramientas]Cómo simular miles de robots a la vez con MJWarp, la herramienta de Nvidia para entrenar IA física[Investigación]El instituto de seguridad de IA del Reino Unido publica sus resultados de evaluación en abierto[Herramientas]Hugging Face ficha al creador de oMLX para reforzar la IA local en dispositivos Apple[Herramientas]Google lanza Fairwind, un programa exclusivo para que gobiernos corrijan vulnerabilidades con IA[Modelos de IA]Google lanza Gemini 3.8 Flash, su modelo más rápido para programar y detectar vulnerabilidades[Modelos de IA]Gemini ahora analiza vídeos de forma 'agéntica' y reduce costes hasta un 66%[Herramientas]El nuevo sistema Vera Rubin de NVIDIA triplica el rendimiento de su predecesor en inferencia de IA[Negocios]NVIDIA, Google y Emerald AI crean una alianza para que los centros de datos de IA consuman electricidad de forma flexible
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Liquid AI acelera su modelo de visión e imagen con decodificación especulativa

La empresa publica un modelo auxiliar que acelera hasta tres veces la generación de texto en su modelo LFM2.5-VL sin cambiar la calidad de las respuestas ni apenas aumentar la memoria.

Por Redacción2 min
En resumen

Liquid AI lanzó LFM2.5-VL-DSpark, un modelo auxiliar de 280 millones de parámetros que acelera hasta tres veces la generación de texto en su modelo de visión-lenguaje LFM2.5-VL-3B mediante decodificación especulativa (una técnica donde un modelo pequeño propone respuestas que el modelo principal verifica), sin cambiar la calidad de las respuestas ni apenas aumentar la memoria.

Compartir
Liquid AI acelera su modelo de visión e imagen con decodificación especulativa
Modelos de IA · Hugging Face Blog

Liquid AI ha publicado un modelo experimental llamado LFM2.5-VL-DSpark que acelera la velocidad de respuesta de su modelo de visión-lenguaje LFM2.5-VL-3B (un modelo de IA capaz de procesar tanto imágenes como texto) mediante una técnica llamada decodificación especulativa. Según informó la compañía en su blog, este sistema auxiliar logra multiplicar por tres la velocidad de generación de texto en ciertos dispositivos sin modificar la calidad de las respuestas, añadiendo solo 280 millones de parámetros (un 8,9% más) al modelo original de 3.000 millones.

La decodificación especulativa funciona como un asistente que propone bloques de tokens (fragmentos de texto) que el modelo principal verifica después. El modelo auxiliar observa los estados internos del modelo principal en capas intermedias y genera hasta nueve candidatos a la vez. Como las imágenes y el texto se convierten en un mismo tipo de representación antes de esas capas, el sistema funciona igual independientemente de si procesa una foto o palabras.

Las mejoras de velocidad varían según el hardware y la tarea. En un chip M5 Max de Apple, la generación de texto (decode) se acelera entre 2,3 y 3,13 veces, mientras que el tiempo total de respuesta (de principio a fin) mejora entre 1,56 y 2,62 veces. En una GPU H100 (un acelerador de inteligencia artificial de Nvidia usado en centros de datos), la velocidad de generación aumenta hasta 2,66 veces y el tiempo total hasta 2,27 veces. Estas cifras se midieron en seis tareas distintas: preguntas sobre imágenes generales, preguntas sobre texto en imágenes, descripción de fotos, análisis de gráficos, razonamiento complejo y conversaciones de múltiples turnos.

La aceleración es menos espectacular en el tiempo total porque la decodificación especulativa solo mejora la fase de generación de texto, no el procesamiento inicial de la imagen ni la lectura del prompt (la pregunta o instrucción del usuario). En dispositivos con menos potencia de cálculo, esas fases iniciales consumen una parte importante del tiempo total, lo que limita la ganancia global según la ley de Amdahl (un principio que establece que la mejora total de un sistema está limitada por la parte que no se acelera).

Liquid AI ha publicado el modelo con soporte inmediato para tres herramientas populares entre desarrolladores: llama.cpp (un framework para ejecutar modelos en CPUs), MLX-VLM (optimizado para chips de Apple) y SGLang (un servidor de inferencia, es decir, un software para ejecutar modelos ya entrenados). Los modelos están disponibles en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA) en formatos Safetensors y GGUF, con licencia de pesos abiertos (cualquiera puede descargarlos, modificarlos y desplegarlos sin restricciones).

Fuente original
Hugging Face Blog
Más en · Modelos de IA