Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos
La empresa presenta d1-3B y d1-omni-600M, dos sistemas que responden preguntas concretas en una sola operación sin generar texto, diseñados para funcionar en dispositivos pequeños como los chips Jetson de NVIDIA.
Liquid AI presenta d1-3B y d1-omni-600M, dos modelos que toman decisiones estructuradas (sí/no, clasificar, puntuar) en una sola operación en lugar de generar texto. El primero funciona con texto e imágenes, el segundo añade audio. Responden en 16 a 50 milisegundos en chips Jetson de NVIDIA y superan a modelos más grandes en pruebas de decisión.

Liquid AI acaba de lanzar dos modelos de IA con un enfoque poco habitual: en lugar de generar texto palabra por palabra como ChatGPT, estos sistemas responden preguntas concretas de golpe, en una sola pasada de cálculo. Según informó la empresa en su blog oficial, el modelo d1-3B (un sistema con 3.000 millones de parámetros, que son los valores numéricos que determinan cómo funciona un modelo) alcanza 48,57 puntos en el Decision Index 0.2.1, una métrica que mide la capacidad de tomar decisiones estructuradas, superando a modelos con más de 35.000 millones de parámetros. El segundo modelo, d1-omni-600M (con 600 millones de parámetros), es experimental y puede procesar texto, imágenes o audio.
La velocidad es el punto fuerte de estos sistemas. El d1-3B responde una pregunta en 16 milisegundos en un Jetson AGX Thor (un ordenador compacto de NVIDIA diseñado para ejecutar IA sin depender de internet), 26 milisegundos en un Jetson AGX Orin y 50 milisegundos en un Jetson Orin Nano, el modelo más pequeño de la familia. En GPUs de escritorio (procesadores gráficos potentes usados para entrenar y ejecutar modelos), tarda menos de 10 milisegundos por pregunta. Estas cifras hacen viable usar los modelos en dispositivos que necesitan respuestas instantáneas, como robots, cámaras de seguridad o equipos médicos.
Ambos modelos parten de arquitecturas muy distintas. El d1-3B se entrena desde LFM2.5-VL-3B, un modelo multimodal (que entiende texto e imágenes) de tipo decoder-only (diseñado para generar secuencias, aunque aquí se ha adaptado para responder de una vez). El d1-omni-600M, en cambio, usa LFM2.5-Encoder-350M, un encoder bidireccional (que lee todo el texto de golpe en lugar de palabra por palabra) al que se le añaden módulos para procesar imágenes y audio. Liquid AI aclara que el segundo modelo aún está en fase de investigación temprana.
En las pruebas sobre siete conjuntos de datos públicos que miden comprensión lectora, detección de toxicidad, clasificación de intenciones, preguntas médicas y entendimiento multilingüe, el d1-3B obtiene una media de 82,9 puntos, por encima del Decider 4B (un modelo competidor con 4.000 millones de parámetros). El d1-omni-600M alcanza 78,4 puntos, superando al Decider 2B pese a tener solo una cuarta parte de sus parámetros. La empresa no publica cifras sobre las capacidades de visión o audio porque el Decision Index v0.3, el estándar usado para medir estos modelos, solo incluye pruebas de visión privadas y aún no existen benchmarks (conjuntos de pruebas estandarizadas) para audio en este tipo de tareas.
Los dos modelos se distribuyen con pesos abiertos (cualquiera puede descargarlos y usarlos) en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). Liquid AI sugiere usar estos sistemas cuando se necesiten decisiones rápidas y estructuradas, como clasificar tickets de soporte técnico, responder si una imagen contiene un objeto concreto o determinar la urgencia de un mensaje. El código de ejemplo muestra cómo cargar el modelo y hacerle preguntas sobre un texto o una imagen, con respuestas que incluyen sí/no, elección múltiple o una puntuación en una escala.


