Un modelo de IA que entiende vídeo y cabe en un móvil
Hugging Face lanza SmolVLM2, un modelo capaz de analizar imágenes y vídeo que funciona en dispositivos sin conexión a internet, desde móviles hasta ordenadores pequeños como Raspberry Pi.
Hugging Face lanzó SmolVLM2, un modelo de visión-lenguaje (IA que combina texto e imagen) optimizado para funcionar en móviles y ordenadores pequeños sin conexión. Puede analizar vídeo fotograma a fotograma, describir acciones y responder preguntas sobre secuencias grabadas, todo ejecutándose localmente sin enviar datos a servidores externos.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de publicar SmolVLM2, un modelo de visión-lenguaje (un tipo de IA que combina la capacidad de entender texto e imágenes) diseñado específicamente para ejecutarse en dispositivos locales sin necesidad de enviar datos a la nube. A diferencia de los grandes modelos multimodales (sistemas de IA que procesan varios tipos de información, como texto, imagen o vídeo) que solo funcionan en servidores potentes, SmolVLM2 está optimizado para correr en móviles, ordenadores de escritorio convencionales y hasta en placas pequeñas como la Raspberry Pi 5.
La principal novedad de esta segunda versión es la capacidad de procesar vídeo fotograma a fotograma, algo que hasta ahora exigía hardware especializado. El modelo, con apenas 2.000 millones de parámetros (los números que ajusta una IA durante su entrenamiento para aprender a resolver tareas), puede analizar secuencias de vídeo y responder preguntas sobre lo que ocurre en ellas. Por ejemplo, puede describir acciones en un vídeo de vigilancia, identificar productos en un anuncio o resumir el contenido de una clase grabada.
Según los datos que publica Hugging Face, SmolVLM2 supera en varios tests de referencia (conjuntos de pruebas estándar que se usan para comparar modelos de IA) a su predecesor y a otros modelos ligeros del mismo tamaño, incluido el Llama 3.2 de Meta. El equipo ha entrenado el modelo con una mezcla de conjuntos de datos públicos de imagen y vídeo, utilizando técnicas de aumento sintético (generar ejemplos de entrenamiento artificiales a partir de datos existentes) para mejorar su capacidad de razonamiento visual.
El modelo está disponible en varias versiones: una base sin ajustes adicionales (útil para desarrolladores que quieran adaptarlo a usos específicos), una versión de instrucciones (entrenada para seguir órdenes en lenguaje natural) y otra optimizada para dispositivos móviles que pesa menos de 1 GB. Todas se publican con licencia Apache 2.0, lo que permite usarlas libremente incluso en productos comerciales.
La herramienta ya funciona en iPhone 15 Pro y en ordenadores con chips Snapdragon (procesadores de Qualcomm, la empresa que fabrica la mayoría de componentes para móviles Android), y el equipo de Hugging Face está trabajando en demos para navegador que permitan probarla sin instalar nada. La apuesta de fondo es clara: llevar capacidades de IA visual avanzadas a cualquier dispositivo, sin depender de conexiones rápidas ni de enviar información sensible fuera del aparato.


