En directo
[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Un modelo de IA que entiende vídeo y cabe en un móvil

Hugging Face lanza SmolVLM2, un modelo capaz de analizar imágenes y vídeo que funciona en dispositivos sin conexión a internet, desde móviles hasta ordenadores pequeños como Raspberry Pi.

Por Redacción2 min
En resumen

Hugging Face lanzó SmolVLM2, un modelo de visión-lenguaje (IA que combina texto e imagen) optimizado para funcionar en móviles y ordenadores pequeños sin conexión. Puede analizar vídeo fotograma a fotograma, describir acciones y responder preguntas sobre secuencias grabadas, todo ejecutándose localmente sin enviar datos a servidores externos.

Compartir
Un modelo de IA que entiende vídeo y cabe en un móvil
Modelos de IA · Hugging Face Blog

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) acaba de publicar SmolVLM2, un modelo de visión-lenguaje (un tipo de IA que combina la capacidad de entender texto e imágenes) diseñado específicamente para ejecutarse en dispositivos locales sin necesidad de enviar datos a la nube. A diferencia de los grandes modelos multimodales (sistemas de IA que procesan varios tipos de información, como texto, imagen o vídeo) que solo funcionan en servidores potentes, SmolVLM2 está optimizado para correr en móviles, ordenadores de escritorio convencionales y hasta en placas pequeñas como la Raspberry Pi 5.

La principal novedad de esta segunda versión es la capacidad de procesar vídeo fotograma a fotograma, algo que hasta ahora exigía hardware especializado. El modelo, con apenas 2.000 millones de parámetros (los números que ajusta una IA durante su entrenamiento para aprender a resolver tareas), puede analizar secuencias de vídeo y responder preguntas sobre lo que ocurre en ellas. Por ejemplo, puede describir acciones en un vídeo de vigilancia, identificar productos en un anuncio o resumir el contenido de una clase grabada.

Según los datos que publica Hugging Face, SmolVLM2 supera en varios tests de referencia (conjuntos de pruebas estándar que se usan para comparar modelos de IA) a su predecesor y a otros modelos ligeros del mismo tamaño, incluido el Llama 3.2 de Meta. El equipo ha entrenado el modelo con una mezcla de conjuntos de datos públicos de imagen y vídeo, utilizando técnicas de aumento sintético (generar ejemplos de entrenamiento artificiales a partir de datos existentes) para mejorar su capacidad de razonamiento visual.

El modelo está disponible en varias versiones: una base sin ajustes adicionales (útil para desarrolladores que quieran adaptarlo a usos específicos), una versión de instrucciones (entrenada para seguir órdenes en lenguaje natural) y otra optimizada para dispositivos móviles que pesa menos de 1 GB. Todas se publican con licencia Apache 2.0, lo que permite usarlas libremente incluso en productos comerciales.

La herramienta ya funciona en iPhone 15 Pro y en ordenadores con chips Snapdragon (procesadores de Qualcomm, la empresa que fabrica la mayoría de componentes para móviles Android), y el equipo de Hugging Face está trabajando en demos para navegador que permitan probarla sin instalar nada. La apuesta de fondo es clara: llevar capacidades de IA visual avanzadas a cualquier dispositivo, sin depender de conexiones rápidas ni de enviar información sensible fuera del aparato.

Fuente original
Hugging Face Blog
Más en · Modelos de IA