IBM lanza un modelo de IA visual tan pequeño que cabe en un móvil
Granite 4.0 3B Vision puede leer documentos complejos, hacer OCR y responder preguntas sobre imágenes sin depender de servidores en la nube.

IBM acaba de publicar Granite 4.0 3B Vision, un modelo de inteligencia artificial multimodal (es decir, que entiende tanto texto como imágenes) lo suficientemente ligero como para funcionar en un teléfono móvil o un ordenador portátil sin necesidad de conexión a internet. Según informó Hugging Face en su blog oficial, el modelo pesa solo 3.000 millones de parámetros (los valores numéricos que determinan el comportamiento de un modelo de IA), lo que lo convierte en una alternativa compacta frente a gigantes como GPT-4 Vision o Claude, que requieren servidores potentes para ejecutarse.
La gran apuesta de IBM con este modelo es su capacidad para procesar documentos empresariales reales: facturas, contratos, formularios escaneados, gráficas o diagramas técnicos. Granite 4.0 3B Vision puede extraer texto de una imagen (lo que se conoce como OCR, reconocimiento óptico de caracteres), responder preguntas sobre su contenido o resumir información clave. A diferencia de modelos más grandes, este puede desplegarse dentro de la infraestructura de una empresa sin compartir datos sensibles con proveedores externos, algo crucial en sectores como banca, salud o administración pública.
IBM lo ha publicado con licencia Apache 2.0 (una licencia de código abierto que permite uso comercial sin restricciones) y está disponible en Hugging Face, la plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados. El modelo forma parte de la familia Granite, una serie de modelos de pesos abiertos (es decir, cuyos parámetros internos se pueden descargar y modificar libremente) que IBM diseñó específicamente para casos de uso empresarial, no para chatear de forma general como ChatGPT.
En los benchmarks oficiales (pruebas estandarizadas para medir el rendimiento de modelos de IA), Granite 4.0 3B Vision obtiene resultados comparables a modelos mucho más grandes en tareas como interpretación de gráficas o comprensión de documentos, aunque sigue por detrás de los gigantes del sector en razonamiento visual complejo. La ventaja no está en la potencia bruta, sino en que puede ejecutarse en local (sin internet) en dispositivos con recursos limitados: IBM menciona que funciona en GPUs de gama media (las tarjetas gráficas que aceleran cálculos de IA) e incluso en algunos chips de procesadores modernos sin GPU dedicada.
El lanzamiento llega en un momento en que varias empresas buscan alternativas a los modelos gigantes cerrados de OpenAI o Google, tanto por motivos de privacidad como de costes. Ejecutar un modelo pequeño en tus propios servidores puede salir mucho más barato que pagar por cada consulta a una API externa (la puerta de acceso que ofrecen empresas como OpenAI para usar sus modelos). Para sectores regulados o con requisitos estrictos de soberanía de datos, la diferencia puede ser determinante.


