En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

IBM lanza un modelo de IA visual tan pequeño que cabe en un móvil

Granite 4.0 3B Vision puede leer documentos complejos, hacer OCR y responder preguntas sobre imágenes sin depender de servidores en la nube.

Por Redacción2 min
Compartir
IBM lanza un modelo de IA visual tan pequeño que cabe en un móvil
Modelos de IA · Hugging Face Blog

IBM acaba de publicar Granite 4.0 3B Vision, un modelo de inteligencia artificial multimodal (es decir, que entiende tanto texto como imágenes) lo suficientemente ligero como para funcionar en un teléfono móvil o un ordenador portátil sin necesidad de conexión a internet. Según informó Hugging Face en su blog oficial, el modelo pesa solo 3.000 millones de parámetros (los valores numéricos que determinan el comportamiento de un modelo de IA), lo que lo convierte en una alternativa compacta frente a gigantes como GPT-4 Vision o Claude, que requieren servidores potentes para ejecutarse.

La gran apuesta de IBM con este modelo es su capacidad para procesar documentos empresariales reales: facturas, contratos, formularios escaneados, gráficas o diagramas técnicos. Granite 4.0 3B Vision puede extraer texto de una imagen (lo que se conoce como OCR, reconocimiento óptico de caracteres), responder preguntas sobre su contenido o resumir información clave. A diferencia de modelos más grandes, este puede desplegarse dentro de la infraestructura de una empresa sin compartir datos sensibles con proveedores externos, algo crucial en sectores como banca, salud o administración pública.

IBM lo ha publicado con licencia Apache 2.0 (una licencia de código abierto que permite uso comercial sin restricciones) y está disponible en Hugging Face, la plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados. El modelo forma parte de la familia Granite, una serie de modelos de pesos abiertos (es decir, cuyos parámetros internos se pueden descargar y modificar libremente) que IBM diseñó específicamente para casos de uso empresarial, no para chatear de forma general como ChatGPT.

En los benchmarks oficiales (pruebas estandarizadas para medir el rendimiento de modelos de IA), Granite 4.0 3B Vision obtiene resultados comparables a modelos mucho más grandes en tareas como interpretación de gráficas o comprensión de documentos, aunque sigue por detrás de los gigantes del sector en razonamiento visual complejo. La ventaja no está en la potencia bruta, sino en que puede ejecutarse en local (sin internet) en dispositivos con recursos limitados: IBM menciona que funciona en GPUs de gama media (las tarjetas gráficas que aceleran cálculos de IA) e incluso en algunos chips de procesadores modernos sin GPU dedicada.

El lanzamiento llega en un momento en que varias empresas buscan alternativas a los modelos gigantes cerrados de OpenAI o Google, tanto por motivos de privacidad como de costes. Ejecutar un modelo pequeño en tus propios servidores puede salir mucho más barato que pagar por cada consulta a una API externa (la puerta de acceso que ofrecen empresas como OpenAI para usar sus modelos). Para sectores regulados o con requisitos estrictos de soberanía de datos, la diferencia puede ser determinante.

Fuente original
Hugging Face Blog
Más en · Modelos de IA