IBM lança modelo de IA compacto que lê documentos empresariais e cabe num computador comum
O Granite 4.0 3B Vision processa textos, tabelas e gráficos sem precisar de servidor — e tem código aberto.

A IBM lançou o Granite 4.0 3B Vision, um modelo de inteligência artificial multimodal (capaz de processar tanto texto quanto imagens) pequeno o suficiente para rodar em hardware comum, sem depender da nuvem. Segundo informou a empresa no blog da Hugging Face (uma plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados), o modelo foi desenhado especificamente para lidar com documentos corporativos — contratos, relatórios financeiros, apresentações — que misturam texto, tabelas e gráficos numa mesma página.
Com apenas 3 bilhões de parâmetros (os valores numéricos que definem o comportamento de um modelo de IA), o Granite 4.0 3B Vision é muito menor do que gigantes como o GPT-4 ou o Gemini, mas entrega desempenho competitivo em tarefas específicas de leitura e interpretação de documentos. A IBM afirma que ele supera modelos similares em testes de compreensão de tabelas e extração de informações de PDFs complexos, áreas onde muitos modelos maiores ainda tropeçam.
O diferencial está na arquitetura: o modelo usa um encoder de visão (a parte que processa imagens) de 2 bilhões de parâmetros treinado especificamente para reconhecer a estrutura de documentos — não fotos genéricas. Isso significa que ele entende melhor onde começa uma linha de tabela, como uma nota de rodapé se relaciona com o texto principal, ou onde está a legenda de um gráfico. Toda a base de código e os pesos do modelo (os valores que determinam suas respostas) estão disponíveis sob licença Apache 2.0, permitindo uso comercial sem restrições.
Por rodar localmente, o Granite 4.0 3B Vision resolve um problema prático para empresas que lidam com dados sensíveis: nada precisa sair do computador ou da rede interna. A IBM sugere aplicações como automação de análise de contratos, auditoria de relatórios financeiros e chatbots internos que respondem perguntas sobre manuais técnicos. O modelo está disponível para download na Hugging Face e pode ser ajustado (fine-tuning, o processo de retreinar um modelo com dados específicos) para casos de uso particulares com conjuntos de dados proprietários.


