Como a TNG Technology treinou um modelo de OCR que mantém a formatação original dos documentos
A empresa alemã ajustou o olmOCR, um modelo de IA de código aberto, para extrair texto de documentos preservando títulos, listas e parágrafos exatamente como aparecem na página — sem misturar tudo numa linha só.
A TNG Technology ajustou o olmOCR, um modelo de IA de código aberto baseado no Idefics3 (modelo multimodal da Hugging Face), para reconhecer texto em documentos mantendo a formatação original — títulos, parágrafos, listas e espaçamentos — em vez de devolver tudo como um bloco contínuo. O modelo alcançou taxa de erro de 0,44% e está disponível gratuitamente.

A TNG Technology (uma consultoria de tecnologia alemã) publicou um guia detalhado sobre como treinou o olmOCR, um modelo de visão e linguagem de código aberto, para reconhecer texto em documentos mantendo a formatação original intacta. A diferença principal em relação a ferramentas tradicionais de OCR (sigla em inglês para reconhecimento óptico de caracteres, a tecnologia que transforma imagens de texto em texto editável) é que o olmOCR preserva títulos, parágrafos, listas e até espaçamentos — em vez de devolver tudo como um bloco contínuo de palavras.
O projeto partiu do Idefics3 (um modelo multimodal da Hugging Face, plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados, capaz de processar simultaneamente imagens e texto), ajustado especificamente para a tarefa de OCR. A equipe da TNG usou uma técnica chamada fine-tuning (ajuste fino, processo em que se treina um modelo já existente com dados específicos para melhorar seu desempenho numa tarefa particular) com dois conjuntos de dados: o IMGUR5K, que contém milhares de imagens de texto capturadas na internet, e o RenderedText, criado pela própria TNG renderizando páginas web como imagens.
O treinamento foi feito em GPUs NVIDIA L40S (chips gráficos potentes voltados para processamento de IA) com o framework Axolotl (uma ferramenta que simplifica o ajuste fino de modelos de linguagem). A TNG testou diferentes estratégias de quantização (técnica que reduz o tamanho do modelo comprimindo os números que ele usa internamente, permitindo rodar IA em hardware mais barato sem perder muita qualidade) e LoRA (Low-Rank Adaptation, método que ajusta apenas uma pequena parte dos parâmetros do modelo, economizando memória e tempo de treinamento).
Segundo os testes publicados pela empresa, o olmOCR ajustado alcançou uma taxa de erro de caracteres (CER, métrica que mede quantos caracteres o modelo erra ao transcrever texto) de 0,44% no conjunto IMGUR5K — um resultado competitivo com ferramentas comerciais como Google Vision e Microsoft Azure OCR, mas com a vantagem de ser totalmente aberto e personalizável. O modelo e os dados de treinamento estão disponíveis gratuitamente na Hugging Face para quem quiser reproduzir ou adaptar o trabalho.
A TNG destaca que o olmOCR é especialmente útil para quem precisa processar documentos técnicos, formulários ou páginas com estrutura complexa — casos em que perder a formatação original pode tornar o texto ilegível ou confuso. Por ser de código aberto, empresas e pesquisadores podem rodar o modelo nos próprios servidores, sem enviar documentos sensíveis para APIs de terceiros.


