Ao vivo
[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA[Modelos de IA]IBM e Confluent lançam modelos de IA para análise de séries temporais em tempo real[Pesquisa]Pesquisadores criam ferramenta que mostra o que os testes de IA medem de verdade[Ferramentas]Hugging Face integra dezenas de serviços de IA em uma única plataforma[Ferramentas]Hugging Face lança biblioteca com mais de 200 operações para rodar IA no navegador[Modelos de IA]Open-R1: a primeira cópia totalmente aberta do DeepSeek-R1[Pesquisa]AlphaFold completa cinco anos e já acelerou pesquisas em mais de 190 países[Modelos de IA]OpenAI apresenta GPT-Live, nova geração de vozes mais naturais para o ChatGPT[Regulação]Mercado paralelo vende acesso ao Claude na China por 10% do preço oficial[Pesquisa]Google DeepMind abre laboratório de pesquisa em Singapura[Pesquisa]Google DeepMind e governo dos EUA criam Genesis, projeto nacional para acelerar ciência com IA
Transmitindo ·

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Como a TNG Technology treinou um modelo de OCR que mantém a formatação original dos documentos

A empresa alemã ajustou o olmOCR, um modelo de IA de código aberto, para extrair texto de documentos preservando títulos, listas e parágrafos exatamente como aparecem na página — sem misturar tudo numa linha só.

Por Redação2 min
Em resumo

A TNG Technology ajustou o olmOCR, um modelo de IA de código aberto baseado no Idefics3 (modelo multimodal da Hugging Face), para reconhecer texto em documentos mantendo a formatação original — títulos, parágrafos, listas e espaçamentos — em vez de devolver tudo como um bloco contínuo. O modelo alcançou taxa de erro de 0,44% e está disponível gratuitamente.

Compartilhar
Como a TNG Technology treinou um modelo de OCR que mantém a formatação original dos documentos
Modelos de IA · Hugging Face Blog

A TNG Technology (uma consultoria de tecnologia alemã) publicou um guia detalhado sobre como treinou o olmOCR, um modelo de visão e linguagem de código aberto, para reconhecer texto em documentos mantendo a formatação original intacta. A diferença principal em relação a ferramentas tradicionais de OCR (sigla em inglês para reconhecimento óptico de caracteres, a tecnologia que transforma imagens de texto em texto editável) é que o olmOCR preserva títulos, parágrafos, listas e até espaçamentos — em vez de devolver tudo como um bloco contínuo de palavras.

O projeto partiu do Idefics3 (um modelo multimodal da Hugging Face, plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados, capaz de processar simultaneamente imagens e texto), ajustado especificamente para a tarefa de OCR. A equipe da TNG usou uma técnica chamada fine-tuning (ajuste fino, processo em que se treina um modelo já existente com dados específicos para melhorar seu desempenho numa tarefa particular) com dois conjuntos de dados: o IMGUR5K, que contém milhares de imagens de texto capturadas na internet, e o RenderedText, criado pela própria TNG renderizando páginas web como imagens.

O treinamento foi feito em GPUs NVIDIA L40S (chips gráficos potentes voltados para processamento de IA) com o framework Axolotl (uma ferramenta que simplifica o ajuste fino de modelos de linguagem). A TNG testou diferentes estratégias de quantização (técnica que reduz o tamanho do modelo comprimindo os números que ele usa internamente, permitindo rodar IA em hardware mais barato sem perder muita qualidade) e LoRA (Low-Rank Adaptation, método que ajusta apenas uma pequena parte dos parâmetros do modelo, economizando memória e tempo de treinamento).

Segundo os testes publicados pela empresa, o olmOCR ajustado alcançou uma taxa de erro de caracteres (CER, métrica que mede quantos caracteres o modelo erra ao transcrever texto) de 0,44% no conjunto IMGUR5K — um resultado competitivo com ferramentas comerciais como Google Vision e Microsoft Azure OCR, mas com a vantagem de ser totalmente aberto e personalizável. O modelo e os dados de treinamento estão disponíveis gratuitamente na Hugging Face para quem quiser reproduzir ou adaptar o trabalho.

A TNG destaca que o olmOCR é especialmente útil para quem precisa processar documentos técnicos, formulários ou páginas com estrutura complexa — casos em que perder a formatação original pode tornar o texto ilegível ou confuso. Por ser de código aberto, empresas e pesquisadores podem rodar o modelo nos próprios servidores, sem enviar documentos sensíveis para APIs de terceiros.

Fonte original
Hugging Face Blog
Mais em · Modelos de IA