Ao vivo
[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas[Pesquisa]Como o Ai2 resolveu a briga por GPUs com orçamentos em vez de fila de prioridade[Ferramentas]Como criar modelos de IA personalizados por menos de US$ 20 usando um agente automatizado[Modelos de IA]Liquid AI lança modelos de IA que tomam decisões em milissegundos — e funcionam em celulares[Modelos de IA]TII lança Falcon ASR, modelo de transcrição de áudio aberto que roda em hardware comum[Modelos de IA]Nvidia mostra que um único modelo de IA pode chegar ao pódio tanto em programação quanto em matemática avançada[Modelos de IA]Falcon-Emirati: o modelo de IA que aprendeu a falar árabe como um emiradense de verdade[Ferramentas]Hugging Face cria repositório central para ambientes de IA que aprendem por tentativa e erro[Ferramentas]O agente de IA disse que terminou. O banco de dados discordou.[Modelos de IA]Instituto Allen lança modelo de IA aberto para escrever relatórios científicos em segundos[Pesquisa]Como a ServiceNow cria dados de treino que ensinam agentes de IA a funcionar dentro de empresas
Transmitindo · —

Notícias.
Inteligência Artificial

Inteligência Artificial para Gente de Verdade · ES / PT-BR

FerramentasHugging Face Blog2 min

PaddleOCR agora roda direto no Transformers e facilita leitura automática de documentos

Biblioteca chinesa de OCR — tecnologia que transforma imagens de texto em texto editável — acaba de ganhar integração nativa com a plataforma mais usada para rodar modelos de inteligência artificial.

Por Redação2 min
Compartilhar
PaddleOCR agora roda direto no Transformers e facilita leitura automática de documentos
Ferramentas · Hugging Face Blog

O PaddleOCR (uma biblioteca open-source criada pela gigante chinesa Baidu para reconhecer e extrair texto de imagens e PDFs) acaba de lançar sua versão 3.5 com uma novidade importante: agora funciona diretamente dentro do Transformers, segundo informou a Hugging Face (a plataforma onde desenvolvedores compartilham e baixam modelos de IA já treinados). Na prática, isso significa que milhões de pessoas que já usam o Transformers para rodar modelos de linguagem ou visão computacional podem adicionar OCR (Optical Character Recognition, a tecnologia que "lê" texto em fotos, PDFs digitalizados ou capturas de tela) aos seus projetos com apenas três linhas de código.

Antes, quem quisesse usar PaddleOCR precisava instalar a biblioteca separadamente, lidar com dependências complicadas e escrever código customizado para integrar com outros modelos. Agora, basta chamar o modelo como qualquer outro pipeline do Transformers — o mesmo jeito que você rodaria um modelo de tradução ou análise de sentimento. A ferramenta reconhece texto em mais de 80 idiomas, incluindo português, chinês, árabe e alfabetos complexos como hindi ou tailandês, e consegue processar tanto documentos estruturados (como faturas ou formulários) quanto imagens bagunçadas (placas de rua, fotos de cadernos manuscritos).

A integração traz dois benefícios práticos. Primeiro, desenvolvedores que já trabalham no ecossistema Hugging Face não precisam mais sair dele para adicionar capacidades de leitura de documentos — tudo vive no mesmo ambiente, usando a mesma API (interface de programação, a "linguagem" que diferentes softwares usam para conversar entre si). Segundo, o PaddleOCR agora herda automaticamente funcionalidades do Transformers, como otimização para rodar em GPUs (chips especializados em processar muitos cálculos ao mesmo tempo, essenciais para IA) ou exportação para formatos mais leves que funcionam em celulares.

O timing faz sentido: aplicações de IA que lidam com documentos do mundo real — de assistentes que leem contratos a apps que digitalizam recibos — explodiram nos últimos dois anos, impulsionadas por modelos multimodais (que entendem tanto texto quanto imagem) como o GPT-4V ou o Gemini. Mas esses modelos gigantes costumam ser caros e lentos. O PaddleOCR oferece uma alternativa: é pequeno o suficiente para rodar em um laptop comum, gratuito, e agora muito mais fácil de conectar com o resto do pipeline de IA. Para quem trabalha com automação de processos ou precisa extrair dados de pilhas de documentos, isso pode economizar semanas de trabalho de integração.

Fonte original
Hugging Face Blog
Mais em · Ferramentas