PaddleOCR ya funciona con Transformers y permite procesar documentos sin instalar dependencias complejas
La popular herramienta de reconocimiento de texto ahora se integra con la biblioteca de Hugging Face, facilitando su uso en proyectos de IA

PaddleOCR (una herramienta gratuita y de código abierto que extrae texto de imágenes y documentos) acaba de lanzar su versión 3.5 con una novedad importante: ahora funciona como parte de Transformers, la biblioteca de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). Según informó Hugging Face en su blog oficial, este cambio permite a cualquier persona usar modelos de OCR (reconocimiento óptico de caracteres, la tecnología que convierte imágenes de texto en texto editable) sin tener que instalar PaddlePaddle (el framework de aprendizaje profundo original de PaddleOCR, desarrollado por Baidu).
La integración elimina una barrera técnica importante. Hasta ahora, quien quisiera usar PaddleOCR en un proyecto debía instalar tanto PaddlePaddle como sus dependencias específicas, lo que complicaba el proceso especialmente en entornos de producción o en sistemas con recursos limitados. Con la nueva versión, basta con tener instalado Transformers —que ya usan millones de desarrolladores— para acceder a los modelos de detección y reconocimiento de texto de PaddleOCR.
La herramienta soporta más de 80 idiomas, incluidos español, catalán y gallego, y puede procesar tanto texto impreso como manuscrito. Los modelos están disponibles en diferentes tamaños: desde versiones ligeras pensadas para ejecutarse en dispositivos móviles o en edge computing (procesamiento que se hace en el propio dispositivo, sin enviar datos a la nube) hasta versiones más precisas para servidores. Todos los modelos tienen pesos abiertos (es decir, se pueden descargar, modificar y usar sin restricciones de licencia).
PaddleOCR 3.5 también incluye mejoras en la arquitectura de sus modelos de detección de texto, que ahora usan bloques de atención más eficientes. Esto reduce el tiempo de procesamiento sin sacrificar precisión, según las pruebas publicadas por el equipo. La herramienta es especialmente útil en tareas de análisis documental: desde digitalizar facturas y extractos bancarios hasta extraer información de formularios administrativos o menús de restaurantes.
Para la comunidad de desarrolladores hispanohablantes, esta integración simplifica proyectos que requieren OCR multilingüe: chatbots que procesan documentos escaneados, sistemas de archivo digital o aplicaciones de accesibilidad que convierten imágenes en texto para lectores de pantalla. Los modelos están disponibles desde hoy en el Hub de Hugging Face, y la documentación incluye ejemplos de código en Python para empezar a usarlos en minutos.


