En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

PaddleOCR ya funciona con Transformers y permite procesar documentos sin instalar dependencias complejas

La popular herramienta de reconocimiento de texto ahora se integra con la biblioteca de Hugging Face, facilitando su uso en proyectos de IA

Por Redacción2 min
Compartir
PaddleOCR ya funciona con Transformers y permite procesar documentos sin instalar dependencias complejas
Herramientas · Hugging Face Blog

PaddleOCR (una herramienta gratuita y de código abierto que extrae texto de imágenes y documentos) acaba de lanzar su versión 3.5 con una novedad importante: ahora funciona como parte de Transformers, la biblioteca de Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). Según informó Hugging Face en su blog oficial, este cambio permite a cualquier persona usar modelos de OCR (reconocimiento óptico de caracteres, la tecnología que convierte imágenes de texto en texto editable) sin tener que instalar PaddlePaddle (el framework de aprendizaje profundo original de PaddleOCR, desarrollado por Baidu).

La integración elimina una barrera técnica importante. Hasta ahora, quien quisiera usar PaddleOCR en un proyecto debía instalar tanto PaddlePaddle como sus dependencias específicas, lo que complicaba el proceso especialmente en entornos de producción o en sistemas con recursos limitados. Con la nueva versión, basta con tener instalado Transformers —que ya usan millones de desarrolladores— para acceder a los modelos de detección y reconocimiento de texto de PaddleOCR.

La herramienta soporta más de 80 idiomas, incluidos español, catalán y gallego, y puede procesar tanto texto impreso como manuscrito. Los modelos están disponibles en diferentes tamaños: desde versiones ligeras pensadas para ejecutarse en dispositivos móviles o en edge computing (procesamiento que se hace en el propio dispositivo, sin enviar datos a la nube) hasta versiones más precisas para servidores. Todos los modelos tienen pesos abiertos (es decir, se pueden descargar, modificar y usar sin restricciones de licencia).

PaddleOCR 3.5 también incluye mejoras en la arquitectura de sus modelos de detección de texto, que ahora usan bloques de atención más eficientes. Esto reduce el tiempo de procesamiento sin sacrificar precisión, según las pruebas publicadas por el equipo. La herramienta es especialmente útil en tareas de análisis documental: desde digitalizar facturas y extractos bancarios hasta extraer información de formularios administrativos o menús de restaurantes.

Para la comunidad de desarrolladores hispanohablantes, esta integración simplifica proyectos que requieren OCR multilingüe: chatbots que procesan documentos escaneados, sistemas de archivo digital o aplicaciones de accesibilidad que convierten imágenes en texto para lectores de pantalla. Los modelos están disponibles desde hoy en el Hub de Hugging Face, y la documentación incluye ejemplos de código en Python para empezar a usarlos en minutos.

Fuente original
Hugging Face Blog
Más en · Herramientas