Un modelo de IA capaz de leer texto en 50 idiomas ya está disponible gratis
PaddlePaddle lanza PP-OCRv6, un sistema de reconocimiento óptico de caracteres que funciona desde dispositivos móviles hasta servidores y ya está en Hugging Face.

PaddlePaddle (el framework de inteligencia artificial desarrollado por Baidu, el gigante tecnológico chino) acaba de publicar PP-OCRv6 en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). Se trata de un sistema de reconocimiento óptico de caracteres, o OCR (la tecnología que permite a las máquinas leer texto en imágenes), capaz de procesar documentos en 50 idiomas distintos, desde chino y árabe hasta español o ruso.
Lo interesante de PP-OCRv6 es su flexibilidad: el equipo ha publicado cuatro versiones del mismo modelo, con tamaños que van desde 1,5 millones de parámetros (los valores ajustables que un modelo de IA usa para hacer predicciones) hasta 34,5 millones. La versión más pequeña está pensada para funcionar en dispositivos móviles o en hardware sin acceso a GPUs potentes (chips especializados en acelerar cálculos de IA), mientras que las versiones más grandes ofrecen mayor precisión en servidores o equipos más capaces. Todas están disponibles con licencia Apache 2.0, lo que significa que cualquiera puede usarlas, modificarlas o integrarlas en productos comerciales sin pagar.
Según informó el equipo de PaddlePaddle en su blog oficial, PP-OCRv6 mejora la precisión en escenarios complicados: documentos escaneados con mala calidad, texto en ángulos raros, fondos con ruido visual o idiomas con alfabetos complejos. El modelo combina tres etapas: primero detecta dónde hay texto en la imagen, luego identifica la orientación de cada bloque y finalmente lo reconoce carácter por carácter. Todo esto ocurre de forma local, sin necesidad de enviar datos a la nube.
Para facilitar su uso, PaddlePaddle ha publicado también un pipeline (una herramienta que encadena automáticamente los pasos necesarios para procesar una imagen) integrado directamente en Hugging Face. Esto permite que cualquier desarrollador pueda usar el modelo con apenas unas pocas líneas de código en Python, sin necesidad de configurar manualmente cada componente. La documentación incluye ejemplos de uso tanto para inferencia (ejecutar el modelo sobre nuevas imágenes) como para fine-tuning (reentrenar el modelo con datos propios para adaptarlo a casos específicos).
La llegada de PP-OCRv6 a Hugging Face refuerza una tendencia clave en la IA actual: la disponibilidad de modelos especializados, ligeros y listos para usar, que democratizan capacidades que antes requerían equipos de ingeniería y presupuestos considerables. Para desarrolladores que trabajan en aplicaciones de digitalización de documentos, accesibilidad o traducción automática, contar con un OCR multilingüe de calidad y sin coste de licencia representa una ventaja competitiva real.


