En directo
[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA[Investigación]Cómo dar prioridad a la investigación más valiosa sin dejar GPUs sin usar[Herramientas]Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern[Modelos de IA]Liquid AI lanza dos modelos de IA que toman decisiones en 16 milisegundos[Investigación]Nvidia logra medalla de oro en dos olimpiadas científicas con el mismo modelo de IA[Modelos de IA]Un modelo de IA que habla árabe emiratí como un local[Herramientas]Hugging Face convierte su plataforma en un catálogo unificado de entornos para entrenar agentes de IA[Herramientas]Un benchmark de Microsoft exige que los agentes de IA funcionen bien veinte veces seguidas[Modelos de IA]Allen AI publica AstaBrief, un modelo abierto que redacta informes científicos con citas en un minuto[Investigación]ServiceNow crea un sistema que genera automáticamente tareas para entrenar agentes de IA empresariales[Investigación]Allen Institute publica Olmo-core 3, su infraestructura abierta para entrenar modelos gigantes de IA
Transmitiendo · —

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

Un modelo de IA capaz de leer texto en 50 idiomas ya está disponible gratis

PaddlePaddle lanza PP-OCRv6, un sistema de reconocimiento óptico de caracteres que funciona desde dispositivos móviles hasta servidores y ya está en Hugging Face.

Por Redacción2 min
Compartir
Un modelo de IA capaz de leer texto en 50 idiomas ya está disponible gratis
Modelos de IA · Hugging Face Blog

PaddlePaddle (el framework de inteligencia artificial desarrollado por Baidu, el gigante tecnológico chino) acaba de publicar PP-OCRv6 en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). Se trata de un sistema de reconocimiento óptico de caracteres, o OCR (la tecnología que permite a las máquinas leer texto en imágenes), capaz de procesar documentos en 50 idiomas distintos, desde chino y árabe hasta español o ruso.

Lo interesante de PP-OCRv6 es su flexibilidad: el equipo ha publicado cuatro versiones del mismo modelo, con tamaños que van desde 1,5 millones de parámetros (los valores ajustables que un modelo de IA usa para hacer predicciones) hasta 34,5 millones. La versión más pequeña está pensada para funcionar en dispositivos móviles o en hardware sin acceso a GPUs potentes (chips especializados en acelerar cálculos de IA), mientras que las versiones más grandes ofrecen mayor precisión en servidores o equipos más capaces. Todas están disponibles con licencia Apache 2.0, lo que significa que cualquiera puede usarlas, modificarlas o integrarlas en productos comerciales sin pagar.

Según informó el equipo de PaddlePaddle en su blog oficial, PP-OCRv6 mejora la precisión en escenarios complicados: documentos escaneados con mala calidad, texto en ángulos raros, fondos con ruido visual o idiomas con alfabetos complejos. El modelo combina tres etapas: primero detecta dónde hay texto en la imagen, luego identifica la orientación de cada bloque y finalmente lo reconoce carácter por carácter. Todo esto ocurre de forma local, sin necesidad de enviar datos a la nube.

Para facilitar su uso, PaddlePaddle ha publicado también un pipeline (una herramienta que encadena automáticamente los pasos necesarios para procesar una imagen) integrado directamente en Hugging Face. Esto permite que cualquier desarrollador pueda usar el modelo con apenas unas pocas líneas de código en Python, sin necesidad de configurar manualmente cada componente. La documentación incluye ejemplos de uso tanto para inferencia (ejecutar el modelo sobre nuevas imágenes) como para fine-tuning (reentrenar el modelo con datos propios para adaptarlo a casos específicos).

La llegada de PP-OCRv6 a Hugging Face refuerza una tendencia clave en la IA actual: la disponibilidad de modelos especializados, ligeros y listos para usar, que democratizan capacidades que antes requerían equipos de ingeniería y presupuestos considerables. Para desarrolladores que trabajan en aplicaciones de digitalización de documentos, accesibilidad o traducción automática, contar con un OCR multilingüe de calidad y sin coste de licencia representa una ventaja competitiva real.

Fuente original
Hugging Face Blog
Más en · Modelos de IA