En directo
[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia[Herramientas]Un hospital infantil de Filadelfia usa IA de código abierto para modelar corazones de niños en segundos[Modelos de IA]Jensen Huang: «Ahora podemos saberlo todo y hacerlo todo» gracias a la inteligencia artificial[Herramientas]Nvidia convierte sus centros de IA en centrales eléctricas flexibles que se adaptan a la red[Herramientas]Perplexity lleva sus agentes de IA a Windows para trabajar sin conexión[Negocios]Bruselas reunirá a 900 empresas y gobiernos para acelerar el uso de IA en sanidad, movilidad y administración pública[Investigación]Un robot aprende tareas nuevas viendo un solo vídeo, sin volver a entrenarse[Modelos de IA]IBM y Confluent lanzan modelos de series temporales para analizar datos en tiempo real[Investigación]Los tests de IA miden sobre todo cuántos datos ha visto el modelo, no su inteligencia[Herramientas]Cómo usar los modelos de DeepSeek en la nube de Amazon sin pagar de más[Herramientas]Hugging Face abre su plataforma a proveedores externos de inferencia
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

HerramientasHugging Face Blog2 min

Cómo convertir un modelo de IA en un lector de texto ultrarrápido y preciso

Un equipo de desarrolladores ha adaptado olmOCR, un modelo de inteligencia artificial que reconoce texto en imágenes, para que funcione sin conexión a internet y sea mucho más fiel al contenido original.

Por Redacción2 min
En resumen

TNG Technology Consulting ha adaptado olmOCR, un modelo de IA que reconoce texto en imágenes, para que funcione sin internet y reproduzca el contenido exactamente como aparece. Aplicaron fine-tuning (reentrenamiento con datos específicos) para evitar que el modelo invente o corrija texto, logrando más del 95% de precisión incluso en documentos degradados.

Compartir
Cómo convertir un modelo de IA en un lector de texto ultrarrápido y preciso
Herramientas · Hugging Face Blog

Reconocer texto en imágenes escaneadas o fotografías es una tarea aparentemente sencilla que esconde una enorme complejidad técnica. Los sistemas de OCR (Optical Character Recognition, el software que convierte imágenes de texto en texto editable) tradicionales funcionan bien con documentos limpios, pero suelen fallar con textos históricos, manuscritos o imágenes de baja calidad. olmOCR es un modelo de IA desarrollado por Allen Institute que aborda este problema usando técnicas de aprendizaje profundo (deep learning, algoritmos que aprenden patrones a partir de enormes cantidades de ejemplos), pero hasta ahora requería enviar las imágenes a servidores remotos para procesarlas.

TNG Technology Consulting, una consultora tecnológica alemana, ha publicado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) una versión adaptada de olmOCR que funciona completamente sin conexión a internet. El equipo aplicó una técnica llamada fine-tuning (reentrenamiento de un modelo ya existente con datos específicos para mejorar su rendimiento en una tarea concreta) usando un conjunto de datos propio que incluía documentos históricos, facturas y formularios complejos. El objetivo era conseguir que el modelo reprodujera el texto exactamente como aparece en la imagen, sin añadir ni cambiar nada.

El principal reto técnico fue evitar que el modelo "alucinara" contenido, un problema común en modelos de lenguaje grandes o LLMs (Large Language Models, sistemas de IA entrenados con cantidades masivas de texto que pueden generar respuestas coherentes pero a veces inventadas). Los modelos de IA tienden a autocorregir errores ortográficos o completar palabras cortadas, algo útil en algunos contextos pero desastroso cuando necesitas preservar exactamente lo que dice un documento legal o histórico. Para solucionarlo, el equipo ajustó los hiperparámetros (valores que controlan cómo aprende el modelo durante el entrenamiento) y diseñó un conjunto de datos de entrenamiento que penalizaba cualquier desviación del texto original.

La versión resultante puede ejecutarse en hardware modesto, incluyendo dispositivos como el Jetson Nano (un ordenador pequeño y barato diseñado para ejecutar modelos de IA sin depender de internet), lo que abre la puerta a aplicaciones donde la privacidad es crítica o la conexión a internet no está garantizada. Según los desarrolladores, el modelo mantiene una precisión superior al 95% incluso con documentos degradados, y procesa páginas completas en segundos en lugar de minutos. El código y el modelo están disponibles bajo licencias de pesos abiertos (modelos cuyos parámetros y arquitectura se pueden descargar y modificar libremente), lo que permite a cualquier equipo adaptarlo a sus propias necesidades sin depender de servicios comerciales.

Fuente original
Hugging Face Blog
Más en · Herramientas