Guía práctica de Docly
Cómo realizar OCR en un PDF escaneado
Un PDF de un escáner generalmente no contiene más que imágenes de páginas: no puedes buscarlo ni copiarlo. OCR reconoce los caracteres y agrega una capa de texto invisible detrás de la página, que es lo que convierte un escaneo en un documento utilizable.
Pasos para realizar OCR en un PDF
Agregue el archivo, seleccione el idioma principal del documento y comience a procesar. Si el documento mezcla dos idiomas, la opción combinada es más segura; Para documentos en un solo idioma, elegir ese idioma mejora la precisión.
La forma más rápida de confirmar el resultado obtenido es buscar en un lector de PDF una palabra que puedas ver en la página. Si se encuentra, la capa de texto existe. La página en sí parece no haber cambiado, porque el texto reconocido se encuentra de forma invisible detrás de la imagen.
¿Qué determina la precisión del OCR?
La calidad del escaneo importa más que el software. Una página recta, capturada con una resolución suficiente e iluminada uniformemente sin sombras siempre superará a una herramienta mejor alimentada con una imagen deficiente. Ninguna configuración rescata un escaneo de muy baja resolución.
Elegir el idioma correcto del documento tiene un efecto directo, ya que los caracteres específicos del idioma son los primeros que se leen mal bajo el modelo incorrecto. Para documentos fotografiados con un teléfono, corregir la perspectiva y limpiar la página antes del OCR da resultados notablemente mejores que ejecutar el reconocimiento en la foto sin editar.
Revisar el resultado
El OCR es una comodidad, no una certificación. Compare nombres, fechas, montos, números de cuenta y números de identificación con la imagen de la página. Las confusiones habituales son predecibles: cero y O mayúscula, uno y l minúscula, cinco y S, ocho y B.
Para documentos llenos de cifras, volver a calcular un total y compararlo con el total impreso es mucho más rápido que leer celda por celda. Para escaneos de baja calidad, no existe ninguna configuración que reemplace la revisión humana.
Qué desbloquea el OCR
Una vez que existe una capa de texto, el documento deja de ser simplemente buscable y se vuelve utilizable como entrada para otras herramientas. Convertir a Word o Excel, traducir a otro idioma, comparar dos versiones y redactar texto requieren una capa de texto para funcionar.
Para escaneos destinados a un archivo, ejecutar OCR y luego convertir a PDF/A deja una copia que aún se abre años después y aún se puede buscar, lo cual es considerablemente más valioso que almacenar únicamente imágenes de páginas.
Lista de comprobación rápida
- ✓Capture páginas rectas, iluminadas uniformemente y con suficiente resolución.
- ✓Elija el idioma correcto del documento.
- ✓Verifica manualmente números y nombres importantes.
- ✓Para archivos, ejecute OCR primero y luego convierta a PDF/A.
Herramientas de esta guía
Preguntas frecuentes
¿Qué hace el OCR?
Convierte la escritura dentro de una imagen en texto que se puede buscar y seleccionar.
¿Puede el OCR leer escritura a mano?
El OCR es más confiable para texto impreso; Los resultados de la escritura a mano dependen del guión y de la calidad de la imagen.