Guia prático da Docly
Como fazer OCR em um PDF digitalizado
Um PDF de um scanner geralmente contém apenas imagens de páginas: você não pode pesquisá-lo e não pode copiá-lo. OCR reconhece os caracteres e adiciona uma camada de texto invisível atrás da página, que transforma uma digitalização em um documento utilizável.
Etapas para fazer o OCR de um PDF
Adicione o arquivo, selecione o idioma principal do documento e inicie o processamento. Se o documento misturar dois idiomas, a opção combinada é mais segura; para documentos em um único idioma, a escolha desse idioma melhora a precisão.
A maneira mais rápida de confirmar se o resultado funcionou é pesquisar em um leitor de PDF uma palavra que você possa ver na página. Se for encontrado, a camada de texto existe. A página em si parece inalterada, porque o texto reconhecido fica invisível atrás da imagem.
O que determina a precisão do OCR
A qualidade da digitalização é mais importante do que o software. Uma página reta, capturada com resolução suficiente e iluminada uniformemente sem sombras sempre terá um desempenho melhor do que uma ferramenta melhor alimentada com uma imagem de baixa qualidade. Nenhuma configuração resgata uma varredura de resolução muito baixa.
A escolha do idioma correto do documento tem um efeito direto, uma vez que os caracteres específicos do idioma são os primeiros a serem mal interpretados no modelo errado. Para documentos fotografados com um telefone, corrigir a perspectiva e limpar a página antes do OCR oferece resultados visivelmente melhores do que executar o reconhecimento na foto bruta.
Revise o resultado
OCR é uma conveniência, não uma certificação. Compare nomes, datas, valores, números de contas e números de identificação com a imagem da página. As confusões usuais são previsíveis: zero e O maiúsculo, um e l minúsculo, cinco e S, oito e B.
Para documentos cheios de números, recalcular um total e compará-lo com o total impresso é muito mais rápido do que ler célula por célula. Para digitalizações de baixa qualidade, não há configuração que substitua a revisão humana.
O que o OCR desbloqueia
Uma vez existente uma camada de texto, o documento deixa de ser apenas pesquisável e passa a ser utilizável como entrada para outras ferramentas. Converter para Word ou Excel, traduzir para outro idioma, comparar duas versões e redigir texto, tudo isso requer uma camada de texto para funcionar.
Para digitalizações destinadas a um arquivo, executar o OCR e depois converter para PDF/A deixa uma cópia que ainda abre anos depois e ainda pode ser pesquisada, o que é consideravelmente mais valioso do que armazenar apenas imagens de páginas.
Lista de verificação rápida
- ✓Capture páginas retas, iluminadas uniformemente e com resolução suficiente.
- ✓Escolha o idioma correto do documento.
- ✓Verifique manualmente números e nomes importantes.
- ✓Para arquivos, execute primeiro o OCR e depois converta para PDF/A.
Ferramentas deste guia
Perguntas frequentes
O que o OCR faz?
Transforma a escrita dentro de uma imagem em texto pesquisável e selecionável.
O OCR consegue ler manuscritos?
OCR é mais confiável para texto impresso; os resultados da escrita à mão dependem do script e da qualidade da imagem.