Guide pratique Docly

Comment OCR un PDF numérisé

Un PDF provenant d'un scanner ne contient généralement que des images de page : vous ne pouvez pas le rechercher ni le copier. L'OCR reconnaît les caractères et ajoute une couche de texte invisible derrière la page, ce qui transforme une numérisation en un document utilisable.

Lecture de 6 minutesMis à jour le 26 juillet 2026Docly

Étapes pour OCR un PDF

Ajoutez le fichier, sélectionnez la langue principale du document et lancez le traitement. Si le document mélange deux langues, l’option combinée est plus sûre ; pour les documents monolingues, le choix de cette langue améliore la précision.

Le moyen le plus rapide de confirmer le résultat est de rechercher dans un lecteur PDF un mot que vous pouvez voir sur la page. S'il est trouvé, le calque de texte existe. La page elle-même semble inchangée, car le texte reconnu est invisible derrière l'image.

Qu'est-ce qui détermine la précision de l'OCR

La qualité de la numérisation compte plus que le logiciel. Une page droite, capturée avec une résolution suffisante et éclairée uniformément sans ombres surpassera toujours un meilleur outil alimenté par une mauvaise image. Aucun paramètre ne sauve une analyse à très basse résolution.

Choisir la bonne langue du document a un effet direct, puisque les caractères spécifiques à la langue sont les premiers à être mal lus sous le mauvais modèle. Pour les documents photographiés avec un téléphone, la correction de la perspective et le nettoyage de la page avant l'OCR donnent des résultats nettement meilleurs que la reconnaissance sur la photo brute.

Examiner le résultat

L'OCR est une commodité, pas une certification. Comparez les noms, les dates, les montants, les numéros de compte et les numéros d'identification avec l'image de la page. Les confusions habituelles sont prévisibles : zéro et O majuscule, un et l minuscule, cinq et S, huit et B.

Pour les documents remplis de chiffres, recalculer un total et le comparer avec le total imprimé est bien plus rapide que de lire cellule par cellule. Pour les analyses de mauvaise qualité, aucun paramètre ne remplace l’examen humain.

Ce que l'OCR débloque

Une fois qu'un calque de texte existe, le document cesse d'être simplement consultable et devient utilisable comme entrée pour d'autres outils. La conversion vers Word ou Excel, la traduction dans une autre langue, la comparaison de deux versions et la rédaction de texte nécessitent toutes un calque de texte pour fonctionner.

Pour les numérisations destinées à une archive, l'exécution d'OCR puis la conversion en PDF/A laisse une copie qui s'ouvre encore des années plus tard et peut toujours être recherchée, ce qui est considérablement plus précieux que le stockage seul des images de page.

Liste de contrôle rapide

  • Capturez des pages droites, uniformément éclairées et avec une résolution suffisante.
  • Choisissez la langue correcte du document.
  • Vérifiez manuellement les numéros et noms importants.
  • Pour les archives, exécutez d'abord l'OCR, puis convertissez-les en PDF/A.

Outils de ce guide

Questions fréquentes

À quoi sert l'OCR ?

Il transforme l'écriture à l'intérieur d'une image en texte consultable et sélectionnable.

L'OCR peut-elle lire l'écriture manuscrite ?

L'OCR est plus fiable pour le texte imprimé ; les résultats d’écriture manuscrite dépendent de la qualité du script et de l’image.

Guides associés

Voir tous les guides