Praktischer Docly-Leitfaden

Wie man ein gescanntes PDF mit OCR erkennt

Ein PDF von einem Scanner enthält normalerweise nur Seitenbilder: Sie können es nicht durchsuchen und nicht daraus kopieren. OCR erkennt die Zeichen und fügt eine unsichtbare Textebene hinter der Seite hinzu, wodurch aus einem Scan ein verwendbares Dokument wird.

6 Minuten LesezeitAktualisiert am 26. Juli 2026Docly

Schritte zum OCR einer PDF

Fügen Sie die Datei hinzu, wählen Sie die Hauptsprache des Dokuments aus und beginnen Sie mit der Verarbeitung. Wenn das Dokument zwei Sprachen mischt, ist die kombinierte Option sicherer; Bei einsprachigen Dokumenten erhöht die Auswahl dieser Sprache die Genauigkeit.

Der schnellste Weg, das Ergebnis zu bestätigen, besteht darin, einen PDF-Reader nach einem Wort zu durchsuchen, das Sie auf der Seite sehen können. Wenn es gefunden wird, ist die Textebene vorhanden. Die Seite selbst sieht unverändert aus, da der erkannte Text unsichtbar hinter dem Bild sitzt.

Was bestimmt die OCR-Genauigkeit?

Die Scanqualität ist wichtiger als die Software. Eine Seite, die gerade ist, mit ausreichender Auflösung aufgenommen und gleichmäßig ohne Schatten ausgeleuchtet ist, übertrifft immer ein besseres Werkzeug mit einem schlechten Bild. Keine Einstellung rettet einen Scan mit sehr niedriger Auflösung.

Die Wahl der richtigen Dokumentsprache hat direkte Auswirkungen, da sprachspezifische Zeichen unter dem falschen Modell als erste falsch gelesen werden. Bei Dokumenten, die mit einem Telefon fotografiert wurden, führt die Korrektur der Perspektive und das Bereinigen der Seite vor der OCR zu deutlich besseren Ergebnissen als die Durchführung der Erkennung des Rohfotos.

Überprüfen Sie die Ausgabe

OCR ist eine Annehmlichkeit, keine Zertifizierung. Vergleichen Sie Namen, Daten, Beträge, Kontonummern und Identifikationsnummern mit dem Seitenbild. Die üblichen Verwechslungen sind vorhersehbar: Null und großes O, Eins und kleines l, fünf und S, Acht und B.

Bei Dokumenten voller Zahlen ist die Neuberechnung einer Summe und der Vergleich mit der gedruckten Summe viel schneller als das Lesen Zelle für Zelle. Für Scans mit geringer Qualität gibt es keine Einstellung, die die menschliche Überprüfung ersetzt.

Was OCR freischaltet

Sobald eine Textebene vorhanden ist, ist das Dokument nicht mehr nur durchsuchbar, sondern kann als Eingabe für andere Tools verwendet werden. Um in Word oder Excel zu konvertieren, in eine andere Sprache zu übersetzen, zwei Versionen zu vergleichen und Text zu redigieren, ist eine Textebene erforderlich, um überhaupt zu funktionieren.

Bei Scans, die für ein Archiv bestimmt sind, hinterlässt die Ausführung von OCR und die anschließende Konvertierung in PDF/A eine Kopie, die auch Jahre später noch geöffnet und durchsucht werden kann, was erheblich wertvoller ist als das alleinige Speichern von Seitenbildern.

Schnelle Checkliste

  • Erfassen Sie Seiten gerade, gleichmäßig beleuchtet und mit ausreichender Auflösung.
  • Wählen Sie die richtige Dokumentsprache.
  • Überprüfen Sie wichtige Nummern und Namen manuell.
  • Führen Sie für Archive zuerst OCR aus und konvertieren Sie sie dann in PDF/A.

Tools in diesem Leitfaden

Häufig gestellte Fragen

Was macht OCR?

Es verwandelt Schrift in einem Bild in durchsuchbaren und auswählbaren Text.

Kann OCR Handschrift lesen?

OCR ist für gedruckten Text zuverlässiger; Die handschriftlichen Ergebnisse hängen von der Schrift und der Bildqualität ab.

Verwandte Leitfäden

Alle Leitfäden anzeigen