Startseite / Blog & Anleitungen / So machen Sie ein gescanntes PDF durchsuchbar
PDF-Arbeitsablauf

So machen Sie ein gescanntes PDF durchsuchbar

Machen Sie aus einem gescannten PDF eines, das Sie durchsuchen, markieren und kopieren können, ohne es hochzuladen und ohne sein Aussehen zu verändern.

Ein gescannter Vertrag, ein alter Bericht, mit dem Handy fotografiert, oder ein Stapel Rechnungen aus dem Kopierer: Sie sehen aus wie Dokumente, aber für den Computer ist jede Seite nur ein Bild. Sie können sie nicht durchsuchen, keinen Satz markieren und keine Zahl kopieren. PDF OCR erkennt den Text auf jeder Seite und fügt ihn als unsichtbare Ebene hinzu, sodass die Datei genau gleich aussieht, aber durchsuchbar wird.

OCR (optische Zeichenerkennung) arbeitet mit dem Bild jeder Seite, daher hängt ihre Genauigkeit vom Scan ab. Sie baut das Layout nicht zu einem bearbeitbaren Dokument um; dafür geben Sie das Ergebnis anschließend in PDF in Word.

Schritt für Schritt

  1. Öffnen Sie das Werkzeug PDF OCR oder klicken Sie auf der Startseite auf die Karte „PDF OCR“.
  2. Klicken Sie auf den Ablagebereich oder ziehen Sie Ihr gescanntes PDF hinein.
  3. Wählen Sie die „Dokumentsprache“. Voreingestellt ist die Sprache der Website, die Sie gerade nutzen.
  4. Klicken Sie auf „Jetzt verarbeiten“. Wenn Sie eine Sprache zum ersten Mal verwenden, lädt der Browser ein Erkennungsmodell von 2 bis 15 MB herunter und speichert es für das nächste Mal.
  5. Die Statuszeile zeigt, welche Seite gerade erkannt wird. Jede Seite dauert je nach Gerät einige Sekunden. Seiten, die bereits markierbaren Text haben, bleiben unverändert.
  6. Ihr Browser lädt das PDF mit dem Zusatz „-ocr“ im Dateinamen herunter. Öffnen Sie es und suchen Sie nach einem Wort, das Sie auf einer Seite sehen, um das Ergebnis zu prüfen.

Häufige Fehler

FAQ

Wird meine Datei zur Texterkennung hochgeladen?

Nein. Die Erkennung läuft in Ihrem Browser mit tesseract.js, der zu WebAssembly kompilierten OCR-Engine Tesseract. Heruntergeladen werden nur das Programm selbst und ein Sprachmodell, niemals Ihr Dokument.

Welche Sprachen werden erkannt?

Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Indonesisch, vereinfachtes Chinesisch, Japanisch und Arabisch. Wählen Sie vor dem Verarbeiten die Sprache des Dokuments; bei Chinesisch, Japanisch und Arabisch wird zusätzlich Englisch erkannt, sodass gemischte Wörter richtig herauskommen.

Kann ich den Text nach der OCR bearbeiten?

Das PDF behält sein ursprüngliches Aussehen, mit dem erkannten Text als unsichtbarer Ebene, die Sie markieren, durchsuchen und kopieren können. Um den Text zu bearbeiten, geben Sie das Ergebnis in PDF in Word, das diese Ebene in eine .docx-Datei extrahiert.

Warum sind manche Wörter falsch?

Die Genauigkeit der OCR hängt vom Scan ab. Unscharfe, schiefe oder niedrig aufgelöste Seiten, Handschrift und dekorative Schriften führen zu mehr Fehlern. Die besten Ergebnisse erzielen Sie, wenn Sie mit 300 dpi scannen, die Seite gerade halten und auf guten Kontrast achten.

Checkliste

PDF OCR

Gescannte PDFs durchsuchbar und markierbar machen

Werkzeug öffnen →