Ein gescannter Vertrag, ein alter Bericht, mit dem Handy fotografiert, oder ein Stapel Rechnungen aus dem Kopierer: Sie sehen aus wie Dokumente, aber für den Computer ist jede Seite nur ein Bild. Sie können sie nicht durchsuchen, keinen Satz markieren und keine Zahl kopieren. PDF OCR erkennt den Text auf jeder Seite und fügt ihn als unsichtbare Ebene hinzu, sodass die Datei genau gleich aussieht, aber durchsuchbar wird.
OCR (optische Zeichenerkennung) arbeitet mit dem Bild jeder Seite, daher hängt ihre Genauigkeit vom Scan ab. Sie baut das Layout nicht zu einem bearbeitbaren Dokument um; dafür geben Sie das Ergebnis anschließend in PDF in Word.
Schritt für Schritt
- Öffnen Sie das Werkzeug PDF OCR oder klicken Sie auf der Startseite auf die Karte „PDF OCR“.
- Klicken Sie auf den Ablagebereich oder ziehen Sie Ihr gescanntes PDF hinein.
- Wählen Sie die „Dokumentsprache“. Voreingestellt ist die Sprache der Website, die Sie gerade nutzen.
- Klicken Sie auf „Jetzt verarbeiten“. Wenn Sie eine Sprache zum ersten Mal verwenden, lädt der Browser ein Erkennungsmodell von 2 bis 15 MB herunter und speichert es für das nächste Mal.
- Die Statuszeile zeigt, welche Seite gerade erkannt wird. Jede Seite dauert je nach Gerät einige Sekunden. Seiten, die bereits markierbaren Text haben, bleiben unverändert.
- Ihr Browser lädt das PDF mit dem Zusatz „-ocr“ im Dateinamen herunter. Öffnen Sie es und suchen Sie nach einem Wort, das Sie auf einer Seite sehen, um das Ergebnis zu prüfen.
Häufige Fehler
- Perfekten Text von einem schlechten Scan erwarten. Unscharfe, schiefe oder kontrastarme Seiten führen zu Fehlern. Scannen Sie mit 300 dpi neu, wenn es auf das Ergebnis ankommt.
- Die falsche Sprache wählen. Das Modell einer Sprache liest Buchstaben und Akzente einer anderen falsch. Wählen Sie die Sprache, in der das Dokument geschrieben ist.
- Ein passwortgeschütztes PDF verarbeiten. Das Werkzeug kann es nicht lesen. Entfernen Sie das Passwort zuerst mit PDF entsperren.
- Ein bearbeitbares Dokument erwarten. OCR fügt durchsuchbaren Text hinzu, behält die Seite aber als Bild bei. Nutzen Sie PDF in Word auf dem Ergebnis, um den Text zu bearbeiten.
- OCR auf Handschrift anwenden. Tesseract ist auf gedruckten Text trainiert; handschriftliche Notizen werden größtenteils nicht erkannt.
FAQ
Wird meine Datei zur Texterkennung hochgeladen?
Nein. Die Erkennung läuft in Ihrem Browser mit tesseract.js, der zu WebAssembly kompilierten OCR-Engine Tesseract. Heruntergeladen werden nur das Programm selbst und ein Sprachmodell, niemals Ihr Dokument.
Welche Sprachen werden erkannt?
Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Indonesisch, vereinfachtes Chinesisch, Japanisch und Arabisch. Wählen Sie vor dem Verarbeiten die Sprache des Dokuments; bei Chinesisch, Japanisch und Arabisch wird zusätzlich Englisch erkannt, sodass gemischte Wörter richtig herauskommen.
Kann ich den Text nach der OCR bearbeiten?
Das PDF behält sein ursprüngliches Aussehen, mit dem erkannten Text als unsichtbarer Ebene, die Sie markieren, durchsuchen und kopieren können. Um den Text zu bearbeiten, geben Sie das Ergebnis in PDF in Word, das diese Ebene in eine .docx-Datei extrahiert.
Warum sind manche Wörter falsch?
Die Genauigkeit der OCR hängt vom Scan ab. Unscharfe, schiefe oder niedrig aufgelöste Seiten, Handschrift und dekorative Schriften führen zu mehr Fehlern. Die besten Ergebnisse erzielen Sie, wenn Sie mit 300 dpi scannen, die Seite gerade halten und auf guten Kontrast achten.
Checkliste
- Der Scan ist scharf, gerade und hat mindestens 200 bis 300 dpi
- Die Sprache des Dokuments wurde ausgewählt
- Das PDF hat kein Passwort
- Im Ergebnis wurde nach einem Wort von der Seite gesucht
- Wichtige Zahlen und Namen wurden mit eigenen Augen geprüft