Un contrat numérisé, un vieux rapport photographié avec un téléphone ou une pile de factures sorties d'un photocopieur : ils ressemblent à des documents, mais pour l'ordinateur, chaque page n'est qu'une image. Impossible d'y faire une recherche, de sélectionner une phrase ou de copier un chiffre. OCR PDF reconnaît le texte de chaque page et l'ajoute sous forme de calque invisible : le fichier garde exactement la même apparence, mais on peut désormais y faire des recherches.
L'OCR (reconnaissance optique de caractères) travaille sur l'image de chaque page, donc sa précision dépend de la numérisation. Elle ne reconstruit pas la mise en page sous forme de document modifiable ; pour cela, passez ensuite le résultat dans PDF vers Word.
Étapes détaillées
- Ouvrez l'outil OCR PDF, ou cliquez sur la carte "OCR PDF" de la page d'accueil.
- Cliquez sur la zone de dépôt ou glissez-y votre PDF numérisé.
- Choisissez la "Langue du document". Par défaut, c'est la langue du site que vous utilisez.
- Cliquez sur "Traiter maintenant". La première fois que vous utilisez une langue, le navigateur télécharge un modèle de reconnaissance de 2 à 15 Mo et le conserve pour la prochaine fois.
- La ligne d'état indique quelle page est en cours de reconnaissance. Chaque page prend quelques secondes, selon votre appareil. Les pages qui contiennent déjà du texte sélectionnable sont laissées telles quelles.
- Votre navigateur télécharge le PDF avec "-ocr" ajouté à son nom. Ouvrez-le et recherchez un mot visible sur une page pour vérifier le résultat.
Erreurs fréquentes
- Attendre un texte parfait d'une mauvaise numérisation. Les pages floues, inclinées ou peu contrastées produisent des erreurs. Numérisez de nouveau à 300 dpi si le résultat compte.
- Choisir la mauvaise langue. Le modèle d'une langue lit mal les lettres et les accents d'une autre. Choisissez la langue dans laquelle le document est rédigé.
- Traiter un PDF protégé par mot de passe. L'outil ne peut pas le lire. Retirez d'abord le mot de passe avec Déverrouiller un PDF.
- S'attendre à un document modifiable. L'OCR ajoute du texte que l'on peut rechercher, mais conserve la page sous forme d'image. Utilisez PDF vers Word sur le résultat pour modifier le texte.
- Lancer l'OCR sur de l'écriture manuscrite. Tesseract est entraîné sur du texte imprimé ; les notes manuscrites ne sont en grande partie pas reconnues.
Questions fréquentes
Mon fichier est-il envoyé sur un serveur pour reconnaître le texte ?
Non. La reconnaissance s'effectue dans votre navigateur avec tesseract.js, le moteur OCR Tesseract compilé en WebAssembly. Les seuls téléchargements sont le programme lui-même et un modèle de langue, jamais votre document.
Quelles langues l'outil reconnaît-il ?
Anglais, espagnol, portugais, français, allemand, indonésien, chinois simplifié, japonais et arabe. Choisissez la langue du document avant le traitement ; pour le chinois, le japonais et l'arabe, l'anglais est aussi reconnu, afin que les passages mêlant les deux langues ressortent correctement.
Puis-je modifier le texte après l'OCR ?
Le PDF conserve son apparence d'origine, avec le texte reconnu sous forme de calque invisible que vous pouvez sélectionner, rechercher et copier. Pour modifier le texte, passez le résultat dans PDF vers Word, qui extrait ce calque dans un fichier .docx.
Pourquoi certains mots sont-ils erronés ?
La précision de l'OCR dépend de la numérisation. Les pages floues, inclinées ou en basse résolution, l'écriture manuscrite et les polices décoratives produisent davantage d'erreurs. Pour de meilleurs résultats, numérisez à 300 dpi, gardez la page bien droite et assurez un bon contraste.
Checklist
- La numérisation est nette, droite et d'au moins 200 à 300 dpi
- La langue du document a été sélectionnée
- Le PDF n'a pas de mot de passe
- Un mot de la page a été recherché dans le résultat
- Les chiffres et les noms importants ont été vérifiés à l'œil