Accueil / Blog et guides / Comment rendre un PDF numérisé indexable
Flux PDF

Comment rendre un PDF numérisé indexable

Transformez un PDF numérisé en un fichier dans lequel vous pouvez rechercher, sélectionner et copier du texte, sans l'envoyer sur un serveur et sans changer son apparence.

Un contrat numérisé, un vieux rapport photographié avec un téléphone ou une pile de factures sorties d'un photocopieur : ils ressemblent à des documents, mais pour l'ordinateur, chaque page n'est qu'une image. Impossible d'y faire une recherche, de sélectionner une phrase ou de copier un chiffre. OCR PDF reconnaît le texte de chaque page et l'ajoute sous forme de calque invisible : le fichier garde exactement la même apparence, mais on peut désormais y faire des recherches.

L'OCR (reconnaissance optique de caractères) travaille sur l'image de chaque page, donc sa précision dépend de la numérisation. Elle ne reconstruit pas la mise en page sous forme de document modifiable ; pour cela, passez ensuite le résultat dans PDF vers Word.

Étapes détaillées

  1. Ouvrez l'outil OCR PDF, ou cliquez sur la carte "OCR PDF" de la page d'accueil.
  2. Cliquez sur la zone de dépôt ou glissez-y votre PDF numérisé.
  3. Choisissez la "Langue du document". Par défaut, c'est la langue du site que vous utilisez.
  4. Cliquez sur "Traiter maintenant". La première fois que vous utilisez une langue, le navigateur télécharge un modèle de reconnaissance de 2 à 15 Mo et le conserve pour la prochaine fois.
  5. La ligne d'état indique quelle page est en cours de reconnaissance. Chaque page prend quelques secondes, selon votre appareil. Les pages qui contiennent déjà du texte sélectionnable sont laissées telles quelles.
  6. Votre navigateur télécharge le PDF avec "-ocr" ajouté à son nom. Ouvrez-le et recherchez un mot visible sur une page pour vérifier le résultat.

Erreurs fréquentes

Questions fréquentes

Mon fichier est-il envoyé sur un serveur pour reconnaître le texte ?

Non. La reconnaissance s'effectue dans votre navigateur avec tesseract.js, le moteur OCR Tesseract compilé en WebAssembly. Les seuls téléchargements sont le programme lui-même et un modèle de langue, jamais votre document.

Quelles langues l'outil reconnaît-il ?

Anglais, espagnol, portugais, français, allemand, indonésien, chinois simplifié, japonais et arabe. Choisissez la langue du document avant le traitement ; pour le chinois, le japonais et l'arabe, l'anglais est aussi reconnu, afin que les passages mêlant les deux langues ressortent correctement.

Puis-je modifier le texte après l'OCR ?

Le PDF conserve son apparence d'origine, avec le texte reconnu sous forme de calque invisible que vous pouvez sélectionner, rechercher et copier. Pour modifier le texte, passez le résultat dans PDF vers Word, qui extrait ce calque dans un fichier .docx.

Pourquoi certains mots sont-ils erronés ?

La précision de l'OCR dépend de la numérisation. Les pages floues, inclinées ou en basse résolution, l'écriture manuscrite et les polices décoratives produisent davantage d'erreurs. Pour de meilleurs résultats, numérisez à 300 dpi, gardez la page bien droite et assurez un bon contraste.

Checklist

OCR PDF

Rendez les PDF numérisés indexables et sélectionnables

Ouvrir l'outil →