ホーム / ブログとガイド / スキャンしたPDFを検索可能にする方法
PDFワークフロー

スキャンしたPDFを検索可能にする方法

スキャンしたPDFを、アップロードせず見た目も変えずに、検索・選択・コピーできるPDFに変えられます。

スキャンした契約書、スマートフォンで撮影した古いレポート、コピー機で読み取った請求書の束。見た目は文書でも、コンピューターにとっては各ページがただの画像です。検索も、文の選択も、数字のコピーもできません。PDF OCRは各ページのテキストを認識し、目に見えないレイヤーとして追加します。ファイルの見た目はまったく変わらないまま、検索できるようになります。

OCR(光学文字認識)は各ページの画像をもとに処理するため、精度はスキャンの状態に左右されます。レイアウトを編集可能な文書に作り直す機能ではありません。編集可能な文書が必要な場合は、処理後のファイルを「PDFをWordに変換」にかけてください。

手順

  1. PDF OCRツールを開くか、ホームページの「PDF OCR」カードをクリックします。
  2. ドロップゾーンをクリックするか、スキャンしたPDFをドラッグします。
  3. 「文書の言語」を選びます。最初は、ご利用中のサイトの言語が選ばれています。
  4. 「今すぐ処理」をクリックします。ある言語を初めて使うときは、ブラウザが2〜15 MBの認識モデルをダウンロードし、次回のために保存します。
  5. ステータス行に、認識中のページが表示されます。1ページあたりの所要時間は、お使いのデバイスによって数秒ほどです。すでに選択可能なテキストがあるページは、そのまま残されます。
  6. ブラウザが、ファイル名に「-ocr」を付けたPDFをダウンロードします。ファイルを開き、ページ上に見える単語を検索して結果を確認してください。

よくある間違い

よくある質問

テキストを認識するために、ファイルはアップロードされますか?

いいえ。認識はtesseract.js(WebAssemblyにコンパイルされたTesseract OCRエンジン)を使ってブラウザ内で行われます。ダウンロードされるのはプログラム本体と言語モデルだけで、文書が送信されることはありません。

どの言語を認識できますか?

英語、スペイン語、ポルトガル語、フランス語、ドイツ語、インドネシア語、中国語(簡体字)、日本語、アラビア語です。処理する前に文書の言語を選んでください。中国語、日本語、アラビア語では英語も同時に認識されるため、混在する単語も正しく読み取れます。

OCRの後でテキストを編集できますか?

PDFは元の見た目を保ったまま、認識したテキストが目に見えないレイヤーとして追加され、選択・検索・コピーができるようになります。テキストを編集するには、処理後のファイルを「PDFをWordに変換」にかけてください。そのレイヤーが.docxファイルに抽出されます。

一部の単語が間違っているのはなぜですか?

OCRの精度はスキャンの状態によって決まります。ぼやけたページ、傾いたページ、解像度の低いページ、手書きの文字、装飾的なフォントでは誤りが増えます。最良の結果を得るには、300 dpiでスキャンし、ページをまっすぐに置き、十分なコントラストを確保してください。

チェックリスト

PDF OCR

スキャンしたPDFを検索・選択できるようにする

ツールを開く →