スキャンした契約書、スマートフォンで撮影した古いレポート、コピー機で読み取った請求書の束。見た目は文書でも、コンピューターにとっては各ページがただの画像です。検索も、文の選択も、数字のコピーもできません。PDF OCRは各ページのテキストを認識し、目に見えないレイヤーとして追加します。ファイルの見た目はまったく変わらないまま、検索できるようになります。
OCR(光学文字認識)は各ページの画像をもとに処理するため、精度はスキャンの状態に左右されます。レイアウトを編集可能な文書に作り直す機能ではありません。編集可能な文書が必要な場合は、処理後のファイルを「PDFをWordに変換」にかけてください。
手順
- PDF OCRツールを開くか、ホームページの「PDF OCR」カードをクリックします。
- ドロップゾーンをクリックするか、スキャンしたPDFをドラッグします。
- 「文書の言語」を選びます。最初は、ご利用中のサイトの言語が選ばれています。
- 「今すぐ処理」をクリックします。ある言語を初めて使うときは、ブラウザが2〜15 MBの認識モデルをダウンロードし、次回のために保存します。
- ステータス行に、認識中のページが表示されます。1ページあたりの所要時間は、お使いのデバイスによって数秒ほどです。すでに選択可能なテキストがあるページは、そのまま残されます。
- ブラウザが、ファイル名に「-ocr」を付けたPDFをダウンロードします。ファイルを開き、ページ上に見える単語を検索して結果を確認してください。
よくある間違い
- 質の悪いスキャンから完璧なテキストを期待する。ぼやけたページ、傾いたページ、コントラストの低いページでは誤認識が起こります。結果が重要な場合は、300 dpiでスキャンし直してください。
- 言語の選択を誤る。ある言語のモデルでは、別の言語の文字やアクセント記号を読み違えます。文書が書かれている言語を選んでください。
- パスワードで保護されたPDFを処理する。このツールでは読み込めません。先に「PDFロック解除」でパスワードを解除してください。
- 編集可能な文書になると期待する。OCRは検索可能なテキストを追加しますが、ページは画像のままです。テキストを編集するには、処理後のファイルに「PDFをWordに変換」を使ってください。
- 手書きの文字にOCRを使う。Tesseractは印刷された文字で学習しているため、手書きのメモはほとんど認識されません。
よくある質問
テキストを認識するために、ファイルはアップロードされますか?
いいえ。認識はtesseract.js(WebAssemblyにコンパイルされたTesseract OCRエンジン)を使ってブラウザ内で行われます。ダウンロードされるのはプログラム本体と言語モデルだけで、文書が送信されることはありません。
どの言語を認識できますか?
英語、スペイン語、ポルトガル語、フランス語、ドイツ語、インドネシア語、中国語(簡体字)、日本語、アラビア語です。処理する前に文書の言語を選んでください。中国語、日本語、アラビア語では英語も同時に認識されるため、混在する単語も正しく読み取れます。
OCRの後でテキストを編集できますか?
PDFは元の見た目を保ったまま、認識したテキストが目に見えないレイヤーとして追加され、選択・検索・コピーができるようになります。テキストを編集するには、処理後のファイルを「PDFをWordに変換」にかけてください。そのレイヤーが.docxファイルに抽出されます。
一部の単語が間違っているのはなぜですか?
OCRの精度はスキャンの状態によって決まります。ぼやけたページ、傾いたページ、解像度の低いページ、手書きの文字、装飾的なフォントでは誤りが増えます。最良の結果を得るには、300 dpiでスキャンし、ページをまっすぐに置き、十分なコントラストを確保してください。
チェックリスト
- スキャンが鮮明でまっすぐで、解像度が200〜300 dpi以上ある
- 文書の言語を選んだ
- PDFにパスワードが設定されていない
- 処理後のファイルで、ページ上の単語を検索した
- 重要な数字や名前を目で確認した