首页 / 使用指南 / 如何让扫描版 PDF 可搜索
PDF 流程

如何让扫描版 PDF 可搜索

把扫描版 PDF 变成可以搜索、选中和复制文字的文件,无需上传,也不改变它的外观。

一份扫描的合同、一份用手机拍下的旧报告,或者一叠复印机扫出来的发票:它们看起来是文档,但对电脑来说,每一页都只是一张图片。您无法搜索其中的内容,也无法选中一句话或复制一个数字。OCR识别PDF会识别每一页上的文字,并把它作为隐藏的文字层添加进去,文件看起来完全不变,却可以搜索了。

OCR(光学字符识别)处理的是每一页的图像,因此准确度取决于扫描质量。它不会把版式重建为可编辑的文档;如有需要,之后可以再用PDF转Word处理结果文件。

操作步骤

  1. 打开OCR识别PDF工具,或在首页点击“OCR识别PDF”卡片。
  2. 点击拖放区域或拖入您的扫描版 PDF。
  3. 选择“文档语言”。默认是您正在使用的网站语言。
  4. 点击“立即处理”。首次使用某种语言时,浏览器会下载一个 2 到 15 MB 的识别模型,并将其保存以供下次使用。
  5. 状态栏会显示正在识别哪一页。每页需要几秒钟,具体取决于您的设备。已经有可选中文字的页面会保持原样。
  6. 浏览器会下载文件名中加上“-ocr”的 PDF。打开它,搜索页面上能看到的某个词,检查识别结果。

常见错误

常见问题

识别文字时我的文件会被上传吗?

不会。识别通过 tesseract.js 在您的浏览器中进行,它是编译为 WebAssembly 的 Tesseract OCR 引擎。需要下载的只有程序本身和语言模型,绝不会上传您的文档。

它能识别哪些语言?

英语、西班牙语、葡萄牙语、法语、德语、印度尼西亚语、简体中文、日语和阿拉伯语。请在处理前选择文档的语言;选择中文、日语和阿拉伯语时,也会同时识别英语,因此夹杂的英文单词也能正确识别。

OCR 之后可以编辑文字吗?

PDF 会保持原来的外观,识别出的文字作为一个隐藏的文字层,可以选中、搜索和复制。如需编辑文字,请用PDF转Word处理结果文件,它会把这一文字层提取为 .docx 文件。

为什么有些字识别错了?

OCR 的准确度取决于扫描质量。模糊、歪斜或分辨率低的页面,以及手写字和装饰性字体,都会产生更多错误。为获得最佳效果,请以 300 dpi 扫描,保持页面端正,并确保对比度良好。

检查清单

OCR识别PDF

让扫描版PDF可搜索、可选中文字

打开工具 →