一份扫描的合同、一份用手机拍下的旧报告,或者一叠复印机扫出来的发票:它们看起来是文档,但对电脑来说,每一页都只是一张图片。您无法搜索其中的内容,也无法选中一句话或复制一个数字。OCR识别PDF会识别每一页上的文字,并把它作为隐藏的文字层添加进去,文件看起来完全不变,却可以搜索了。
OCR(光学字符识别)处理的是每一页的图像,因此准确度取决于扫描质量。它不会把版式重建为可编辑的文档;如有需要,之后可以再用PDF转Word处理结果文件。
操作步骤
- 打开OCR识别PDF工具,或在首页点击“OCR识别PDF”卡片。
- 点击拖放区域或拖入您的扫描版 PDF。
- 选择“文档语言”。默认是您正在使用的网站语言。
- 点击“立即处理”。首次使用某种语言时,浏览器会下载一个 2 到 15 MB 的识别模型,并将其保存以供下次使用。
- 状态栏会显示正在识别哪一页。每页需要几秒钟,具体取决于您的设备。已经有可选中文字的页面会保持原样。
- 浏览器会下载文件名中加上“-ocr”的 PDF。打开它,搜索页面上能看到的某个词,检查识别结果。
常见错误
- 指望从质量差的扫描件中得到完美的文字。模糊、歪斜或对比度低的页面会产生错误。如果结果很重要,请以 300 dpi 重新扫描。
- 选错了语言。某种语言的模型会认错另一种语言的字母和重音符号。请选择文档所用的语言。
- 处理受密码保护的 PDF。工具无法读取它。请先用解密PDF移除密码。
- 指望得到可编辑的文档。OCR 会添加可搜索的文字,但页面仍保留为图像。如需编辑文字,请对结果使用PDF转Word。
- 对手写内容进行 OCR。Tesseract 是针对印刷文字训练的,手写笔记大多无法识别。
常见问题
识别文字时我的文件会被上传吗?
不会。识别通过 tesseract.js 在您的浏览器中进行,它是编译为 WebAssembly 的 Tesseract OCR 引擎。需要下载的只有程序本身和语言模型,绝不会上传您的文档。
它能识别哪些语言?
英语、西班牙语、葡萄牙语、法语、德语、印度尼西亚语、简体中文、日语和阿拉伯语。请在处理前选择文档的语言;选择中文、日语和阿拉伯语时,也会同时识别英语,因此夹杂的英文单词也能正确识别。
OCR 之后可以编辑文字吗?
PDF 会保持原来的外观,识别出的文字作为一个隐藏的文字层,可以选中、搜索和复制。如需编辑文字,请用PDF转Word处理结果文件,它会把这一文字层提取为 .docx 文件。
为什么有些字识别错了?
OCR 的准确度取决于扫描质量。模糊、歪斜或分辨率低的页面,以及手写字和装饰性字体,都会产生更多错误。为获得最佳效果,请以 300 dpi 扫描,保持页面端正,并确保对比度良好。
检查清单
- 扫描件清晰、端正,分辨率至少为 200 到 300 dpi
- 已选择文档的语言
- PDF 没有设置密码
- 已在结果中搜索过页面上的某个词
- 重要的数字和名称已人工核对