عقد ممسوح ضوئياً، أو تقرير قديم مصوَّر بالهاتف، أو رزمة فواتير من آلة نسخ: تبدو كمستندات، لكن كل صفحة بالنسبة إلى الحاسوب مجرد صورة. لا يمكنك البحث فيها أو تحديد جملة أو نسخ رقم. تتعرّف أداة OCR لملفات PDF على النص في كل صفحة وتضيفه كطبقة غير مرئية، فيبدو الملف كما هو تماماً لكنه يصبح قابلاً للبحث.
تعمل تقنية OCR (التعرّف الضوئي على الحروف) على صورة كل صفحة، لذا تعتمد دقتها على جودة المسح. وهي لا تعيد بناء التخطيط في مستند قابل للتحرير؛ لذلك، مرّر النتيجة بعدها عبر أداة PDF إلى Word.
خطوة بخطوة
- افتح أداة OCR لملفات PDF، أو انقر على بطاقة «OCR لملفات PDF» في الصفحة الرئيسية.
- انقر على منطقة الإسقاط أو اسحب ملف PDF الممسوح ضوئياً إليها.
- اختر «لغة المستند». تكون مضبوطة في البداية على لغة الموقع الذي تستخدمه.
- انقر على «معالجة الآن». في أول مرة تستخدم فيها لغة ما، ينزّل المتصفح نموذج تعرّف بحجم يتراوح بين 2 و15 ميغابايت ويحتفظ به للمرات القادمة.
- يعرض سطر الحالة الصفحة التي يجري التعرّف عليها. تستغرق كل صفحة بضع ثوانٍ، بحسب جهازك. وتُترك الصفحات التي تحتوي بالفعل على نص قابل للتحديد كما هي.
- ينزّل متصفحك ملف PDF مع إضافة «-ocr» إلى اسمه. افتحه وابحث عن كلمة تراها في إحدى الصفحات للتحقق من النتيجة.
الأخطاء الشائعة
- توقّع نص مثالي من مسح رديء. فالصفحات الضبابية أو المائلة أو منخفضة التباين تُنتج أخطاءً. أعد المسح بدقة 300 dpi إذا كانت النتيجة مهمة.
- اختيار لغة خاطئة. يخطئ نموذج لغةٍ ما في قراءة حروف لغة أخرى وعلاماتها. اختر اللغة المكتوب بها المستند.
- معالجة ملف PDF محمي بكلمة مرور. لا تستطيع الأداة قراءته. أزل كلمة المرور أولاً باستخدام فك حماية PDF.
- توقّع مستند قابل للتحرير. تضيف تقنية OCR نصاً قابلاً للبحث لكنها تُبقي الصفحة صورة. استخدم PDF إلى Word على النتيجة لتحرير النص.
- تشغيل OCR على خط اليد. دُرِّب Tesseract على النص المطبوع؛ ولا يُتعرَّف على معظم الملاحظات المكتوبة بخط اليد.
الأسئلة الشائعة
هل يُرفع ملفي للتعرّف على النص؟
لا. يجري التعرّف في متصفحك باستخدام tesseract.js، وهو محرك Tesseract للتعرّف الضوئي على الحروف مترجَماً إلى WebAssembly. لا يُنزَّل سوى البرنامج نفسه ونموذج لغة، أما مستندك فلا يُرسَل أبداً.
ما اللغات التي يمكنها التعرّف عليها؟
الإنجليزية والإسبانية والبرتغالية والفرنسية والألمانية والإندونيسية والصينية المبسّطة واليابانية والعربية. اختر لغة المستند قبل المعالجة؛ وفي الصينية واليابانية والعربية يُتعرَّف على الإنجليزية أيضاً، فتظهر الكلمات المختلطة بشكل صحيح.
هل يمكنني تحرير النص بعد OCR؟
يحتفظ ملف PDF بمظهره الأصلي، مع النص المُتعرَّف عليه كطبقة غير مرئية يمكنك تحديدها والبحث فيها ونسخها. لتحرير النص، مرّر النتيجة عبر أداة PDF إلى Word، التي تستخرج تلك الطبقة إلى ملف .docx.
لماذا تظهر بعض الكلمات خاطئة؟
تعتمد دقة OCR على جودة المسح. فالصفحات الضبابية أو المائلة أو منخفضة الدقة، وخط اليد، والخطوط الزخرفية تُنتج أخطاءً أكثر. للحصول على أفضل النتائج، امسح بدقة 300 dpi، وأبقِ الصفحة مستقيمة، واحرص على تباين جيد.
قائمة التحقق
- المسح واضح ومستقيم وبدقة لا تقل عن 200 إلى 300 dpi
- تم اختيار لغة المستند
- ملف PDF غير محمي بكلمة مرور
- تم البحث في النتيجة عن كلمة من الصفحة
- تم التحقق بالعين من الأرقام والأسماء المهمة