Beranda / Blog & Panduan / Cara membuat PDF hasil pindaian bisa dicari
Alur kerja PDF

Cara membuat PDF hasil pindaian bisa dicari

Ubah PDF hasil pindaian menjadi file yang bisa dicari, dipilih, dan disalin teksnya, tanpa mengunggahnya dan tanpa mengubah tampilannya.

Kontrak hasil pindaian, laporan lama yang difoto dengan ponsel, atau setumpuk faktur dari mesin fotokopi: semuanya tampak seperti dokumen, tetapi bagi komputer setiap halamannya hanyalah gambar. Anda tidak bisa mencarinya, memilih sebuah kalimat, atau menyalin angka. OCR PDF mengenali teks di setiap halaman dan menambahkannya sebagai lapisan tak terlihat, sehingga file tampak persis sama tetapi menjadi bisa dicari.

OCR (pengenalan karakter optik) bekerja pada gambar setiap halaman, jadi akurasinya bergantung pada hasil pindaian. OCR tidak menyusun ulang tata letak menjadi dokumen yang bisa diedit; untuk itu, proses hasilnya dengan PDF ke Word setelahnya.

Langkah demi langkah

  1. Buka alat OCR PDF, atau klik kartu "OCR PDF" di beranda.
  2. Klik zona lepas atau seret PDF hasil pindaian Anda ke sana.
  3. Pilih "Bahasa dokumen". Pilihan awalnya adalah bahasa situs yang sedang Anda gunakan.
  4. Klik "Proses sekarang". Saat pertama kali Anda menggunakan suatu bahasa, browser mengunduh model pengenalan berukuran 2 hingga 15 MB dan menyimpannya untuk penggunaan berikutnya.
  5. Baris status menunjukkan halaman mana yang sedang dikenali. Setiap halaman membutuhkan beberapa detik, tergantung perangkat Anda. Halaman yang sudah memiliki teks yang bisa dipilih dibiarkan apa adanya.
  6. Browser Anda mengunduh PDF dengan tambahan "-ocr" pada namanya. Buka file itu dan cari kata yang terlihat di sebuah halaman untuk memeriksa hasilnya.

Kesalahan umum

FAQ

Apakah file saya diunggah untuk mengenali teksnya?

Tidak. Pengenalan teks berjalan di browser Anda dengan tesseract.js, mesin OCR Tesseract yang dikompilasi ke WebAssembly. Yang diunduh hanyalah program itu sendiri dan model bahasa, tidak pernah dokumen Anda.

Bahasa apa saja yang bisa dikenali?

Bahasa Inggris, Spanyol, Portugis, Prancis, Jerman, Indonesia, Tionghoa Sederhana, Jepang, dan Arab. Pilih bahasa dokumen sebelum memproses; untuk Tionghoa, Jepang, dan Arab, bahasa Inggris juga dikenali, sehingga kata-kata campuran terbaca dengan benar.

Bisakah saya mengedit teks setelah OCR?

PDF tetap mempertahankan tampilan aslinya, dengan teks yang dikenali sebagai lapisan tak terlihat yang bisa Anda pilih, cari, dan salin. Untuk mengedit teks, proses hasilnya dengan PDF ke Word, yang mengekstrak lapisan itu ke file .docx.

Mengapa ada kata yang salah?

Akurasi OCR bergantung pada hasil pindaian. Halaman yang buram, miring, atau beresolusi rendah, tulisan tangan, dan font dekoratif menghasilkan lebih banyak kesalahan. Untuk hasil terbaik, pindai pada 300 dpi, jaga halaman tetap lurus, dan gunakan kontras yang baik.

Daftar periksa

OCR PDF

Jadikan PDF hasil pindaian bisa dicari dan dipilih

Buka alat →