Kontrak hasil pindaian, laporan lama yang difoto dengan ponsel, atau setumpuk faktur dari mesin fotokopi: semuanya tampak seperti dokumen, tetapi bagi komputer setiap halamannya hanyalah gambar. Anda tidak bisa mencarinya, memilih sebuah kalimat, atau menyalin angka. OCR PDF mengenali teks di setiap halaman dan menambahkannya sebagai lapisan tak terlihat, sehingga file tampak persis sama tetapi menjadi bisa dicari.
OCR (pengenalan karakter optik) bekerja pada gambar setiap halaman, jadi akurasinya bergantung pada hasil pindaian. OCR tidak menyusun ulang tata letak menjadi dokumen yang bisa diedit; untuk itu, proses hasilnya dengan PDF ke Word setelahnya.
Langkah demi langkah
- Buka alat OCR PDF, atau klik kartu "OCR PDF" di beranda.
- Klik zona lepas atau seret PDF hasil pindaian Anda ke sana.
- Pilih "Bahasa dokumen". Pilihan awalnya adalah bahasa situs yang sedang Anda gunakan.
- Klik "Proses sekarang". Saat pertama kali Anda menggunakan suatu bahasa, browser mengunduh model pengenalan berukuran 2 hingga 15 MB dan menyimpannya untuk penggunaan berikutnya.
- Baris status menunjukkan halaman mana yang sedang dikenali. Setiap halaman membutuhkan beberapa detik, tergantung perangkat Anda. Halaman yang sudah memiliki teks yang bisa dipilih dibiarkan apa adanya.
- Browser Anda mengunduh PDF dengan tambahan "-ocr" pada namanya. Buka file itu dan cari kata yang terlihat di sebuah halaman untuk memeriksa hasilnya.
Kesalahan umum
- Mengharapkan teks sempurna dari pindaian yang buruk. Halaman yang buram, miring, atau kontrasnya rendah menghasilkan kesalahan. Pindai ulang pada 300 dpi jika hasilnya penting.
- Memilih bahasa yang salah. Model untuk satu bahasa salah membaca huruf dan aksen bahasa lain. Pilih bahasa yang digunakan dalam dokumen.
- Memproses PDF yang dilindungi kata sandi. Alat ini tidak bisa membacanya. Hapus kata sandinya terlebih dahulu dengan Buka Kunci PDF.
- Mengharapkan dokumen yang bisa diedit. OCR menambahkan teks yang bisa dicari, tetapi halaman tetap berupa gambar. Gunakan PDF ke Word pada hasilnya untuk mengedit teks.
- Menjalankan OCR pada tulisan tangan. Tesseract dilatih dengan teks cetak; catatan tulisan tangan sebagian besar tidak dikenali.
FAQ
Apakah file saya diunggah untuk mengenali teksnya?
Tidak. Pengenalan teks berjalan di browser Anda dengan tesseract.js, mesin OCR Tesseract yang dikompilasi ke WebAssembly. Yang diunduh hanyalah program itu sendiri dan model bahasa, tidak pernah dokumen Anda.
Bahasa apa saja yang bisa dikenali?
Bahasa Inggris, Spanyol, Portugis, Prancis, Jerman, Indonesia, Tionghoa Sederhana, Jepang, dan Arab. Pilih bahasa dokumen sebelum memproses; untuk Tionghoa, Jepang, dan Arab, bahasa Inggris juga dikenali, sehingga kata-kata campuran terbaca dengan benar.
Bisakah saya mengedit teks setelah OCR?
PDF tetap mempertahankan tampilan aslinya, dengan teks yang dikenali sebagai lapisan tak terlihat yang bisa Anda pilih, cari, dan salin. Untuk mengedit teks, proses hasilnya dengan PDF ke Word, yang mengekstrak lapisan itu ke file .docx.
Mengapa ada kata yang salah?
Akurasi OCR bergantung pada hasil pindaian. Halaman yang buram, miring, atau beresolusi rendah, tulisan tangan, dan font dekoratif menghasilkan lebih banyak kesalahan. Untuk hasil terbaik, pindai pada 300 dpi, jaga halaman tetap lurus, dan gunakan kontras yang baik.
Daftar periksa
- Pindaian tajam, lurus, dan setidaknya 200 hingga 300 dpi
- Bahasa dokumen sudah dipilih
- PDF tidak memiliki kata sandi
- Sebuah kata dari halaman sudah dicari di hasilnya
- Angka dan nama yang penting sudah diperiksa secara visual