Un contrato escaneado, un informe antiguo fotografiado con el teléfono o un montón de facturas de la fotocopiadora: parecen documentos, pero para la computadora cada página es solo una imagen. No puedes buscar en ellos, seleccionar una frase ni copiar una cifra. OCR PDF reconoce el texto de cada página y lo añade como una capa invisible, así que el archivo se ve exactamente igual, pero ahora se puede buscar en él.
El OCR (reconocimiento óptico de caracteres) trabaja sobre la imagen de cada página, así que su precisión depende del escaneo. No reconstruye el diseño como un documento editable; para eso, pasa después el resultado por PDF a Word.
Paso a paso
- Abre la herramienta OCR PDF o haz clic en la tarjeta "OCR PDF" de la página de inicio.
- Haz clic en la zona para soltar archivos o arrastra hasta ella tu PDF escaneado.
- Elige el "Idioma del documento". Viene seleccionado el idioma del sitio que estás usando.
- Haz clic en "Procesar ahora". La primera vez que usas un idioma, el navegador descarga un modelo de reconocimiento de 2 a 15 MB y lo guarda para la próxima vez.
- La línea de estado muestra qué página se está reconociendo. Cada página tarda unos segundos, según tu dispositivo. Las páginas que ya tienen texto seleccionable se dejan como están.
- Tu navegador descarga el PDF con "-ocr" añadido a su nombre. Ábrelo y busca una palabra que veas en una página para comprobar el resultado.
Errores comunes
- Esperar un texto perfecto de un escaneo de mala calidad. Las páginas borrosas, torcidas o con poco contraste producen errores. Vuelve a escanear a 300 dpi si el resultado es importante.
- Elegir el idioma equivocado. El modelo de un idioma lee mal las letras y los acentos de otro. Elige el idioma en que está escrito el documento.
- Procesar un PDF protegido con contraseña. La herramienta no puede leerlo. Quita primero la contraseña con Desbloquear PDF.
- Esperar un documento editable. El OCR añade texto buscable, pero mantiene la página como imagen. Usa PDF a Word sobre el resultado para editar el texto.
- Pasar el OCR sobre escritura a mano. Tesseract está entrenado con texto impreso; las notas manuscritas casi nunca se reconocen.
Preguntas frecuentes
¿Se sube mi archivo para reconocer el texto?
No. El reconocimiento se hace en tu navegador con tesseract.js, el motor de OCR Tesseract compilado a WebAssembly. Lo único que se descarga es el propio programa y un modelo de idioma, nunca tu documento.
¿Qué idiomas puede reconocer?
Inglés, español, portugués, francés, alemán, indonesio, chino simplificado, japonés y árabe. Elige el idioma del documento antes de procesarlo; en chino, japonés y árabe también se reconoce el inglés, para que las palabras mezcladas salgan bien.
¿Puedo editar el texto después del OCR?
El PDF conserva su aspecto original, con el texto reconocido como una capa invisible que puedes seleccionar, buscar y copiar. Para editar el texto, pasa el resultado por PDF a Word, que extrae esa capa a un archivo .docx.
¿Por qué algunas palabras salen mal?
La precisión del OCR depende del escaneo. Las páginas borrosas, torcidas o de baja resolución, la escritura a mano y las fuentes decorativas producen más errores. Para obtener mejores resultados, escanea a 300 dpi, mantén la página recta y usa un buen contraste.
Checklist
- El escaneo es nítido, está recto y tiene al menos 200 a 300 dpi
- Se seleccionó el idioma del documento
- El PDF no tiene contraseña
- Se buscó en el resultado una palabra de la página
- Se revisaron a ojo las cifras y los nombres importantes