Início / Blog & Guias / Como tornar pesquisável um PDF digitalizado
Fluxo PDF

Como tornar pesquisável um PDF digitalizado

Transforme um PDF digitalizado num ficheiro em que pode pesquisar, selecionar e copiar texto, sem o enviar e sem alterar o seu aspeto.

Um contrato digitalizado, um relatório antigo fotografado com o telemóvel ou uma pilha de faturas saídas da fotocopiadora: parecem documentos, mas para o computador cada página é apenas uma imagem. Não é possível pesquisá-los, selecionar uma frase ou copiar um valor. A ferramenta OCR PDF reconhece o texto de cada página e acrescenta-o como uma camada invisível, pelo que o ficheiro fica exatamente igual, mas passa a ser pesquisável.

O OCR (reconhecimento ótico de caracteres) trabalha sobre a imagem de cada página, pelo que a precisão depende da digitalização. Não reconstrói o esquema num documento editável; para isso, passe depois o resultado pelo PDF para Word.

Passo a passo

  1. Abra a ferramenta OCR PDF, ou clique no cartão "OCR PDF" na página inicial.
  2. Clique na área de seleção ou arraste o seu PDF digitalizado para lá.
  3. Escolha o "Idioma do documento". Por predefinição, é o idioma do site que está a usar.
  4. Clique em "Processar agora". Da primeira vez que usar um idioma, o navegador transfere um modelo de reconhecimento de 2 a 15 MB e guarda-o para a próxima vez.
  5. A linha de estado mostra que página está a ser reconhecida. Cada página demora alguns segundos, consoante o seu dispositivo. As páginas que já têm texto selecionável ficam como estão.
  6. O navegador transfere o PDF com "-ocr" acrescentado ao nome. Abra-o e pesquise uma palavra que veja numa página para confirmar o resultado.

Erros comuns

Perguntas frequentes

O meu ficheiro é enviado para reconhecer o texto?

Não. O reconhecimento é feito no seu navegador com o tesseract.js, o motor de OCR Tesseract compilado para WebAssembly. As únicas transferências são o próprio programa e um modelo de idioma, nunca o seu documento.

Que idiomas consegue reconhecer?

Inglês, espanhol, português, francês, alemão, indonésio, chinês simplificado, japonês e árabe. Escolha o idioma do documento antes de processar; no caso do chinês, do japonês e do árabe, o inglês também é reconhecido, para que as palavras misturadas saiam corretas.

Posso editar o texto depois do OCR?

O PDF mantém o aspeto original, com o texto reconhecido numa camada invisível que pode selecionar, pesquisar e copiar. Para editar o texto, passe o resultado pelo PDF para Word, que extrai essa camada para um ficheiro .docx.

Porque é que algumas palavras estão erradas?

A precisão do OCR depende da digitalização. Páginas desfocadas, inclinadas ou de baixa resolução, texto manuscrito e tipos de letra decorativos produzem mais erros. Para obter melhores resultados, digitalize a 300 dpi, mantenha a página direita e use um bom contraste.

Checklist

OCR PDF

Torne pesquisáveis e selecionáveis os PDFs digitalizados

Abrir a ferramenta →