Início / Blog & Guias / Como tornar um PDF digitalizado pesquisável
Fluxo PDF

Como tornar um PDF digitalizado pesquisável

Transforme um PDF digitalizado em um arquivo que você pode pesquisar, selecionar e copiar, sem enviá-lo para nenhum servidor e sem mudar a aparência dele.

Um contrato digitalizado, um relatório antigo fotografado com o celular ou uma pilha de notas fiscais saída da copiadora: parecem documentos, mas para o computador cada página é só uma imagem. Não dá para pesquisar, selecionar uma frase ou copiar um valor. A ferramenta OCR em PDF reconhece o texto de cada página e o adiciona como uma camada invisível, então o arquivo continua com a mesma aparência, mas passa a ser pesquisável.

O OCR (reconhecimento óptico de caracteres) trabalha sobre a imagem de cada página, então a precisão depende da digitalização. Ele não reconstrói o layout em um documento editável; para isso, passe o resultado pelo PDF para Word depois.

Passo a passo

  1. Abra a ferramenta OCR em PDF ou clique no card "OCR em PDF" na página inicial.
  2. Clique na área de soltar ou arraste o seu PDF digitalizado até ela.
  3. Escolha o "Idioma do documento". Ele começa com o idioma do site que você está usando.
  4. Clique em "Processar agora". Na primeira vez que você usa um idioma, o navegador baixa um modelo de reconhecimento de 2 a 15 MB e o guarda para as próximas vezes.
  5. A linha de status mostra qual página está sendo reconhecida. Cada página leva alguns segundos, dependendo do seu dispositivo. Páginas que já têm texto selecionável ficam como estão.
  6. O navegador baixa o PDF com "-ocr" acrescentado ao nome. Abra o arquivo e pesquise uma palavra que você vê em uma página para conferir o resultado.

Erros comuns

Perguntas frequentes

Meu arquivo é enviado para algum servidor para reconhecer o texto?

Não. O reconhecimento acontece no seu navegador com tesseract.js, o mecanismo de OCR Tesseract compilado para WebAssembly. Os únicos downloads são o próprio programa e um modelo de idioma, nunca o seu documento.

Quais idiomas ele reconhece?

Inglês, espanhol, português, francês, alemão, indonésio, chinês simplificado, japonês e árabe. Escolha o idioma do documento antes de processar; para chinês, japonês e árabe, o inglês também é reconhecido, então palavras misturadas saem corretas.

Posso editar o texto depois do OCR?

O PDF mantém a aparência original, com o texto reconhecido como uma camada invisível que você pode selecionar, pesquisar e copiar. Para editar o texto, passe o resultado pelo PDF para Word, que extrai essa camada para um arquivo .docx.

Por que algumas palavras saem erradas?

A precisão do OCR depende da digitalização. Páginas borradas, tortas ou em baixa resolução, texto manuscrito e fontes decorativas geram mais erros. Para ter o melhor resultado, digitalize a 300 dpi, mantenha a página reta e use um bom contraste.

Checklist

OCR em PDF

Torne PDFs digitalizados pesquisáveis e selecionáveis

Abrir a ferramenta →