Um contrato digitalizado, um relatório antigo fotografado com o celular ou uma pilha de notas fiscais saída da copiadora: parecem documentos, mas para o computador cada página é só uma imagem. Não dá para pesquisar, selecionar uma frase ou copiar um valor. A ferramenta OCR em PDF reconhece o texto de cada página e o adiciona como uma camada invisível, então o arquivo continua com a mesma aparência, mas passa a ser pesquisável.
O OCR (reconhecimento óptico de caracteres) trabalha sobre a imagem de cada página, então a precisão depende da digitalização. Ele não reconstrói o layout em um documento editável; para isso, passe o resultado pelo PDF para Word depois.
Passo a passo
- Abra a ferramenta OCR em PDF ou clique no card "OCR em PDF" na página inicial.
- Clique na área de soltar ou arraste o seu PDF digitalizado até ela.
- Escolha o "Idioma do documento". Ele começa com o idioma do site que você está usando.
- Clique em "Processar agora". Na primeira vez que você usa um idioma, o navegador baixa um modelo de reconhecimento de 2 a 15 MB e o guarda para as próximas vezes.
- A linha de status mostra qual página está sendo reconhecida. Cada página leva alguns segundos, dependendo do seu dispositivo. Páginas que já têm texto selecionável ficam como estão.
- O navegador baixa o PDF com "-ocr" acrescentado ao nome. Abra o arquivo e pesquise uma palavra que você vê em uma página para conferir o resultado.
Erros comuns
- Esperar um texto perfeito de uma digitalização ruim. Páginas borradas, tortas ou com pouco contraste geram erros. Digitalize de novo a 300 dpi se o resultado for importante.
- Escolher o idioma errado. O modelo de um idioma lê errado as letras e os acentos de outro. Escolha o idioma em que o documento está escrito.
- Processar um PDF protegido por senha. A ferramenta não consegue lê-lo. Remova a senha antes com o Desbloquear PDF.
- Esperar um documento editável. O OCR adiciona texto pesquisável, mas mantém a página como imagem. Use o PDF para Word no resultado para editar o texto.
- Usar OCR em texto manuscrito. O Tesseract é treinado com texto impresso; anotações à mão, em geral, não são reconhecidas.
Perguntas frequentes
Meu arquivo é enviado para algum servidor para reconhecer o texto?
Não. O reconhecimento acontece no seu navegador com tesseract.js, o mecanismo de OCR Tesseract compilado para WebAssembly. Os únicos downloads são o próprio programa e um modelo de idioma, nunca o seu documento.
Quais idiomas ele reconhece?
Inglês, espanhol, português, francês, alemão, indonésio, chinês simplificado, japonês e árabe. Escolha o idioma do documento antes de processar; para chinês, japonês e árabe, o inglês também é reconhecido, então palavras misturadas saem corretas.
Posso editar o texto depois do OCR?
O PDF mantém a aparência original, com o texto reconhecido como uma camada invisível que você pode selecionar, pesquisar e copiar. Para editar o texto, passe o resultado pelo PDF para Word, que extrai essa camada para um arquivo .docx.
Por que algumas palavras saem erradas?
A precisão do OCR depende da digitalização. Páginas borradas, tortas ou em baixa resolução, texto manuscrito e fontes decorativas geram mais erros. Para ter o melhor resultado, digitalize a 300 dpi, mantenha a página reta e use um bom contraste.
Checklist
- A digitalização está nítida, reta e com pelo menos 200 a 300 dpi
- O idioma do documento foi selecionado
- O PDF não tem senha
- Uma palavra da página foi pesquisada no resultado
- Valores e nomes importantes foram conferidos a olho