Um contrato digitalizado, um relatório antigo fotografado com o telemóvel ou uma pilha de faturas saídas da fotocopiadora: parecem documentos, mas para o computador cada página é apenas uma imagem. Não é possível pesquisá-los, selecionar uma frase ou copiar um valor. A ferramenta OCR PDF reconhece o texto de cada página e acrescenta-o como uma camada invisível, pelo que o ficheiro fica exatamente igual, mas passa a ser pesquisável.
O OCR (reconhecimento ótico de caracteres) trabalha sobre a imagem de cada página, pelo que a precisão depende da digitalização. Não reconstrói o esquema num documento editável; para isso, passe depois o resultado pelo PDF para Word.
Passo a passo
- Abra a ferramenta OCR PDF, ou clique no cartão "OCR PDF" na página inicial.
- Clique na área de seleção ou arraste o seu PDF digitalizado para lá.
- Escolha o "Idioma do documento". Por predefinição, é o idioma do site que está a usar.
- Clique em "Processar agora". Da primeira vez que usar um idioma, o navegador transfere um modelo de reconhecimento de 2 a 15 MB e guarda-o para a próxima vez.
- A linha de estado mostra que página está a ser reconhecida. Cada página demora alguns segundos, consoante o seu dispositivo. As páginas que já têm texto selecionável ficam como estão.
- O navegador transfere o PDF com "-ocr" acrescentado ao nome. Abra-o e pesquise uma palavra que veja numa página para confirmar o resultado.
Erros comuns
- Esperar texto perfeito de uma digitalização fraca. Páginas desfocadas, inclinadas ou com pouco contraste produzem erros. Volte a digitalizar a 300 dpi se o resultado for importante.
- Escolher o idioma errado. O modelo de um idioma lê mal as letras e os acentos de outro. Escolha o idioma em que o documento está escrito.
- Processar um PDF protegido por palavra-passe. A ferramenta não o consegue ler. Remova primeiro a palavra-passe com o Desbloquear PDF.
- Esperar um documento editável. O OCR acrescenta texto pesquisável, mas mantém a página como imagem. Use o PDF para Word no resultado para editar o texto.
- Aplicar OCR a texto manuscrito. O Tesseract foi treinado com texto impresso; as notas manuscritas, na sua maioria, não são reconhecidas.
Perguntas frequentes
O meu ficheiro é enviado para reconhecer o texto?
Não. O reconhecimento é feito no seu navegador com o tesseract.js, o motor de OCR Tesseract compilado para WebAssembly. As únicas transferências são o próprio programa e um modelo de idioma, nunca o seu documento.
Que idiomas consegue reconhecer?
Inglês, espanhol, português, francês, alemão, indonésio, chinês simplificado, japonês e árabe. Escolha o idioma do documento antes de processar; no caso do chinês, do japonês e do árabe, o inglês também é reconhecido, para que as palavras misturadas saiam corretas.
Posso editar o texto depois do OCR?
O PDF mantém o aspeto original, com o texto reconhecido numa camada invisível que pode selecionar, pesquisar e copiar. Para editar o texto, passe o resultado pelo PDF para Word, que extrai essa camada para um ficheiro .docx.
Porque é que algumas palavras estão erradas?
A precisão do OCR depende da digitalização. Páginas desfocadas, inclinadas ou de baixa resolução, texto manuscrito e tipos de letra decorativos produzem mais erros. Para obter melhores resultados, digitalize a 300 dpi, mantenha a página direita e use um bom contraste.
Checklist
- A digitalização está nítida, direita e tem pelo menos 200 a 300 dpi
- O idioma do documento foi selecionado
- O PDF não tem palavra-passe
- Foi pesquisada no resultado uma palavra da página
- Os valores e os nomes importantes foram verificados a olho