Como tornar um PDF escaneado pesquisável (OCR)
Última atualização: 7 de julho de 2026
Você aperta Ctrl+F, digita o número da nota fiscal que sabe que está ali em algum lugar e não encontra nada. O documento está bem na sua frente, o número aparece claramente na página 3, mas, para o computador, o PDF não contém texto nenhum. Essa é a frustração cotidiana dos PDFs escaneados: eles parecem documentos, mas se comportam como fotografias.
A solução é o OCR, e hoje você não precisa do Acrobat, do programa do scanner nem de assinatura para usá-lo. Dá para fazer no navegador em alguns minutos e, com a ferramenta certa, sem que o documento saia da sua máquina em momento algum. Veja como fazer, além do que o OCR pode e não pode fazer de forma realista.
Por que PDFs escaneados são documentos mortos
Um PDF criado a partir de um arquivo do Word ou de uma página da web carrega texto de verdade por dentro: cada letra é armazenada como um caractere, e é por isso que você consegue pesquisar, selecionar e copiar. Um PDF gerado por um scanner ou pela câmera do celular não carrega caractere nenhum. Cada página é uma grande imagem, uma foto do texto em vez do texto em si. A busca não encontra nada, o copiar e colar não captura nada, os leitores de tela não leem nada e indexadores de arquivos como o Windows Search ou o Spotlight passam direto.
OCR, sigla em inglês para reconhecimento óptico de caracteres, é a tecnologia que fecha essa lacuna. Um motor de OCR examina a imagem, reconhece as formas das letras e das palavras e produz texto de verdade, legível por máquina, com a posição de cada palavra na página. Os motores modernos são notavelmente bons com páginas impressas limpas: o Tesseract, motor de código aberto criado originalmente na HP e depois mantido pelo Google, está por trás de muitos aplicativos de OCR para desktop e costuma ler um escaneamento razoável de escritório com pouquíssimos erros.
Torne um PDF escaneado pesquisável, passo a passo
A ferramenta de OCR do robinpdf executa uma versão WebAssembly desse mesmo motor Tesseract diretamente no seu navegador. O processo leva poucos cliques:
- Abra a página OCR PDF.
- Clique na caixa e escolha o seu PDF escaneado, ou arraste o arquivo para lá.
- Escolha o idioma do documento: inglês, espanhol ou os dois, se o documento misturar ambos. Escolher o idioma certo importa, porque o motor o usa para resolver formas de letras ambíguas.
- Aperte Executar OCR e deixe-o percorrer as páginas. O reconhecimento acontece no seu próprio processador, então um documento longo demora mais em um notebook antigo, exatamente como em um aplicativo de OCR de desktop.
- Baixe o resultado. Ele fica idêntico, pixel por pixel, ao escaneamento original, mas o Ctrl+F agora funciona e você pode selecionar e copiar o texto.
Um detalhe que merece atenção: nada é enviado para fora. Na verdade, o tráfego flui no sentido contrário. O próprio motor de OCR é baixado para o seu navegador na primeira vez que você usa a ferramenta e, depois, lê o documento localmente. Para um contrato escaneado, um laudo médico ou uma caixa de extratos bancários antigos, isso faz uma diferença real em relação a serviços que pedem o arquivo primeiro. Se quiser a discussão mais longa sobre o que acontece com os arquivos nos sites convencionais baseados em upload, escrevemos sobre isso em Ferramentas de PDF online são seguras?
Como funciona a camada de texto invisível
Uma preocupação comum é que o OCR bagunce a aparência do documento e, com algumas ferramentas que reconstroem a página a partir do texto reconhecido, isso pode acontecer de verdade. Esta ferramenta segue o caminho mais seguro, usado pelos softwares profissionais de arquivamento: mantém a imagem escaneada original exatamente como está e coloca o texto reconhecido por baixo dela, de forma invisível, com cada palavra posicionada onde aparece na imagem.
O resultado costuma ser chamado de "PDF sanduíche". O que você vê continua sendo o escaneamento original, com carimbos, assinaturas e manchas de café inclusos. O que o computador vê é uma camada completa de texto alinhada com a imagem. Quando você pesquisa, a correspondência é encontrada na camada oculta e destacada na imagem acima dela. Quando seleciona e copia, também está copiando dessa camada. Nada na página visível muda, o que também significa que o OCR nunca degrada a qualidade do escaneamento: a imagem passa intocada.
É também por isso que um arquivo recém-processado pelo OCR pode ficar um pouco maior que o original: agora ele guarda a imagem mais o texto. Se o tamanho importa, passe o resultado depois pelo Comprimir PDF; escaneamentos costumam encolher bastante.
Onde escaneamentos pesquisáveis realmente valem a pena
- Recibos e notas fiscais. Escaneie conforme chegam, rode o OCR e, na hora do imposto de renda, pesquise uma pasta inteira pelo nome de um fornecedor ou por um valor em vez de folhear páginas.
- Documentos antigos de família. Cartas datilografadas, certidões e registros passam a ser pesquisáveis e citáveis, o que acelera muito o trabalho de genealogia.
- Artigos científicos. Artigos antigos de periódicos costumam circular como escaneamentos brutos. O OCR permite pesquisar neles e copiar citações em vez de redigitar trechos.
- Contratos arquivados. Encontrar uma cláusula em uma prateleira de acordos escaneados passa de uma tarde inteira para um toque de tecla. Se um contrato tem detalhes que você precisa compartilhar com cuidado, combine o OCR com o Tarjar PDF antes de repassá-lo.
Como obter os melhores resultados dos seus escaneamentos
A precisão do OCR depende muito mais do original do que do motor. Alguns hábitos fazem uma grande diferença:
- Mire em 300 DPI. É a regra de bolso clássica do OCR. Com 200 DPI muitas vezes ainda funciona; abaixo disso, as letras perdem o detalhe de que o motor precisa.
- Mantenha as páginas retas. Uma página escaneada torta é reconhecida visivelmente pior. A maioria dos programas de scanner tem uma opção de alinhamento automático; use-a.
- Ilumine por igual. Se fotografar documentos com o celular, evite sombras sobre a página e fotografe de cima, na vertical.
- Prefira preto no branco. Papel colorido, marcações de marca-texto e toner fraco custam precisão.
- Configure o idioma corretamente. Rodar um modelo de inglês sobre texto em espanhol produz um disparate de aparência plausível em volta dos caracteres acentuados.
- Rode o OCR em um único arquivo combinado. Se o escaneamento chegou como arquivos de página separados, junte tudo em um único PDF primeiro e depois rode o OCR de uma vez só.
Limites honestos: o que o OCR não vai fazer
Vale ser franco sobre os limites. Motores de OCR são feitos para texto impresso, então a escrita à mão fica, em grande parte, fora de alcance: uma carta manuscrita ou um campo de formulário preenchido à mão vai sair como algo sem sentido, ou nem sair, e nenhum reescaneamento resolve isso. Escaneamentos de baixa qualidade, documentos de fax, fotos tremidas de celular e letras minúsculas vão gerar erros, às vezes muitos. E, embora as palavras de uma tabela sejam reconhecidas, a estrutura dela não é: copie uma tabela de uma página com OCR e você recebe um fluxo de valores de células, não linhas e colunas prontas para colar em uma planilha.
Nada disso torna o OCR menos útil para a sua função principal. Mesmo uma camada de texto imperfeita, com alguns caracteres lidos errado, ainda permite encontrar em segundos a página de que você precisa, e normalmente é disso que se trata.
Perguntas frequentes
Meu PDF vai ficar diferente depois do OCR?
Não. As páginas visíveis são as imagens do seu escaneamento original, sem alterações. O texto reconhecido é adicionado como uma camada invisível por baixo delas.
Meu documento é enviado para algum lugar?
Não. O reconhecimento roda dentro do navegador, no seu próprio dispositivo. O motor é baixado para você; seu arquivo nunca sai da sua máquina.
Quais idiomas são compatíveis?
Inglês, espanhol ou os dois juntos, para documentos que misturam ambos.
Ele consegue ler manuscritos?
Não de forma confiável. Motores de OCR são treinados com tipos impressos. Letra de forma bem caprichada às vezes passa; letra cursiva, não.
Por que o OCR é lento na minha máquina?
Porque o trabalho acontece no seu processador, e não em um servidor. Um notebook moderno dá conta de um documento típico rapidamente; um escaneamento longo em uma máquina antiga leva um tempo. Só precisa ser feito uma vez por arquivo.
O arquivo final ficou maior. Isso é normal?
Sim, um pouco: agora ele contém as imagens mais a camada de texto. Passe-o pelo Comprimir PDF se precisar dele menor.