Cómo hacer que un PDF escaneado se pueda buscar (OCR)
Última actualización: 7 de julio de 2026
Pulsas Ctrl+F, escribes el número de factura que sabes que está ahí dentro y no aparece nada. El documento lo tienes delante, el número se ve perfectamente en la página 3, pero para tu ordenador el PDF no contiene texto alguno. Esa es la frustración cotidiana de los PDF escaneados: parecen documentos, pero se comportan como fotografías.
La solución es el OCR, y hoy en día no necesitas Acrobat, la suite del escáner ni una suscripción para usarlo. Puedes hacerlo en tu navegador en un par de minutos y, si eliges la herramienta adecuada, sin que el documento salga de tu equipo en ningún momento. Aquí tienes cómo, y también qué puede y qué no puede hacer el OCR de forma realista.
Por qué los PDF escaneados son documentos muertos
Un PDF creado a partir de un archivo de Word o de una página web lleva texto de verdad en su interior: cada letra se guarda como un carácter, y por eso puedes buscarlo, seleccionarlo y copiarlo. Un PDF generado por un escáner o por la cámara del móvil no contiene ni un solo carácter. Cada página es una gran imagen, una foto del texto en lugar del texto en sí. La búsqueda no encuentra nada, copiar y pegar no captura nada, los lectores de pantalla no leen nada y los indexadores de archivos como Windows Search o Spotlight pasan de largo.
El OCR, siglas en inglés de reconocimiento óptico de caracteres, es la tecnología que salva esa distancia. Un motor de OCR examina la imagen, reconoce las formas de letras y palabras y produce texto legible por la máquina con la posición de cada palabra en la página. Los motores modernos son sorprendentemente buenos con páginas impresas limpias: el motor de código abierto Tesseract, desarrollado originalmente en HP y mantenido después por Google, está detrás de muchas aplicaciones de OCR de escritorio y lee un escaneo de oficina decente con muy pocos errores.
Haz que un PDF escaneado se pueda buscar, paso a paso
La herramienta de OCR de robinpdf ejecuta una versión WebAssembly de ese mismo motor Tesseract directamente en tu navegador. El proceso son unos pocos clics:
- Abre la página OCR PDF.
- Haz clic en el recuadro y elige tu PDF escaneado, o arrastra el archivo.
- Selecciona el idioma del documento: inglés, español o ambos si el documento los mezcla. Elegir bien el idioma importa, porque el motor lo usa para resolver formas de letras ambiguas.
- Pulsa Ejecutar OCR y deja que recorra las páginas. El reconocimiento se hace en tu propio procesador, así que un documento largo tarda más en un portátil antiguo, exactamente igual que en una aplicación de OCR de escritorio.
- Descarga el resultado. Es idéntico píxel a píxel a tu escaneo original, pero ahora Ctrl+F funciona y puedes seleccionar y copiar el texto.
Hay un detalle en el que merece la pena detenerse: no se sube nada. El tráfico, de hecho, va en sentido contrario. El propio motor de OCR se descarga a tu navegador la primera vez que usas la herramienta y después lee tu documento en local. Para un contrato escaneado, un informe médico o una caja de extractos bancarios antiguos, es una diferencia importante frente a los servicios que te piden entregar el archivo primero. Si quieres la explicación larga de qué pasa con los archivos en los sitios convencionales basados en subidas, la tienes en ¿Son seguras las herramientas PDF online?
Cómo funciona la capa de texto invisible
Una preocupación habitual es que el OCR estropee el aspecto del documento y, con algunas herramientas que reconstruyen la página a partir del texto reconocido, puede pasar de verdad. Esta herramienta sigue la vía más segura, la que usa el software de archivado profesional: conserva la imagen escaneada original exactamente como está y coloca el texto reconocido debajo, de forma invisible, con cada palabra situada donde aparece en la imagen.
Al resultado se le suele llamar "PDF sándwich". Lo que tú ves sigue siendo el escaneo original, con sus sellos, firmas y manchas de café incluidos. Lo que ve el ordenador es una capa completa de texto alineada con la imagen. Cuando buscas, la coincidencia se encuentra en la capa oculta y se resalta sobre la imagen. Cuando seleccionas y copias, también estás copiando de esa capa. Nada de la página visible cambia, lo que además significa que el OCR nunca degrada la calidad del escaneo: la imagen pasa intacta.
Por eso mismo un archivo recién pasado por OCR puede ser algo más grande que el original: ahora contiene la imagen más el texto. Si el tamaño importa, pasa después el resultado por Comprimir PDF; los escaneos suelen reducirse mucho.
Dónde compensa de verdad un escaneo buscable
- Recibos y facturas. Escanéalos según llegan, pásales el OCR y, cuando toque la declaración, podrás buscar en toda una carpeta el nombre de un proveedor o un importe en lugar de hojear páginas.
- Documentos familiares antiguos. Cartas mecanografiadas, certificados y registros pasan a poder buscarse y citarse, lo que acelera muchísimo el trabajo de genealogía.
- Artículos de investigación. Los artículos antiguos de revistas suelen circular como escaneos en bruto. El OCR te permite buscar en ellos y copiar citas en lugar de reescribirlas.
- Contratos archivados. Encontrar una cláusula entre una estantería de acuerdos escaneados pasa de una tarde a una pulsación de tecla. Si un contrato contiene datos que debes compartir con cuidado, combina el OCR con Censurar PDF antes de reenviarlo.
Cómo sacar los mejores resultados de tus escaneos
La precisión del OCR depende mucho más del original que del motor. Unos pocos hábitos marcan una gran diferencia:
- Apunta a 300 DPI. Es la regla de oro clásica del OCR. Con 200 DPI a menudo aún funciona; por debajo, las letras pierden el detalle que el motor necesita.
- Mantén las páginas rectas. Una página escaneada torcida se reconoce notablemente peor. Casi todo el software de escáner tiene una opción de enderezado; úsala.
- Ilumina de manera uniforme. Si fotografías documentos con el móvil, evita las sombras sobre la página y dispara desde justo encima.
- Mejor negro sobre blanco. El papel de color, las marcas de rotulador fluorescente y el tóner desvaído restan precisión.
- Configura bien el idioma. Pasar un modelo de inglés sobre texto en español produce disparates de aspecto verosímil alrededor de los caracteres acentuados.
- Pasa el OCR a un único archivo combinado. Si el escaneo te llegó como archivos de página sueltos, únelos primero en un solo PDF y después pásale el OCR a todo de una vez.
Límites honestos: lo que el OCR no hará
Conviene ser claros con los límites. Los motores de OCR están hechos para texto impreso, así que la escritura a mano queda en gran medida fuera de su alcance: una carta manuscrita o un campo de formulario rellenado a mano saldrán como un galimatías o directamente vacíos, y por mucho que vuelvas a escanear no se arregla. Los escaneos de baja calidad, los documentos enviados por fax, las fotos borrosas de móvil y la letra minúscula producirán errores, a veces muchos. Y aunque las palabras de una tabla sí se reconocen, su estructura no: copia una tabla de una página con OCR y obtendrás un chorro de valores de celda, no filas y columnas que puedas pegar en una hoja de cálculo.
Nada de esto hace al OCR menos útil para su cometido principal. Incluso una capa de texto imperfecta, con algunos caracteres mal leídos, te sigue permitiendo encontrar en segundos la página que necesitas, que suele ser de lo que se trata.
Preguntas frecuentes
¿Mi PDF se verá distinto después del OCR?
No. Las páginas visibles son las imágenes de tu escaneo original, sin cambios. El texto reconocido se añade como una capa invisible debajo de ellas.
¿Mi documento se sube a algún sitio?
No. El reconocimiento se ejecuta dentro de tu navegador, en tu propio dispositivo. El motor se descarga hacia ti; tu archivo nunca sale de tu equipo.
¿Qué idiomas se admiten?
Inglés, español o ambos a la vez para documentos que mezclan los dos.
¿Puede leer escritura a mano?
No de forma fiable. Los motores de OCR se entrenan con tipografía impresa. Las mayúsculas de imprenta muy claras a veces pasan; la cursiva no.
¿Por qué el OCR va lento en mi equipo?
Porque el trabajo se hace en tu procesador y no en un servidor. Un portátil moderno despacha un documento típico con rapidez; un escaneo largo en una máquina antigua lleva un rato. Solo hay que hacerlo una vez por archivo.
El archivo de salida ha crecido. ¿Es normal?
Sí, un poco: ahora contiene las imágenes más la capa de texto. Pásalo por Comprimir PDF si lo necesitas más pequeño.