Comment rendre un PDF scanné interrogeable (OCR)

Dernière mise à jour: 7 juillet 2026

Vous appuyez sur Ctrl+F, vous tapez le numéro de facture qui se trouve forcément quelque part dans le document, et rien. Le document est sous vos yeux, le numéro est parfaitement lisible en page 3, mais pour votre ordinateur ce PDF ne contient pas le moindre texte. C'est la frustration quotidienne des PDF scannés : ils ressemblent à des documents, mais ils se comportent comme des photographies.

La solution, c'est l'OCR, et il n'y a plus besoin d'Acrobat, d'une suite de numérisation ou d'un abonnement pour s'en servir. Vous pouvez le faire dans votre navigateur en quelques minutes et, avec le bon outil, sans que votre document ne quitte jamais votre machine. Voici comment procéder, et aussi ce que l'OCR peut et ne peut pas faire de manière réaliste.

Pourquoi les PDF scannés sont des documents morts

Un PDF créé à partir d'un fichier Word ou d'une page web contient du vrai texte : chaque lettre y est stockée comme un caractère, et c'est pour cela que vous pouvez le rechercher, le sélectionner et le copier. Un PDF produit par un scanner ou par l'appareil photo d'un téléphone ne contient aucun caractère. Chaque page est une grande image, une photo du texte plutôt que le texte lui-même. La recherche ne trouve rien, le copier-coller n'attrape rien, les lecteurs d'écran ne lisent rien, et les indexeurs de fichiers comme Windows Search ou Spotlight passent leur chemin.

L'OCR, pour reconnaissance optique de caractères, est la technologie qui comble ce fossé. Un moteur d'OCR examine l'image, reconnaît la forme des lettres et des mots et produit du texte réellement lisible par la machine, avec la position de chaque mot sur la page. Les moteurs modernes sont remarquablement bons sur des pages imprimées propres : le moteur open source Tesseract, développé à l'origine chez HP puis maintenu par Google, équipe de nombreuses applications d'OCR de bureau et lit couramment un scan de bureau correct avec très peu d'erreurs.

Rendre un PDF scanné interrogeable, étape par étape

L'outil OCR de robinpdf exécute une version WebAssembly de ce même moteur Tesseract directement dans votre navigateur. Le processus tient en quelques clics :

  1. Ouvrez la page OCR PDF.
  2. Cliquez sur la zone et choisissez votre PDF scanné, ou glissez-déposez le fichier.
  3. Choisissez la langue du document : anglais, espagnol, ou les deux si le document les mélange. Bien choisir la langue compte, car le moteur s'en sert pour trancher les formes de lettres ambiguës.
  4. Appuyez sur Lancer l'OCR et laissez-le parcourir les pages. La reconnaissance s'effectue sur votre propre processeur, donc un long document prendra plus de temps sur un vieil ordinateur portable, exactement comme avec un logiciel d'OCR de bureau.
  5. Téléchargez le résultat. Il est identique au pixel près à votre scan d'origine, mais Ctrl+F fonctionne désormais et vous pouvez sélectionner et copier le texte.

Un détail mérite qu'on s'y arrête : rien n'est envoyé sur un serveur. Le trafic circule en réalité dans l'autre sens. C'est le moteur d'OCR qui se télécharge dans votre navigateur la première fois que vous utilisez l'outil, puis il lit votre document en local. Pour un contrat scanné, un compte rendu médical ou un carton de vieux relevés bancaires, la différence est réelle par rapport aux services qui vous demandent d'abord de leur confier le fichier. Pour une discussion plus complète sur ce qui arrive aux fichiers sur les sites classiques à téléversement, nous avons détaillé le sujet dans Les outils PDF en ligne sont-ils sûrs ?

Comment fonctionne la couche de texte invisible

Une crainte fréquente est que l'OCR abîme l'apparence du document, et avec certains outils qui reconstruisent la page à partir du texte reconnu, c'est un risque bien réel. Cet outil emprunte la voie la plus sûre, celle des logiciels d'archivage professionnels : il conserve l'image scannée d'origine telle quelle et place le texte reconnu en dessous, de façon invisible, chaque mot étant positionné là où il apparaît dans l'image.

Le résultat est souvent appelé "PDF sandwich". Ce que vous voyez reste le scan d'origine, tampons, signatures et taches de café compris. Ce que voit l'ordinateur, c'est une couche complète de texte alignée sur l'image. Quand vous lancez une recherche, la correspondance est trouvée dans la couche cachée et surlignée sur l'image au-dessus. Quand vous sélectionnez et copiez, c'est aussi depuis cette couche. Rien ne change sur la page visible, ce qui signifie aussi que l'OCR ne dégrade jamais la qualité du scan : l'image passe sans être retouchée.

C'est aussi pour cela qu'un fichier fraîchement passé à l'OCR peut être un peu plus lourd que l'original : il contient désormais l'image plus le texte. Si la taille compte, passez ensuite le résultat dans Compresser PDF ; les scans fondent généralement beaucoup.

Là où les scans interrogeables font vraiment la différence

Tirer le meilleur de vos scans

La précision de l'OCR dépend bien plus de la qualité du document d'entrée que du moteur. Quelques habitudes changent tout :

Des limites assumées : ce que l'OCR ne fera pas

Autant être franc sur les limites. Les moteurs d'OCR sont conçus pour le texte imprimé, donc l'écriture manuscrite reste largement hors de portée : une lettre manuscrite ou un champ de formulaire rempli à la main ressortira en charabia, voire pas du tout, et aucun nouveau scan n'y changera rien. Les scans de mauvaise qualité, les documents faxés, les photos floues de téléphone et les toutes petites polices produiront des erreurs, parfois nombreuses. Et si les mots d'un tableau sont bien reconnus, sa structure ne l'est pas : copiez un tableau depuis une page passée à l'OCR et vous obtenez un flot de valeurs de cellules, pas des lignes et des colonnes à coller dans un tableur.

Rien de tout cela ne rend l'OCR moins utile pour sa mission principale. Même une couche de texte imparfaite, avec quelques caractères mal lus, vous permet de retrouver en quelques secondes la page qu'il vous faut, et c'est généralement tout ce qu'on lui demande.

Questions fréquentes

Mon PDF aura-t-il un aspect différent après l'OCR ?

Non. Les pages visibles sont les images de votre scan d'origine, inchangées. Le texte reconnu est ajouté sous forme de couche invisible en dessous.

Mon document est-il envoyé quelque part ?

Non. La reconnaissance s'exécute dans votre navigateur, sur votre propre appareil. C'est le moteur qui est téléchargé chez vous ; votre fichier ne quitte jamais votre machine.

Quelles langues sont prises en charge ?

L'anglais, l'espagnol, ou les deux ensemble pour les documents qui mélangent les deux.

Peut-il lire l'écriture manuscrite ?

Pas de manière fiable. Les moteurs d'OCR sont entraînés sur des caractères d'imprimerie. Des majuscules d'imprimerie bien nettes passent parfois ; la cursive, non.

Pourquoi l'OCR est-il lent sur ma machine ?

Parce que le travail se fait sur votre processeur et non sur un serveur. Un ordinateur portable récent traite rapidement un document classique ; un long scan sur une vieille machine prend un moment. Il ne faut le faire qu'une fois par fichier.

Le fichier de sortie est plus gros. C'est normal ?

Oui, légèrement : il contient désormais les images plus la couche de texte. Passez-le dans Compresser PDF s'il vous le faut plus léger.

Rendez votre PDF scanné interrogeable →