Een gescande PDF doorzoekbaar maken (OCR)

Laatst bijgewerkt: 7 juli 2026

Je drukt op Ctrl+F, typt het factuurnummer in waarvan je zeker weet dat het er ergens in staat, en krijgt niets. Het document ligt vlak voor je, het nummer staat duidelijk op pagina 3, maar voor je computer bevat de PDF helemaal geen tekst. Dat is de dagelijkse ergernis van gescande PDF's: ze zien eruit als documenten, maar gedragen zich als foto's.

De oplossing is OCR, en tegenwoordig heb je daar geen Acrobat, scannersoftware of abonnement voor nodig. Je doet het in een paar minuten in je browser en, met het juiste hulpmiddel, zonder dat je document ooit je computer verlaat. Zo pak je het aan, plus wat OCR realistisch wel en niet voor je kan doen.

Waarom gescande PDF's dode documenten zijn

Een PDF die uit een Word-bestand of een webpagina komt, bevat echte tekst: elke letter is opgeslagen als een teken, en daarom kun je erin zoeken, selecteren en kopiëren. Een PDF die door een scanner of een telefooncamera wordt gemaakt, bevat geen enkel teken. Elke pagina is één grote afbeelding, een foto van tekst in plaats van de tekst zelf. Zoeken vindt niets, kopiëren en plakken pakt niets, schermlezers lezen niets voor, en bestandsindexeerders zoals Windows Search of Spotlight lopen er zo aan voorbij.

OCR, kort voor optische tekenherkenning, is de techniek die dat gat dicht. Een OCR-engine bekijkt de afbeelding, herkent de vormen van letters en woorden en levert echte, machineleesbare tekst op, met de positie van elk woord op de pagina. Moderne engines zijn opvallend goed op schone gedrukte pagina's: de open source Tesseract-engine, oorspronkelijk ontwikkeld bij HP en later onderhouden door Google, zit achter veel desktop-OCR-programma's en leest een fatsoenlijke kantoorscan doorgaans met heel weinig fouten.

Een gescande PDF doorzoekbaar maken, stap voor stap

Het OCR-hulpmiddel van robinpdf draait een WebAssembly-versie van diezelfde Tesseract-engine rechtstreeks in je browser. Het proces is een kwestie van een paar klikken:

  1. Open de pagina OCR PDF.
  2. Klik op het vak en kies je gescande PDF, of sleep het bestand erin.
  3. Kies de taal van het document: Engels, Spaans, of allebei als het document ze mengt. De juiste taal kiezen doet ertoe, want de engine gebruikt die om dubbelzinnige lettervormen op te lossen.
  4. Druk op OCR uitvoeren en laat het de pagina's doorlopen. De herkenning gebeurt op je eigen processor, dus een lang document duurt langer op een oudere laptop, precies zoals bij een desktop-OCR-programma.
  5. Download het resultaat. Het ziet er pixel voor pixel identiek uit aan je originele scan, maar Ctrl+F werkt nu en je kunt de tekst selecteren en kopiëren.

Eén detail is het waard om even bij stil te staan: er wordt niets geüpload. Het verkeer gaat juist de andere kant op. De OCR-engine zelf wordt de eerste keer dat je het hulpmiddel gebruikt naar je browser gedownload en leest je document daarna lokaal. Voor een gescand contract, een medisch verslag of een doos oude bankafschriften is dat een wezenlijk verschil met diensten die je het bestand eerst laten afstaan. Wil je de langere uitleg over wat er met bestanden gebeurt op de klassieke sites die op uploaden zijn gebaseerd, dan hebben we dat uitgeschreven in Zijn online PDF-tools veilig?

Hoe de onzichtbare tekstlaag werkt

Een veelgehoorde zorg is dat OCR het uiterlijk van het document verpest, en bij sommige hulpmiddelen die de pagina uit de herkende tekst opnieuw opbouwen, kan dat ook echt gebeuren. Dit hulpmiddel kiest de veiligere weg van professionele archiveringssoftware: het houdt de originele gescande afbeelding precies zoals ze is en plaatst de herkende tekst er onzichtbaar onder, waarbij elk woord staat waar het in de afbeelding verschijnt.

Het resultaat wordt vaak een "sandwich-PDF" genoemd. Wat je ziet is nog steeds de originele scan, inclusief stempels, handtekeningen en koffievlekken. Wat de computer ziet, is een volledige tekstlaag die op de afbeelding is uitgelijnd. Als je zoekt, wordt de treffer in de verborgen laag gevonden en op de afbeelding erboven gemarkeerd. Als je selecteert en kopieert, kopieer je ook uit die laag. Aan de zichtbare pagina verandert niets, wat ook betekent dat OCR de scankwaliteit nooit aantast: de afbeelding gaat er onaangeroerd doorheen.

Dat is ook waarom een net met OCR bewerkt bestand iets groter kan zijn dan het origineel: het bevat nu de afbeelding plus de tekst. Als de grootte ertoe doet, haal het resultaat er daarna doorheen met PDF comprimeren; scans krimpen meestal flink.

Waar doorzoekbare scans zich echt uitbetalen

Zo haal je het beste uit je scans

De nauwkeurigheid van OCR hangt veel sterker af van de invoer dan van de engine. Een paar gewoontes maken een groot verschil:

Eerlijke grenzen: wat OCR niet doet

Het is goed om eerlijk te zijn over de randen. OCR-engines zijn gebouwd voor gedrukte tekst, dus handschrift blijft grotendeels buiten bereik: een handgeschreven brief of een met de hand ingevuld formulierveld komt eruit als wartaal of helemaal niet, en geen enkele nieuwe scan lost dat op. Scans van slechte kwaliteit, gefaxte documenten, wazige telefoonfoto's en piepkleine letters leveren fouten op, soms veel. En hoewel de woorden in een tabel worden herkend, geldt dat niet voor de structuur van de tabel: kopieer een tabel uit een OCR-pagina en je krijgt een stroom celwaarden, geen rijen en kolommen die je in een spreadsheet kunt plakken.

Niets hiervan maakt OCR minder nuttig voor zijn hoofdtaak. Zelfs een onvolmaakte tekstlaag met een paar verkeerd gelezen tekens laat je de pagina die je nodig hebt in seconden vinden, en daar gaat het meestal om.

Veelgestelde vragen

Ziet mijn PDF er anders uit na OCR?

Nee. De zichtbare pagina's zijn je originele scanafbeeldingen, ongewijzigd. De herkende tekst wordt eronder toegevoegd als onzichtbare laag.

Wordt mijn document ergens geüpload?

Nee. De herkenning draait in je browser op je eigen apparaat. De engine wordt naar jou gedownload; je bestand verlaat je computer nooit.

Welke talen worden ondersteund?

Engels, Spaans, of allebei samen voor documenten die de twee mengen.

Kan het handschrift lezen?

Niet betrouwbaar. OCR-engines zijn getraind op drukletters. Nette blokletters komen soms door; schuinschrift niet.

Waarom is OCR traag op mijn computer?

Omdat het werk op je processor gebeurt en niet op een server. Een moderne laptop handelt een gewoon document snel af; een lange scan op een oude machine duurt even. Het hoeft maar één keer per bestand.

Het uitvoerbestand werd groter. Is dat normaal?

Ja, een beetje: het bevat nu de afbeeldingen plus de tekstlaag. Haal het door PDF comprimeren als je het kleiner nodig hebt.

Maak je gescande PDF doorzoekbaar →