Een gescande PDF doorzoekbaar maken (OCR)
Laatst bijgewerkt: 7 juli 2026
Je drukt op Ctrl+F, typt het factuurnummer in waarvan je zeker weet dat het er ergens in staat, en krijgt niets. Het document ligt vlak voor je, het nummer staat duidelijk op pagina 3, maar voor je computer bevat de PDF helemaal geen tekst. Dat is de dagelijkse ergernis van gescande PDF's: ze zien eruit als documenten, maar gedragen zich als foto's.
De oplossing is OCR, en tegenwoordig heb je daar geen Acrobat, scannersoftware of abonnement voor nodig. Je doet het in een paar minuten in je browser en, met het juiste hulpmiddel, zonder dat je document ooit je computer verlaat. Zo pak je het aan, plus wat OCR realistisch wel en niet voor je kan doen.
Waarom gescande PDF's dode documenten zijn
Een PDF die uit een Word-bestand of een webpagina komt, bevat echte tekst: elke letter is opgeslagen als een teken, en daarom kun je erin zoeken, selecteren en kopiëren. Een PDF die door een scanner of een telefooncamera wordt gemaakt, bevat geen enkel teken. Elke pagina is één grote afbeelding, een foto van tekst in plaats van de tekst zelf. Zoeken vindt niets, kopiëren en plakken pakt niets, schermlezers lezen niets voor, en bestandsindexeerders zoals Windows Search of Spotlight lopen er zo aan voorbij.
OCR, kort voor optische tekenherkenning, is de techniek die dat gat dicht. Een OCR-engine bekijkt de afbeelding, herkent de vormen van letters en woorden en levert echte, machineleesbare tekst op, met de positie van elk woord op de pagina. Moderne engines zijn opvallend goed op schone gedrukte pagina's: de open source Tesseract-engine, oorspronkelijk ontwikkeld bij HP en later onderhouden door Google, zit achter veel desktop-OCR-programma's en leest een fatsoenlijke kantoorscan doorgaans met heel weinig fouten.
Een gescande PDF doorzoekbaar maken, stap voor stap
Het OCR-hulpmiddel van robinpdf draait een WebAssembly-versie van diezelfde Tesseract-engine rechtstreeks in je browser. Het proces is een kwestie van een paar klikken:
- Open de pagina OCR PDF.
- Klik op het vak en kies je gescande PDF, of sleep het bestand erin.
- Kies de taal van het document: Engels, Spaans, of allebei als het document ze mengt. De juiste taal kiezen doet ertoe, want de engine gebruikt die om dubbelzinnige lettervormen op te lossen.
- Druk op OCR uitvoeren en laat het de pagina's doorlopen. De herkenning gebeurt op je eigen processor, dus een lang document duurt langer op een oudere laptop, precies zoals bij een desktop-OCR-programma.
- Download het resultaat. Het ziet er pixel voor pixel identiek uit aan je originele scan, maar Ctrl+F werkt nu en je kunt de tekst selecteren en kopiëren.
Eén detail is het waard om even bij stil te staan: er wordt niets geüpload. Het verkeer gaat juist de andere kant op. De OCR-engine zelf wordt de eerste keer dat je het hulpmiddel gebruikt naar je browser gedownload en leest je document daarna lokaal. Voor een gescand contract, een medisch verslag of een doos oude bankafschriften is dat een wezenlijk verschil met diensten die je het bestand eerst laten afstaan. Wil je de langere uitleg over wat er met bestanden gebeurt op de klassieke sites die op uploaden zijn gebaseerd, dan hebben we dat uitgeschreven in Zijn online PDF-tools veilig?
Hoe de onzichtbare tekstlaag werkt
Een veelgehoorde zorg is dat OCR het uiterlijk van het document verpest, en bij sommige hulpmiddelen die de pagina uit de herkende tekst opnieuw opbouwen, kan dat ook echt gebeuren. Dit hulpmiddel kiest de veiligere weg van professionele archiveringssoftware: het houdt de originele gescande afbeelding precies zoals ze is en plaatst de herkende tekst er onzichtbaar onder, waarbij elk woord staat waar het in de afbeelding verschijnt.
Het resultaat wordt vaak een "sandwich-PDF" genoemd. Wat je ziet is nog steeds de originele scan, inclusief stempels, handtekeningen en koffievlekken. Wat de computer ziet, is een volledige tekstlaag die op de afbeelding is uitgelijnd. Als je zoekt, wordt de treffer in de verborgen laag gevonden en op de afbeelding erboven gemarkeerd. Als je selecteert en kopieert, kopieer je ook uit die laag. Aan de zichtbare pagina verandert niets, wat ook betekent dat OCR de scankwaliteit nooit aantast: de afbeelding gaat er onaangeroerd doorheen.
Dat is ook waarom een net met OCR bewerkt bestand iets groter kan zijn dan het origineel: het bevat nu de afbeelding plus de tekst. Als de grootte ertoe doet, haal het resultaat er daarna doorheen met PDF comprimeren; scans krimpen meestal flink.
Waar doorzoekbare scans zich echt uitbetalen
- Bonnen en facturen. Scan ze zodra ze binnenkomen, laat er OCR overheen gaan, en in belastingtijd doorzoek je een hele map op een leveranciersnaam of een bedrag in plaats van pagina's door te bladeren.
- Oude familiedocumenten. Getypte brieven, aktes en registers worden doorzoekbaar en citeerbaar, waardoor stamboomonderzoek veel sneller gaat.
- Wetenschappelijke artikelen. Oudere tijdschriftartikelen circuleren vaak als ruwe scans. Met OCR kun je erin zoeken en citaten kopiëren in plaats van passages over te typen.
- Gearchiveerde contracten. Eén clausule terugvinden in een hele plank vol gescande overeenkomsten gaat van een middag naar een toetsaanslag. Bevat een contract gegevens die je zorgvuldig moet delen, combineer OCR dan met PDF redigeren voordat je het doorstuurt.
Zo haal je het beste uit je scans
De nauwkeurigheid van OCR hangt veel sterker af van de invoer dan van de engine. Een paar gewoontes maken een groot verschil:
- Mik op 300 DPI. Dat is de aloude vuistregel voor OCR. 200 DPI werkt vaak nog; daaronder verliezen de letters het detail dat de engine nodig heeft.
- Houd de pagina's recht. Een scheef gescande pagina wordt merkbaar slechter herkend. De meeste scannersoftware heeft een rechtzet-optie; gebruik die.
- Verlicht gelijkmatig. Als je documenten met een telefoon fotografeert, vermijd schaduwen over de pagina en fotografeer recht van bovenaf.
- Geef de voorkeur aan zwart op wit. Gekleurd papier, markeerstiftstrepen en flauwe toner kosten allemaal nauwkeurigheid.
- Stel de taal juist in. Een Engels model over Spaanse tekst halen levert plausibel ogende onzin op rond de letters met accenten.
- Voer OCR uit op één samengevoegd bestand. Kwam je scan binnen als losse paginabestanden, voeg ze dan eerst samen tot één PDF en laat OCR er daarna in één keer overheen gaan.
Eerlijke grenzen: wat OCR niet doet
Het is goed om eerlijk te zijn over de randen. OCR-engines zijn gebouwd voor gedrukte tekst, dus handschrift blijft grotendeels buiten bereik: een handgeschreven brief of een met de hand ingevuld formulierveld komt eruit als wartaal of helemaal niet, en geen enkele nieuwe scan lost dat op. Scans van slechte kwaliteit, gefaxte documenten, wazige telefoonfoto's en piepkleine letters leveren fouten op, soms veel. En hoewel de woorden in een tabel worden herkend, geldt dat niet voor de structuur van de tabel: kopieer een tabel uit een OCR-pagina en je krijgt een stroom celwaarden, geen rijen en kolommen die je in een spreadsheet kunt plakken.
Niets hiervan maakt OCR minder nuttig voor zijn hoofdtaak. Zelfs een onvolmaakte tekstlaag met een paar verkeerd gelezen tekens laat je de pagina die je nodig hebt in seconden vinden, en daar gaat het meestal om.
Veelgestelde vragen
Ziet mijn PDF er anders uit na OCR?
Nee. De zichtbare pagina's zijn je originele scanafbeeldingen, ongewijzigd. De herkende tekst wordt eronder toegevoegd als onzichtbare laag.
Wordt mijn document ergens geüpload?
Nee. De herkenning draait in je browser op je eigen apparaat. De engine wordt naar jou gedownload; je bestand verlaat je computer nooit.
Welke talen worden ondersteund?
Engels, Spaans, of allebei samen voor documenten die de twee mengen.
Kan het handschrift lezen?
Niet betrouwbaar. OCR-engines zijn getraind op drukletters. Nette blokletters komen soms door; schuinschrift niet.
Waarom is OCR traag op mijn computer?
Omdat het werk op je processor gebeurt en niet op een server. Een moderne laptop handelt een gewoon document snel af; een lange scan op een oude machine duurt even. Het hoeft maar één keer per bestand.
Het uitvoerbestand werd groter. Is dat normaal?
Ja, een beetje: het bevat nu de afbeeldingen plus de tekstlaag. Haal het door PDF comprimeren als je het kleiner nodig hebt.