Sådan gør du en scannet PDF søgbar (OCR)
Senest opdateret: 7. juli 2026
Du trykker Ctrl+F, skriver det fakturanummer, du ved er derinde et sted, og får ingenting. Dokumentet ligger lige foran dig, nummeret står tydeligt på side 3, men for din computer indeholder PDF'en slet ingen tekst. Det er den daglige frustration med scannede PDF'er: de ligner dokumenter, men opfører sig som fotografier.
Løsningen er OCR, og i dag behøver du hverken Acrobat, et scannerprogram eller et abonnement for at bruge den. Du kan gøre det i din browser på et par minutter og, med det rette værktøj, uden at dokumentet nogensinde forlader din maskine. Her er hvordan, plus hvad OCR realistisk kan og ikke kan gøre for dig.
Hvorfor scannede PDF'er er døde dokumenter
En PDF lavet ud fra en Word-fil eller en webside bærer rigtig tekst i sig: hvert bogstav gemmes som et tegn, og derfor kan du søge i den, markere og kopiere. En PDF lavet af en scanner eller et telefonkamera bærer ikke et eneste tegn. Hver side er ét stort billede, et foto af tekst frem for teksten selv. Søgning finder ingenting, kopiér og indsæt fanger ingenting, skærmlæsere læser ingenting, og filindeksering som Windows Search eller Spotlight går lige forbi.
OCR, en forkortelse for optisk tegngenkendelse, er teknologien, der bygger bro over kløften. En OCR-motor undersøger billedet, genkender formerne på bogstaver og ord og laver egentlig maskinlæsbar tekst med hvert ords placering på siden. Moderne motorer er bemærkelsesværdigt gode på rene trykte sider: den open source Tesseract-motor, oprindeligt udviklet hos HP og siden vedligeholdt af Google, ligger bag mange OCR-programmer til computeren og læser rutinemæssigt en anstændig kontorscanning med ganske få fejl.
Gør en scannet PDF søgbar, trin for trin
robinpdfs OCR-værktøj kører en WebAssembly-udgave af netop den Tesseract-motor direkte inde i din browser. Processen tager nogle få klik:
- Åbn siden OCR PDF.
- Klik på feltet og vælg din scannede PDF, eller træk filen ind.
- Vælg dokumentets sprog: engelsk, spansk, eller begge, hvis dokumentet blander dem. Det betyder noget at vælge det rette sprog, for motoren bruger det til at afgøre tvetydige bogstavsformer.
- Tryk på Kør OCR og lad den arbejde sig gennem siderne. Genkendelsen sker på din egen processor, så et langt dokument tager længere tid på en ældre bærbar, præcis som et OCR-program til computeren ville gøre.
- Hent resultatet. Det ser pixel for pixel identisk ud med din oprindelige scanning, men nu virker Ctrl+F, og du kan markere og kopiere teksten.
En detalje, der er værd at dvæle ved: intet bliver uploadet. Trafikken går faktisk den anden vej. Det er selve OCR-motoren, der hentes ned til din browser, første gang du bruger værktøjet, og som derefter læser dit dokument lokalt. For en scannet kontrakt, en lægeerklæring eller en kasse med gamle kontoudtog er det en reel forskel fra tjenester, der beder dig aflevere filen først. Vil du have den længere gennemgang af, hvad der sker med filer på almindelige uploadbaserede sider, har vi skrevet om det i Er online PDF-værktøjer sikre?
Sådan virker det usynlige tekstlag
En almindelig bekymring er, at OCR vil ødelægge dokumentets udseende, og med visse værktøjer, der genopbygger siden ud fra den genkendte tekst, kan det faktisk ske. Dette værktøj tager den mere sikre vej, som professionel arkiveringssoftware bruger: det bevarer det oprindelige scannede billede præcis som det er og placerer den genkendte tekst under det, usynligt, med hvert ord placeret der, hvor det står i billedet.
Resultatet kaldes ofte en sandwich-PDF. Det, du ser, er stadig den oprindelige scanning, med stempler, underskrifter, kaffepletter og det hele. Det, computeren ser, er et fuldt tekstlag på linje med billedet. Når du søger, findes træffet i det skjulte lag og fremhæves på billedet ovenover. Når du markerer og kopierer, kopierer du også fra det lag. Intet på den synlige side ændres, hvilket også betyder, at OCR aldrig forringer scanningens kvalitet: billedet føres uberørt igennem.
Det er også derfor, en netop OCR-behandlet fil kan blive lidt større end originalen: den rummer nu billedet plus teksten. Betyder størrelsen noget, så kør resultatet gennem Komprimér PDF bagefter; scanninger skrumper som regel meget.
Hvor søgbare scanninger virkelig betaler sig
- Kvitteringer og fakturaer. Scan dem, efterhånden som de kommer, OCR-behandl dem, og ved skattetid kan du søge i en hel mappe efter et leverandørnavn eller et beløb i stedet for at bladre gennem sider.
- Gamle familiedokumenter. Maskinskrevne breve, attester og optegnelser bliver søgbare og citérbare, hvilket gør slægtsforskning dramatisk hurtigere.
- Forskningsartikler. Ældre tidsskriftsartikler cirkulerer ofte som rå scanninger. OCR lader dig søge i dem og kopiere citater i stedet for at skrive dem af.
- Arkiverede kontrakter. At finde én klausul i en hylde fuld af scannede aftaler går fra en eftermiddag til et tastetryk. Hvis en kontrakt indeholder oplysninger, du skal dele forsigtigt, så kombinér OCR med Slør PDF, før du sender den videre.
Få det bedste ud af dine scanninger
OCR-nøjagtigheden afhænger langt mere af inputtet end af motoren. Nogle få vaner gør en stor forskel:
- Sigt efter 300 DPI. Det er den gamle tommelfingerregel for OCR. 200 DPI virker ofte stadig; derunder mister bogstaverne de detaljer, motoren har brug for.
- Hold siderne lige. En side, der er scannet skævt, genkendes mærkbart dårligere. De fleste scannerprogrammer har en funktion til at rette op; brug den.
- Lys jævnt op. Fotograferer du dokumenter med en telefon, så undgå skygger hen over siden og tag billedet lige oppefra.
- Foretræk sort på hvidt. Farvet papir, overstregninger og bleg toner koster alt sammen på nøjagtigheden.
- Indstil sproget korrekt. At køre en engelsk model over spansk tekst giver noget, der ser plausibelt ud, men er rent nonsens omkring tegn med accent.
- OCR-behandl én samlet fil. Kom din scanning som separate sidefiler, så saml dem til én PDF først, og OCR-behandl så det hele på én gang.
Ærlige grænser: hvad OCR ikke kan
Det er værd at være ærlig om kanterne. OCR-motorer er bygget til trykt tekst, så håndskrift er stort set uden for rækkevidde: et håndskrevet brev eller et udfyldt felt i en formular kommer ud som volapyk eller ingenting, og ingen mængde omscanning retter op på det. Scanninger af lav kvalitet, faxede dokumenter, slørede telefonfotos og bitte lille skrift giver fejl, nogle gange mange. Og selv om ordene i en tabel genkendes, gør tabellens struktur det ikke: kopier en tabel ud af en OCR-behandlet side, og du får en strøm af celleværdier, ikke rækker og kolonner, du kan sætte ind i et regneark.
Intet af dette gør OCR mindre nyttig til sin hovedopgave. Selv et ufuldkomment tekstlag med et par fejllæste tegn lader dig stadig finde den side, du skal bruge, på få sekunder, hvilket som regel er hele pointen.
Ofte stillede spørgsmål
Ser min PDF anderledes ud efter OCR?
Nej. De synlige sider er dine oprindelige scanningsbilleder, uændret. Den genkendte tekst tilføjes som et usynligt lag under dem.
Bliver mit dokument uploadet nogen steder?
Nej. Genkendelsen kører inde i din browser på din egen enhed. Motoren hentes ned til dig; din fil forlader aldrig din maskine.
Hvilke sprog understøttes?
Engelsk, spansk, eller begge sammen til dokumenter, der blander de to.
Kan den læse håndskrift?
Ikke pålideligt. OCR-motorer er trænet på trykte skrifttyper. Pæne blokbogstaver slipper nogle gange igennem; skråskrift gør ikke.
Hvorfor er OCR langsom på min maskine?
Fordi arbejdet foregår på din processor frem for på en server. En moderne bærbar klarer et typisk dokument hurtigt; en lang scanning på en gammel maskine tager et stykke tid. Det skal kun gøres én gang per fil.
Outputfilen blev større. Er det normalt?
Ja, en anelse: den indeholder nu billederne plus tekstlaget. Kør den gennem Komprimér PDF, hvis du har brug for den mindre.