Slik gjør du bilder om til en søkbar PDF

  1. Legg til bildene dine. Slipp JPG-, PNG- eller WebP-bilder på verktøyet, eller trykk for å velge dem. Hver side vises som et kort — dra håndtaket for å endre rekkefølge, eller fjern de du ikke vil ha.
  2. Velg språket. Velg språket dokumentene er skrevet på. Gjenkjenningsdataene for det språket lastes ned én gang (størrelsen vises ved siden av velgeren) — bildene dine forlater fortsatt aldri enheten din.
  3. Gjenkjenn. Trykk «Gjenkjenn tekst» og se hvert sidekort gå fra ventende til ferdig, med et løpende ordantall. Du kan avbryte underveis; ingenting beholdes.
  4. Sjekk og last ned. Den gjenkjente teksten vises per side slik at du kan verifisere den før du stoler på den. Gi utdatafilen et navn, last deretter ned den søkbare PDF-en, hent den rene .txt-filen, eller kopier alt til utklippstavlen.

Hva det gjør

  • Ekte OCR i nettleseren din — filer lastes aldri opp noe sted
  • Flere bilder blir til én PDF med flere sider, i rekkefølgen du velger
  • Usynlig tekstlag: PDF-en ser ut som bildet ditt, men er søkbar og kan kopieres fra
  • 15 gjenkjenningsspråk, lastet ned ved behov
  • Eksporterer også den rene gjenkjente teksten som en .txt-fil

Hva en søkbar PDF faktisk er

Et bilde av en kvittering er bare piksler — du kan ikke søke i det, markere totalsummen eller kopiere navnet på selgeren. En søkbar PDF legger til et andre, usynlig lag oppå bildet: den gjenkjente teksten, plassert der den vises i bildet. Siden ser fortsatt nøyaktig ut som bildet ditt, men Preview, Adobe Reader, Spotlight og ethvert dokumentsystem kan nå lese den.

Dette verktøyet bygger den filen i nettleseren din. Det dekoder bildene dine, kjører den åpne kildekode-gjenkjenningsmotoren Tesseract kompilert til WebAssembly, og setter sammen en PDF med pdf-lib — alt i siden du ser på. Ingenting overføres. Det er hele poenget: kvitteringer, kontrakter, medisinske brev og ID-dokumenter er nøyaktig de filene du ikke bør gi til en tilfeldig konverteringsnettside i bytte mot gratis OCR.

Når du bør bruke den

  • Bilder av papirdokumenter du vil kunne finne igjen senere — kvitteringer, garantier, brev, skjemaer.
  • Skanninger som kom ut av en skanner som rene bilder.
  • Alt du ikke ville limt inn på en fremmed nettside.

Hvorfor posisjon betyr noe i tekstlaget

De gjenkjente ordene legges ikke bare til på slutten av filen — hvert ord plasseres usynlig ved koordinatene der det vises i bildet. Det er det som får markering til å føles naturlig: dra over bildet og markeringen følger de trykte linjene, søk etter et ord og fremviseren hopper til riktig sted på siden. Geometrien er tilnærmet, på samme måte som i filer produsert av kontorskannere, og det er greit for å finne og kopiere.

Ærlige begrensninger

OCR på enheten er tregere enn en servergård, og den leser trykt skrift, ikke håndskrift. Veldig liten eller uskarp tekst kan bli feil — .txt-eksporten gjør det enkelt å sjekke. Bilder skaleres ned til rundt 2500 px på den lange siden for gjenkjenningshastighet; det innebygde sidebildet beholder opptil 4000 px, som skriver ut rent i letter-størrelse.

Hvis du gjør dette ofte

Dette verktøyet er en engangskonverterer. Hvis kamerarullen din er stedet dokumenter forsvinner, er det nøyaktig det problemet Paperlock finnes for: den skanner, leser og arkiverer papirarbeidet ditt på iPhonen din — med samme regel om at ingenting forlater enheten din ukryptert.