Så gör du om foton till en sökbar PDF

  1. Lägg till dina bilder. Släpp JPG-, PNG- eller WebP-foton på verktyget, eller tryck för att välja dem. Varje sida visas som ett kort — dra i handtaget för att ändra ordning, eller ta bort de du inte vill ha.
  2. Välj språk. Välj språket dokumenten är skrivna på. Igenkänningsdata för det språket laddas ner en gång (storleken visas bredvid väljaren) — dina bilder lämnar ändå aldrig din enhet.
  3. Läs av texten. Tryck på Läs av text och se varje sidas kort gå från väntar till klar, med ett löpande ordantal. Du kan avbryta mitt i; inget sparas.
  4. Kontrollera och ladda ner. Den igenkända texten visas per sida så du kan kontrollera den innan du litar på den. Namnge utdatafilen, ladda sedan ner den sökbara PDF:en, hämta den vanliga .txt-filen, eller kopiera allt till urklipp.

Vad det gör

  • Riktig OCR i din webbläsare — filer laddas aldrig upp någonstans
  • Flera foton blir en flersidig PDF, i den ordning du väljer
  • Osynligt textlager: PDF:en ser ut som ditt foto men är sökbar och kopierbar
  • 15 igenkänningsspråk, laddas ner vid behov
  • Exporterar även den vanliga igenkända texten som en .txt-fil

Vad en sökbar PDF egentligen är

Ett foto av ett kvitto är bara pixlar — du kan inte söka i det, markera totalsumman eller kopiera butikens namn. En sökbar PDF lägger till ett andra, osynligt lager ovanpå bilden: den igenkända texten, placerad där den förekommer i bilden. Sidan ser fortfarande exakt ut som ditt foto, men Preview, Adobe Reader, Spotlight och alla dokumentsystem kan nu läsa den.

Det här verktyget bygger den filen i din webbläsare. Det avkodar dina bilder, kör den öppna källkodsmotorn Tesseract kompilerad till WebAssembly, och sätter ihop en PDF med pdf-lib — allt på sidan du tittar på. Inget skickas iväg. Det är hela poängen: kvitton, avtal, sjukvårdsbrev och id-dokument är exakt de filer du inte bör lämna till en slumpmässig konverteringswebbplats i utbyte mot gratis OCR.

När du ska använda det

  • Foton av pappersdokument du vill kunna hitta senare — kvitton, garantier, brev, blanketter.
  • Skanningar som kom ut ur en skanner som vanliga bilder.
  • Allt du inte skulle klistra in på en främlings webbplats.

Varför position spelar roll i textlagret

De igenkända orden läggs inte bara till i slutet av filen — vart och ett placeras osynligt vid koordinaterna där det förekommer i fotot. Det är det som gör markering naturlig: dra över bilden och markeringen följer de tryckta raderna, sök efter ett ord och visningsprogrammet hoppar till rätt ställe på sidan. Geometrin är ungefärlig, precis som i filer som produceras av kontorsskannrar, och det är helt okej för att hitta och kopiera text.

Ärliga begränsningar

OCR på enheten är långsammare än en serverpark, och den läser tryckt text, inte handskrift. Väldigt liten eller suddig text kan bli fel — .txt-exporten gör det enkelt att kontrollera. Bilder skalas ner till cirka 2 500 px på långsidan för igenkänningshastighet; den inbäddade sidbilden behåller upp till 4 000 px, vilket skrivs ut skarpt i brevformat.

Om du gör det här ofta

Det här verktyget är en engångskonverterare. Om din kamerarulle är där dokument går för att försvinna, är det exakt det problemet Paperlock finns för: den skannar, läser och arkiverar dina papper på din iPhone — med samma regel att inget lämnar din enhet okrypterat.