Kako pretvoriti fotografije u PDF s mogućnošću pretraživanja

  1. Dodajte svoje slike. Ubacite JPG, PNG ili WebP fotografije u alat, ili dodirnite za odabir. Svaka stranica prikazuje se kao kartica — povucite ručku za promjenu redoslijeda, ili uklonite one koje ne želite.
  2. Odaberite jezik. Odaberite jezik na kojem su dokumenti napisani. Podaci za prepoznavanje tog jezika preuzimaju se jednom (veličina je prikazana pokraj izbornika) — Vaše slike i dalje nikad ne napuštaju uređaj.
  3. Prepoznajte. Pritisnite „Prepoznaj tekst” i pratite kako kartica svake stranice prelazi od čekanja do gotovog, uz broj riječi u stvarnom vremenu. Postupak možete prekinuti u sredini; ništa se ne zadržava.
  4. Provjerite i preuzmite. Prepoznati tekst prikazan je po stranici kako biste ga mogli provjeriti prije nego mu vjerujete. Nazovite izlaznu datoteku, zatim preuzmite PDF s pretraživanjem, obični .txt, ili kopirajte sve u međuspremnik.

Što radi

  • Stvarni OCR u Vašem pregledniku — datoteke se nikad nikamo ne prenose
  • Više fotografija postaje jedan višestranični PDF, redoslijedom koji odaberete
  • Nevidljivi sloj teksta: PDF izgleda kao Vaša fotografija, ali je pretraživ i tekst se može kopirati
  • 15 jezika prepoznavanja, preuzimaju se po potrebi
  • Također izvozi prepoznati tekst kao .txt datoteku

Što je zapravo PDF s mogućnošću pretraživanja

Fotografija računa samo su pikseli — ne možete je pretraživati, označiti ukupan iznos ili kopirati naziv trgovine. PDF s mogućnošću pretraživanja dodaje drugi, nevidljivi sloj preko slike: prepoznati tekst, postavljen tamo gdje se pojavljuje na slici. Stranica i dalje izgleda točno kao Vaša fotografija, ali je Preview, Adobe Reader, Spotlight i svaki sustav za dokumente sada mogu pročitati.

Ovaj alat gradi tu datoteku u Vašem pregledniku. Dekodira Vaše slike, pokreće open-source alat za prepoznavanje Tesseract preveden u WebAssembly, i sastavlja PDF pomoću pdf-lib — sve na stranici koju gledate. Ništa se ne prenosi. U tome je cijela poanta: računi, ugovori, medicinska pisma i osobni dokumenti upravo su datoteke koje ne biste trebali predati nasumičnoj web stranici za pretvaranje u zamjenu za besplatan OCR.

Kada ga koristiti

  • Fotografije papirnatih dokumenata koje želite kasnije moći pronaći — računi, jamstva, pisma, obrasci.
  • Skenovi koji su iz skenera izašli kao obične slike.
  • Sve što ne biste zalijepili na nepoznatu web stranicu.

Zašto je položaj u sloju teksta važan

Prepoznate riječi nisu samo dodane na kraj datoteke — svaka je nevidljivo postavljena na koordinate na kojima se pojavljuje na fotografiji. Zbog toga označavanje djeluje prirodno: povucite preko slike i istaknuto područje prati otisnute retke, potražite riječ i preglednik skoči na pravo mjesto na stranici. Geometrija je približna, jednako kao u datotekama koje proizvode uredski skeneri, i to je sasvim u redu za pronalaženje i kopiranje.

Iskrena ograničenja

OCR na uređaju sporiji je od poslužiteljske farme i čita tisak, ne rukopis. Vrlo sitan ili mutan tekst može ispasti pogrešno — izvoz u .txt olakšava provjeru. Slike se za brzinu prepoznavanja smanjuju na otprilike 2500 px na dužoj stranici; ugrađena slika stranice zadržava do 4000 px, što se čisto ispisuje u veličini letter.

Ako ovo radite često

Ovaj alat je jednokratni pretvarač. Ako Vam se dokumenti gube u galeriji fotografija, upravo za to postoji Paperlock: skenira, čita i sprema Vaše papire na iPhoneu — uz isto pravilo da ništa nešifrirano ne napušta Vaš uređaj.