Kako pretvoriti fotografije u PDF s mogućnošću pretraživanja
- Dodajte svoje slike. Ubacite JPG, PNG ili WebP fotografije u alat, ili dodirnite za odabir. Svaka stranica prikazuje se kao kartica — povucite ručku za promjenu redoslijeda, ili uklonite one koje ne želite.
- Odaberite jezik. Odaberite jezik na kojem su dokumenti napisani. Podaci za prepoznavanje tog jezika preuzimaju se jednom (veličina je prikazana pokraj izbornika) — Vaše slike i dalje nikad ne napuštaju uređaj.
- Prepoznajte. Pritisnite „Prepoznaj tekst” i pratite kako kartica svake stranice prelazi od čekanja do gotovog, uz broj riječi u stvarnom vremenu. Postupak možete prekinuti u sredini; ništa se ne zadržava.
- Provjerite i preuzmite. Prepoznati tekst prikazan je po stranici kako biste ga mogli provjeriti prije nego mu vjerujete. Nazovite izlaznu datoteku, zatim preuzmite PDF s pretraživanjem, obični .txt, ili kopirajte sve u međuspremnik.
Što radi
- Stvarni OCR u Vašem pregledniku — datoteke se nikad nikamo ne prenose
- Više fotografija postaje jedan višestranični PDF, redoslijedom koji odaberete
- Nevidljivi sloj teksta: PDF izgleda kao Vaša fotografija, ali je pretraživ i tekst se može kopirati
- 15 jezika prepoznavanja, preuzimaju se po potrebi
- Također izvozi prepoznati tekst kao .txt datoteku
Što je zapravo PDF s mogućnošću pretraživanja
Fotografija računa samo su pikseli — ne možete je pretraživati, označiti ukupan iznos ili kopirati naziv trgovine. PDF s mogućnošću pretraživanja dodaje drugi, nevidljivi sloj preko slike: prepoznati tekst, postavljen tamo gdje se pojavljuje na slici. Stranica i dalje izgleda točno kao Vaša fotografija, ali je Preview, Adobe Reader, Spotlight i svaki sustav za dokumente sada mogu pročitati.
Ovaj alat gradi tu datoteku u Vašem pregledniku. Dekodira Vaše slike, pokreće open-source alat za prepoznavanje Tesseract preveden u WebAssembly, i sastavlja PDF pomoću pdf-lib — sve na stranici koju gledate. Ništa se ne prenosi. U tome je cijela poanta: računi, ugovori, medicinska pisma i osobni dokumenti upravo su datoteke koje ne biste trebali predati nasumičnoj web stranici za pretvaranje u zamjenu za besplatan OCR.
Kada ga koristiti
- Fotografije papirnatih dokumenata koje želite kasnije moći pronaći — računi, jamstva, pisma, obrasci.
- Skenovi koji su iz skenera izašli kao obične slike.
- Sve što ne biste zalijepili na nepoznatu web stranicu.
Zašto je položaj u sloju teksta važan
Prepoznate riječi nisu samo dodane na kraj datoteke — svaka je nevidljivo postavljena na koordinate na kojima se pojavljuje na fotografiji. Zbog toga označavanje djeluje prirodno: povucite preko slike i istaknuto područje prati otisnute retke, potražite riječ i preglednik skoči na pravo mjesto na stranici. Geometrija je približna, jednako kao u datotekama koje proizvode uredski skeneri, i to je sasvim u redu za pronalaženje i kopiranje.
Iskrena ograničenja
OCR na uređaju sporiji je od poslužiteljske farme i čita tisak, ne rukopis. Vrlo sitan ili mutan tekst može ispasti pogrešno — izvoz u .txt olakšava provjeru. Slike se za brzinu prepoznavanja smanjuju na otprilike 2500 px na dužoj stranici; ugrađena slika stranice zadržava do 4000 px, što se čisto ispisuje u veličini letter.
Ako ovo radite često
Ovaj alat je jednokratni pretvarač. Ako Vam se dokumenti gube u galeriji fotografija, upravo za to postoji Paperlock: skenira, čita i sprema Vaše papire na iPhoneu — uz isto pravilo da ništa nešifrirano ne napušta Vaš uređaj.