Cum să transformați fotografii într-un PDF căutabil
- Adăugați imaginile. Trageți fotografii JPG, PNG sau WebP peste unealtă, sau atingeți pentru a le alege. Fiecare pagină apare ca un card — trageți mânerul pentru a reordona sau eliminați paginile nedorite.
- Alegeți limba. Alegeți limba în care sunt scrise documentele. Datele de recunoaștere pentru limba respectivă se descarcă o singură dată (dimensiunea este afișată lângă selector) — imaginile dumneavoastră tot nu părăsesc dispozitivul.
- Recunoașteți textul. Apăsați Recunoaște textul și urmăriți cum cardul fiecărei pagini trece de la așteptare la finalizat, cu un contor de cuvinte în timp real. Puteți anula pe parcurs; nimic nu este păstrat.
- Verificați și descărcați. Textul recunoscut este afișat pentru fiecare pagină, ca să îl puteți verifica înainte de a-l folosi. Denumiți fișierul de ieșire, apoi descărcați PDF-ul căutabil, luați fișierul .txt simplu sau copiați totul în clipboard.
Ce face
- OCR real în browser — fișierele nu sunt niciodată încărcate nicăieri
- Mai multe fotografii devin un singur PDF cu mai multe pagini, în ordinea aleasă de dumneavoastră
- Strat de text invizibil: PDF-ul arată exact ca fotografia, dar este căutabil și se poate copia
- 15 limbi de recunoaștere, descărcate la cerere
- Exportă și textul recunoscut ca fișier .txt simplu
Ce este de fapt un PDF căutabil
O fotografie a unei chitanțe este doar niște pixeli — nu o puteți căuta, nu puteți selecta totalul și nu puteți copia numele comerciantului. Un PDF căutabil adaugă un al doilea strat, invizibil, peste imagine: textul recunoscut, poziționat exact unde apare în fotografie. Pagina arată în continuare identic cu fotografia dumneavoastră, dar Preview, Adobe Reader, Spotlight și orice sistem de documente o pot acum citi.
Această unealtă construiește fișierul respectiv chiar în browserul dumneavoastră. Decodează imaginile, rulează motorul de recunoaștere open-source Tesseract compilat în WebAssembly și asamblează un PDF cu pdf-lib — totul în pagina pe care o vedeți acum. Nimic nu este transmis. Acesta este chiar rostul ei: chitanțele, contractele, scrisorile medicale și actele de identitate sunt exact fișierele pe care nu ar trebui să le predați unui convertor oarecare de pe internet în schimbul unui OCR gratuit.
Când să o folosiți
- Fotografii ale unor documente pe hârtie pe care doriți să le puteți găsi mai târziu — chitanțe, garanții, scrisori, formulare.
- Scanări ieșite dintr-un scaner sub formă de imagini simple.
- Orice lucru pe care nu l-ați lipi pe situl unui necunoscut.
De ce contează poziția în stratul de text
Cuvintele recunoscute nu sunt doar adăugate la sfârșitul fișierului — fiecare este plasat invizibil la coordonatele la care apare în fotografie. Acest lucru face ca selecția să pară naturală: trageți peste imagine și evidențierea urmărește liniile tipărite, căutați un cuvânt și vizualizatorul sare direct la locul potrivit din pagină. Geometria este aproximativă, la fel ca în fișierele produse de scanerele de birou, iar acest lucru este suficient pentru a găsi și copia text.
Limitări sincere
OCR-ul pe dispozitiv este mai lent decât o fermă de servere și citește text tipărit, nu scris de mână. Textul foarte mic sau neclar poate ieși greșit — exportul .txt face verificarea ușoară. Imaginile sunt redimensionate la aproximativ 2.500 px pe latura lungă pentru viteza recunoașterii; imaginea paginii încorporate păstrează până la 4.000 px, ceea ce se imprimă curat la format letter.
Dacă faceți asta des
Această unealtă este un convertor de o singură dată. Dacă albumul foto de pe telefon este locul unde documentele dispar, exact aceasta este problema pentru care există Paperlock: scanează, citește și arhivează hârtiile dumneavoastră pe iPhone — cu aceeași regulă că nimic nu părăsește dispozitivul necriptat.