Πώς να μετατρέψετε φωτογραφίες σε αναζητήσιμο PDF

  1. Προσθέστε τις εικόνες σας. Ρίξτε φωτογραφίες JPG, PNG ή WebP στο εργαλείο, ή πατήστε για να τις επιλέξετε. Κάθε σελίδα εμφανίζεται ως κάρτα — σύρετε τη λαβή για αναδιάταξη, ή αφαιρέστε όσες δεν θέλετε.
  2. Επιλέξτε τη γλώσσα. Επιλέξτε τη γλώσσα στην οποία είναι γραμμένα τα έγγραφα. Τα δεδομένα αναγνώρισης για αυτή τη γλώσσα κατεβαίνουν μία φορά (το μέγεθος εμφανίζεται δίπλα στην επιλογή) — οι εικόνες σας εξακολουθούν να μη φεύγουν ποτέ από τη συσκευή σας.
  3. Αναγνώριση. Πατήστε «Αναγνώριση κειμένου» και παρακολουθήστε την κάρτα κάθε σελίδας να περνά από αναμονή σε ολοκλήρωση, με ζωντανή μέτρηση λέξεων. Μπορείτε να ακυρώσετε στη μέση· τίποτα δεν διατηρείται.
  4. Ελέγξτε και κατεβάστε. Το αναγνωρισμένο κείμενο εμφανίζεται ανά σελίδα ώστε να το επαληθεύσετε πριν το εμπιστευτείτε. Ονομάστε το αρχείο εξόδου, μετά κατεβάστε το αναζητήσιμο PDF, πάρτε το απλό .txt, ή αντιγράψτε τα πάντα στο πρόχειρο.

Τι κάνει

  • Πραγματικό OCR στον περιηγητή σας — τα αρχεία δεν ανεβαίνουν ποτέ πουθενά
  • Πολλαπλές φωτογραφίες γίνονται ένα πολυσέλιδο PDF, με τη σειρά που επιλέγετε
  • Αόρατο επίπεδο κειμένου: το PDF μοιάζει με τη φωτογραφία σας αλλά είναι αναζητήσιμο και αντιγράψιμο
  • 15 γλώσσες αναγνώρισης, με λήψη κατόπιν αιτήματος
  • Εξάγει επίσης το απλό αναγνωρισμένο κείμενο ως αρχείο .txt

Τι είναι πραγματικά ένα αναζητήσιμο PDF

Η φωτογραφία μιας απόδειξης είναι απλώς pixel — δεν μπορείτε να την αναζητήσετε, να επιλέξετε το σύνολο, ή να αντιγράψετε το όνομα του εμπόρου. Ένα αναζητήσιμο PDF προσθέτει ένα δεύτερο, αόρατο επίπεδο πάνω στην εικόνα: το αναγνωρισμένο κείμενο, τοποθετημένο εκεί που εμφανίζεται στην εικόνα. Η σελίδα εξακολουθεί να μοιάζει ακριβώς με τη φωτογραφία σας, αλλά το Preview, το Adobe Reader, το Spotlight και κάθε σύστημα εγγράφων μπορούν πλέον να τη διαβάσουν.

Αυτό το εργαλείο φτιάχνει αυτό το αρχείο στον περιηγητή σας. Αποκωδικοποιεί τις εικόνες σας, τρέχει τη μηχανή αναγνώρισης ανοιχτού κώδικα Tesseract μεταγλωττισμένη σε WebAssembly, και συναρμολογεί ένα PDF με το pdf-lib — όλα μέσα στη σελίδα που βλέπετε. Τίποτα δεν μεταδίδεται. Αυτό είναι όλο το νόημα: αποδείξεις, συμβόλαια, ιατρικές επιστολές και έγγραφα ταυτότητας είναι ακριβώς τα αρχεία που δεν θα έπρεπε να παραδώσετε σε έναν τυχαίο ιστότοπο μετατροπής με αντάλλαγμα δωρεάν OCR.

Πότε να το χρησιμοποιήσετε

  • Φωτογραφίες χάρτινων εγγράφων που θέλετε να μπορείτε να βρείτε αργότερα — αποδείξεις, εγγυήσεις, επιστολές, φόρμες.
  • Σαρώσεις που βγήκαν από σαρωτή ως απλές εικόνες.
  • Οτιδήποτε δεν θα επικολλούσατε στον ιστότοπο ενός αγνώστου.

Γιατί έχει σημασία η θέση στο επίπεδο κειμένου

Οι αναγνωρισμένες λέξεις δεν προστίθενται απλώς στο αρχείο — καθεμία τοποθετείται αόρατα στις συντεταγμένες όπου εμφανίζεται στη φωτογραφία. Αυτό κάνει την επιλογή να νιώθει φυσική: σύρετε πάνω από την εικόνα και η επισήμανση ακολουθεί τις τυπωμένες γραμμές, αναζητήστε μια λέξη και ο προβολέας μεταβαίνει στο σωστό σημείο της σελίδας. Η γεωμετρία είναι κατά προσέγγιση, όπως ακριβώς και στα αρχεία που παράγουν οι σαρωτές γραφείου, και αυτό είναι εντάξει για εύρεση και αντιγραφή.

Ειλικρινείς περιορισμοί

Το OCR στη συσκευή είναι πιο αργό από ένα σμήνος διακομιστών, και διαβάζει έντυπα, όχι χειρόγραφα. Πολύ μικρό ή θολό κείμενο μπορεί να βγει λάθος — η εξαγωγή .txt διευκολύνει τον έλεγχο. Οι εικόνες υποβαθμίζονται σε περίπου 2.500 px στη μεγάλη πλευρά για ταχύτητα αναγνώρισης· η ενσωματωμένη εικόνα σελίδας διατηρεί έως 4.000 px, που εκτυπώνεται καθαρά σε μέγεθος letter.

Αν το κάνετε συχνά

Αυτό το εργαλείο είναι μετατροπέας μιας χρήσης. Αν το άλμπουμ φωτογραφιών σας είναι εκεί που τα έγγραφα πάνε για να εξαφανιστούν, αυτό είναι ακριβώς το πρόβλημα για το οποίο υπάρχει το Paperlock: σαρώνει, διαβάζει και αρχειοθετεί τα χαρτιά σας στο iPhone σας — με τον ίδιο κανόνα ότι τίποτα δεν φεύγει από τη συσκευή σας μη κρυπτογραφημένο.