OCR je kratica od engleskog optical character recognition, odnosno optičkog prepoznavanja znakova — što je ukočeno ime za jednostavnu ideju: softver koji gleda sliku teksta — fotografiju, sken, stranicu PDF-a — i utvrđuje koja se slova i brojke u njoj nalaze.
To je važno jer je fotografija računa, za računalo, samo mreža obojenih točkica. Ne može je pretražiti, kopirati ni pročitati ukupan iznos. Pokrenite OCR na toj fotografiji i točkice postaju pravi tekst: „Blue Bottle Coffee… $14.20…” Sada ga računalo može pronaći kad pretražujete, isto kao što pronalazi e-poruku.
To je cijeli koncept. Unutra ide slika riječi, van izlaze pretražive riječi. Sve ostalo o OCR-u su detalji — uključujući i detalj o tome zašto, iako je OCR posvuda, i dalje ne možete pronaći jamstvo za svoju perilicu posuđa. Doći ćemo i do toga.
OCR već koristite svaki dan
OCR zvuči kao poslovni softver iz 2003., ali vjerojatno ste ga koristili već jutros, a da to niste ni primijetili:
- Pretraživanje aplikacije Fotografije na iPhoneu. Apple svoju inačicu zove Live Text. Vaš telefon tiho čita tekst na svakoj fotografiji koju snimite, zato možete pretraživati fotografije po riječima sa znaka ili računa i doista dobiti rezultate. Možete i pritisnuti bilo koju fotografiju i kopirati tekst izravno iz nje.
- Aplikacije za skeniranje. Kad skenirate dokument iPhoneom, aplikacija snimi sliku — a OCR je ono što nastali PDF čini pretraživim, umjesto da bude samo fotografija prerušena u PDF.
- Vaša banka. Uplatite ček tako da ga fotografirate, a OCR pročita iznos i brojeve računa.
- Pošta. Poštanske službe desetljećima koriste OCR za čitanje adresa i raspoređivanje omotnica. To je doista stara tehnologija koja je polako postala dobra.
Dakle, kad aplikacija za skeniranje reklamira „pretražive PDF-ove”, to je OCR. Nije riječ o marki ni proizvodu — to je općeniti naziv za učenje računala da čitaju.
Kako to funkcionira, ugrubo
Ne treba Vam inženjerstvo, ali verzija u jednom odlomku pomaže Vam predvidjeti kada će zatajiti.
Softver za OCR traži oblike znakova: ovaj se skup tamnih piksela izvija poput slova „S”, onaj ima vodoravnu crtu slova „t”. Suvremeni OCR u tome je vrlo dobar kod čistog, tiskanog teksta — dobro osvjetljenje, ravna stranica, uobičajeni fontovi. Zatim niza znakove u riječi, a riječi u retke, i predaje Vam rezultat kao običan tekst.
Primijetite što se ovdje događa: prepoznaje znakove. Ne račune, ne ugovore, ne „ovaj je broj ukupan iznos, a onaj je datum”. Znakove. Zapamtite to, jer je to pukotina kroz koju sve propada.
Gdje OCR pošteno zapinje
Tri ograničenja pojavljuju se iznova u stvarnom životu:
Rukopis. Tiskani tekst je riješen problem; Vaš rukopis nije. Uredna tiskana slova obično prežive. Kurziv, nabijene bilješke u marginama i sve što je napisao liječnik izađe izopačeno — ili uopće ne izađe. Ako Vaša važna dokumentacija uključuje rukom pisane stranice, običan OCR će Vas razočarati.
Izgled stranice. OCR čita s lijeva na desno, odozgo prema dolje. Stvarni dokumenti ne surađuju: računi stavljaju cijene u nazubljeni desni stupac, obrasci rasipaju oznake i kućice posvuda, tablice se pretvaraju u juhu od riječi. Znakovi mogu biti svi točni, a redoslijed besmislen — „Ukupno 3 $14.20 Kol. Zobeni latte”.
Kontekst. Ovo je najvažnije. OCR Vam može reći da stranica sadrži znakove „03/15/2027”. Ne može Vam reći je li to datum isteka, datum kupnje ili dan kad je obrazac ispisan. Zna koja su slova, ne zna što znače.
Zašto pretraživi tekstovi i dalje nisu dokumenti koje možete pronaći
Evo svakodnevne posljedice tog zadnjeg ograničenja. Pretpostavimo da je OCR savršeno obavio posao i da je svaki sken na Vašem telefonu potpuno pretraživ. Treba Vam jamstvo za perilicu posuđa. Što upisujete?
„Jamstvo” — i dobijete četrdeset rezultata, jer svaki račun spominje jamstvo. „Perilica” — ništa, jer na računu piše „BOSCH SHEM63W55N”. Sav je tekst tu; značenje nije. Pretraživanje po točnoj riječi funkcionira samo kad se možete sjetiti točne riječi, a papiri su upravo ono što pokušavate ne držati u glavi.
| OCR Vam daje | Razumijevanje Vam daje | |
|---|---|---|
| Račun | Znakove s njega | „Račun od Boscha, 649 $, ožujak 2025.” |
| Sken putovnice | Imena i brojeve kao tekst | „Vaša putovnica — istječe 03/15/2027” |
| Vaše pitanje | Podudaranja točnih riječi | Pravi odgovor, s priloženim dokumentom |
Korak iznad OCR-a: znati što dokument jest
Sljedeći korak je softver koji ne staje na čitanju znakova, nego utvrđuje što dokument jest: račun, od koga, na koliko, s kojim rokom. Kad se to zna, „gdje je jamstvo za perilicu posuđa?” postaje pitanje na koje se može odgovoriti, a ne igra nagađanja o tome koje se riječi pojavljuju na stranici.
Upravo oko toga je izgrađen Paperlock. Skenirate ili uvezete dokument u sef zaštićen Face ID-jem na svom iPhoneu, a on pročita cijeli dokument — uključujući rukopis — i razumije ga: vrstu, pošiljatelja, datume, iznose. Bez mapa i imenovanja; sam sve razvrstava. Zatim pitate jednostavnim jezikom — „kada mi istječe putovnica?”, „koliko sam potrošio u Blue Bottleu?” — i dobijete odgovor s priloženim izvornim dokumentom. Ako odgovora nema u Vašem sefu, reći će Vam to umjesto da nagađa. Za sve što ima datum isteka stižu automatski podsjetnici 30 dana i 7 dana ranije. Možete vidjeti kako sve to funkcionira ovdje; uskoro dolazi u App Store.
Jedna napomena koja zaslužuje vlastitu rečenicu: kad god neka aplikacija čita Vaše dokumente — OCR-om ili bilo čim pametnijim — vrijedi znati gdje se to čitanje događa i što se čuva. Napisali smo iskren vodič o tome jesu li aplikacije za skeniranje sigurne i što provjeriti prije nego što nekoj vjerujete.
Ukratko
OCR pretvara slike teksta u pretraživ tekst i tiho je posvuda — u Vašoj galeriji, Vašoj aplikaciji za skeniranje, Vašoj banci. Doista je koristan i doista ograničen: nesiguran s rukopisom, zbunjen rasporedima na stranici i slijep za značenje. Daje Vam slova; ne može Vam razlučiti jamstvo za perilicu posuđa od računa za večeru.
Za pronalaženje stvari upravo je ta zadnja praznina presudna — a njezino je zatvaranje ono čemu služi korak nakon OCR-a.