OCR znamená optické rozpoznávanie znakov, čo je trochu strnulý názov pre jednoduchú myšlienku: softvér sa pozrie na obrázok textu — fotku, sken, stránku PDF — a zistí, aké písmená a čísla sa v ňom nachádzajú.
Na tom záleží preto, že fotka účtenky je pre počítač len mriežka farebných bodiek. Nedá sa v nej vyhľadávať, kopírovať z nej ani prečítať sumu. Keď na tú fotku pustíte OCR, bodky sa zmenia na skutočný text: „Blue Bottle Coffee… $14.20…“ A zrazu ho počítač nájde pri vyhľadávaní, rovnako ako nájde e-mail.
To je celá podstata. Dnu obrázok slov, von vyhľadateľné slová. Všetko ostatné o OCR sú detaily — vrátane detailu o tom, prečo ani pri všadeprítomnom OCR stále neviete nájsť záruku na umývačku riadu. Dostaneme sa k tomu.
OCR už používate každý deň
OCR znie ako firemný softvér z roku 2003, no pravdepodobne ste ho dnes ráno použili, bez toho aby ste si to všimli:
- Vyhľadávanie vo Fotkách na iPhone. Apple svoju verziu nazýva Živý text. Telefón potichu číta text na každej fotke, ktorú urobíte, a preto môžete vo fotkách vyhľadávať slová z nápisu či účtenky a naozaj dostanete výsledky. Môžete tiež podržať prst na ľubovoľnej fotke a skopírovať text priamo z nej.
- Aplikácie na skenovanie. Keď naskenujete dokument iPhonom, aplikácia urobí fotku — a OCR je to, vďaka čomu je výsledné PDF vyhľadateľné, a nie len fotka v prestrojení za dokument.
- Vaša banka. Keď vložíte šek tak, že ho odfotíte, OCR prečíta sumu a čísla účtov.
- Pošta. Poštové služby používajú OCR na čítanie adries a triedenie obálok už desaťročia. Je to naozaj stará technológia, ktorá sa pomaly stala dobrou.
Keď teda aplikácia na skenovanie inzeruje „vyhľadateľné PDF“, ide o OCR. Nie je to značka ani produkt — je to všeobecný názov pre to, ako naučiť počítače čítať.
Ako to funguje, v skratke
Inžinierstvo nepotrebujete, ale verzia na jeden odsek vám pomôže predvídať, kedy to zlyhá.
Softvér OCR hľadá tvary znakov: táto kopa tmavých pixelov je zakrivená ako „S“, táto má priečnu čiarku ako „t“. Moderné OCR je v tom veľmi dobré pri čistom, tlačenom texte — dobré svetlo, rovná stránka, obyčajné písma. Potom reťazí znaky do slov a slová do riadkov a odovzdá vám výsledok ako obyčajný text.
Všimnite si, čo sa deje: rozpoznáva znaky. Nie účtenky, nie zmluvy, nie „toto číslo je suma a tamto je dátum“. Znaky. Zapamätajte si to, lebo práve tou štrbinou všetko prepadáva.
Kde OCR úprimne zlyháva
Tri limity sa v reálnom živote objavujú stále dookola:
Rukopis. Tlačený text je vyriešený problém; váš rukopis nie. Úhľadné tlačené písmená zvyčajne prežijú. Kurzíva, stiesnené poznámky na okraji a čokoľvek napísané lekárom vyjde zdeformované, alebo nevyjde vôbec. Ak vaše dôležité veci zahŕňajú rukou písané stránky, obyčajné OCR vás sklame.
Rozloženie. OCR číta zľava doprava, zhora nadol. Skutočné dokumenty nespolupracujú: účtenky tlačia ceny do strapatého pravého stĺpca, formuláre roztrúsia popisky a kolónky všade, tabuľky sa zmenia na slovnú polievku. Znaky môžu byť všetky správne, kým poradie je nezmysel — „Spolu 3 $14.20 Ks Ovsené latte“.
Kontext. Toto je tá hlavná vec. OCR vám vie povedať, že stránka obsahuje znaky „03/15/2027“. Nevie vám povedať, či je to dátum spotreby, dátum nákupu alebo deň, keď bol formulár vytlačený. Vie, aké sú to písmená, nie čo znamenajú.
Prečo vyhľadateľný text stále neznamená nájdené dokumenty
Tu je každodenný dôsledok toho posledného limitu. Predpokladajme, že OCR odviedlo svoju prácu dokonale a každý sken vo vašom telefóne sa dá plne vyhľadávať. Potrebujete záruku na umývačku riadu. Čo napíšete?
„Záruka“ — a dostanete štyridsať výsledkov, lebo každá účtenka záruku spomína. „Umývačka“ — nič, lebo na účtenke je „BOSCH SHEM63W55N“. Text je celý tam; význam nie. Vyhľadávanie podľa presného slova funguje len vtedy, keď si viete spomenúť na presné slovo — a papiere sú presne to, čo sa snažíte nedržať v hlave.
| OCR vám dá | Pochopenie vám dá | |
|---|---|---|
| Účtenka | Znaky, ktoré sú na nej | „Účtenka od Bosch, $649, marec 2025“ |
| Sken pasu | Mená a čísla ako text | „Váš pas — platnosť končí 03/15/2027“ |
| Vaša otázka | Zhody presných slov | Skutočná odpoveď s priloženým dokumentom |
Krok za hranice OCR: vedieť, čo dokument je
Ďalším krokom je softvér, ktorý sa nezastaví pri čítaní znakov, ale zistí, čo ten dokument je: účtenka, od koho, za koľko, s platnosťou dokedy. Keď je toto známe, „kde je záruka na umývačku?“ sa mení na otázku, na ktorú sa dá odpovedať — a nie na hádanie, ktoré slová sa na stránke nachádzajú.
Práve okolo toho je postavený Paperlock. Naskenujete alebo importujete dokument do trezoru chráneného Face ID vo vašom iPhone a on si celý dokument prečíta — vrátane rukopisu — a porozumie mu: typ, odosielateľ, dátumy, sumy. Žiadne priečinky ani pomenovávanie; veci si zatriedi sám. Potom sa pýtate normálnou slovenčinou — „kedy mi vyprší pas?“, „koľko som minul v Blue Bottle?“ — a dostanete odpoveď s priloženým zdrojovým dokumentom. Ak odpoveď vo vašom trezore nie je, povie to, namiesto hádania. Ku všetkému s dátumom spotreby či platnosti dostanete automatické pripomenutia 30 dní a 7 dní vopred. Ako celá vec funguje, si môžete pozrieť tu; čoskoro príde do App Store.
Jedno upozornenie, ktoré si zaslúži vlastnú vetu: kedykoľvek nejaká aplikácia číta vaše dokumenty — OCR alebo čokoľvek múdrejšie — oplatí sa vedieť, kde sa to čítanie deje a čo sa uchováva. Napísali sme úprimného sprievodcu o tom, či sú aplikácie na skenovanie bezpečné, a čo skontrolovať, skôr než niektorej dôverujete.
V krátkosti
OCR mení obrázky textu na vyhľadateľný text a je potichu všade — vo vašej galérii, v aplikácii na skenovanie, vo vašej banke. Je naozaj užitočné a naozaj obmedzené: s rukopisom si poradí len ťažko, mätie ho rozloženie a na význam je slepé. Dá vám písmená; nedokáže rozlíšiť záruku na umývačku od účtenky za večeru.
Pri hľadaní vecí je práve táto posledná medzera tou, na ktorej záleží — a jej preklenutie je to, na čo slúži krok po OCR.