OCR je zkratka pro optical character recognition, což je suchý název pro jednoduchou myšlenku: software, který se podívá na fotografii textu — fotografii, sken, PDF stránku — a určí, která v něm jsou písmena a čísla.

To je důležité, protože pro počítač je fotografie účtenky jen mřížka barevných teček. Nemůže ji vyhledávat, kopírovat nebo přečíst celkový součet. Spusťte OCR na tu fotografii a tečky se stanou opravdovým textem: „Blue Bottle Coffee… $14.20…" Teď ji počítač najde, když ji vyhledáváte, stejně jako najde e-mail.

To je veškerá myšlenka. Fotografii textu dovnitř, prohledávatelný text ven. Všechno ostatní o OCR je detail — včetně otázky, proč i s OCR všude kolem vás stále nemůžete najít garanci na myčku. Vrátíme se k tomu.

OCR už teď používáte každý den

OCR zní jako firemní software z roku 2003, ale je velmi pravděpodobné, že jste jej dnes ráno používali, aniž byste si toho všimli:

  • Vyhledávání v Fotografiích na vašem iPhonu. Apple mu říká Live Text. Váš telefon tiše čte text na každé fotografii, kterou pořídíte, a proto si můžete vyhledat fotografie podle slov na cedulích nebo účtenkách a skutečně dostat výsledky. Můžete si také stisknout fotografii a zkopírovat si text přímo z ní.
  • Aplikace pro skenování. Když si naskenujete dokument na iPhonu, aplikace pořídí fotografii — a právě OCR je to, co z výsledného PDF dělá prohledávatelné místo jen neprohledávatelného obrázku.
  • Vaše banka. Vložte šek prostřednictvím fotografie a OCR si přečte částku a čísla účtu.
  • Pošta. Poštovní služby používají OCR k čtení adres a směrování obálek již desítky let. Je to opravdu stará technologie, která se pomalu zlepšila.

Takže když si aplikace pro skenování propaguje „prohledávatelné PDF", jde právě o OCR. Není to značka ani produkt — je to obecný výraz pro naučení počítačů čtení.

Jak to funguje, velmi zhruba

Nepotřebujete znát detaily, ale stručné vysvětlení vám pomůže pochopit, kdy selže.

OCR software hledá tvary znaků: tento shluk tmavých pixelů se zakřivuje jako „S", tamten má příčku jako „t". Moderní OCR je v tom velmi dobrý u čistého tištěného textu — dobré osvětlení, rovná stránka, běžné fonty. Pak spojuje znaky do slov, slova do řádků, a dává vám výsledek jako běžný text.

Všimněte si, co se děje: rozpoznává znaky. Ne účtenky, ne smlouvy, ne „toto číslo je součet a tamto je datum". Znaky. Pamatujte si to, protože to je základní omezení, které vede ke všem ostatním chybám.

Kde má OCR problémy

V reálném životě se objevují tři omezení:

Rukopis. Tištěný text je vyřešený problém; váš rukopis není. Úhledná velká písmena obvykle přežijí. Kurzíva, husté poznámky na okrajích a cokoli napsané lékařem vychází zdeformované nebo vůbec. Pokud vaše důležité věci obsahují rukou psané stránky, jednoduché OCR vás zklamete.

Rozložení. OCR čte zleva doprava, shora dolů. Opravdové dokumenty nekooperují: účtenky umísťují ceny v neurovnané pravé koloně, formuláře rozptylují popisky a čtverečky všude, tabulky se proměňují v zmatení slov. Znaky mohou být všechny správné, zatímco jejich pořadí je nesmysl — „Součet 3 $14.20 Ks Ovesné Latte."

Kontext. Toto je ten zásadní rozdíl. OCR vám řekne, že stránka obsahuje znaky „03/15/2027". Nemůže vám říci, zda to je datum vypršení, datum nákupu nebo den, kdy byl formulář vytisknut. Ví, jaké znaky to jsou, ale ne co znamenají.

Proč není prohledávatelný text totéž co hledatelný dokument

Tady vidíte každodenní důsledek tohoto posledního omezení. Předpokládejme, že OCR udělal svou práci dokonale a každý sken na vašem telefonu je plně prohledávatelný. Potřebujete garanci na myčku. Co do vyhledávání napíšete?

„Garance" — a dostanete čtyřicet výsledků, protože každá účtenka zmiňuje garanci. „Myčka" — nic, protože účtenka říká „BOSCH SHEM63W55N". Text tam všechno je; smysl není. Vyhledávání podle přesného slova funguje jen když si můžete zapamatovat přesné slovo — a právě papíry jsou to, co se nesnažíte si pamatovat.

OCR vám dá Porozumění vám dá
Účtenka Znaky na ní „Účtenka od Bosch, $649, březen 2025"
Sken pasu Jména a čísla jako text „Váš pas — vyprší 03/15/2027"
Vaše otázka Shody přesných slov Opravdovou odpověď s připojeným dokumentem

Krok dál od OCR: poznání, čím je dokument

Dalším krokem je software, který se nezastaví u čtení znaků, ale pochopí, čím je dokument: účtenka, od koho, za kolik, kdy vyprší. Jakmile je to jasné, změní se „kde je garance na myčku?" z hádání, která slova na stránce jsou, na skutečnou otázku s odpovědí.

To je to, kolem čeho je Paperlock postaven. Naskenujete nebo importujete dokument do Face-ID-chráněného trezoru na vašem iPhonu a on si ho přečte — včetně rukopisu — a pochopí jej: typ, odesílatele, data, částky. Bez složek nebo pojmenování; archivuje si věci sám. Pak se ptáte v běžné češtině — „kdy vyprší můj pas?", „kolik jsem utratil v Blue Bottle?" — a dostanete odpověď s připojeným zdrojovým dokumentem. Pokud odpověď v trezoru není, řekne vám to místo aby hádal. Cokoli s datem vypršení automaticky dostane připomenutí 30 dní a 7 dní před vypršením. Můžete si podívat, jak to všechno funguje; brzy přijde do App Store.

Jedno varování, které si zaslouží vlastní větu: kdykoli aplikace čte vaše dokumenty — OCR nebo cokoli pokročilejšího — stojí za to vědět, kde se to čtení děje a co se uchovává. Napsali jsme otevřený průvodce tím, zda jsou aplikace pro skenování bezpečné a na co si dát pozor, než jedné důvěříte.

Stručně

OCR změní fotografie textu na prohledávatelný text — a je všude: ve vašich fotografiích, v aplikacích na skenování, v bance. Je opravdu užitečný a opravdu omezený: nejistý u rukopisu, zmatený rozložením a slepý na smysl. Dá vám znaky; nemůže rozlišit garanci na myčku od účtenky na večeři.

Pro hledání věcí to poslední omezení je rozhodující — a právě jeho překonání je účel kroku za OCR.