OCRは光学文字認識を意味しており、固い名前ですが、シンプルな考え方です。写真やスキャン、PDFページなどのテキスト画像を見て、その中にどの文字や数字があるかを判断するソフトウェアのことです。

これが大切な理由は、領収書の写真はコンピュータにとって単なる色付きドットの格子だからです。検索も、コピーも、合計を読むこともできません。その写真にOCRを実行すると、ドットが実際のテキストになります。「Blue Bottle Coffee…$14.20…」という具合です。これでコンピュータはメールを検索するのと同じように、検索時にそれを見つけることができます。

これが全体的な概念です。言葉の画像を入力すると、検索可能な言葉が出力されます。OCRについてのその他すべては細部です。OCRがいたるところにあるのに、なぜあなたは食洗機の保証書が見つからないのかについての詳細も含めて。その話は後で出てきます。

あなたは毎日OCRを使っています

OCRは2003年のエンタープライズソフトウェアのような名前ですが、おそらくあなたは今朝も気付かずに使っていました。

  • iPhoneのフォト検索。 Appleはそのバージョンを「Live Text」と呼んでいます。あなたのiPhoneは撮った写真内のテキストを自動的に読み込むので、標識や領収書の文字を写真から検索して実際に結果を得ることができます。また、どの写真でも長押ししてテキストを直接コピーすることができます。
  • スキャナーアプリ。 iPhoneで書類をスキャンするとき、アプリは写真を撮ります。そして生成されるPDFを、単なる写真ではなく検索可能にするのがOCRです。
  • あなたの銀行。 小切手を写真で撮って預金すると、OCRが金額と口座番号を読み込みます。
  • 郵便。 郵便サービスは何十年も前からOCRを使って住所を読み、封筒をルーティングしています。本当に古い技術で、ゆっくり進化してきました。

ですから、スキャナーアプリが「検索可能なPDF」を宣伝しているときは、それはOCRのことです。ブランド名や製品名ではなく、コンピュータに読むことを教えるための一般的な名称です。

仕組みをざっくり理解する

エンジニアリングの詳細は必要ありませんが、1段落で理解しておくと、いつOCRが失敗するかを予測するのに役立ちます。

OCRソフトウェアは文字の形を探します。このダークピクセルの集まりは「S」のように曲がっていて、あちらの集まりは「t」のクロスバーを持っています。現代のOCRは、きれいで印刷されたテキスト(良い照明、平らなページ、通常のフォント)に対して非常に得意です。その後、文字を単語に、単語を行に並べて、結果をプレーンテキストとして渡します。

何が起きているかに注目してください。それは文字を認識しています。領収書ではなく、契約書でもなく、「この番号は合計で、あれは日付」でもありません。文字です。これをしっかり覚えておいてください。すべてが落ちる隙間だからです。

OCRが本当に苦手な場面

現実生活では3つの制限が何度も現れます。

手書き文字。 印刷されたテキストは解決済みの問題です。あなたの手書き文字はそうではありません。きれいなブロック文字は通常、うまく認識されます。筆記体、詰まった余白メモ、医者が書いたものはぐちゃぐちゃになるか、全く認識されません。重要なものに手書きのページが含まれている場合、プレーンなOCRはあなたを失望させるでしょう。

レイアウト。 OCRは左から右へ、上から下へ読みます。現実の書類は協力しません。領収書は価格をぎくしゃくした右列に置き、フォームはラベルとボックスをあちこちに散乱させ、表は単語スープになります。文字はすべて正しいかもしれませんが、順序はナンセンスです。「Total 3 $14.20 Qty Oat Latte」という具合に。

文脈。 これが大きな問題です。OCRはあなたにページが「03/15/2027」という文字を含んでいることを伝えることができます。しかし、それが有効期限、購入日、またはフォームが印刷された日付なのか伝えることはできません。それが何の文字かを知っていても、何を意味しているかは知らないのです。

検索可能なテキストが見つけられない書類である理由

この最後の制限の日常的な結果があります。OCRが完璧に仕事をして、あなたのスマートフォンのすべてのスキャンが完全に検索可能だとしましょう。食洗機の保証書が必要です。何と入力しますか?

「保証」と入力すると、すべての領収書が保証について言及しているため、40個の結果が得られます。「食洗機」と入力すると、何もない。領収書は「BOSCH SHEM63W55N」と書いているからです。テキストはすべてありますが、意味はありません。正確な単語検索は、正確な単語を覚えているときだけ機能します。そして書類は、頭に入れておきたくないものです。

OCRが提供するもの 理解が提供するもの
領収書 その上の文字 「Boschからの領収書、$649、2025年3月」
パスポートのスキャン テキストとしての名前と数字 「あなたのパスポート—2027年3月15日に有効期限切れ」
あなたの質問 正確な単語とのマッチ 書類が添付された実際の答え

OCRを超えたステップ:書類が何であるかを知る

次のステップは、文字を読むだけでなく、書類が何であるかを理解するソフトウェアです。領収書、誰からのもので、いくらで、いつ有効期限切れか。それがわかると、「食洗機の保証書はどこ?」はページにどの単語が出ているかについてのゲームではなく、答えられる質問になります。

これがPaperlockが構築されている部分です。iPhoneのFace ID保護されたボールトに書類をスキャンまたはインポートすると、全体を読み込んで(手書きを含む)理解します。書類の種類、送信元、日付、金額です。フォルダや名前付けは必要ありません。自動的にファイルされます。その後、プレーンな日本語で質問をします。「パスポートはいつ有効期限切れ?」「Blue Bottleで何を費やした?」そして添付された元の書類を含む答えが返ってきます。ボールトに答えがない場合、推測する代わりにそう伝えます。有効期限がある何かでも、30日前と7日前に自動リマインダーが来ます。全体の仕組みはここで見ることができます。App Storeでまもなくリリース予定です。

1つ、独立した注釈があります。アプリがあなたの書類を読むとき(OCRでも、もっと高度なものでも)、どこでその読み込みが発生し、何が保持されるかを知る価値があります。スキャナーアプリが安全かどうか、そして信頼する前に何をチェックするかについて、誠実なガイドを書きました。詳しくはスキャナーアプリは安全かをご覧ください。

まとめ

OCRはテキストの画像を検索可能なテキストに変え、静かにあらゆる場所にあります。カメラロール、スキャナーアプリ、銀行。本当に便利で、本当に限定的です。手書き文字には不安定、レイアウトに混乱し、意味には盲目です。文字をあなたに与えますが、食洗機の保証書と夕食の領収書の区別はできません。

物を見つけるには、その最後のギャップが重要です。そしてそれを埋めることがOCRの次のステップの目的なのです。