OCR staat voor optical character recognition, een stijve naam voor een eenvoudig idee: software die naar een foto van tekst kijkt — een foto, een scan, een PDF-pagina — en bepaalt welke letters en cijfers erin staan.
Dat is belangrijk omdat een foto van een bon voor een computer gewoon een rooster van gekleurde puntjes is. Het kan erin niet zoeken, het niet kopiëren of het totaal niet lezen. Voer OCR uit op die foto en de puntjes worden echte tekst: "Blue Bottle Coffee… $14.20…" Nu kan de computer het vinden als je zoekt, net zoals een e-mail.
Dat is het hele concept. Foto van woorden erin, doorzoekbare woorden eruit. Al het andere over OCR is detail — inclusief het detail over waarom je, ondanks dat OCR overal is, je waarborgregeling voor de afwasmachine nog steeds niet kunt vinden. Daar zullen we nog op ingaan.
Je gebruikt OCR al dagelijks
OCR klinkt als zakelijke software uit 2003, maar je hebt het waarschijnlijk vanmorgen al gebruikt zonder het te merken:
- Fotogeschiedenis doorzoeken op je iPhone. Apple noemt dit Live Text. Je iPhone leest stil de tekst in elke foto die je maakt, daarom kun je in je foto's naar woorden op een bord of bon zoeken en echt resultaten krijgen. Je kunt ook op een foto drukken en de tekst er direct uit kopiëren.
- Scanner-apps. Als je een document met je iPhone scant, maakt de app de foto — en dan zorgt OCR ervoor dat de PDF doorzoekbaar wordt in plaats van gewoon een foto in vermomming.
- Je bank. Veel banken kunnen een cheque verwerken door hem te fotograferen, en OCR leest het bedrag en de rekeningnummers.
- De post. Postbedrijven gebruiken OCR al decennia om adressen te lezen en enveloppen te sorteren. Het is werkelijk oude technologie die langzaam beter is geworden.
Dus als een scanner-app adverteert met "doorzoekbare PDF's," dan is dat OCR. Het is geen merk en geen product — het is gewoon hoe computers tekst lezen.
Hoe het grotendeels werkt
Je hoeft de technische kant niet te begrijpen, maar deze korte uitleg helpt je voorspellen wanneer het mislukt.
OCR-software zoekt naar de vormen van letters: deze cluster donkere pixels buigt als een "S", die andere heeft de dwarsbalk van een "t". Modern OCR doet dit heel goed met schone, gedrukte tekst — goede belichting, vlakke pagina, normale lettertypen. Dan zet het de letters in woorden en de woorden in regels, en geeft je het resultaat als gewone tekst.
Zien wat er gebeurt: het herkent letters. Niet bonnen, niet contracten, niet "dit bedrag is het totaal en dat is een datum." Letters. Onthoud dat goed, want hier zit het probleem.
Waar OCR echt moeite mee heeft
Drie beperkingen komen keer op keer terug in de praktijk:
Handschrift. Gedrukte tekst is opgelost; je handschrift niet. Nette blokletters overleven meestal. Cursief schrift, krap geschreven aantekeningen en alles wat door een dokter is geschreven, wordt verminkt of niet herkend. Als je belangrijke documenten handgeschreven pagina's bevatten, zal gewone OCR je teleurstellen.
Lay-out. OCR leest van links naar rechts, van boven naar beneden. Echte documenten werken niet mee: op bonnen staan prijzen chaotisch rechts, formulieren hebben labels en vakjes overal, tabellen worden woordbrei. De letters kunnen allemaal correct zijn terwijl de volgorde onzin is — "Totaal 3 $14.20 Hoeveelheid Haver Latte."
Context. Dit is het grootste probleem. OCR kan zeggen dat een pagina de tekens "03/15/2027" bevat. Het kan je niet vertellen of dat een vervaldatum, aankoopdatum of afldrukdatum is. Het weet wat de letters zijn, niet wat ze betekenen.
Waarom doorzoekbare tekst je documenten nog niet vindbaar maakt
Dit is het dagelijks gevolg van die laatste beperking. Stel dat OCR perfect heeft gewerkt en elke scan op je telefoon volledig doorzoekbaar is. Je hebt de waarborgregeling voor je afwasmachine nodig. Wat typ je in?
"Waarborgregeling" — en je krijgt veertig resultaten, omdat elke bon een waarborgregeling vermeldt. "Afwasmachine" — niets, want op de bon staat "BOSCH SHEM63W55N." De tekst is er allemaal; de betekenis niet. Zoeken naar exact woord werkt alleen als je je een exact woord herinnert, en papierwerk is precies wat je liever niet hoeft onthouden.
| OCR geeft je | Inzicht geeft je | |
|---|---|---|
| Een bon | De karakters erop | "Een bon van Bosch, $649, maart 2025" |
| Een gescande paspoort | Namen en nummers als tekst | "Je paspoort — vervalt 03/15/2027" |
| Je vraag | Resultaten voor exacte woorden | Een echt antwoord, met het document eraan |
De stap voorbij OCR: weten wat een document is
De volgende stap is software die niet stopt bij het lezen van karakters, maar bepaalt wat het document is: een bon, van wie, voor hoeveel, wanneer vervalt. Zodra dat bekend is, wordt "Waar is de waarborgregeling van mijn afwasmachine?" een antwoordbare vraag in plaats van te gissen welke woorden erin staan.
Dat is waar Paperlock om draait. Je scant of importeert een document in een Face-ID-beveiligde kluis op je iPhone, en het leest alles — inclusief handschrift — en begrijpt het: het type, de afzender, de datums, de bedragen. Geen mappen, geen bestandsnamen; het ordent alles zelf. Vervolgens vraag je in gewoon Nederlands — "Wanneer vervalt mijn paspoort?", "Hoeveel heb ik bij Blue Bottle besteed?" — en je krijgt het antwoord met het brondocument eraan. Als het antwoord niet in je kluis staat, laat het dat weten. Alles met een vervaldatum krijgt automatische herinneringen 30 en 7 dagen van tevoren. Je kunt hier zien hoe het werkt; het komt binnenkort naar de App Store.
Nog één belangrijk voorbehoud: telkens wanneer een app je documenten leest — OCR of iets slimmer — is het nuttig om te weten waar dat lezen plaats vindt en wat ervan wordt opgeslagen. We hebben een eerlijke gids geschreven over of scanner-apps veilig zijn en wat je moet controleren voordat je er een vertrouwt.
De korte versie
OCR zet foto's van tekst om in doorzoekbare tekst, en het is overal stilletjes aan het werk — je camerarol, je scanner-app, je bank. Het is werkelijk nuttig en werkelijk beperkt: wankel bij handschrift, in de war door lay-outs, blind voor betekenis. Het geeft je de letters; het kan je waarborgregeling niet van de restaurantbon onderscheiden.
Voor het terugvinden van dingen is die laatste beperking het allerbelangrijkste — en het overwinnen ervan is precies wat de stap na OCR voor staat.