12 mei 2026
Van straatbeeld naar inzicht: tekst automatisch ontsloten door OCR en GeoAI
We zijn terug met een nieuw GeoAI‑blog! Eerder schreven we over voorgetrainde deep learning‑modellen die u direct kunt toepassen in uw GIS‑processen, zonder zelf te hoeven trainen. In dit blog duiken we in twee van zulke deep learning packages die automatisch tekst uit foto’s en straatbeelden halen: Optical Character Recognition (OCR) en Scene Text Parsing.
In veel GIS‑processen zit waardevolle informatie verborgen in beelden: foto’s van inspecties, straatbeelden of gescande documenten. Denk aan huisnummers, assetcodes of verkeersborden, vaak bruikbare en nuttige informatie, maar niet direct doorzoekbaar. Met GeoAI en OCR verandert dat.
Optical Character Recognition (OCR)
OCR is een model om tekst te extraheren uit foto’s of straatbeelden. Dit kan van alles zijn: verkeersborden, reclameborden, huisnummers, labels en zelfs gescande documenten. Het model zet deze waardevolle details uit foto’s om naar een attribuut, inclusief locatie van de tekst in het beeld (bounding boxes). Dat maakt foto’s doorzoekbaar, analyseerbaar en koppelbaar aan assets, dossiers en kaarten.
OCR is gebaseerd op het MMOCR model- een open-source deep learning framework van OpenMMLab. MMOCR richt zich op het herkennen van tekst in beelden. Het model bestaat uit twee stappen: eerst detecteert het AI-model PSENet waar tekst zich bevindt, zélfs als deze gebogen of schuin staat. Daarna herkent ABINet (een ander AI-model) de daadwerkelijke tekst, waarbij ook taalkundige context wordt meegenomen om fouten te corrigeren. Goed om te weten dat deze deep learning package MMOCR als technische basis gebruikt, maar dat ArcGIS dit verpakt in een GIS- én gebruiksvriendelijke workflow.
OCR vs. Scene Text Parsing
Naast OCR is er nog een andere deep learning package beschikbaar die tekst uit beelden extraheert, namelijk Scene Tekst Parsing. De input en resultaten van dit model zijn hetzelfde als dat van het OCR-model en op het eerste gezicht lijken deze modellen hetzelfde te doen. Scene Text Parsing is echter gebaseerd op PaddleOCR- een open-source OCR-framework van PaddlePaddle. Het framework is ontworpen met als doel een lichtgewicht alternatief te zijn voor zwaardere deep learning modellen.
Het belangrijkste verschil tussen deze twee modellen, is de hoeveelheid rekenkracht die nodig is. Zoals hierboven benoemd, is Scene Tekst Parsing een lichtere variant van het OCR-model. Die eerste kan volledig op CPU draaien, terwijl OCR meer rekenkracht nodig heeft en wordt aanbevolen om deze op GPU te draaien. Daarnaast kan Scene Text Parsing voornamelijk eenvoudigere en duidelijke tekst aan, terwijl OCR ook werkt met complexe teksten, zoals gebogen of dicht op elkaar staande labels. De keuze tussen deze twee modellen hangt af van wat u nodig heeft én wat u in huis heeft.
Ander aandachtspunt: Scene Tekst Parsing is momenteel in Legacy gezet door Esri Inc. Dit betekent dat het model geen actieve updates of verbeteringen ontvangt. Het model is nog wel bruikbaar, maar zal in de toekomst mogelijk verdwijnen. OCR blijft ondersteund en zal dienen “ter vervanging van”.
Resultaten van het model
Het OCR-model is getest met een selectie foto’s die zijn gemaakt op straat. Zoals verwacht, wordt een groot deel van de teksten correct extraheert. Zelfs teksten die slecht zichtbaar zijn, worden eruit gehaald. Wat opvalt, is dat er regelmatig bounding boxes ontstaan rondom details die geen teksten zijn. Het symbool van de fiets in bovenstaand voetgangersbord, wordt herkend als tekst met waarde ‘fi’. Dit is natuurlijk geen tekst. Gelukkig geeft het model nog een attribuut terug met een waarde TextConfidence. Dit attribuut geeft aan hoe zeker het model is van de tekst die er staat. Dit attribuut helpt om te besluiten wat er gedaan moet worden met de resulterende tekst. Wat verder opvalt, is dat het model de scheiding tussen woorden niet altijd correct herkent. Ook leestekens worden er slecht uitgehaald. “22.00” wordt “2200”. Een andere uitdaging van het model, is dat elk los woord een individueel object wordt. Om dit samen te voegen tot één tekst, zou u gebruik moeten maken van een functie zoals Contencator.
Dit laat zien dat OCR‑resultaten altijd nabewerking nodig hebben. Door bijvoorbeeld te filteren op TextConfidence of regels toe te passen (zoals minimale tekenlengte), kunt ude kwaliteit van uw dataset aanzienlijk verbeteren.
Wat te doen met de resultaten?
Nu u weet wat OCR doet, bent u vast benieuwd hoe dit model relevant is voor uw organisatie. Het extraheren van tekst uit beelden, is bijvoorbeeld interessant wanneer u werkt met waarnemingen in het veld die gekoppeld kunnen worden aan assets. Wanneer u foto's heeft van objecten met namen, codes of andere tekstuele informatie, kan het model automatisch de asset gegevens extraheren en toevoegen als waarde in een attribuut. Zo is het voor u gelijk duidelijk over welk asset het gaat en hoeft de monteur minder informatie in te tikken op de veldwerkapplicatie. Win-win! Door OCR toe te passen, kun je sneller inventariseren, actualiseren en controleren: van “waar staat dit bord?” tot “welke objecten missen nog een asset-ID?” — en u bouwt tegelijk een doorzoekbaar archief van beeldmateriaal op.
OCR helpt ook bij het inventariseren van verkeersborden in de openbare ruimte. Door tekst automatisch uit straatbeelden of inspectiefoto’s te halen, kunnen bijvoorbeeld snelheidsaanduidingen, onderborden of aanvullende teksten direct worden omgezet naar attributen. Dit maakt het mogelijk om verkeersborden efficiënter te registreren en controleren, bijvoorbeeld door gedetecteerde informatie te vergelijken met bestaande datasets. Zo krijgt u sneller inzicht in ontbrekende, verouderde of afwijkende borden, zonder dat alles handmatig ingevoerd moet worden.
OCR uit foto’s, waarnemingen of beelden is vooral waardevol wanneer tekst meer is dan decoratie: wanneer het een identificatie, status of besluit vertegenwoordigt. Juist dan kan GeoAI helpen om foto’s om te zetten in actiegerichte informatie.
Zelf aan de slag met GeoAI?
Wilt u aan de slag met deze packages? Deze kunt u eenvoudig downloaden via deze link in de Living Atlas.
Zoals bij veel deep learning workflows geldt: zorg dat de benodigde deep learning libraries geïnstalleerd zijn en houd rekening met rekenkracht (voor OCR wordt GPU aanbevolen).
Bent u geïnteresseerd in meer mogelijkheden rondom GeoAI? Bekijk onze GeoAI hub voor meer informatie, praktische voorbeelden en klantverhalen.
Geïnspireerd geraakt?
Neem contact met ons op voor meer informatie of vragen, of plan zelf een adviesgesprek om te ontdekken welke mogelijkheden er voor uw organisatie zijn.