Thought leaders
Het gebruik van OCR voor complexe technische tekeningen

Optische tekenherkenning (OCR) heeft de manier waarop bedrijven documentverwerking automatiseren revolutionair veranderd. Echter, de kwaliteit en nauwkeurigheid van de technologie zijn niet voldoende voor elke toepassing. Hoe complexer het document dat wordt verwerkt, hoe minder nauwkeurig het wordt. Dit is vooral het geval bij technische tekeningen. Hoewel standaard OCR-technologieën mogelijk niet geschikt zijn voor deze taak, zijn er andere manieren om uw documentverwerkingsdoelen met OCR te bereiken. In het volgende zal ik enkele haalbare oplossingen onderzoeken om u een algemeen idee te geven zonder te veel in detail te treden.
Uitdagingen van technische tekenherkenning
Wanneer het gaat om technische tekeningen, heeft OCR moeite om de betekenis van individuele tekstelementen te begrijpen. De technologie kan de tekst lezen, maar begrijpt niet de betekenis ervan. Er zijn een aantal kansen voor ingenieurs en fabrikanten om te overwegen als de automatische herkenning van het technische document correct is geconfigureerd. Zie de meest significante onder hen hieronder.

Afbeeldingsbron: Mobidev
Om complexe technische documentanalyse te bereiken, moeten ingenieurs AI-modellen trainen. Net als mensen, hebben AI-modellen ervaring en training nodig om deze tekeningen te begrijpen.
Een van de uitdagingen van blauwdrukken en technische tekeningen is dat de software moet begrijpen hoe de verschillende views van de tekening moeten worden gescheiden. Deze zijn verschillende delen van de tekening die een basisidee van de lay-out geven. Door de views te scheiden en te begrijpen hoe ze met elkaar in verband staan, kan de software de bounding box berekenen.
Dit proces kan enkele uitdagingen omvatten:
- Views kunnen overlappen
- Views kunnen beschadigd zijn
- Labels kunnen equidistant zijn tot twee views
- Views kunnen genest zijn
De relatie tussen views is een ander mogelijk probleem. U moet overwegen of de view een plat deel van het diagram is, een gedraaide deel, een blok of iets anders. Bovendien kunnen er andere problemen zijn zoals gekoppelde maten, ontbrekende annotaties, impliciet gedefinieerde hoogtes door verwijzing naar een standaard, of andere problemen.
Belangrijk is dat generieke OCR niet betrouwbaar tekst in tekeningen kan begrijpen die omgeven zijn door grafische elementen zoals lijnen, symbolen en annotaties. Vanwege dit feit moeten we dieper ingaan op OCR met machine learning dat meer behulpzaam zal zijn voor deze toepassing.
Pre-getrainde en aangepaste OCR-modellen
Er is geen tekort aan OCR-software op de markt, maar niet alle software kan worden getraind of gewijzigd door de gebruiker. Zoals we hebben geleerd, kan training een noodzaak zijn voor het analyseren van uw technische tekeningen. Echter, OCR-gereedschappen voor deze soort tekeningen bestaan.
Pre-getrainde OCR-gereedschappen
Hier zijn enkele veelvoorkomende opties voor OCR-herkenning van technische tekeningen:
- ABBYY FineReader: deze veelzijdige blauwdruk-interpretatie software biedt OCR-technologie met herkenningsmogelijkheden voor tekst. Het ondersteunt verschillende afbeeldingsformaten, lay-outbehoud, gegevensexport en integraties.
- Adobe Acrobat Pro: naast het bieden van PDF-bewerking, weergave en beheer, stelt Acrobat u in staat om OCR-documenten en blauwdrukken te scannen, tekst te extraheren en zoekopdrachten uit te voeren. Het ondersteunt verschillende talen en stelt gebruikers in staat om opties te configureren.
- Bluebeam Revu: een andere populaire PDF-toepassing, biedt Bluebeam Revu OCR-technologieën voor het extraheren van tekst uit technische tekeningen.
- AutoCAD: wat staat voor Computer Aided Design, ondersteunt AutoCAD OCR-plug-ins voor het interpreteren van blauwdrukken en het omzetten ervan in bewerkbare CAD-elementen.
- PlanGrid: deze software bevat blauwdruk-OCR-interpretatie uit de doos. Met deze functie kunt u blauwdruk-afbeeldingen uploaden en vervolgens tekst extraheren, organiseren, indexeren en doorzoeken.
- Textract: deze cloud-gebaseerde AWS-functie maakt OCR-analyse van documenten mogelijk en kan elementen zoals tabellen uit documenten extraheren. Het kan ook elementen uit blauwdrukken herkennen en biedt API’s voor integratie met andere toepassingen.
- Butler OCR: biedt ontwikkelaars document-extractie-API’s, combineert Butler OCR machine learning met menselijke beoordeling om de nauwkeurigheid van documentherkenning te verbeteren.
Aangepaste OCR-oplossingen
Als u op zoek bent naar aangepaste OCR-oplossingen die kunnen worden getraind om betere automatische gegevensextractie uit technische tekeningen te bereiken en aan te passen aan uw specifieke gegevensformaat, zijn hier enkele populaire opties:
- Tesseract: deze flexibele, open-source OCR-engine, onderhouden door Google, kan worden getraind op aangepaste gegevens om blauwdruk-specifieke tekens en symbolen te herkennen.
- OpenCV: Open-Source Computer Vision Library kan worden gecombineerd met OCR-gereedschappen zoals Tesseract om aangepaste interpretatieve oplossingen te bouwen. De beeldverwerkings- en analysefuncties kunnen de nauwkeurigheid van OCR op technische tekeningen verbeteren wanneer deze correct worden gebruikt.
Naast deze gereedschappen is het ook mogelijk om onafhankelijk aangepaste machine learning-modellen te ontwikkelen. Door trainingsmodellen te gebruiken op gelabelde datasets, kaders zoals TensorFlow of PyTorch, kunnen deze oplossingen worden gefinetuned om specifieke blauwdrukelementen te herkennen en een hogere nauwkeurigheid te bereiken voor de behoeften van een organisatie.
Pre-getrainde modellen bieden gemak en gebruiksgemak, maar kunnen mogelijk niet zo effectief zijn in het interpreteren van technische tekeningen als aangepaste oplossingen. Deze aangepaste oplossingen vereisen ook extra middelen en deskundigheid om te ontwikkelen en te onderhouden.
Aangepaste oplossingen vereisen extra financiële middelen en arbeid om te ontwikkelen. Ik zou aanraden om te beginnen met een proof of concept (PoC) om technische mogelijkheden te valideren en een minimum viable product (MVP) om de marktperceptie van het project te controleren voordat u te veel investeert in een aangepaste OCR-oplossing.
Het proces van het implementeren van een OCR-module voor het lezen van technische tekeningen
De beste plek om te beginnen met het bouwen van OCR-software voor technische tekeningen zou zijn om beschikbare open-source-gereedschappen te analyseren. Als u uw open-source-opties uitput, moet u mogelijk naar gesloten bron-opties met API-integraties gaan.
Het bouwen van een OCR-oplossing van scratch is onpraktisch omdat het een enorme dataset voor training vereist. Dit is moeilijk en duur om te verzamelen en vereist veel middelen voor modeltraining. In de meeste gevallen moet het finetunen van bestaande modellen uw behoeften dekken.
Het proces vanaf hier ziet er ongeveer zo uit:
- Overweeg vereisten: u moet begrijpen met welke soort technische tekeningen uw toepassing moet werken en welke functies en functionaliteiten nodig zijn om dit doel te bereiken.
- Afbeeldingsopname en voorverwerking: denk na over welke apparaten u van plan bent te gebruiken om de afbeeldingen op te nemen. Extra voorverwerkingsstappen kunnen nodig zijn om de kwaliteit van uw resultaten te verbeteren. Dit kan onder andere omvatten: bijsnijden, herschalen, ruisreductie en meer.
- OCR-integratie: overweeg de OCR-engine die het beste met uw toepassing werkt. OCR-bibliotheken hebben API’s die uw toepassing in staat stellen om tekst uit opgenomen afbeeldingen te extraheren. Het is belangrijk om open-source OCR-oplossingen te overwegen voor kostenbesparingen. Derdepartij-API’s kunnen onbetrouwbaar zijn met betrekking tot prijzen in de loop van de tijd of ondersteuning verliezen.
- Tekstherkenning en -verwerking: vervolgens is het tijd om logica te implementeren om tekst te verwerken en te herkennen. Enkele mogelijke taken die u in deze stap kunt overwegen, zijn tekstopruiming, taalherkenning of andere technieken die tekstherkenningresultaten kunnen verbeteren.
- Gebruikersinterface en -ervaring: een gebruiksvriendelijke gebruikersinterface voor de app is belangrijk zodat de gebruiker deze effectief kan gebruiken om afbeeldingen op te nemen en OCR te initiëren. De resultaten moeten op een manier aan de gebruiker worden gepresenteerd die gemakkelijk te begrijpen is.
- Testen: test de toepassing grondig om de nauwkeurigheid en gebruiksgemak te waarborgen. Gebruikersfeedback is essentieel voor dit proces.
Samenvatting
In het licht van de uitdagingen van het creëren van OCR-software voor complexe technische tekeningen, hebben organisaties een aantal opties om het probleem aan te pakken. Van een reeks pre-getrainde modellen en aanpasbare gereedschappen om meer persoonlijke oplossingen te creëren, kunnen bedrijven manieren vinden om effectief te analyseren, te indexeren en door te zoeken in blauwdrukken en andere complexe documenten. Alles wat nodig is, is een beetje vindingrijkheid, creativiteit en tijd om een oplossing te creëren die aan hun behoeften voldoet.












