Tankeledere
Brug af OCR til komplekse tekniske tegninger

Optisk tegnkendelse (OCR) har revolutioneret måden, hvorpå virksomheder automatiserer dokumentbehandling. Men kvaliteten og nøjagtigheden af teknologien er ikke tilstrækkelig til alle formål. Jo mere komplekse dokumenterne er, som behandles, desto mindre nøjagtig bliver det. Dette er særligt sandt for tekniske tegninger. Selvom OCR-teknologier ikke er velegnede til denne opgave, findes der andre måder at opnå dokumentbehandlingsmål med OCR på. I det følgende vil jeg undersøge flere mulige løsninger for at give en generel idé uden at gå for dybt ind i tekniske detaljer.
Udfordringer med teknisk tegningerkendelse
Når det kommer til tekniske tegninger, har OCR svært ved at forstå betydningen af enkeltvis tekst. Teknologien kan læse teksten, men den forstår ikke dens betydning. Der er en række muligheder for ingeniører og producenter at overveje, hvis den automatiske genkendelse af det tekniske dokument er konfigureret korrekt. Se de vigtigste af dem nedenfor.

Billede kilde: Mobidev
For at opnå kompleks teknisk dokumentanalyse, skal ingeniører træne AI-modeller. Ligesom mennesker har AI-modeller brug for erfaring og træning for at forstå disse tegninger.
En udfordring med blåkopier og tekniske tegninger er, at softwaren skal forstå, hvordan den kan adskille de forskellige visninger af tegningen. Disse er forskellige dele af tegningen, der giver en grundlæggende idé om dens layout. Ved at adskille visningerne og forstå, hvordan de relaterer til hinanden, kan softwaren beregne begrænsningsfeltet.
Dette proces kan omfatte flere udfordringer:
- Visninger kan overlappe
- Visninger kan være beskadiget
- Etiketter kan være ligeså langt fra to visninger
- Visninger kan være indlejret
Forholdet mellem visninger er endnu en mulig problem. Du skal overveje, om visningen er en flad del af diagrammet, en drejet del, en blok eller noget andet. Derudover kan der være andre problemer som kædede målinger, manglende annoteringer, implicit definerede højder gennem reference til en standard eller andre problemer.
Vigtigt er, at generisk OCR ikke kan pålideligt forstå tekst i tegninger, der er omgivet af grafiske elementer som linjer, symboler og annoteringer. På grund af denne kendsgerning skal vi dykke dybere ind i OCR med maskinlæring, som vil være mere nyttig for denne anvendelse.
Forudindlærte og brugerdefinerede OCR-modeller
Der er ingen mangel på OCR-software på markedet, men ikke alle disse programmer kan trænes eller ændres af brugeren. Som vi har lært, kan træning være en nødvendighed for at analysere jeres tekniske tegninger. Men OCR-værktøjer til disse tegninger findes.
Forudindlærte OCR-værktøjer
Her er nogle almindelige muligheder for OCR-genkendelse af tekniske tegninger:
- ABBYY FineReader: denne fleksible blåkopi-tydningssoftware tilbyder OCR-teknologi med genkendelsesmuligheder for tekst. Den understøtter forskellige billedformater, layoutbevarelse, dataeksport og integrationer.
- Adobe Acrobat Pro: ud over at tilbyde PDF-redigering, visning og administration, tillader Acrobat dig at scannen OCR-dokumenter og blåkopier, ekstrahere tekst og udføre søgninger. Den understøtter forskellige sprog og tillader brugere at konfigurere indstillinger.
- Bluebeam Revu: endnu et populært PDF-program, tilbyder Bluebeam Revu OCR-teknologier til teknisk tegningstekstekstraktion.
- AutoCAD: som står for Computer Aided Design, understøtter AutoCAD OCR-tilføjelser til at fortolke blåkopier og omdanne dem til redigérbar CAD-elementer.
- PlanGrid: denne software indeholder blåkopi-OCR-tydning som standard. Med denne funktion kan du uploade blåkopi-billeder og derefter ekstrahere, organisere, indeksere og søge teksten.
- Textract: denne cloud-baserede AWS-funktion aktiverer OCR-analyse af dokumenter og kan ekstrahere elementer som tabeller fra dokumenter. Den kan også genkende elementer fra blåkopier og tilbyder API’er til integration med andre programmer.
- Butler OCR: tilbyder udviklere dokumentekstraktions-API’er, kombinerer Butler OCR maskinlæring med menneskelig gennemgang for at forbedre nøjagtigheden af dokumentgenkendelse.
Brugerdefinerede OCR-løsninger
Hvis du søger efter brugerdefinerede OCR-løsninger, der kan trænes til at opnå bedre automatisk dataekstraktion fra tekniske tegninger og tilpasse dem til jeres specifikke dataformat, findes der følgende populære muligheder:
- Tesseract: denne fleksible, open-source OCR-motor, der vedligeholdes af Google, kan trænes på brugerdefinerede data for at genkende blåkopi-specifikke tegn og symboler.
- OpenCV: Open-Source Computer Vision Library kan kombineres med OCR-værktøjer som Tesseract for at opbygge brugerdefinerede fortolkningsløsninger. Dets billedbehandlings- og analysefunktioner kan forbedre nøjagtigheden af OCR på tekniske tegninger, når de anvendes korrekt.
Ud over disse værktøjer er det også muligt at uafhængigt udvikle brugerdefinerede maskinlæringsmodeller. Ved at anvende træningsmodeller på mærkede datasæt, rammer som TensorFlow eller PyTorch, kan disse løsninger justeres til at genkende specifikke blåkopi-elementer og opnå højere nøjagtighed for organisationens behov.
Forudindlærte modeller tilbyder bekvemmelighed og let brug, men kan ikke være så effektive til at fortolke tekniske tegninger som brugerdefinerede løsninger. Disse brugerdefinerede løsninger kræver også yderligere ressourcer og ekspertise til udvikling og vedligehold.
Brugerdefinerede løsninger kræver yderligere finansielle ressourcer og arbejdskraft til udvikling. Jeg vil anbefale at starte med en bevis for koncept (PoC) for at validere tekniske evner og en minimum viable produkt (MVP) for at kontrollere markedets perception af projektet, før du investerer for meget i en brugerdefineret OCR-løsning.
Processen med at implementere en OCR-modul til læsning af tekniske tegninger
Det bedste sted at starte med at bygge OCR-software til tekniske tegninger ville være at analysere tilgængelige open-source-værktøjer. Hvis du udtømmer dine open-source-muligheder, kan du muligvis være nødt til at vende til lukkede-værktøjer med API-integrationer.
At bygge en OCR-løsning fra bunden er ikke praktisk, da det kræver en enorm datasæt til træning. Dette er svært og dyrt at samle og kræver mange ressourcer til modeltræning. I de fleste tilfælde bør justering af eksisterende modeller være tilstrækkeligt.
Processen herfra ligner noget i retning af:
- Overvej krav: du skal forstå, hvilke tekniske tegninger din anvendelse skal fungere med, og hvilke funktioner og funktionaliteter der er nødvendige for at opnå dette mål.
- Billeddannelse og forbehandling: tænk over, hvilke enheder du planlægger at bruge til at danne billederne. Ekstra forbehandlingssteg kan være nødvendige for at forbedre kvaliteten af dine resultater. Dette kan omfatte beskæring, omskalerings-, støjreducering og mere.
- OCR-integration: overvej, hvilken OCR-motor der vil fungere bedst med din anvendelse. OCR-biblioteker har API’er, der tillader din anvendelse at ekstrahere tekst fra fangede billeder. Det er vigtigt at overveje open-source OCR-løsninger til omkostningsbesparelse. Tredjeparts-API’er kan være ustabile med hensyn til priser over tid eller tabe support.
- Tekstgenkendelse og -behandling: herefter er det tid til at implementere logik til at behandle og genkende tekst. Nogle mulige opgaver, du kan overveje at tilføje i dette trin, er tekstrensning, sproggenkendelse eller andre teknikker, der kan give klarere tekstgenkendelsesresultater.
- Brugergrænseflade og -oplevelse: en letanvendelig brugergrænseflade til appen er vigtig, så brugeren kan effektivt bruge den til at fange billeder og initiere OCR. Resultaterne skal præsenteres for brugeren på en måde, der er let at forstå.
- Test: test applikationen grundigt for at sikre dens nøjagtighed og brugervenlighed. Brugerfeedback er afgørende for denne proces.
Afslutning
I lyset af udfordringerne med at skabe OCR-software til komplekse tekniske tegninger har organisationer en række muligheder til rådighed for at nærme sig problemet. Fra en række forudindlærte modeller og tilpassede værktøjer til at skabe mere personlige løsninger kan virksomheder finde måder til at effektivt analysere, indeksere og søge gennem blåkopier og andre komplekse dokumenter. Alt det kræver er lidt ingeniøritet, kreativitet og tid til at skabe en løsning, der opfylder deres behov.












