Tankeledere

Brug af OCR til komplekse tekniske tegninger

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Optisk tegnkendelse (OCR) har revolutioneret mÃĨden, hvorpÃĨ virksomheder automatiserer dokumentbehandling. Men kvaliteten og nÃļjagtigheden af teknologien er ikke tilstrÃĶkkelig til alle formÃĨl. Jo mere komplekse dokumenterne er, som behandles, desto mindre nÃļjagtig bliver det. Dette er sÃĶrligt sandt for tekniske tegninger. Selvom OCR-teknologier ikke er velegnede til denne opgave, findes der andre mÃĨder at opnÃĨ dokumentbehandlingsmÃĨl med OCR pÃĨ. I det fÃļlgende vil jeg undersÃļge flere mulige lÃļsninger for at give en generel idÃĐ uden at gÃĨ for dybt ind i tekniske detaljer.

Udfordringer med teknisk tegningerkendelse

NÃĨr det kommer til tekniske tegninger, har OCR svÃĶrt ved at forstÃĨ betydningen af enkeltvis tekst. Teknologien kan lÃĶse teksten, men den forstÃĨr ikke dens betydning. Der er en rÃĶkke muligheder for ingeniÃļrer og producenter at overveje, hvis den automatiske genkendelse af det tekniske dokument er konfigureret korrekt. Se de vigtigste af dem nedenfor.

Billede kilde: Mobidev

For at opnÃĨ kompleks teknisk dokumentanalyse, skal ingeniÃļrer trÃĶne AI-modeller. Ligesom mennesker har AI-modeller brug for erfaring og trÃĶning for at forstÃĨ disse tegninger.

En udfordring med blÃĨkopier og tekniske tegninger er, at softwaren skal forstÃĨ, hvordan den kan adskille de forskellige visninger af tegningen. Disse er forskellige dele af tegningen, der giver en grundlÃĶggende idÃĐ om dens layout. Ved at adskille visningerne og forstÃĨ, hvordan de relaterer til hinanden, kan softwaren beregne begrÃĶnsningsfeltet.

Dette proces kan omfatte flere udfordringer:

  • Visninger kan overlappe
  • Visninger kan vÃĶre beskadiget
  • Etiketter kan vÃĶre ligesÃĨ langt fra to visninger
  • Visninger kan vÃĶre indlejret

Forholdet mellem visninger er endnu en mulig problem. Du skal overveje, om visningen er en flad del af diagrammet, en drejet del, en blok eller noget andet. Derudover kan der vÃĶre andre problemer som kÃĶdede mÃĨlinger, manglende annoteringer, implicit definerede hÃļjder gennem reference til en standard eller andre problemer.

Vigtigt er, at generisk OCR ikke kan pÃĨlideligt forstÃĨ tekst i tegninger, der er omgivet af grafiske elementer som linjer, symboler og annoteringer. PÃĨ grund af denne kendsgerning skal vi dykke dybere ind i OCR med maskinlÃĶring, som vil vÃĶre mere nyttig for denne anvendelse.

ForudindlÃĶrte og brugerdefinerede OCR-modeller

Der er ingen mangel pÃĨ OCR-software pÃĨ markedet, men ikke alle disse programmer kan trÃĶnes eller ÃĶndres af brugeren. Som vi har lÃĶrt, kan trÃĶning vÃĶre en nÃļdvendighed for at analysere jeres tekniske tegninger. Men OCR-vÃĶrktÃļjer til disse tegninger findes.

ForudindlÃĶrte OCR-vÃĶrktÃļjer

Her er nogle almindelige muligheder for OCR-genkendelse af tekniske tegninger:

  • ABBYY FineReader: denne fleksible blÃĨkopi-tydningssoftware tilbyder OCR-teknologi med genkendelsesmuligheder for tekst. Den understÃļtter forskellige billedformater, layoutbevarelse, dataeksport og integrationer.
  • Adobe Acrobat Pro: ud over at tilbyde PDF-redigering, visning og administration, tillader Acrobat dig at scannen OCR-dokumenter og blÃĨkopier, ekstrahere tekst og udfÃļre sÃļgninger. Den understÃļtter forskellige sprog og tillader brugere at konfigurere indstillinger.
  • Bluebeam Revu: endnu et populÃĶrt PDF-program, tilbyder Bluebeam Revu OCR-teknologier til teknisk tegningstekstekstraktion.
  • AutoCAD: som stÃĨr for Computer Aided Design, understÃļtter AutoCAD OCR-tilfÃļjelser til at fortolke blÃĨkopier og omdanne dem til redigÃĐrbar CAD-elementer.
  • PlanGrid: denne software indeholder blÃĨkopi-OCR-tydning som standard. Med denne funktion kan du uploade blÃĨkopi-billeder og derefter ekstrahere, organisere, indeksere og sÃļge teksten.
  • Textract: denne cloud-baserede AWS-funktion aktiverer OCR-analyse af dokumenter og kan ekstrahere elementer som tabeller fra dokumenter. Den kan ogsÃĨ genkende elementer fra blÃĨkopier og tilbyder API’er til integration med andre programmer.
  • Butler OCR: tilbyder udviklere dokumentekstraktions-API’er, kombinerer Butler OCR maskinlÃĶring med menneskelig gennemgang for at forbedre nÃļjagtigheden af dokumentgenkendelse.

Brugerdefinerede OCR-lÃļsninger

Hvis du sÃļger efter brugerdefinerede OCR-lÃļsninger, der kan trÃĶnes til at opnÃĨ bedre automatisk dataekstraktion fra tekniske tegninger og tilpasse dem til jeres specifikke dataformat, findes der fÃļlgende populÃĶre muligheder:

  • Tesseract: denne fleksible, open-source OCR-motor, der vedligeholdes af Google, kan trÃĶnes pÃĨ brugerdefinerede data for at genkende blÃĨkopi-specifikke tegn og symboler.
  • OpenCV: Open-Source Computer Vision Library kan kombineres med OCR-vÃĶrktÃļjer som Tesseract for at opbygge brugerdefinerede fortolkningslÃļsninger. Dets billedbehandlings- og analysefunktioner kan forbedre nÃļjagtigheden af OCR pÃĨ tekniske tegninger, nÃĨr de anvendes korrekt.

Ud over disse vÃĶrktÃļjer er det ogsÃĨ muligt at uafhÃĶngigt udvikle brugerdefinerede maskinlÃĶringsmodeller. Ved at anvende trÃĶningsmodeller pÃĨ mÃĶrkede datasÃĶt, rammer som TensorFlow eller PyTorch, kan disse lÃļsninger justeres til at genkende specifikke blÃĨkopi-elementer og opnÃĨ hÃļjere nÃļjagtighed for organisationens behov.

ForudindlÃĶrte modeller tilbyder bekvemmelighed og let brug, men kan ikke vÃĶre sÃĨ effektive til at fortolke tekniske tegninger som brugerdefinerede lÃļsninger. Disse brugerdefinerede lÃļsninger krÃĶver ogsÃĨ yderligere ressourcer og ekspertise til udvikling og vedligehold.

Brugerdefinerede lÃļsninger krÃĶver yderligere finansielle ressourcer og arbejdskraft til udvikling. Jeg vil anbefale at starte med en bevis for koncept (PoC) for at validere tekniske evner og en minimum viable produkt (MVP) for at kontrollere markedets perception af projektet, fÃļr du investerer for meget i en brugerdefineret OCR-lÃļsning.

Processen med at implementere en OCR-modul til lÃĶsning af tekniske tegninger

Det bedste sted at starte med at bygge OCR-software til tekniske tegninger ville vÃĶre at analysere tilgÃĶngelige open-source-vÃĶrktÃļjer. Hvis du udtÃļmmer dine open-source-muligheder, kan du muligvis vÃĶre nÃļdt til at vende til lukkede-vÃĶrktÃļjer med API-integrationer.

At bygge en OCR-lÃļsning fra bunden er ikke praktisk, da det krÃĶver en enorm datasÃĶt til trÃĶning. Dette er svÃĶrt og dyrt at samle og krÃĶver mange ressourcer til modeltrÃĶning. I de fleste tilfÃĶlde bÃļr justering af eksisterende modeller vÃĶre tilstrÃĶkkeligt.

Processen herfra ligner noget i retning af:

  1. Overvej krav: du skal forstÃĨ, hvilke tekniske tegninger din anvendelse skal fungere med, og hvilke funktioner og funktionaliteter der er nÃļdvendige for at opnÃĨ dette mÃĨl.
  2. Billeddannelse og forbehandling: tÃĶnk over, hvilke enheder du planlÃĶgger at bruge til at danne billederne. Ekstra forbehandlingssteg kan vÃĶre nÃļdvendige for at forbedre kvaliteten af dine resultater. Dette kan omfatte beskÃĶring, omskalerings-, stÃļjreducering og mere.
  3. OCR-integration: overvej, hvilken OCR-motor der vil fungere bedst med din anvendelse. OCR-biblioteker har API’er, der tillader din anvendelse at ekstrahere tekst fra fangede billeder. Det er vigtigt at overveje open-source OCR-lÃļsninger til omkostningsbesparelse. Tredjeparts-API’er kan vÃĶre ustabile med hensyn til priser over tid eller tabe support.
  4. Tekstgenkendelse og -behandling: herefter er det tid til at implementere logik til at behandle og genkende tekst. Nogle mulige opgaver, du kan overveje at tilfÃļje i dette trin, er tekstrensning, sproggenkendelse eller andre teknikker, der kan give klarere tekstgenkendelsesresultater.
  5. BrugergrÃĶnseflade og -oplevelse: en letanvendelig brugergrÃĶnseflade til appen er vigtig, sÃĨ brugeren kan effektivt bruge den til at fange billeder og initiere OCR. Resultaterne skal prÃĶsenteres for brugeren pÃĨ en mÃĨde, der er let at forstÃĨ.
  6. Test: test applikationen grundigt for at sikre dens nÃļjagtighed og brugervenlighed. Brugerfeedback er afgÃļrende for denne proces.

Afslutning

I lyset af udfordringerne med at skabe OCR-software til komplekse tekniske tegninger har organisationer en rÃĶkke muligheder til rÃĨdighed for at nÃĶrme sig problemet. Fra en rÃĶkke forudindlÃĶrte modeller og tilpassede vÃĶrktÃļjer til at skabe mere personlige lÃļsninger kan virksomheder finde mÃĨder til at effektivt analysere, indeksere og sÃļge gennem blÃĨkopier og andre komplekse dokumenter. Alt det krÃĶver er lidt ingeniÃļritet, kreativitet og tid til at skabe en lÃļsning, der opfylder deres behov.

AI Team Leder hos MobiDev, et softwareudviklingsselskab, der hjÃĶlper virksomheder verden over med at innovere med nyeste teknologier sÃĨsom kunstig intelligens, datavidenskab, forstÃĶrket virkelighed og Internet of Things. Hendes professionelle fokus er dataanalyse, prognose, NLP og chatbots. Forfatter af artikler om kunstig intelligens til AiiotTalk, Hackernoon, DevTo. Taler ved forskellige AI-konferencer og tech-talks.