Ajatusjohtajat

OCR:n käyttäminen monimutkaisissa teknisissä piirustuksissa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Optinen merkkentunnistus (OCR) on vallankumouksellinen tapa, jolla yritykset automatisoivat asiakirjojen käsittelyä. Teknologian laatu ja tarkkuus eivät kuitenkaan ole riittäviä kaikkeen soveltamiseen. Mitä monimutkaisempi asiakirja on, sitä vähemmän tarkka teknologia on. Tämä on erityisen totta teknisille piirustuksille. Vaikka valmiit OCR-tekniikat eivät välttämättä sovellu tähän tehtävään, on olemassa muita keinoja saavuttaa asiakirjojen käsittelytavoitteet OCR:n avulla. Seuraavassa tarkastellaan useita toteuttamiskelpoisia ratkaisuja antaaksesi yleiskuvan ilman liian teknisten yksityiskohtien antamista.

Haasteet teknisten piirustusten tunnistamisessa

Kun on kyse teknisistä piirustuksista, OCR:ssä on vaikeuksia ymmärtää yksittäisten tekstielementtien merkitys. Teknologia voi lukea tekstin, mutta se ei ymmärrä sen merkitystä. Insinööreillä ja valmistajilla on useita mahdollisuuksia, jos teknisen asiakirjan automaattinen tunnistus on määritetty oikein. Katso alla olevat merkittävimmät niistä.

Kuva: Mobidev

Jotta voidaan saavuttaa monimutkainen tekninen asiakirjan analyysi, insinööreiden on koulutettava tekoälymallit. Niin kuin ihmisillä, myös tekoälymallien tarvitsee kokemusta ja koulutusta ymmärtääkseen nämä piirustukset.

Yksi haaste teknisten piirustusten ja piirrosten tunnistamisessa on, että ohjelmisto on ymmärrettävä, miten eri näkymät piirroksessa erottellaan. Nämä ovat piirroksen eri osia, jotka antavat perustiedon sen ulkoasusta. Erottamalla näkymät ja ymmärtämällä, miten ne liittyvät toisiinsa, ohjelmisto voi laskea rajatun laatikon.

Tässä prosessissa voi olla useita haasteita:

  • Näkymät voivat olla päällekkäin
  • Näkymät voivat olla vahingoittuneita
  • Merkit voivat olla yhtä etäisiä kahden näkymän välillä
  • Näkymät voivat olla sisäkkäin

Näkymien välinen suhde on toinen mahdollinen ongelma. On tarkasteltava, onko näkymä tasainen osa kaaviota, käännöskohta, lohko tai jotain muuta. Lisäksi voi olla muita ongelmia, kuten ketjumittaukset, puuttuvat annotaatiot, implisiittisesti määritellyt korkeudet viitaten standardiin tai muita ongelmia.

Tärkeää on, ettei yleinen OCR voi luotettavasti ymmärtää tekstiä piirroksissa, jota ympäröivät graafiset elementit kuten viivat, symbolit ja annotaatiot. Tämän vuoksi on tutkittava syvemmälle OCR:ää koneoppimisen kanssa, joka on hyödyllisempää tähän soveltamiseen.

Valmiit ja mukautettavat OCR-mallit

OCR-ohjelmistoja on markkinoilla runsaasti, mutta kaikki nämä ohjelmistot eivät ole käyttäjän mukautettavissa. Olemme oppineet, että koulutus voi olla välttämätöntä analyysiä varten. OCR-työkalut näiden tyyppisille piirroksille ovat kuitenkin olemassa.

Valmiit OCR-työkalut

Tässä on joitakin yleisiä vaihtoehtoja OCR-tunnistukselle teknisille piirustuksille:

  • ABBYY FineReader: monipuolinen piirrosten tulkintatyökalu tarjoaa OCR-tekniikkaa tekstintunnistusominaisuuksilla. Se tukee useita kuvamuotoja, ulkoasun säilyttämistä, tietojen vientiä ja integraatioita.
  • Adobe Acrobat Pro: tarjoaa PDF-muokkauksen, näyttämisen ja hallinnan lisäksi mahdollisuuden skannata OCR-dokumentteja ja piirroksia, poimia tekstin ja suorittaa hakutoimintoja. Se tukee useita kieliä ja sallii käyttäjien määritellä asetuksia.
  • Bluebeam Revu: toinen suosittu PDF-sovellus, Bluebeam Revu tarjoaa OCR-tekniikoita teknisten piirrosten tekstintunnistukseen.
  • AutoCAD: tarkoittaa tietokoneavusteista suunnittelua, AutoCAD tukee OCR-liitännäisiä piirrosten tulkitsemiseen ja muuttamiseen muokattaviin CAD-elementteihin.
  • PlanGrid: tämä ohjelmisto sisältää piirrosten OCR-tulkinnan valmiina. Tämän ominaisuuden avulla voit ladata piirrosten kuvia ja sitten poimia, järjestellä, indeksoida ja etsiä tekstiä.
  • Textract: tämä pilvipohjainen AWS-ominaisuus mahdollistaa OCR-analyysin asiakirjoissa ja voi poimia taulukoita asiakirjoista. Se voi myös tunnistaa piirrosten elementtejä ja tarjoaa API:ta muiden sovellusten integroimiseen.
  • Butler OCR: tarjoaa kehittäjille asiakirjojen poimintaa varten API:ta, Butler OCR yhdistää koneoppimisen ja ihmisen tarkastelun parantamaan asiakirjojen tunnistuksen tarkkuutta.

Mukautettavat OCR-ratkaisut

Jos etsit mukautettavia OCR-ratkaisuja, joita voidaan kouluttaa saavuttamaan parempi automaattinen tietojen poiminta teknisistä piirustuksista ja sovittaa ne tietyeen tietomuotoihin, tässä on muutamia suosittuja vaihtoehtoja:

  • Tesseract: tämä joustava, avoimen lähdekoodin OCR-moottori, jota ylläpitää Google, voidaan kouluttaa mukautettuihin tietoihin tunnistamaan piirrosten erityisiä merkkejä ja symboleja.
  • OpenCV: avoimen lähdekoodin tietokoneen näkökirjasto voidaan yhdistää OCR-työkalujen kanssa, kuten Tesseract, luomaan mukautettuja tulkintaratkaisuja. Sen kuvan käsittely- ja analyysitoiminnot voivat parantaa OCR:n tarkkuutta teknisissä piirustuksissa, kun niitä käytetään oikein.

Näiden työkalujen lisäksi on mahdollista kehittää itsenäisesti mukautettuja tekoälymalleja. Käyttämällä koulutusmalleja merkityistä tietoja, kehyksiä kuten TensorFlow tai PyTorch, nämä ratkaisut voidaan hienosäätää tunnistamaan tiettyjä piirrosten elementtejä ja saavuttaa korkeampi tarkkuus organisaation tarpeisiin.

Esikoulutetut mallit tarjoavat helppoutta ja helppokäyttöisyyttä, mutta ne eivät välttämättä ole yhtä tehokkaita teknisten piirrosten tulkinnassa kuin mukautettavat ratkaisut. Mukautettavat ratkaisut vaativat myös lisäresursseja ja asiantuntemusta kehittääkseen ja ylläpitääkseen.

Mukautettavat ratkaisut vaativat lisärahoitusta ja työvoimaa kehittääkseen. Suosittelen aloittamaan näytön (PoC) validoidaksesi tekniset kyvykkyydet ja vähimmäisviabiliteetin (MVP) tarkastellaksesi markkinoiden vastaanottoa ennen kuin panostat liikaa mukautettuun OCR-ratkaisuun.

OCR-moduulin toteuttamisprosessi teknisten piirrosten lukemiseen

Paras paikka aloittaa OCR-ohjelmiston rakentaminen teknisille piirustuksille on analyysin suorittaminen avoinna olevista työkaluista. Jos lopetat avoimet vaihtoehdot, sinun on ehkä käännyttävä suljettujen vaihtoehtojen puoleen, joissa on API-integraatiot.

Rakentaa OCR-ratkaisu alusta alkaen on epäkäytännöllistä, koska se vaatii valtavan tietojoukon koulutukseen. Tämä on vaikeaa ja kallista kerätä ja vaatii paljon resursseja mallin koulutukseen. Useimmissa tapauksissa olemassa olevien mallien hienosäätö pitäisi riittää.

Prosessi näyttää tältä:

  1. Tarpeiden tarkastelu: sinun on ymmärrettävä, millaisia teknisiä piirustuksia sovelluksesi on tarkoitettu käsittelemään ja mitä ominaisuuksia ja toimintoja tarvitaan tavoitteiden saavuttamiseen.
  2. Kuvan kaappaus ja esikäsittely: mieti, mitä laitteita aiot käyttää kuvien kaappamiseen. Lisäksi esikäsittelyaskelten saattaa olla tarpeen tulosten laadun parantamiseksi. Tähän voi kuulua muun muassa leikkaus, kokoa muutos, melunpoisto ja muut.
  3. OCR-integraatio: mieti, mikä OCR-moottori toimii parhaiten sovelluksesi kanssa. OCR-kirjastojen API:t sallivat sovelluksesi poimia tekstin kaapatuista kuvista. On tärkeää tarkastella avoimia OCR-ratkaisuja kustannussäästöjen vuoksi. Kolmannen osapuolen API:t voivat olla epävakaita hinnoittelun suhteen tai menettää tukensa ajan myötä.
  4. Tekstin tunnistus ja käsittely: seuraavaksi on aika toteuttaa logiikkaa tekstin käsittelyyn ja tunnistamiseen. Jotkut mahdolliset tehtävät, joita voit lisätä tähän vaiheeseen, ovat tekstin puhdistus, kielentunnistus tai muut tekniikat, jotka voivat tarjota selkeämmän tekstin tunnistustuloksia.
  5. Käyttöliittymä ja käyttökokemus: helppokäyttöinen käyttöliittymä sovellukselle on tärkeää, jotta käyttäjä voi käyttää sitä tehokkaasti kuvien kaappamiseen ja OCR:n käynnistämiseen. Tulokset on esitettävä käyttäjälle ymmärrettävässä muodossa.
  6. Testaus: testaa sovellusta perusteellisesti varmistaaksesi sen tarkkuuden ja käytettävyyden. Käyttäjien palautetta on olennaista tähän prosessiin.

Yhteenveto

Monimutkaisten teknisten piirrosten luomiseen liittyvien haasteiden edessä organisaatioilla on useita vaihtoehtoja lähestymistapaan. Valmiiden mallien ja mukautettavien työkalujen avulla voidaan luoda henkilökohtaisempia ratkaisuja, ja yritykset voivat löytää tavoitteisiinsa sopivan ratkaisun. Kaikki mitä tarvitaan, on hieman kekseliäisyyttä, luovuutta ja aikaa luodakseen ratkaisun, joka vastaa heidän tarpeitaan.

AI-tiimin johtaja MobiDev: ssä, ohjelmistokehitysyrityksessä, joka auttaa yrityksiä ympäri maailmaa innovoimaan viimeisimmän teknologian avulla, kuten tekoäly, data-analytiikka, lisätty todellisuus ja Internet of Things. Hänen ammatillinen painopiste on data-analytiikka, ennustaminen, NLP ja chatbotit. Tekoälyartikkeleiden kirjoittaja AiiotTalk, Hackernoon, DevTo: lle. Puhuja useissa tekoälykonferensseissa ja teknillisissä keskusteluissa.