Lideri de opinie

Utilizarea OCR pentru desene inginerești complexe

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Recunoașterea optică a caracterelor (OCR) a revoluționat modul în care companiile automatizează procesarea documentelor. Cu toate acestea, calitatea și acuratețea tehnologiei nu sunt suficiente pentru fiecare aplicație. Cu cât documentul procesat este mai complex, cu atât mai puțin precis devine. Acest lucru este valabil în special pentru desenele inginerești. Deși tehnologiile OCR standard nu sunt potrivite pentru această sarcină, există alte modalități de a atinge obiectivele de procesare a documentelor cu ajutorul OCR. În continuare, voi explora câteva soluții viabile pentru a vă oferi o idee generală fără a intra în prea multe detalii tehnice.

Provocările recunoașterii desenelor inginerești

Atunci când vine vorba de desene tehnice, OCR are dificultăți în a înțelege sensul elementelor de text individuale. Tehnologia poate citi textul, dar nu înțelege sensul său. Există o serie de oportunități pentru ingineri și producători de a considera dacă recunoașterea automată a documentului tehnic este configurată corect. Vezi cele mai semnificative dintre ele mai jos.

Sursa imaginii: Mobidev

Pentru a realiza o analiză a documentației tehnice complexe, inginerii au nevoie de modele de inteligență artificială antrenate. La fel ca oamenii, modelele de inteligență artificială au nevoie de experiență și antrenament pentru a înțelege aceste desene.

O provocare a recunoașterii desenelor inginerești și a planurilor este că software-ul trebuie să înțeleagă cum să separe diferitele vederi ale desenului. Acestea sunt diferite părți ale desenului care oferă o idee de bază despre dispoziția sa. Prin separarea vederilor și înțelegerea modului în care acestea se relaționează unele cu altele, software-ul poate calcula cutia de delimitare.

Acest proces poate include mai multe provocări:

  • Vederile pot suprapune
  • Vederile pot fi deteriorate
  • Etichetele pot fi la distanță egală față de două vederi
  • Vederile pot fi încorporate

Relația dintre vederi este o altă problemă posibilă. Trebuie să luați în considerare dacă vederea este o parte plată a diagramelor, o parte rotită, un bloc sau altceva. De asemenea, pot exista alte probleme, cum ar fi măsurători în lanț, anotări lipsă, înălțimi definite implicit prin referință la un standard sau alte probleme.

În mod important, OCR-ul generic nu poate înțelege în mod fiabil textul din desene care este înconjurat de elemente grafice, cum ar fi linii, simboluri și anotări. Din cauza acestui fapt, trebuie să mergem mai departe cu OCR cu învățare automată, care va fi mai util pentru această aplicație.

Modele OCR preantrenate și personalizate

Nu există o lipsă de software OCR pe piață, dar nu toate aceste software pot fi antrenate sau modificate de utilizator. Așa cum am învățat, antrenamentul poate fi o necesitate pentru analizarea desenelor dvs. inginerești. Cu toate acestea, există instrumente OCR pentru acest tip de desene.

Instrumente OCR preantrenate

Iată câteva opțiuni comune pentru recunoașterea OCR a desenelor inginerești:

  • ABBYY FineReader: acest software de interpretare a planurilor versatile oferă tehnologie OCR cu capacități de recunoaștere a textului. Suportă diverse formate de imagine, păstrarea layout-ului, exportul de date și integrări.
  • Adobe Acrobat Pro: pe lângă faptul că oferă editare, vizualizare și gestionare a PDF-urilor, Acrobat vă permite să scanați documente OCR și planuri, să extrageți text și să efectuați căutări. Suportă diverse limbi și vă permite să configurați opțiuni.
  • Bluebeam Revu: o altă aplicație PDF populară, Bluebeam Revu oferă tehnologii OCR pentru extragerea textului din desene inginerești.
  • AutoCAD: care înseamnă Proiectare Asistată de Calculator, AutoCAD suportă plugin-uri OCR pentru interpretarea planurilor și conversia lor în elemente CAD editabile.
  • PlanGrid: acest software include interpretarea OCR a planurilor din cutie. Cu această funcție, puteți încărca imagini cu planuri și apoi extrage, organiza, indexa și căuta textul.
  • Textract: această funcție cloud-based AWS permite analiza OCR a documentelor și poate extrage elemente precum tabele din documente. De asemenea, poate recunoaște elemente din planuri și oferă API-uri pentru integrare cu alte aplicații.
  • Butler OCR: oferind dezvoltatorilor API-uri de extragere a documentelor, Butler OCR combină învățarea automată cu revizia umană pentru a îmbunătăți acuratețea recunoașterii documentelor.

Soluții OCR personalizate

Dacă căutați soluții OCR personalizate care pot fi antrenate pentru a obține o extragere automată de date mai bună din desene inginerești și pentru a adopta un format de date specific, iată câteva opțiuni populare:

  • Tesseract: acest motor OCR flexibil și open-source, întreținut de Google, poate fi antrenat pe date personalizate pentru a recunoaște caractere și simboluri specifice planurilor.
  • OpenCV: Biblioteca Open-Source de Viziune Computerizată poate fi combinată cu instrumente OCR, cum ar fi Tesseract, pentru a construi soluții interpretative personalizate. Funcțiile sale de procesare și analiză a imaginilor pot îmbunătăți acuratețea OCR-ului pe desene inginerești atunci când sunt utilizate corespunzător.

Pe lângă aceste instrumente, este posibil să se dezvolte independent modele de învățare automată personalizate. Prin utilizarea modelelor de antrenament pe seturi de date etichetate, cadre precum TensorFlow sau PyTorch, aceste soluții pot fi reglate pentru a recunoaște elemente specifice planurilor și pentru a obține o acuratețe mai mare pentru nevoile unei organizații.

Modelele preantrenate oferă confort și ușurință în utilizare, dar nu pot fi la fel de eficiente în interpretarea desenelor inginerești ca soluțiile personalizate. Aceste soluții personalizate necesită, de asemenea, resurse și expertiză suplimentare pentru a fi dezvoltate și întreținute.

Soluțiile personalizate necesită resurse financiare și muncă suplimentare pentru a fi dezvoltate. Vă recomand să începeți cu un proiect de concept (PoC) pentru a valida capacitățile tehnice și un produs minim viabil (MVP) pentru a verifica percepția pieței despre proiect înainte de a investi prea mult într-o soluție OCR personalizată.

Procesul de implementare a unui modul OCR pentru citirea desenelor inginerești

Cel mai bun loc pentru a începe construirea unui software OCR pentru desene inginerești ar fi să analizați instrumentele open-source disponibile. Dacă epuizați opțiunile dvs. open-source, este posibil să trebuiască să vă îndreptați spre opțiuni closed-source cu integrări API.

Construirea unei soluții OCR de la zero este impractică, deoarece necesită un set de date uriaș pentru antrenament. Acest lucru este dificil și costisitor de obținut și necesită multe resurse pentru antrenarea modelului. În majoritatea cazurilor, reglarea modelelor existente ar trebui să vă satisfacă nevoile.

Procesul de aici arată astfel:

  1. Luarea în considerare a cerințelor: trebuie să înțelegeți cu ce tip de desene inginerești ar trebui să funcționeze aplicația dvs. și ce funcționalități și caracteristici sunt necesare pentru a atinge acest obiectiv.
  2. Capturarea și prelucrarea imaginilor: gândiți-vă la ce dispozitive intenționați să utilizați pentru a captura imaginile. Pot fi necesare pași suplimentari de prelucrare pentru a îmbunătăți calitatea rezultatelor. Acest lucru poate include decuparea, redimensionarea, denoizarea și multe altele.
  3. Integrarea OCR: considerați motorul OCR care va funcționa cel mai bine cu aplicația dvs. Bibliotecile OCR au API-uri care permit aplicației dvs. să extragă text din imagini capturate. Este important să luați în considerare soluțiile OCR open-source pentru economie.
  4. Recunoașterea și prelucrarea textului: următorul pas este să implementați logica pentru a prelucra și recunoaște textul. Unele sarcini pe care le puteți considera în acest pas sunt curățarea textului, recunoașterea limbii sau orice alte tehnici care pot oferi rezultate de recunoaștere a textului mai clare.
  5. Interfața cu utilizatorul și experiența: o interfață cu utilizatorul ușor de utilizat pentru aplicație este importantă, astfel încât utilizatorul să poată utiliza aplicația pentru a captura imagini și a iniția OCR. Rezultatele ar trebui să fie prezentate utilizatorului într-un mod ușor de înțeles.
  6. Testarea: testați aplicația pentru a vă asigura că este precisă și ușor de utilizat. Feedback-ul utilizatorului este esențial în acest proces.

Încheiere

În fața provocărilor de a crea software OCR pentru desene inginerești complexe, organizațiile au o serie de opțiuni la dispoziție pentru a aborda problema. De la o gamă de modele preantrenate și unelte personalizabile pentru a crea soluții mai personalizate, companiile pot găsi modalități de a analiza, indexa și căuta prin planuri și alte documente complexe. Tot ce este necesar este puțină ingeniozitate, creativitate și timp pentru a crea o soluție care să satisfacă nevoile lor.

Lider al echipei de Inteligență Artificială la MobiDev, o companie de dezvoltare software care ajută companiile din întreaga lume să inoveze cu tehnologii de ultimă generație, cum ar fi inteligența artificială, știința datelor, realitatea augmentată și Internetul lucrurilor. Focusul său profesional este analiza datelor, previziunea, NLP și chatbot-urile. Autoare a articolelor despre inteligența artificială pentru AiiotTalk, Hackernoon, DevTo. Vorbitoare la diverse conferințe și discuții tehnice despre inteligență artificială.