Liderzy opinii
Używanie OCR do złożonych rysunków inżynierskich

Optyczne rozpoznawanie znaków (OCR) rewolucjonizowało sposób, w jaki firmy automatyzują przetwarzanie dokumentów. Jednak jakość i dokładność tej technologii nie są wystarczające dla każdego zastosowania. Im bardziej złożony jest dokument, tym mniej dokładna staje się technologia. Dotyczy to szczególnie rysunków inżynierskich. Chociaż gotowe technologie OCR mogą nie być odpowiednie do tego zadania, istnieją inne sposoby osiągnięcia celów przetwarzania dokumentów za pomocą OCR. W tym, co następuje, omówię kilka rozwiązań, aby dać ogólne pojęcie bez wdawania się w zbyt wiele technicznych szczegółów.
Wyzwania rozpoznawania rysunków inżynierskich
Jeśli chodzi o rysunki techniczne, OCR ma trudności z zrozumieniem znaczenia poszczególnych elementów tekstowych. Technologia może odczytać tekst, ale nie rozumie jego znaczenia. Istnieje wiele możliwości dla inżynierów i producentów, jeśli automatyczne rozpoznawanie dokumentu technicznego jest skonfigurowane poprawnie. Zobacz poniżej najważniejsze z nich.

Źródło obrazu: Mobidev
Aby osiągnąć złożoną analizę dokumentacji technicznej, inżynierowie muszą szkolić modele AI. Jak ludzie, modele AI potrzebują doświadczenia i szkolenia, aby zrozumieć te rysunki.
Jednym z wyzwań rozpoznawania rysunków inżynierskich jest to, że oprogramowanie musi zrozumieć, jak oddzielić różne widoki rysunku. Są to różne części rysunku, które dają podstawową wiedzę o jego układzie. Poprzez oddzielenie widoków i zrozumienie, jak są one ze sobą powiązane, oprogramowanie może obliczyć bounding box.
Proces ten może obejmować kilka wyzwań:
- Widoki mogą się nachodzić
- Widoki mogą być uszkodzone
- Etykiety mogą być równoodległe do dwóch widoków
- Widoki mogą być zagnieżdżone
Relacja między widokami jest kolejnym możliwym problemem. Należy rozważyć, czy widok jest płaską częścią diagramu, obróconą częścią, blokiem czy czymś innym. Ponadto mogą wystąpić inne problemy, takie jak łańcuchowe pomiary, brakujące adnotacje, niejawno określone wysokości poprzez odniesienie do standardu lub inne problemy.
Co ważne, ogólne OCR nie może niezawodnie zrozumieć tekstu w rysunkach, który jest otoczony elementami graficznymi, takimi jak linie, symbole i adnotacje. Z tego powodu musimy zagłębić się w OCR z użyciem machine learning, co będzie bardziej przydatne w tym zastosowaniu.
Wstępnie ustawione i niestandardowe modele OCR
Nie brakuje oprogramowania OCR na rynku, ale nie wszystkie z nich mogą być szkolone lub modyfikowane przez użytkownika. Jak się dowiedzieliśmy, szkolenie może być konieczne do analizy rysunków inżynierskich. Jednak narzędzia OCR dla tego rodzaju rysunków istnieją.
Wstępnie ustawione narzędzia OCR
Oto kilka opcji dla rozpoznawania rysunków inżynierskich za pomocą OCR:
- ABBYY FineReader: to wszechstronne oprogramowanie do interpretacji rysunków oferuje technologię OCR z funkcjami rozpoznawania tekstu. Obsługuje różne formaty obrazów, zachowanie układu, eksport danych i integracje.
- Adobe Acrobat Pro: oprócz edycji, wyświetlania i zarządzania plikami PDF, Acrobat pozwala na skanowanie dokumentów OCR i rysunków, wyodrębnianie tekstu i przeprowadzanie wyszukiwań. Obsługuje różne języki i pozwala użytkownikom na konfigurowanie opcji.
- Bluebeam Revu: kolejne popularne oprogramowanie PDF, Bluebeam Revu oferuje technologie OCR do wyodrębniania tekstu z rysunków inżynierskich.
- AutoCAD: oznacza to komputerowo wspomagany projekt (Computer Aided Design), AutoCAD obsługuje wtyczki OCR do interpretacji rysunków i konwersji ich w edytowalne elementy CAD.
- PlanGrid: to oprogramowanie zawiera interpretację rysunków za pomocą OCR. Za pomocą tej funkcji możesz przesłać obrazy rysunków, a następnie wyodrębnić, zorganizować, zindeksować i wyszukać tekst.
- Textract: to chmurowa funkcja AWS umożliwia analizę dokumentów OCR i może wyodrębnić elementy, takie jak tabele z dokumentów. Może również rozpoznać elementy z rysunków i zapewnia interfejsy API do integracji z innymi aplikacjami.
- Butler OCR: dostarczający deweloperom interfejsy API do wyodrębniania dokumentów, Butler OCR łączy machine learning z przeglądem ludzkim, aby poprawić dokładność rozpoznawania dokumentów.
Niestandardowe rozwiązania OCR
Jeśli szukasz niestandardowych rozwiązań OCR, które mogą być szkolone, aby osiągnąć lepsze automatyczne wyodrębnianie danych z rysunków inżynierskich i dostosować je do Twojego konkretnego formatu danych, oto kilka popularnych opcji:
- Tesseract: to elastyczny, otwarty silnik OCR obsługiwany przez Google może być szkolony na danych niestandardowych, aby rozpoznać znaki i symbole specyficzne dla rysunków.
- OpenCV: Otwarty zestaw narzędzi komputerowego widzenia może być połączony z narzędziami OCR, takimi jak Tesseract, aby tworzyć niestandardowe rozwiązania interpretacyjne. Jego funkcje przetwarzania i analizy obrazu mogą poprawić dokładność OCR na rysunkach inżynierskich, gdy są odpowiednio wykorzystywane.
Ponadto możliwe jest również niezależne opracowanie niestandardowych modeli machine learning. Poprzez wykorzystanie modeli szkoleniowych na oznaczonych zbiorach danych, ramy takie jak TensorFlow lub PyTorch mogą być dostosowane do rozpoznawania konkretnych elementów rysunków i osiągania wyższej dokładności dla potrzeb organizacji.
Wstępnie ustawione modele oferują wygodę i łatwość użycia, ale mogą nie być tak skuteczne w interpretacji rysunków inżynierskich, jak rozwiązania niestandardowe. Te rozwiązania niestandardowe wymagają również dodatkowych zasobów i ekspertyzy do rozwoju i utrzymania.
Rozwiązania niestandardowe wymagają dodatkowych środków finansowych i pracy, aby je opracować. Zalecam rozpoczęcie od pojęcia dowodu (PoC), aby zwalidować możliwości techniczne i minimalnego produktywnego produktu (MVP), aby sprawdzić postrzeganie projektu przez rynek, zanim zainwestujesz zbyt wiele w niestandardowe rozwiązanie OCR.
Proces wdrażania modułu OCR do odczytywania rysunków inżynierskich
Najlepszym miejscem do rozpoczęcia budowy oprogramowania OCR dla rysunków inżynierskich byłoby analiza dostępnych narzędzi open-source. Jeśli wyczerpałeś opcje open-source, możesz musieć skorzystać z zamkniętych opcji z integracjami API.
Budowanie rozwiązania OCR od podstaw jest niepraktyczne, ponieważ wymaga ogromnego zbioru danych do szkolenia. Jest to trudne i kosztowne do zebrania i wymaga wielu zasobów do szkolenia modelu. W większości przypadków dostosowanie istniejących modeli powinno spełnić Twoje potrzeby.
Proces od tego momentu wygląda mniej więcej tak:
- Rozważ wymagania: musisz zrozumieć, z jakimi rysunkami inżynierskimi Twoja aplikacja powinna współpracować i jakie funkcje i funkcjonalności są potrzebne, aby osiągnąć ten cel.
- Przechwytywanie i wstępne przetwarzanie obrazu: pomyśl o tym, jakie urządzenia planujesz użyć do przechwytywania obrazów. Dodatkowe kroki przetwarzania mogą być potrzebne, aby poprawić jakość wyników. Może to obejmować obcinanie, zmianę rozmiaru, usuwanie szumu i więcej.
- Integracja OCR: rozważ silnik OCR, który najlepiej współpracuje z Twoją aplikacją. Biblioteki OCR mają interfejsy API, które pozwalają Twojej aplikacji wyodrębnić tekst z przechwyconych obrazów. Ważne jest, aby rozważyć otwarte rozwiązania OCR ze względu na oszczędność kosztów. Trzecie strony API mogą być kapryśne w odniesieniu do cen lub utraty wsparcia w czasie.
- Rozpoznawanie i przetwarzanie tekstu: następnie jest czas na wdrożenie logiki do przetwarzania i rozpoznawania tekstu. Możliwe zadania, które możesz rozważyć w tym kroku, to oczyszczanie tekstu, rozpoznawanie języka lub inne techniki, które mogą zapewnić jaśniejsze wyniki rozpoznawania tekstu.
- Interfejs użytkownika i doświadczenie: łatwy w użyciu interfejs użytkownika aplikacji jest ważny, aby użytkownik mógł skutecznie używać go do przechwytywania obrazów i inicjowania OCR. Wyniki powinny być przedstawione użytkownikowi w sposób, który jest łatwy do zrozumienia.
- Testowanie: przetestuj aplikację, aby upewnić się, że jest dokładna i użyteczna. Opinia użytkownika jest niezbędna w tym procesie.
Podsumowanie
W obliczu wyzwań tworzenia oprogramowania OCR dla złożonych rysunków inżynierskich, organizacje mają wiele opcji, aby podejść do tego problemu. Od wstępnie ustawionych modeli i dostosowywanych narzędzi do tworzenia bardziej personalizowanych rozwiązań, firmy mogą znaleźć sposoby, aby skutecznie analizować, indeksować i wyszukiwać rysunki i inne złożone dokumenty. Wszystko, czego potrzeba, to trochę pomysłowości, kreatywności i czasu, aby stworzyć rozwiązanie, które spełnia ich potrzeby.












