사상 리더

복잡한 공학 도면을 위한 OCR 사용

mm
Unite.AI를 Google의 선호 소스에 추가

광학 문자 인식(OCR)은 비즈니스에서 문서 처리를 자동화하는 방식을 혁신적으로 바꾸었습니다. 그러나 기술의 품질과 정확도는 모든 응용 분야에서 적합하지 않습니다. 처리되는 문서가 더 복잡할수록 정확도가 낮아집니다. 이것은 특히 공학 도면의 경우에 해당합니다. 박스 외부의 OCR 기술은 이 작업에 적합하지 않을 수 있지만, OCR을 사용하여 문서 처리 목표를 달성하는 다른 방법이 있습니다. 다음에서는 공학 도면을 인식하는 OCR의 도전 과제를 살펴보고, 이를 극복하기 위한 몇 가지 방법을 제시합니다.

공학 도면 인식의 도전

기술 도면의 경우, OCR은 개별 텍스트 요소의 의미를 이해하는 데 어려움을 겪습니다. 기술은 텍스트를 읽을 수 있지만, 그 의미를 이해하지 못합니다. 자동으로 기술 문서를 인식하려면, 엔지니어와 제조업체가 고려해야 할 몇 가지 기회가 있습니다. 가장 중요한 것은 다음과 같습니다.

이미지 출처: Mobidev

복잡한 기술 문서 분석을 달성하려면, 엔지니어가 AI 모델을 훈련해야 합니다. 인간과 마찬가지로, AI 모델은 이러한 도면을 이해하기 위해 경험과 훈련이 필요합니다.

블루프린트와 공학 도면 인식의 한 가지 도전은 소프트웨어가 도면의 다양한 뷰를 분리하는 방법을 이해해야 한다는 것입니다. 이러한 뷰는 도면의 레이아웃에 대한 기본적인 아이디어를 제공하는 도면의 다른 부분입니다. 뷰를 분리하고它们가 서로 어떻게 관련되는지 이해하면, 소프트웨어는 바운딩 박스를 계산할 수 있습니다.

이 과정에는 다음과 같은 몇 가지 도전이 포함될 수 있습니다:

  • 뷰가 겹칠 수 있습니다
  • 뷰가 손상될 수 있습니다
  • 레이블이 두 뷰에서 동일한 거리에 있을 수 있습니다
  • 뷰가 중첩될 수 있습니다

뷰 사이의 관계는 또 다른 문제입니다. 뷰가 평면 부분인지, 회전된 부분인지, 블록인지, 또는 다른 것인지 여부를 고려해야 합니다. 또한, 체인 측정, 누락된 주석, 표준 참조를 통해 암시적으로 정의된 높이 등 다른 문제가 있을 수 있습니다.

중요한 것은, 일반적인 OCR은 그래픽 요소들(선, 기호, 주석 등)에 둘러싸인 도면의 텍스트를 신뢰성 있게 이해할 수 없다는 것입니다. 이러한 사실 때문에, 우리는 더 도움이 될 OCR 기술을 살펴보아야 합니다.

사전 훈련된 OCR 모델과 사용자 정의 OCR 모델

시장에는 많은 OCR 소프트웨어가 있지만, 모두 사용자에 의해 훈련되거나 수정될 수는 없습니다. 우리는 훈련이 공학 도면을 분석하는 데 필요하다는 것을 배웠습니다. 그러나 이러한 도면을 위한 OCR 툴이 존재합니다.

사전 훈련된 OCR 툴

공학 도면의 OCR 인식을 위한 몇 가지 일반적인 옵션은 다음과 같습니다:

  • ABBYY FineReader: 이 다재다능한 블루프린트 해석 소프트웨어는 텍스트 인식 기능을 제공하는 OCR 기술을 제공합니다. 다양한 이미지 형식을 지원하며, 레이아웃 유지, 데이터 내보내기, 통합 등을 제공합니다.
  • Adobe Acrobat Pro: PDF 편집, 보기, 관리 외에도, Acrobat은 OCR 문서와 블루프린트를 스캔하고, 텍스트를 추출하고, 검색을 수행할 수 있습니다. 다양한 언어를 지원하며, 사용자가 옵션을 구성할 수 있습니다.
  • Bluebeam Revu: 또 다른 인기 있는 PDF 애플리케이션인 Bluebeam Revu는 공학 도면의 텍스트 추출을 위한 OCR 기술을 제공합니다.
  • AutoCAD: 컴퓨터 지원 설계를 의미하는 AutoCAD는 블루프린트와 공학 도면을 해석하고 편집 가능한 CAD 요소로 변환하는 OCR 플러그인을 지원합니다.
  • PlanGrid: 이 소프트웨어에는 기본적으로 블루프린트 OCR 해석 기능이 포함되어 있습니다. 이 기능을 사용하여 블루프린트 이미지를 업로드하고, 텍스트를 추출하고, 조직하고, 색인하고, 검색할 수 있습니다.
  • Textract: 이 클라우드 기반의 AWS 기능은 문서를 분석하고, 표와 같은 요소를 추출할 수 있습니다. 또한 블루프린트에서 요소를 인식하고, 다른 애플리케이션과 통합하기 위한 API를 제공합니다.
  • Butler OCR: 개발자에게 문서 추출 API를 제공하는 Butler OCR은 기계 학습과 인간 검토를 결합하여 문서 인식의 정확도를 향상시킵니다.

사용자 정의 OCR 솔루션

사용자 정의 OCR 솔루션을 찾고 있다면, 공학 도면에서 자동 데이터 추출을 더 잘 달성하고, 특정 데이터 형식에 적응할 수 있는 다음 몇 가지 인기 있는 옵션이 있습니다:

  • Tesseract: 구글에서 유지 관리하는 이 유연한 오픈 소스 OCR 엔진은 사용자 정의 데이터에 훈련되어 블루프린트 특정 문자와 기호를 인식할 수 있습니다.
  • OpenCV: 오픈 소스 컴퓨터 비전 라이브러리는 Tesseract와 같은 OCR 툴과 결합하여 사용자 정의 해석 솔루션을 구축할 수 있습니다. 이미지 처리와 분석 기능을 적절히 사용하면, 공학 도면의 OCR 정확도를 향상시킬 수 있습니다.

이 툴 외에도, 독립적으로 사용자 정의 기계 학습 모델을 개발하는 것이 가능합니다. 레이블이 지정된 데이터셋에 대한 훈련 모델을 사용하여, TensorFlow 또는 PyTorch와 같은 프레임워크를 사용하여, 이러한 솔루션은 특정 블루프린트 요소를 인식하고, 조직의 요구 사항에 따라 더 높은 정확도를 달성할 수 있습니다.

사전 훈련된 모델은 편리하고 사용하기 쉽지만, 사용자 정의 솔루션만큼 공학 도면을 해석하는 데 효과적이지 않을 수 있습니다. 이러한 사용자 정의 솔루션은 개발과 유지 보수에 추가적인 자원과 전문 지식이 필요합니다.

사용자 정의 솔루션은 개발에 추가적인 재정 자원과 노력이 필요합니다. 기술 능력을 검증하고, 시장의 프로젝트 인식을 확인하기 위해, 프로젝트에 너무 많이 투자하기 전에, 먼저 Proof of Concept(PoC)와 최소 가치 제품(MVP)을 시작하는 것이 좋습니다.

공학 도면을 읽는 OCR 모듈 구현 과정

공학 도면을 위한 OCR 소프트웨어를 구축하기 시작하는 최선의 방법은 사용 가능한 오픈 소스 툴을 분석하는 것입니다. 오픈 소스 옵션이 исчерп되면, 클로즈드 소스 옵션과 API 통합을 사용해야 할 수 있습니다.

기초부터 OCR 솔루션을 구축하는 것은 실용적이지 않습니다. 왜냐하면 그것은 훈련에大量의 데이터셋이 필요하기 때문입니다. 이는 어려운 일이고, 비용이 많이 들며, 모델 훈련을 위해 많은 자원이 필요합니다. 대부분의 경우, 기존 모델을 미세 조정하면 충분합니다.

이 과정은 다음과 같습니다:

  1. 요구 사항 고려: 어떤 종류의 공학 도면과 어떤 기능 및 기능이 목표를 달성하는 데 필요한지 이해해야 합니다.
  2. 이미지 캡처 및 전처리: 이미지를 캡처하기 위해 어떤 장치를 사용할지 생각해야 합니다. 결과의 품질을 향상시키기 위해, 추가적인 전처리 단계가 필요할 수 있습니다. 이것은 크롭, 리사이즈, 노이즈 제거 등이 포함될 수 있습니다.
  3. OCR 통합: 응용 프로그램과 잘 작동하는 OCR 엔진을 고려해야 합니다. OCR 라이브러리는 API를 통해 캡처된 이미지에서 텍스트를 추출할 수 있습니다. 오픈 소스 OCR 솔루션을 사용하여 비용을 절감할 수 있습니다. 제3자 API는 시간이 지남에 따라 가격이 변하거나 지원이 중단될 수 있습니다.
  4. 텍스트 인식 및 처리: 다음으로, 텍스트를 처리하고 인식하는 논리를 구현할 때입니다. 이 단계에서 고려할 수 있는 몇 가지 작업에는 텍스트 정리, 언어 인식, 또는 텍스트 인식 결과를 더 명확하게 제공할 수 있는 기타 기술이 포함될 수 있습니다.
  5. 사용자 인터페이스 및 경험: 사용자가 쉽게 사용할 수 있는 앱의 사용자 인터페이스가 중요합니다. 사용자는 이미지를 캡처하고 OCR을 시작할 수 있어야 합니다. 결과는 사용자가 쉽게 이해할 수 있는 방식으로 표시되어야 합니다.
  6. 테스트: 응용 프로그램의 정확성과 사용 편의성을 보장하기 위해 철저하게 테스트해야 합니다. 사용자 피드백은 이 과정에서 필수적입니다.

まとめ

복잡한 공학 도면을 위한 OCR 소프트웨어를 생성하는 도전 앞에서, 조직은 이 문제에 접근하기 위해 여러 옵션이 있습니다. 사전 훈련된 모델과 사용자 정의 툴에서 더 개인화된 솔루션을 생성하는 범위까지, 비즈니스에서는 블루프린트와 다른 복잡한 문서를 효과적으로 분석하고, 색인하고, 검색할 수 있는 방법을 찾을 수 있습니다. 필요한 것은只是 몇 가지 발명과 창의력, 그리고 시간을 가지고 솔루션을 제작하는 것입니다.

MobiDev의 AI 팀 리더로서, 인공 지능, 데이터 과학, 증강 현실 및 사물 인터넷과 같은 최첨단 기술로 전 세계의 기업이 혁신할 수 있도록 도와주는 소프트웨어 개발 회사입니다. 그녀의 전문 분야는 데이터 분석, 예측, NLP, 채팅봇입니다. AiiotTalk, Hackernoon, DevTo의 인공 지능에 관한 기사 저자입니다. 다양한 AI 컨퍼런스 및 기술 세션의 연사입니다.