ソートリーダー

複雑なエンジニアリング図面のOCR化にOCRを使用する

mm
Unite.AI を Google の優先ソースに追加

光学式文字認識(OCR)技術は、企業が文書処理を自動化する方法を革命的に変えました。しかし、この技術の品質と精度は、すべてのアプリケーションに適しているわけではありません。処理される文書の複雑性が高くなるにつれて、精度は低下します。これは、特にエンジニアリング図面に当てはまります。ただし、オフザシェルフのOCR技術ではこのタスクに適していない場合もあります。エンジニアリング図面の認識におけるOCRの課題、事前トレーニング済みのOCRモデル、カスタムOCRソリューション、エンジニアリング図面のOCRモジュールの実装プロセスについて説明します。

エンジニアリング図面認識の課題

技術図面の場合、OCRは個々のテキスト要素の意味を理解するのに苦労します。テキストを読み取ることはできますが、その意味を理解できないからです。エンジニアや製造業者は、技術文書の自動認識を正しく設定した場合に、以下に示すような機会を考慮する必要があります。

イメージソース:Mobidev

複雑な技術文書の分析を実現するには、エンジニアはAIモデルをトレーニングする必要があります。人間と同様に、AIモデルもこれらの図面を理解するために経験とトレーニングが必要です。

ブループリントやエンジニアリング図面の認識の1つの課題は、ソフトウェアが図面の異なるビューを区別する方法を理解する必要があることです。これらのビューは、図面の基本的なレイアウトを示す図面の異なる部分です。ビューを区別し、それらの関係を理解することで、ソフトウェアはバウンディングボックスを計算できます。

このプロセスには以下のような課題が含まれる場合があります:

  • ビューが重なり合う
  • ビューが損傷する
  • ラベルが2つのビューから等距離になる
  • ビューがネストする

ビュー間の関係も別の問題です。ビューが図面の平面部分、回転部分、ブロック、またはその他のものであるかを判断する必要があります。さらに、連鎖測定、欠落した注釈、標準への参照によって暗黙的に定義された高さ、またはその他の問題が発生する可能性があります。

重要な点は、グラフィカル要素、線、シンボル、注釈に囲まれた図面内のテキストを、汎用OCRが信頼性を持って理解できないことです。このため、OCRと機械学習についてさらに詳しく調べる必要があります。

事前トレーニング済みのOCRモデルとカスタムOCRモデル

市場には多数のOCRソフトウェアがありますが、すべてのソフトウェアがユーザーによってトレーニングまたは変更できます。エンジニアリング図面を分析するには、トレーニングが必要になることがあります。ただし、エンジニアリング図面の認識に適したOCRツールもあります。

事前トレーニング済みのOCRツール

以下は、エンジニアリング図面のOCR認識の一般的なオプションです:

  • ABBYY FineReader:この汎用的なブループリント解釈ソフトウェアは、テキスト認識機能を備えたOCR技術を提供します。さまざまな画像形式、レイアウトの保持、データのエクスポート、統合をサポートします。
  • Adobe Acrobat Pro :PDFの編集、表示、管理に加えて、AcrobatではOCR文書とブループリントのスキャン、テキストの抽出、検索が可能です。さまざまな言語をサポートし、ユーザーはオプションを設定できます。
  • Bluebeam Revu:人気のあるPDFアプリケーションの1つであるBluebeam Revuは、エンジニアリング図面のテキスト抽出用のOCR技術を提供します。
  • AutoCAD:コンピュータ支援設計(CAD)を意味するAutoCADは、ブループリントの解釈と、編集可能なCAD要素への変換用のOCRプラグインをサポートします。
  • PlanGrid:このソフトウェアには、ブループリントのOCR解釈が標準で含まれています。この機能を使用すると、ブループリントのイメージをアップロードして、テキストを抽出、整理、索引、および検索できます。
  • Textract:このクラウドベースのAWS機能により、文書のOCR分析が可能になり、テーブルなどの要素を文書から抽出できます。ブループリントから要素を認識し、他のアプリケーションとの統合用のAPIも提供します。
  • Butler OCR:開発者向けのドキュメント抽出APIを提供するButler OCRは、機械学習と人間のレビューを組み合わせて、ドキュメント認識の精度を高めます。

カスタムOCRソリューション

エンジニアリング図面からの自動データ抽出を実現するために、特定のデータ形式に適合するカスタムOCRソリューションをトレーニングする場合は、以下のオプションを検討してください:

  • Tesseract:Googleがメンテナンスするこの柔軟なオープンソースOCRエンジンは、カスタムデータでトレーニングして、ブループリント固有の文字やシンボルを認識できます。
  • OpenCV:OpenCV(オープンソースコンピュータビジョンライブラリ)は、TesseractなどのOCRツールと組み合わせて、カスタムの解釈ソリューションを構築できます。画像処理と分析機能を適切に活用すると、エンジニアリング図面のOCRの精度を高めることができます。

これらのツール以外に、独自の機械学習モデルを開発することもできます。ラベル付きデータセットでモデルをトレーニングし、TensorFlowやPyTorchなどのフレームワークを使用して、ブループリントの特定の要素を認識し、組織のニーズに合わせて精度を高めることができます。

事前トレーニング済みのモデルは便利で使いやすいですが、エンジニアリング図面の解釈にはカスタムソリューションの方が効果的である場合があります。カスタムソリューションには、開発と維持のために追加のリソースと専門知識が必要です。

カスタムソリューションには、開発のために追加の財務リソースと労力が必要です。まず、PoC(Proof of Concept)を実施して技術的な能力を検証し、市場のプロジェクトに対する認識を確認するために、MVP(Minimum Viable Product)を確認することをお勧めします。カスタムOCRソリューションに多く投資する前に。

エンジニアリング図面のOCRモジュールの実装プロセス

エンジニアリング図面用のOCRソフトウェアを構築するための最良の出発点は、利用可能なオープンソースツールを分析することです。オープンソースの選択肢が尽きた場合は、API統合を備えたクローズドソースの選択肢に切り替える必要がある場合があります。

OCRソリューションをスクラッチから構築することは実用的ではありません。大量のトレーニングデータセットが必要であり、これは収集とモデルトレーニングに多くのリソースを必要とします。ほとんどの場合、既存のモデルをファインチューニングするだけで十分です。

ここからのプロセスは以下のようになります:

  1. 要件の検討:アプリケーションがどのようなエンジニアリング図面とどのような機能や機能を必要とするかを理解する必要があります。
  2. 画像の取得と前処理:画像を取得するデバイスについて考える必要があります。結果の品質を向上させるために、画像のトリミング、リサイズ、ノイズ除去など、追加の前処理ステップが必要になる場合があります。
  3. OCRの統合:アプリケーションに最適なOCRエンジンを検討する必要があります。OCRライブラリには、画像からテキストを抽出するためのAPIが含まれています。コスト削減のためにオープンソースのOCRソリューションを検討することが重要です。サードパーティのAPIは、価格やサポートの変更に伴って不安定になる可能性があります。
  4. テキストの認識と処理:次に、テキストを処理して認識するためのロジックを実装する必要があります。このステップで追加する可能性のあるタスクの例としては、テキストのクリーンアップ、言語の認識、またはテキスト認識結果を明確にするためのその他の技術があります。
  5. ユーザーインターフェイスとユーザーエクスペリエンス:ユーザーが画像を取得してOCRを開始するための使いやすいUIが重要です。結果は、ユーザーが理解しやすい形式で提示される必要があります。
  6. テスト:アプリケーションの精度と使いやすさを確保するために、徹底的にテストする必要があります。ユーザーのフィードバックはこのプロセスに不可欠です。

まとめ

エンジニアリング図面のOCRソフトウェアの作成の課題に直面して、企業には以下のような選択肢があります。事前トレーニング済みのモデルやカスタムツールを使用して、より個性化されたソリューションを作成することで、ブループリントやその他の複雑な文書を効果的に分析、索引、および検索できます。企業のニーズに合ったソリューションを作成するには、工夫、創造性、時間が必要です。

MobiDevのAIチームリーダーであり、世界中の企業が人工知能、データサイエンス、拡張現実、インターネットオブシングズなどの最先端技術で革新できるように支援するソフトウェア開発会社です。彼女の専門分野は、データ分析、予測、NLP、チャットボットです。AiiotTalk、Hackernoon、DevTo向けの人工知能に関する記事の著者であり、様々なAIカンファレンスやテクノロジー会議でのスピーカーです。