MobiDevのAIチームリーダーであり、世界中の企業が人工知能、データサイエンス、拡張現実、インターネットオブシングズなどの最先端技術で革新できるように支援するソフトウェア開発会社です。彼女の専門分野は、データ分析、予測、NLP、チャットボットです。AiiotTalk、Hackernoon、DevTo向けの人工知能に関する記事の著者であり、様々なAIカンファレンスやテクノロジー会議でのスピーカーです。
光学式文字認識(OCR)技術は、企業が文書処理を自動化する方法を革命的に変えました。しかし、この技術の品質と精度は、すべてのアプリケーションに適しているわけではありません。処理される文書の複雑性が高くなるにつれて、精度は低下します。これは、特にエンジニアリング図面に当てはまります。ただし、オフザシェルフのOCR技術ではこのタスクに適していない場合もあります。エンジニアリング図面の認識におけるOCRの課題、事前トレーニング済みのOCRモデル、カスタムOCRソリューション、エンジニアリング図面のOCRモジュールの実装プロセスについて説明します。エンジニアリング図面認識の課題技術図面の場合、OCRは個々のテキスト要素の意味を理解するのに苦労します。テキストを読み取ることはできますが、その意味を理解できないからです。エンジニアや製造業者は、技術文書の自動認識を正しく設定した場合に、以下に示すような機会を考慮する必要があります。複雑な技術文書の分析を実現するには、エンジニアはAIモデルをトレーニングする必要があります。人間と同様に、AIモデルもこれらの図面を理解するために経験とトレーニングが必要です。ブループリントやエンジニアリング図面の認識の1つの課題は、ソフトウェアが図面の異なるビューを区別する方法を理解する必要があることです。これらのビューは、図面の基本的なレイアウトを示す図面の異なる部分です。ビューを区別し、それらの関係を理解することで、ソフトウェアはバウンディングボックスを計算できます。このプロセスには以下のような課題が含まれる場合があります: ビューが重なり合う ビューが損傷する ラベルが2つのビューから等距離になる ビューがネストする ビュー間の関係も別の問題です。ビューが図面の平面部分、回転部分、ブロック、またはその他のものであるかを判断する必要があります。さらに、連鎖測定、欠落した注釈、標準への参照によって暗黙的に定義された高さ、またはその他の問題が発生する可能性があります。重要な点は、グラフィカル要素、線、シンボル、注釈に囲まれた図面内のテキストを、汎用OCRが信頼性を持って理解できないことです。このため、OCRと機械学習についてさらに詳しく調べる必要があります。事前トレーニング済みのOCRモデルとカスタムOCRモデル市場には多数のOCRソフトウェアがありますが、すべてのソフトウェアがユーザーによってトレーニングまたは変更できます。エンジニアリング図面を分析するには、トレーニングが必要になることがあります。ただし、エンジニアリング図面の認識に適したOCRツールもあります。事前トレーニング済みのOCRツール以下は、エンジニアリング図面のOCR認識の一般的なオプションです: ABBYY FineReader:この汎用的なブループリント解釈ソフトウェアは、テキスト認識機能を備えたOCR技術を提供します。さまざまな画像形式、レイアウトの保持、データのエクスポート、統合をサポートします。 Adobe Acrobat Pro :PDFの編集、表示、管理に加えて、AcrobatではOCR文書とブループリントのスキャン、テキストの抽出、検索が可能です。さまざまな言語をサポートし、ユーザーはオプションを設定できます。 Bluebeam Revu:人気のあるPDFアプリケーションの1つであるBluebeam Revuは、エンジニアリング図面のテキスト抽出用のOCR技術を提供します。 AutoCAD:コンピュータ支援設計(CAD)を意味するAutoCADは、ブループリントの解釈と、編集可能なCAD要素への変換用のOCRプラグインをサポートします。 PlanGrid:このソフトウェアには、ブループリントのOCR解釈が標準で含まれています。この機能を使用すると、ブループリントのイメージをアップロードして、テキストを抽出、整理、索引、および検索できます。 Textract:このクラウドベースのAWS機能により、文書のOCR分析が可能になり、テーブルなどの要素を文書から抽出できます。ブループリントから要素を認識し、他のアプリケーションとの統合用のAPIも提供します。 Butler OCR:開発者向けのドキュメント抽出APIを提供するButler OCRは、機械学習と人間のレビューを組み合わせて、ドキュメント認識の精度を高めます。 カスタムOCRソリューションエンジニアリング図面からの自動データ抽出を実現するために、特定のデータ形式に適合するカスタムOCRソリューションをトレーニングする場合は、以下のオプションを検討してください: Tesseract:Googleがメンテナンスするこの柔軟なオープンソースOCRエンジンは、カスタムデータでトレーニングして、ブループリント固有の文字やシンボルを認識できます。 OpenCV:OpenCV(オープンソースコンピュータビジョンライブラリ)は、TesseractなどのOCRツールと組み合わせて、カスタムの解釈ソリューションを構築できます。画像処理と分析機能を適切に活用すると、エンジニアリング図面のOCRの精度を高めることができます。 これらのツール以外に、独自の機械学習モデルを開発することもできます。ラベル付きデータセットでモデルをトレーニングし、TensorFlowやPyTorchなどのフレームワークを使用して、ブループリントの特定の要素を認識し、組織のニーズに合わせて精度を高めることができます。事前トレーニング済みのモデルは便利で使いやすいですが、エンジニアリング図面の解釈にはカスタムソリューションの方が効果的である場合があります。カスタムソリューションには、開発と維持のために追加のリソースと専門知識が必要です。カスタムソリューションには、開発のために追加の財務リソースと労力が必要です。まず、PoC(Proof of...