Jay Mishra、AsteraのCOOであり、ノーコードデータソリューションの先駆的提供者である、20年以上の経験を持つデータおよびアナリティクスリーダーであり、AIパワードデータソリューションを通じて組織に変革的な戦略を提供する。
最近のハードウェアの進歩、例えばNvidia H100 GPUの登場により、計算能力が大幅に強化されました。これらのGPUは、ディープラーニングのワークロードを処理する能力がNvidia A100の9倍に達し、ジェネレーティブAIの商業利用が促進されました。自然言語処理(NLP)やコンピュータビジョンで自動化されたインテリジェントなデータ抽出が可能になり、企業は非構造化データを容易に貴重な洞察に変えることができます。これは技術の統合における大きな進歩です。 伝統的なデータ抽出方法 手動データ入力 驚くことに、多くの企業はまだ手動データ入力を使用しています。手動データ入力は、情報をターゲットシステムに直接入力する方法です。初期コストが低いため、採用が容易です。しかし、手動データ入力は単調で時間がかかり、エラーも多発します。さらに、機密データを扱う場合、セキュリティリスクも存在します。自動化とデジタルセキュリティの時代に、手動データ入力はあまり好ましくありません。 光学文字認識(OCR) OCR技術は、画像や手書きの内容を機械が読み取れるデータに変換する方法です。データ抽出のためのより迅速でコスト効率の高い解決策を提供します。しかし、品質は信頼できない場合があります。たとえば、「S」と「8」は混同されることがあります。 OCRの性能は、入力データの複雑さや特性によって大きく影響を受けます。高解像度のスキャン画像で、向きの傾きやウォーターマーク、上書きなどがない場合、OCRはうまく機能します。しかし、手書きのテキスト、特に複雑な視覚的なものや処理が困難なものに対しては、OCRは苦労します。テキスト入力の精度を向上させるために、適応が必要になる場合があります。市場にあるOCRをベースとするデータ抽出ツールは、精度を向上させるために、後処理の層を追加します。しかし、これらの解決策は100%の正確性を保証することはできません。 テキストパターンマッチング テキストパターンマッチングは、事前に定義されたルールやパターンを使用して、テキストから特定の情報を抽出する方法です。速度が速く、他の方法よりも高いROIを提供します。すべての複雑さのレベルで有効であり、類似したレイアウトのファイルでは100%の精度を達成します。 しかし、単語ごとのマッチングの厳密さが柔軟性を制限し、抽出に成功するためには100%の正確なマッチングが必要です。同義語の扱いには課題があり、たとえば「天気」と「気候」を区別することが難しい場合があります。さらに、テキストパターンマッチングはコンテキストに敏感であり、異なるコンテキストでの複数の意味を認識できません。柔軟性と厳密さのバランスを取ることが、効果的にこの方法を使用する上での継続的な課題です。 固有表現認識(NER) 固有表現認識(NER)は、NLP技術の一種で、テキスト内の重要な情報を特定して分類します。 NERの抽出は、事前に定義されたエンティティ(組織名、場所、人名、日付など)に限定されます。NERシステムは、事前に定義されたセット以外のカスタムエンティティを抽出する能力が不足しています。さらに、NERはエンティティに関連する重要な値の抽出に重点を置いていますが、テーブルなどのより複雑な構造化データからのデータ抽出には対応できません。 企業が非構造化データの量を増やしている中で、これらの課題は、抽出方法に対する包括的かつスケーラブルなアプローチの必要性を強調しています。 LLMを用いた非構造化データの解放 大規模言語モデル(LLM)を用いた非構造化データ抽出は、重要な課題に対処する独自の利点を持つ魅力的な解決策です。 コンテキスト認識データ抽出 LLMは、強力なコンテキスト理解能力を持ち、広範なデータセットでのトレーニングを通じて洗練されています。表面的な理解を超えてコンテキストの複雑さを理解する能力により、多様な情報抽出タスクで有用です。たとえば、天気の値を抽出する場合、気候の値などの関連要素を考慮して、同義語や意味論をスムーズに取り入れています。この高度な理解レベルにより、LLMはデータ抽出のダイナミックで適応性の高い選択肢となります。 並列処理能力の活用 LLMは並列処理を使用し、タスクをより迅速かつ効率的に実行します。シーケンシャルモデルとは異なり、LLMはリソース配分を最適化し、データ抽出タスクの速度を向上させます。これにより、抽出プロセスの全体的なパフォーマンスが向上します。 さまざまなデータタイプへの適応 一部のモデル、たとえばRNNは特定のシーケンスに限定されますが、LLMはシーケンスに依存しないデータ、たとえばテーブルや画像をうまく処理できます。この多様性は、さまざまなデータ形式をカバーします。 処理パイプラインの強化 LLMの使用は、前処理と後処理の両方の自動化において大きな転換点を示しています。LLMは、抽出プロセスを正確に自動化することで、手動作業の必要性を減らし、非構造化データの処理を合理化します。広範なデータセットでのトレーニングにより、従来の方法では見逃されるパターンや相関関係を特定できます。 このジェネレーティブAIパイプラインの図は、BERT、GPT、OPTなどのモデルがデータ抽出に使用される方法を示しています。これらのLLMは、データ抽出を含むさまざまなNLP操作を実行できます。通常、ジェネレーティブAIモデルは、必要なデータを記述したプロンプトを提供し、応答には抽出されたデータが含まれます。たとえば、「この購入注文からすべてのベンダーの名前を抽出してください」というプロンプトは、半構造化レポートに含まれるすべてのベンダーの名前を含む応答を生成できます。その後、抽出されたデータは解析され、データベーステーブルまたはフラットファイルにロードされ、組織のワークフローにシームレスに統合されます。 AIフレームワークの進化:RNNからトランスフォーマーまでのモダンデータ抽出 ジェネレーティブAIは、エンコーダとデコーダの2つの協調的なニューラルネットワークを特徴とするフレームワーク内で動作します。エンコーダは入力データを処理し、重要な特徴を「コンテキストベクトル」に凝縮します。このベクトルは、デコーダによって生成タスク(言語翻訳など)に使用されます。このアーキテクチャは、RNNやトランスフォーマーなどのニューラルネットワークを使用し、機械翻訳、画像生成、音声合成、データエンティティ抽出などのさまざまなドメインで使用されています。これらのネットワークは、データシーケンス内の複雑な関係や依存関係をモデル化する能力が優れています。 再帰型ニューラルネットワーク 再帰型ニューラルネットワーク(RNN)は、翻訳や要約などのシーケンスタスクに適しています。しかし、長距離依存を含むタスクでは精度が低くなります。 RNNは、文章からキーと値のペアを抽出する能力がありますが、テーブル形式の構造では苦労します。シーケンスと位置の配置を慎重に考慮する必要があり、テーブルからのデータ抽出を最適化するための特別なアプローチが必要です。しかし、その採用は、ROIが低く、ほとんどのテキスト処理タスクでパフォーマンスが低かったため、制限されました。 長短期記憶ネットワーク 長短期記憶(LSTM)ネットワークは、RNNの限界に対処するための解決策として現れました。RNNと同様に、LSTMは文章からキーと値のペアを抽出する能力があります。しかし、テーブル形式の構造では、シーケンスと位置の配置を慎重に考慮する必要があります。GPUは、2012年にディープラーニングで初めて使用され、有名なAlexNet CNNモデルが開発されました。その後、RNNもGPUでトレーニングされましたが、良い結果は得られませんでした。現在、GPUが利用可能になっているにもかかわらず、これらのモデルはほとんど使われなくなっており、トランスフォーマーベースのLLMに置き換えられました。 2012年に、GPUはディープラーニングで初めて使用され、有名なAlexNet CNNモデルが開発されました。その後、RNNもGPUでトレーニングされましたが、良い結果は得られませんでした。現在、GPUが利用可能になっているにもかかわらず、これらのモデルはほとんど使われなくなっており、トランスフォーマーベースのLLMに置き換えられました。 トランスフォーマー – アテンションメカニズム トランスフォーマーの導入は、NLPを革命的に変え、並列計算を可能にし、長距離依存をうまく捉える能力を提供しました。LLMのGPT、BERT、OPTは、トランスフォーマーテクノロジーを活用しています。トランスフォーマーの中心にある「アテンション」メカニズムは、シーケンス間のデータ処理のパフォーマンスを向上させる重要な要素です。 トランスフォーマーの「アテンション」メカニズムは、「クエリ」(質問プロンプト)と「キー」(モデルの各単語の理解)之间の互換性に基づいて、値の加重和を計算します。このアプローチにより、シーケンス生成中に焦点を当てたアテンションが可能になり、正確な抽出が実現します。トランスフォーマー内の2つの重要なコンポーネントは、入力シーケンス内の単語間の重要性を捉える「セルフアテンション」と、特定の関係に対する多様なアテンションパターンを可能にする「マルチヘッドアテンション」です。 請求書抽出の文脈では、セルフアテンションは、以前にも述べられた日付の関連性を認識し、マルチヘッドアテンションは、独立して数量(金額)とテキストパターン(ベンダー名)に焦点を当てます。RNNとは異なり、トランスフォーマーは、単語の順序を固有に理解しません。したがって、位置エンコーディングを使用して、各単語のシーケンス内の位置を追跡します。このテクニックは、入力と出力の埋め込みに適用され、文書内のキーと対応する値の識別を支援します。 アテンションメカニズムと位置エンコーディングの組み合わせは、構造を表形式と認識し、コンテンツ、スペーシング、テキストマーカーを考慮する大規模言語モデルの能力に不可欠です。このスキルは、非構造化データ抽出の他の方法と比較して、トランスフォーマーを一線を画すものにします。現在のトレンドと開発 AIの分野は、非構造化データ抽出の未来を形作る重要なトレンドと開発で満たされています。主要な側面を詳しく見ていきましょう。 大規模言語モデル(LLM)の進歩 ジェネレーティブAIは、非構造化データ抽出のためのLLMの重要性を強調する、変革的な段階にあります。2つの重要な戦略がこれらの進歩を推進しています: マルチモーダル学習:LLMは、テキスト、画像、オーディオなどのさまざまなタイプのデータを同時に処理する能力を拡大し、さまざまなソースからの貴重な情報を抽出する能力を高めています。研究者は、GPUやDPU、TPUのアクセラレーションなしでこれらのモデルを使用するための効率的な方法を探究し、リソースが限られている場合でも大規模なモデルの操作を可能にしようとしています。 RAGアプリケーション:リトリーバル増強生成(RAG)は、事前トレーニングされた大規模言語モデルと外部検索メカニズムを組み合わせて、ビジネスと消費者アプリケーションの両方でダイナミックなツールを提供する、注目すべきトレンドです。生成プロセス中に膨大なドキュメントコーパスにアクセスすることで、RAGは基本的な言語モデルを、コンテキストと関連性を理解したものに変えます。 LLMのパフォーマンス評価 LLMのパフォーマンス評価は、タスク固有のメトリクスと革新的な評価方法を組み込む戦略的なアプローチで対応します。主要な開発は以下の通りです: フィーネチューンされたメトリクス:情報抽出タスクの品質を評価するためのメトリクスが登場しています。精度、リコール、F1スコアなどのメトリクスは、エンティティ抽出などのタスクで特に有効です。 人間の評価:自動メトリクスと並んで、人間の評価はLLMの包括的な評価に不可欠です。自動メトリクスと人間の判断を組み合わせたハイブリッド評価方法により、コンテキストの正確性と関連性について、繊細な視点が得られます。 画像およびドキュメント処理 マルチモーダルLLMは、OCRを完全に置き換えました。ユーザーは、画像やドキュメント内のスキャンされたテキストを機械が読み取れるテキストに変換できます。さらに、ビジョンベースのモジュールを使用して、視覚的なコンテンツから直接情報を抽出できます。 リンクおよびウェブサイトからのデータ抽出 LLMは、ウェブサイトやウェブリンクからのデータ抽出の需要に応じて進化しています。これらのモデルは、ウェブスクレイピングにますます適しています。ウェブページのデータを構造化された形式に変換することで、ニュース集約、ECデータ収集、競合分析などのタスクに不可欠な価値を提供します。これにより、コンテキストの理解が向上し、ウェブからの関連データの抽出が可能になります。 ジェネレーティブAIにおける小さな巨人の台頭 2023年上半期は、大規模言語モデルを開発する「大きいほど良い」という仮定に焦点が当てられました。しかし、最近の結果は、TinyLlamaやDolly-v2-3Bなどの小さなモデル(3億パラメータ未満)が、推論や要約などのタスクで優れていることを示しています。これらのモデルは、計算能力とストレージを少なくすることで、AIをよりアクセスしやすくし、企業が高価なGPUを必要とせずにAIを活用できるようにしています。 結論 初期のジェネレーティブAIモデル、たとえば生成対抗ネットワーク(GAN)や変分オートエンコーダ(VAE)は、画像ベースのデータの管理に対する新しいアプローチを導入しました。しかし、実際のブレークスルーは、トランスフォーマーベースの大規模言語モデルが到来したときでした。これらのモデルは、エンコーダーとデコーダーの構造、セルフアテンション、そしてマルチヘッドアテンションメカニズムにより、前代未聞の言語理解と人間のような推論能力を実現しました。 ジェネレーティブAIは、レポートからのテキストデータのマイニングを開始するための約束のある出発点を提供します。しかし、こうしたアプローチのスケーラビリティは限られています。初期のステップには、OCR処理が含まれ、レポート内の画像からのテキスト抽出には課題が残ります。 レポート内の画像からのテキスト抽出は別の課題です。GPT-4、Claud3、Geminiなどのマルチモーダルデータ処理とトークン制限の拡張を活用することで、前向きな道筋が開けられます。しかし、これらのモデルはAPIを介してのみアクセス可能であり、APIを使用したドキュメントからのデータ抽出は効果的でコスト効率が高いですが、待ち時間、制限された制御、セキュリティリスクなどの制限も伴います。 より安全で、カスタマイズ可能な解決策は、社内でLLMをフィーネチューンすることです。このアプローチは、データプライバシーとセキュリティに関する懸念を軽減し、データ抽出プロセスに対する制御を強化します。ドキュメントのレイアウト理解とコンテキストに基づくテキストの意味の理解のためのフィーネチューンにより、ゼロショットとファインショット学習を活用して、さまざまなドキュメントレイアウトに適応し、さまざまなドメインで非構造化データ抽出を効率的かつ正確に行うことができます。