AIモデルとプラットフォーム
言語処理を強化するGoogleのオープンソースBERTモデル
トランスフォーマーからの双方向エンコーダー表現、別名BERT; は、NLPモデルの効率と効果を大幅に改善したトレーニングモデルです。GoogleがBERTモデルをオープンソースにしたことで、すべての業界でNLPモデルの改善が可能になりました。この記事では、BERTがNLPを今日の世界で最も強力で有用なAIソリューションの1つに変える方法を見ていきます。
検索にBERTモデルを適用する
Googleの検索エンジンは、関連するコンテンツを提示する能力で世界的に知られています。彼らはこの自然言語処理プログラムをオープンソース化しました。
システムが自然言語を読み解き、解釈する能力は、世界が指数関数的に新しいデータを生産するにつれて、ますます重要になっています。Googleの単語の意味、フレーズ、関連するコンテンツを提示する能力のライブラリは、オープンソースです。自然言語処理を超えて、BERTモデルは大量の非構造化データから情報を抽出する能力があり、任意のライブラリの検索インターフェイスを作成するために適用できます。この記事では、このテクノロジーがエネルギー部門でどのように適用できるかを見ていきます。
BERT(トランスフォーマーからの双方向エンコーダー表現)は、Google (GOOGL ) AI Languageグループによって提案された、事前トレーニングアプローチです。早期のNLPモデルの共通の問題、つまり十分なトレーニングデータの欠如を克服するために開発されました。
詳しく説明する前に、
モデルのトレーニング
低レベルのNLPタスク(例:固有表現認識、トピックセグメンテーション)と高レベルのNLPタスク(例:感情分析、音声認識)には、タスク固有の注釈付きデータセットが必要です。これらは入手困難で、組み立てるのに高価です。ラベル付きデータセットは、浅いニューラルネットワークモデルと深いニューラルネットワークモデルの両方の性能に重要な役割を果たします。高品質の推論結果は、数百万または数十億の注釈付きトレーニング例が利用できる場合にのみ達成できます。つまり、多くのNLPタスクはアプローチ不能でした。BERTが開発されるまででした。
BERTは、非注釈付きテキストの大規模コーパスでトレーニングされた、汎用的な言語表現モデルです。モデルが大量のテキストコンテンツに公開されると、学習して、文内の単語間の関係とコンテキストを理解するようになります。以前の学習モデルは、単語レベルでしか意味を表現できませんでした(銀行は、「銀行口座」と「草地の銀行」で同じ意味になります)。しかし、BERTはコンテキストを考慮します。つまり、文の中での単語の前後関係です。コンテキストは、NLPモデルの欠けている重要な機能であり、モデルの性能に直接影響します。コンテキストを考慮したモデルを設計することは、NLPの新しい時代の始まりと見なされています。
BERTを大量のテキストコンテンツでトレーニングすることは、事前トレーニングと呼ばれるテクニックです。つまり、モデルの重みは、一般的なテキスト理解タスクに調整され、より詳細なモデルはそれの上に構築できます。作者たちは、BERTベースのモデルを11のNLPタスクに適用し、最先端の結果を達成したことで、このテクニックの優位性を証明しました。
事前トレーニング済みモデル
最も良い点は、事前トレーニング済みのBERTモデルがオープンソースで公開されており、誰でもNLPタスクに取り組み、BERTの上にモデルを構築できることです。何がこれを上回るでしょうか?お待ちください。これは、NLPモデルをより小さなデータセットでトレーニング(ファインチューニング)できることを意味し、最初からトレーニングする必要はありません。新しい時代の始まり、確かに。
これらの事前トレーニング済みモデルは、企業がNLPモデルを内部または外部で使用するために展開するためのコストと時間を削減するのに役立ちます。NLPモデルの有効性は、バーチャルチーム文化構築会社のteambuilding.comのCEOであるマイケル・アレクシスによって強調されています。
「NLPの最大の利点は、情報のスケーラブルで一貫した推論と処理です。」– マイケル・アレクシス、teambuilding.com
マイケルは、NLPがアイスブレーカーまたはアンケートなどの文化構築プログラムにどのように適用できるかを説明しています。企業は、従業員の回答を分析することで、企業文化の状況について貴重な洞察を得ることができます。これは、単にテキストを分析するだけでなく、テキストの注釈を分析することで達成されます。実際、モデルは「行間を読む」ことで感情、感覚、全体的な見方についての推論を導き出すことができます。BERTは、事前トレーニングモデルを基に、言語のニュアンスを発見し、より正確な洞察を提供するのに役立ちます。
クエリの改善
コンテキストをモデル化する能力は、BERTをNLPのヒーローに変え、Google検索自体を革命させました。以下は、Google検索製品チームのクォートと、BERTをクエリの意図を理解するために調整する際のテスト経験です。
「ここに、BERTがクエリの背後にある意図を理解する能力を示す例があります。ここでは、「2019ブラジル旅行者が米国にビザが必要です。」という検索を実行します。単語「to」と他の単語との関係は、クエリの意味を理解する上で非常に重要です。これは、ブラジル人が米国に旅行することについてであり、逆の場合ではありません。以前のアルゴリズムでは、この接続の重要性を理解できず、米国人がブラジルに旅行することについての結果を返しました。BERTを使用すると、検索はこのニュアンスを理解し、非常に一般的な単語「to」がここでは非常に重要であることを理解し、より関連性の高い結果を提供できます。」– 検索で言語理解を向上させる、Pandu Nayak、Google FellowおよびSearch担当副社長。

BERT検索例、前と後
私たちの前の記事で、 NLPとOCRについて説明しました。不動産業界でのNLPの使用例を示し、「NLPツールは情報抽出ツールとして理想的です」と述べました。不動産業界ではなく、エネルギー業界を見て、BERTなどの破壊的なNLPテクノロジーが新しい用途を可能にする方法を見ていきましょう。
NLPモデルは大量の非構造化データから情報を抽出できる
NLPモデルを使用する1つの方法は、非構造化テキストデータから重要な情報を抽出することです。メール、ジャーナル、ノート、ログ、レポートはすべて、企業の日常業務の一部であるテキストデータソースの例です。これらのドキュメントの中には、運用効率を向上させ、コストを削減するための企業の努力において重要な役割を果たすものがあるかもしれません。
風力タービンの予測メンテナンスを実装しようとする場合、故障レポートには、さまざまなコンポーネントの動作に関する重要な情報が含まれている場合があります。しかし、風力タービンのさまざまなメーカーには、異なるデータ収集規範(例:メンテナンスレポートは異なる形式で、異なる言語で来ます)があるため、関連するデータ項目を手動で特定することは、プラントオーナーにとって高価になる可能性があります。NLPツールは、非構造化コンテンツから関連する概念、属性、イベントを抽出できます。テキスト分析を使用して、さまざまなデータソースの相関関係とパターンを見つけることができます。これにより、プラントオーナーは故障レポートに基づいて予測メンテナンスを実装する機会を得ることができます。
NLPモデルは自然言語検索インターフェイスを提供できる
同様に、石油会社の地質学者は、過去のボーリング作業、井戸ログ、地震データに関する多くの文書を確認する必要があります。これらの文書は、さまざまな形式で、物理的およびデジタルの両方の場所に散在しているため、情報を探している間にお金を浪費することになります。実行可能な解決策は、NLPを活用した検索インターフェイスです。これにより、ユーザーは自然言語でデータを検索できます。次に、NLPモデルは数百の文書間でデータを関連付け、クエリに対する一連の回答を返します。作業者は、専門知識とフィードバックに基づいて出力を検証できます。
しかし、こうしたモデルを展開する場合にも、技術的な考慮が必要です。1つの側面は、業界固有の用語が従来の学習モデルを混乱させる可能性があることです。2つ目は、モデルの性能がトレーニングデータセットのサイズに影響される可能性があることです。これは、事前トレーニング済みモデルであるBERTが有益である場合です。コンテキスト表現は、適切な単語の意味をモデル化し、業界固有の用語によって引き起こされる混乱を除去できます。事前トレーニング済みモデルを使用することで、より小さなデータセットでネットワークをトレーニングできます。これにより、スクラッチからトレーニングするために必要な時間、エネルギー、リソースを節約できます。
あなたのビジネスについては?
コストを削減し、運用効率を向上させるのに役立つNLPタスクを考えることができますか?
Blue Orange Digitalのデータサイエンスチームは、あなたのためにBERTを調整することも喜んでいます!










