ソートリーダー

マシンラーニングのための人間によるデータ準備はリソース集約型である:コストを削減するための2つの重要なアプローチ

mm
Unite.AI を Google の優先ソースに追加

著者:Dattaraj Rao、チーフデータサイエンティスト、Persistent Systems

データ入力に依存するシステムと同様に、マシンラーニング(ML)は「ガベージインガベージアウト」の公理の対象となる。クリーンで正確にラベル付けされたデータは、どのMLモデルを構築するための基礎である。MLのトレーニングアルゴリズムは、グラウンドトゥルースデータからパターンを理解し、そこから未見のデータに一般化する方法を学習する。トレーニングデータの品質が低い場合、MLアルゴリズムが継続的に学習し、外挿することは非常に難しい。

ペットの犬を訓練することと考えてみる。基本的な行動コマンド(入力)を正しく訓練しない場合、または不正確に訓練した場合、犬が観察によってより複雑な肯定的な行動を学習し、拡張することはできない。適切な訓練は時間がかかり、専門家を雇用する場合は費用もかかるが、最初から正しく行うと大きな利益がある。

MLモデルを訓練する場合、質の高いデータを作成するには、ドメインエキスパートが時間を費やしてデータを注釈付ける必要がある。これには、画像内の目的のオブジェクトを選択するウィンドウまたはテキストエントリまたはデータベースレコードにラベルを割り当てることが含まれる。特に、画像、ビデオ、テキストなどの非構造化データの場合、注釈の品質はモデル品質を決定する上で重要な役割を果たす。通常、未注釈データである生画像やテキストは豊富にありますが、注釈付けは努力を最適化する必要がある部分です。これは、MLライフサイクルの人間が関与する部分であり、通常、最も高価で労力密度が高い部分です。

Prodigy、Amazon Sagemaker Ground Truth、NVIDIA RAPIDS、DataRobotなどのデータ注釈ツールは、品質の向上とドメインエキスパートのための直感的なインターフェースを提供し続けています。ただし、ドメインエキスパートがデータを注釈付けるために費やす時間を最小限に抑えることは、現在でも企業にとって大きな課題です。特に、データサイエンスの才能が限られているが、高い需要がある環境ではそうです。これは、2つの新しいデータ準備アプローチが登場する背景です。

アクティブラーニング

アクティブラーニングは、MLモデルがドメインエキスパートに特定の注釈を要求する方法です。ここでの焦点は、未注釈データに完全な注釈を付けることではなく、モデルがよりよく学習できるように、正しいデータポイントを注釈付けることです。たとえば、ヘルスケアおよびライフサイエンス分野では、早期がん検出を専門とし、臨床医が患者ケアについてデータ駆動型の決定を下す支援を行う診断会社があります。診断プロセスの一環として、がんを強調するためにCTスキャン画像に注釈を付ける必要があります。

MLモデルががんブロックが付いたいくつかの画像から学習した後、アクティブラーニングでは、モデルはユーザーにがんの存在に不確実な画像のみを注釈付けるよう要求します。これらは境界点であり、注釈付けするとモデルの信頼性が高まります。モデルの信頼性が特定の閾値以上の場合、モデルはユーザーに注釈を要求するのではなく、自己注釈付けを行います。これがアクティブラーニングがデータを注釈付けする時間と労力を削減しながら、正確なモデルを構築するのに役立つ方法です。modALなどのフレームワークは、ドメインエキスパートに最も情報量の多いインスタンスを知的に要求することで、分類パフォーマンスを向上させるのに役立ちます。

弱い監督

弱い監督は、ノイズのある不正確なデータまたは抽象的な概念を使用して、未監視データの大部分にラベルを付けるための指示を提供するアプローチです。このアプローチは通常、弱いラベラーを使用し、それらをアンサンブルアプローチで組み合わせて、高品質の注釈付きデータを構築することを目指します。ドメイン知識を自動ラベル付けアクティビティに組み込もうとする努力です。

たとえば、インターネットサービスプロバイダー(ISP)がスパムメールデータセットをスパムまたはスパム以外のメールとしてフラグ付けするシステムが必要な場合、スパムメールに関連するフレーズ(「オファー」、「祝賀」、「無料」など)をチェックする弱いルールを書くことができます。他のルールは、特定のパターンのソースアドレスから送信されたメールを正規表現で検索することができます。これらの弱い関数は、SnorkelやSkweakなどの弱い監督フレームワークを使用して組み合わせて、品質の高いトレーニングデータを構築できます。

MLの核となる部分は、企業が物理的に手作業で達成することが不可能な方法で、プロセスを指数関数的に拡大するのを支援することです。ただし、MLは魔法ではなく、依然として、モデルを適切にセットアップしてトレーニングするために人間の関与が必要です。さらに、モデルが役に立たない、またはマイナスの結果になる可能性があるため、必要に応じて介入して、モデルが偏向しないようにする必要があります。

目標は、時間と結果を最適化しながら、人間の関与の部分をストリームライン化および自動化する方法を見つけることです。ただし、最適な精度のガイドライン内で行う必要があります。高品質の注釈付きデータを取得することは、最も高価で非常に重要なMLプロジェクトの部分であることが、普遍的に受け入れられています。この分野は進化を続けており、ドメインエキスパートが費やす時間を削減し、データ注釈の品質を向上させるための多大な努力が行われています。アクティブラーニングと弱い監督を活用することは、さまざまな業界やユースケースでこれを達成するための実行可能な戦略です。

Dattaraj Rao, Persistent Systemsのチーフデータサイエンティストは、書籍「Keras to Kubernetes: The Journey of a Machine Learning Model to Production」の著者です。Persistent Systemsでは、Dattarajは、コンピュータビジョン、自然言語理解、確率プログラミング、強化学習、説明可能なAIなど、最先端のアルゴリズムを探求するAI研究ラボを率いています。また、ヘルスケア、銀行、産業分野での適用可能性を実証しています。Dattarajは、機械学習とコンピュータビジョン分野で11件の特許を持っています。