ソートリーダー

ディープラーニングを小さなデータで使う方法 – 思想リーダー

mm
Unite.AI を Google の優先ソースに追加

サイバーセキュリティの最新動向を追うには、最新のニュースを追うプロセスが非常に面倒になることがあります。最近では、サイバーセキュリティの分野は「ディープラーニング」という2つの言葉の周りを回っているようです。

当初、ディープラーニングが受けた大量の報道に驚かされたものの、すぐにディープラーニングが受けた注目は当然であることがわかりました。ディープラーニングは、人間の脳と同様に、テキスト、画像、音声からのタスクを直接実行することで、高度に正確な結果を達成することができます。

これまで、ディープラーニングは大量のデータセットに依存しているという考えが広まっていました。シリコンバレーの巨大企業であるGoogleやFacebookが抱えるような大量のデータセットが、組織内の複雑な問題を解決するために必要であると考えられていました。ただし、実際には、企業は大量のデータセットにアクセスすることなく、ディープラーニングの力を利用することができます。

読者がディープラーニングの力を企業に取り入れるために必要な知識を得ることができるように、この記事では、小さなデータセットでディープラーニングを利用する方法について詳しく説明します。

しかし、記事の本質に入る前に、小さなしかし非常に重要な提案をします。簡単に始めましょう。複雑なニューラルネットワークを作成する前に、シンプルなモデル(例:ランダムフォレスト)で始めて、ソフトウェアの使い方を習得しましょう。

では、小さなデータセットでディープラーニングを利用する方法について見ていきましょう。

#1- ベースラインモデルを微調整する:

上で述べたように、企業がシンプルなベースラインディープラーニングモデルを作成した後、最初のステップは、そのモデルを特定の問題に合わせて微調整することです。

ベースラインモデルを微調整することは、紙上では難しそうに思えるかもしれませんが、実際にはそう難しくありません。大量のデータセットを特定のニーズに合わせて微調整する基本的な考え方は、似たようなドメインの大量のデータセットを取り、そこに自分の小さなデータセットを合わせて微調整することです。

大量のデータセットを取得するには、企業はImageNetに頼ることができます。ImageNetは、画像分類の問題を解決するための簡単な解決策も提供します。ImageNetがホストするデータセットは、企業がアクセスできる数百万の画像を提供し、動物の画像など、さまざまなドメインからの画像を分類することができます。

もし、事前トレーニング済みのモデルを微調整するプロセスがあまりにも多くの作業のように感じられる場合は、インターネットで助けを求めることをお勧めします。単純なGoogle検索で、事前トレーニング済みのモデルを微調整する方法についてのチュートリアルが数百件見つかります。

#2- もっとデータを集める:

私たちのリストの2番目のポイントは、冗長に感じるかもしれませんが、事実は、ディープラーニングでは、データセットが大きいほど、より正確な結果が得られる可能性が高くなります。

この記事の本質は、企業が小さなデータセットでディープラーニングを利用する方法について説明することですが、多くの「上層部」がデータの収集を投資することを、罪深い行為とみなすことがあります。

企業は、データの収集に時間と労力を投資することを嫌がり、ディープラーニングの利点を無視することがよくあります。企業が必要なデータの量を判断するのに困難を感じている場合は、学習曲線をプロットし、モデルに追加のデータを統合するにつれて、モデルのパフォーマンスの変化を観察することをお勧めします。

CSOとCISOの役割は、この場合非常に重要です。サイバーアタックの脅威が常に存在するからです。2019年には、サイバーセキュリティへの世界的な支出が1031億ドルに達したことがわかります。この数字は増加しています。例えば、希少なダイヤモンドを分類しようとしているが、非常に小さなデータセットしかないとします。ベースラインモデルで遊ぶのではなく、もっとデータを集めるのが最も明らかな解決策です。

#3- データ拡張:

私たちが上で説明した最初の2つのポイントは、小さなデータセットでディープラーニングを利用するための効率的な解決策ですが、ある程度の運が必要です。

もし、事前トレーニング済みのデータセットを微調整することに成功しなかった場合は、データ拡張を試すことをお勧めします。データ拡張の方法は簡単です。入力データセットを変更することで、ラベル値を変更せずに新しい出力を生成します。

データ拡張の考え方を読者に理解してもらうために、犬の画像を例に挙げます。画像を回転させても、画像の見た目は変わらないでしょう。これがデータ拡張が達成しようとしていることです。画像の角度や高さを変えることは、ディープラーニングアルゴリズムが間違った結論に達する原因となり、ディープラーニングの目的を達成できないためです。

画像分類の問題を解決する場合、データ拡張は重要な役割を果たします。さまざまな画像分類の技術を提供し、ディープラーニングモデルが画像のさまざまな分類を深く理解できるようにします。

データ拡張の可能性はほぼ無限大です。企業は、NLPやGANの実験など、さまざまな方法でデータ拡張を実施することができます。

#4- アンサンブル効果の実装:

ディープラーニングの技術では、ネットワークは複数の層で構成されます。ただし、多くの人が考えているように、各層を「増加する」特徴の階層として見るのではなく、最終的な層はアンサンブルメカニズムを提供する役割を果たします。

小さなデータセットを持つ企業がネットワークを深く構築することをお勧めするという信念は、NIPsの論文でも共有されています。企業は、事前トレーニング済みのモデルを微調整することで、または他の方法で、ディープラーニングネットワークを深く構築することで、アンサンブル効果を利用できます。

#5- オートエンコーダーの導入:

私たちが考慮した5番目のポイントは、相対的に成功したものですが、ネットワークを事前トレーニングし、適切に初期化するためにオートエンコーダーを使用することに賛成しています。

サイバーアタック以外に、企業がディープラーニングの初期の障害を克服できない理由の1つは、初期化が不良であることです。オートエンコーダーは、この点で輝きます。無監督の事前トレーニングは、ディープラーニング技術の実行が不良または不正確になる原因となります。

ニューラルネットワークの基本的な考え方は、入力データセットの性質を予測するニューラルネットワークを作成することです。オートエンコーダーを使用する方法がわからない場合は、オンラインで明確な指示が記載されたチュートリアルが数多くあります。

結論:

記事の最後に、私たちは記事全体で述べたことを振り返り、さらに1つの追加のポイントを付け加えます。ドメイン固有の知識を学習プロセスに取り入れることです。価値のある洞察を取り入れることで、学習プロセスを加速させ、ディープラーニング技術がより優れた、より正確な結果を生み出すことができます。

Rebeccaは熱心なサイバーセキュリティジャーナリスト、創造的なチームリーダー、PrivacyCryptsの編集者です。