AIの基礎
監督学習 対 非監督学習
機械学習では、ほとんどのタスクを、監督学習問題または非監督学習問題の 2 つのクラスに分類できます。監督学習では、データにラベルまたはクラスが付加されますが、非監督学習の場合は、データはラベル付けされません。この区別が重要である理由と、各学習タイプに関連するアルゴリズムを詳しく見ていきましょう。
監督学習 vs 非監督学習
ほとんどの機械学習タスクは、監督学習のドメインにあります。監督学習アルゴリズムでは、データセット内の各インスタンス/データポイントにクラスまたはラベルが割り当てられます。これにより、機械学習モデルは、特定のクラスに関連する機能を区別することを学び、機械学習エンジニアは、適切に分類されたインスタンスの数を確認することでモデルのパフォーマンスを確認できます。分類アルゴリズムは、データに適切なクラスがラベル付けされている限り、多くの複雑なパターンを区別するために使用できます。たとえば、機械学習アルゴリズムは、「ひげ」、「尾」、「爪」などの特徴に基づいて、さまざまな動物を区別することを学習できます。
監督学習とは対照的に、非監督学習では、ラベル付けされていないデータからパターンを抽出するモデルを作成します。コンピューターは入力機能を分析し、最も重要な機能とパターンを自ら決定します。非監督学習は、さまざまなインスタンス間の内在的な類似性を探します。監督学習アルゴリズムが既知のクラスにデータポイントを配置することを目指す場合、非監督学習アルゴリズムはオブジェクトインスタンスの共通機能を分析し、機能に基づいてクラスに分類します。実質的に、独自のクラスを作成します。
監督学習アルゴリズムの例は、線形回帰、ロジスティック回帰、K最近傍法、決定木、サポートベクターマシンです。
一方、非監督学習アルゴリズムの例は、主成分分析とK-meansクラスタリングです。
監督学習アルゴリズム
線形回帰は、2つの特徴をプロットし、その関係を示すアルゴリズムです。線形回帰は、他の数値変数との関係における数値値を予測するために使用されます。線形回帰の式はY = a + bXで、bは線の傾き、aはyがx軸と交差する点です。
ロジスティック回帰は、2つのクラスに分類されるバイナリ分類アルゴリズムです。アルゴリズムは、数値特徴とそのインスタンスを2つのクラスのいずれかに分類できる可能性を分析します。確率値は0または1に近づけられます。強い確率は0.99に近づき、弱い確率は0に近づきます。
K最近傍法は、トレーニングセット内のいくつかの近傍の割り当てられたクラスに基づいて、新しいデータポイントにクラスを割り当てます。アルゴリズムが考慮する近傍の数は重要であり、近傍が少なすぎるか多すぎると、ポイントを誤って分類する可能性があります。
決定木は、分類と回帰の両方で使用されるアルゴリズムです。決定木は、データセットを小さな部分に分割し、サブセットをさらに分割できないまで繰り返します。結果として、ノードと葉を持つツリーが生成されます。ノードは、さまざまなフィルタリング基準を使用してデータポイントについての決定が行われる場所であり、葉は特定のラベル(クラス)が割り当てられたインスタンス(データポイント)です。決定木アルゴリズムは、数値データとカテゴリデータの両方を処理できます。ツリー内の分割は、特定の変数/特徴に基づいて行われます。
サポートベクターマシンは、データポイントをクラスに分割するために、超平面(分離線)を描く分類アルゴリズムです。データポイントは、超平面のどちら側にあるかによってクラスに分割されます。複数の超平面を描くことができ、データセットを複数のクラスに分割できます。クラス分類器は、分割超平面と平面の両側のポイントの間の距離を最大化しようとします。距離が大きいほど、クラス分類器はより自信を持っています。
非監督学習アルゴリズム
主成分分析は、次元削減のためのテクニックです。つまり、データの複雑さがより単純な形式で表現されます。主成分分析アルゴリズムは、データに直交する新しい次元を見つけます。データの次元が削減されると同時に、データ間の分散を可能な限り保存する必要があります。実用的には、データセット内の特徴をより少ない特徴に凝縮し、データのほとんどを表現します。
K-meansクラスタリングは、データポイントを特徴の類似性に基づいてクラスターに自動的にグループ化するアルゴリズムです。データセット内のパターンを分析し、データポイントをこれらのパターンに基づいてグループに分割します。実質的に、K-meansはラベル付けされていないデータから独自のクラスを作成します。K-meansアルゴリズムは、クラスターの中心(重心)を割り当て、重心を最適な位置に移動します。最適な位置は、重心とクラス内の周囲のデータポイントの距離が最小化された位置です。K-meansクラスタリングの「K」は、選択された重心の数を表します。
まとめ
最後に、監督学習と非監督学習の主な違いを簡単にまとめましょう。
監督学習と非監督学習。
前述のように、監督学習タスクでは、入力データがラベル付けされ、クラスの数がわかっています。一方、非監督学習の場合は、入力データがラベル付けされず、クラスの数がわかっていません。非監督学習は、計算上の複雑さが少ない傾向がありますが、監督学習は、計算上の複雑さが多い傾向があります。監督学習の結果は通常、高度に正確ですが、非監督学習の結果は、正確度が低いか、中程度です。












