AIの基礎
マシンラーニングとは何か?
マシンラーニングは、最も急速に成長している技術分野の1つですが、頻繁に「マシンラーニング」という言葉が使われているにもかかわらず、正確に何を指しているのか理解するのは難しいことがあります。
マシンラーニングは、1つのことだけを指すのではなく、さまざまな概念や技術に適用できる傘下の用語です。マシンラーニングを理解するには、さまざまな形式のモデル分析、変数、アルゴリズムに精通している必要があります。マシンラーニングを詳しく見てみましょう。
マシンラーニングとは何か
マシンラーニングという用語は、さまざまなものに適用できますが、一般に、コンピューターが明示的な逐行指示を受け取らずにタスクを実行できるようにすることを指します。マシンラーニングの専門家は、コンピューターがデータ内のパターンを分析し、新しいデータにこれらのパターンを一般化できるため、問題を解決するために必要なすべての手順を書き出す必要はありません。
マシンラーニングシステムには、3つの基本的な部分があります。
- 入力
- アルゴリズム
- 出力
入力は、マシンラーニングシステムに与えられるデータであり、入力データをラベルと特徴に分けることができます。特徴は、パターンを学習し、結論を導き出すために分析される関連する変数です。一方、ラベルは、データの個々のインスタンスに与えられたクラス/説明です。
特徴とラベルは、2つの異なるタイプのマシンラーニング問題に使用できます: 監督学習と無監督学習。
無監督学習と監督学習
監督学習では、入力データは基準事実とともに提供されます。監督学習問題には、正しい出力値がデータセットの一部として含まれており、予想されるクラスは事前にわかっているため、データサイエンティストはテストデータセットでデータをテストし、正しく分類されたアイテムの割合を確認できます。
一方、無監督学習問題には、基準事実ラベルが付与されていません。無監督学習タスクを実行するようにトレーニングされたマシンラーニングアルゴリズムは、データ内の関連するパターンを自分で推測する必要があります。
監督学習アルゴリズムは、通常、クラス分類問題に使用されます。ここでは、大量のデータセットがクラスに分類される必要があります。監督学習の別のタイプは、アルゴリズムが出力する値がカテゴリではなく連続的な値である回帰タスクです。
一方、無監督学習アルゴリズムは、密度推定、クラスタリング、表現学習などのタスクに使用されます。これらの3つのタスクでは、モデルがデータの構造を推測する必要があります。モデルには、事前に定義されたクラスは与えられません。
いくつかの一般的なアルゴリズムを見てみましょう。
監督学習の種類
一般的な監督学習アルゴリズムには、以下のものがあります。
- ナイーブベイズ
- サポートベクターマシン
- ロジスティック回帰
- ランダムフォレスト
- 人工ニューラルネットワーク
サポートベクターマシンは、データセットを異なるクラスに分割するアルゴリズムです。データポイントは、クラスターやグループに分割されます。クラスを分割する線を描き、線の片側にあるポイントは1つのクラスに属し、もう一方の側にあるポイントは別のクラスに属します。サポートベクターマシンは、線とポイントの距離を最大化することを目指し、距離が大きいほど、クラス分類器はポイントが1つのクラスに属するという信頼性が高くなります。
ロジスティック回帰は、データポイントを2つのクラスに分類するために使用されるアルゴリズムです。ロジスティック回帰では、データポイントに0または1のラベルが付けられます。データポイントの値が0.49以下の場合、0に分類され、0.5以上の場合、1に分類されます。
決定木アルゴリズムは、データセットを小さな断片に分割することによって機能します。データを分割するための正確な基準は、マシンラーニングエンジニアによって決定されますが、最終的にはデータを単一のデータポイントに分割し、キーで分類することを目指しています。
ランダムフォレストアルゴリズムは、単一の決定木分類器をより強力な分類器にリンクするものです。
ナイーブベイズ分類器は、ベイズの定理に基づいて、与えられたデータポイントが発生する確率を計算します。分類器は、クラス結果に対する予測子の同じ影響を仮定して、データポイントをクラスに分類します。
人工ニューラルネットワーク、または多層パーセプトロンは、人間の脳の構造と機能に着想を得たマシンラーニングアルゴリズムです。人工ニューラルネットワークは、多くのノード/ニューロンで構成されています。各ニューロンは、データを数学関数で操作します。人工ニューラルネットワークには、入力層、隠し層、出力層があります。
ニューラルネットワークの隠し層は、データが実際に解釈され、パターンが分析される場所です。言い換えると、ここでアルゴリズムが学習します。より多くのニューロンが結合されて、より複雑なネットワークが形成され、より複雑なパターンを学習することができます。
無監督学習の種類
無監督学習アルゴリズムには、以下のものがあります。
- K-平均法
- オートエンコーダー
- 主成分分析
K-平均法は、無監督クラスタリング技術であり、データポイントをクラスターまたはグループに分割します。K-平均法は、データポイントの特徴を分析し、クラスター内のデータポイントが他のクラスター内のデータポイントよりも類似しているパターンを特定します。これは、クラスターの中心、つまり重心をグラフに配置し、重心の位置を変更して、重心とクラスター内のポイントの距離を最小化することによって実現されます。クラスターの数は、研究者によって指定できます。
主成分分析は、大量の特徴/変数をより小さい特徴空間に減らす技術です。データポイントの「主成分」が選択され、他の特徴はより小さい表現に圧縮されます。元のデータポイント間の関係は保持されますが、データポイントの複雑さが低いため、データを数量化して説明するのがより簡単になります。
オートエンコーダーは、無監督学習タスクに適用できるニューラルネットワークのバリエーションです。オートエンコーダーは、ラベル付けされていない自由形式のデータを、ニューラルネットワークが使用できるデータに変換することができます。基本的に、独自のラベル付きトレーニングデータを作成します。オートエンコーダーの目的は、入力データをできるだけ正確に変換し、再構築することです。したがって、ネットワークは、最も重要な特徴を抽出して、どの特徴が最も重要であるかを判断するインセンティブが生まれます。












