AIの基礎
ベイズの定理とは何か?
データサイエンスや機械学習について学習したことがある場合は、ベイズの定理という用語を聞いたことがあるかもしれません。ベイズの定理は、条件付き確率を計算するための方法です。伝統的な確率計算方法では、条件付き確率を計算するために、2つのイベントが同時に発生するジョイント確率を計算し、それを2番目のイベントの確率で割ります。しかし、ベイズの定理を使用すると、条件付き確率を別の方法で計算できます。
ベイズの定理を使用して条件付き確率を計算する場合、次の手順に従います。
- 条件Aが真であると仮定して、条件Bが真である確率を決定します。
- イベントAが真である確率を決定します。
- 2つの確率を掛け合わせます。
- イベントBが発生する確率で割ります。
これは、ベイズの定理の式が次のように表現できることを意味します。
P(A|B) = P(B|A)*P(A) / P(B)
このように条件付き確率を計算することは、逆の条件付き確率を簡単に計算できる場合や、ジョイント確率を計算するのが困難な場合に特に役立ちます。
ベイズの定理の例
これをより簡単に理解するために、ベイズの定理を適用する例を見てみましょう。複数の参加者があなたに話をして、誰が嘘をついているかを判断する必要があるシンプルなゲームを想像してください。ベイズの定理の式に、この仮想シナリオの変数を入力してみましょう。
各参加者が嘘をついているか真実を言っているかを予測しようとしているので、カテゴリ変数はA1、A2、A3と表すことができます。参加者の行動は、嘘をついているか真実を言っているかという証拠です。ポーカーをプレイするように、参加者が嘘をついている「特徴」を探し、それを使用してあなたの予測を導きます。参加者の話が矛盾している証拠がある場合は、それも証拠として使用します。参加者が嘘をついている証拠はBと表すことができます。
明確にするために、参加者の行動に基づいて、参加者が嘘をついているか真実を言っているかという確率を予測しようとしています。参加者が嘘をついているか真実を言っているかという条件付き確率を計算するには、行動が参加者が嘘をついているか真実を言っているかという条件下で発生する確率を計算する必要があります。参加者の行動が最も意味のある条件を判断しようとしています。参加者が3つの行動を示している場合は、各行動について計算を実行します。たとえば、P(B1、B2、B3|A) * P|Aです。
最後に、証拠Bの確率で割ります。
新しい証拠が得られれば、観測されたイベントの事前確率に関する仮定を更新して、確率モデルを再構築します。これは、事前確率の更新と呼ばれます。
ベイズの定理の機械学習への応用
ベイズの定理を機械学習で使用する最も一般的な方法は、ナイーブベイズアルゴリズムの形です。
ナイーブベイズは、2値分類と多クラス分類の両方で使用されます。ナイーブベイズの名前は、証拠/属性の値(Bs in P(B1, B2, B3 * A))が相互に独立しているという仮定に由来します。計算を可能にするためにモデルを簡素化するために、属性間の関係を計算するのではなく、属性が相互に影響を与えないと仮定します。ただし、この簡素化されたモデルでは、ナイーブベイズは分類アルゴリズムとしてかなり優れています。実際にはこの仮定が当てはまらないことがほとんどですが。
ナイーブベイズ分類器の一般的なバリエーションには、多項ナイーブベイズ、ベルヌーイナイーブベイズ、ガウシアンベイズなどがあります。
多項ナイーブベイズアルゴリズムは、ドキュメントを分類するためによく使用され、ドキュメント内の単語の頻度を解釈するのに効果的です。
ベルヌーイナイーブベイズは、多項ナイーブベイズと同様に動作しますが、アルゴリズムによって生成される予測はブール値です。つまり、クラスを予測する際に、値はバイナリ(はい/いいえ)になります。テキスト分類の分野では、ベルヌーイナイーブベイズアルゴリズムは、テキストドキュメント内に単語が見つかるかどうかに基づいて、パラメータにはいまたはいいえを割り当てます。
予測変数/特徴の値が離散的ではなく連続的である場合は、ガウシアンベイズを使用できます。連続特徴の値はガウス分布からサンプリングされたと仮定されます。












