Grundlagen der KI

Was ist das Bayes-Theorem?

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Wenn Sie über Data Science oder Machine Learning gelernt haben, haben Sie wahrscheinlich bereits den Begriff “Bayes-Theorem” oder einen “Bayes-Klassifizierer” gehört. Diese Konzepte können ein bisschen verwirrend sein, besonders wenn Sie nicht daran gewöhnt sind, über Wahrscheinlichkeit aus einer traditionellen, frequentistischen Statistik-Perspektive nachzudenken. Dieser Artikel wird versuchen, die Prinzipien hinter dem Bayes-Theorem und seine Verwendung in der maschinellen Lerntheorie zu erklären.

Was ist das Bayes-Theorem?

Das Bayes-Theorem ist eine Methode zur Berechnung der bedingten Wahrscheinlichkeit. Die traditionelle Methode zur Berechnung der bedingten Wahrscheinlichkeit (die Wahrscheinlichkeit, dass ein Ereignis eintritt, wenn ein anderes Ereignis eintritt) besteht darin, die bedingte Wahrscheinlichkeitsformel zu verwenden, die gemeinsame Wahrscheinlichkeit von Ereignis eins und Ereignis zwei zu berechnen und diese dann durch die Wahrscheinlichkeit von Ereignis zwei zu teilen. Die bedingte Wahrscheinlichkeit kann jedoch auch auf eine leicht andere Weise mithilfe des Bayes-Theorems berechnet werden.

Bei der Berechnung der bedingten Wahrscheinlichkeit mit dem Bayes-Theorem werden die folgenden Schritte verwendet:

  • Bestimmen Sie die Wahrscheinlichkeit, dass Bedingung B wahr ist, wenn Bedingung A wahr ist.
  • Bestimmen Sie die Wahrscheinlichkeit, dass Ereignis A wahr ist.
  • Multiplizieren Sie die beiden Wahrscheinlichkeiten miteinander.
  • Teilen Sie durch die Wahrscheinlichkeit, dass Ereignis B eintritt.

Dies bedeutet, dass die Formel für das Bayes-Theorem wie folgt ausgedrückt werden kann:

P(A|B) = P(B|A)*P(A) / P(B)

Die Berechnung der bedingten Wahrscheinlichkeit auf diese Weise ist besonders nützlich, wenn die umgekehrte bedingte Wahrscheinlichkeit leicht berechnet werden kann oder wenn die Berechnung der gemeinsamen Wahrscheinlichkeit zu schwierig wäre.

Beispiel für das Bayes-Theorem

Dies könnte einfacher zu interpretieren sein, wenn wir uns ein Beispiel ansehen, wie man bayessche Argumentation und das Bayes-Theorem anwendet. Nehmen wir an, Sie spielen ein einfaches Spiel, bei dem mehrere Teilnehmer Ihnen eine Geschichte erzählen und Sie bestimmen müssen, welcher Teilnehmer Ihnen die Unwahrheit sagt. Füllen wir die Gleichung für das Bayes-Theorem mit den Variablen in diesem hypothetischen Szenario aus.

Wir versuchen, vorherzusagen, ob jeder Einzelne im Spiel lügt oder die Wahrheit sagt, also können die kategorialen Variablen als A1, A2 und A3 ausgedrückt werden. Der Beweis für ihre Lügen oder Wahrheiten ist ihr Verhalten. Wie beim Pokern würden Sie nach bestimmten “Anzeichen” suchen, dass eine Person lügt, und diese als Informationen verwenden, um Ihre Vermutung zu informieren. Oder wenn Sie sie befragen dürften, wäre es jeder Beweis, dass ihre Geschichte nicht zusammenpasst. Wir können den Beweis, dass eine Person lügt, als B darstellen.

Um klar zu sein, wir versuchen, die Wahrscheinlichkeit vorherzusagen, dass A1 lügt oder die Wahrheit sagt, gegeben den Beweis ihres Verhaltens. Um dies zu tun, würden wir die Wahrscheinlichkeit von B gegeben A oder die Wahrscheinlichkeit berechnen, dass ihr Verhalten auftritt, wenn die Person tatsächlich lügt oder die Wahrheit sagt. Sie versuchen, unter welchen Bedingungen das Verhalten, das Sie beobachten, am meisten Sinn ergibt. Wenn es drei Verhaltensweisen gibt, die Sie beobachten, würden Sie die Berechnung für jedes Verhalten durchführen. Zum Beispiel P(B1, B2, B3 * A). Sie würden dies für jeden Vorkommen von A oder für jede Person im Spiel tun, außer sich selbst. Das ist dieser Teil der Gleichung oben:

P(B1, B2, B3,|A) * P|A

Schließlich teilen wir dies einfach durch die Wahrscheinlichkeit von B.

Wenn wir irgendwelche Beweise über die tatsächlichen Wahrscheinlichkeiten in dieser Gleichung erhalten, würden wir unser Wahrscheinlichkeitsmodell neu erstellen, wobei wir die neuen Beweise berücksichtigen. Dies wird als “Aktualisieren der Priors” bezeichnet, da Sie Ihre Annahmen über die vorherige Wahrscheinlichkeit der beobachteten Ereignisse aktualisieren.

Machine-Learning-Anwendungen für das Bayes-Theorem

Die häufigste Verwendung des Bayes-Theorems im maschinellen Lernen ist in Form des Naive-Bayes-Algorithmus.

Naive Bayes wird für die Klassifizierung von binären und multiklassigen Datensätzen verwendet. Naive Bayes erhält seinen Namen, weil die Werte, die den Zeugenbeweisen/Attributen – Bs in P(B1, B2, B3 * A) – zugewiesen werden, als unabhängig voneinander angenommen werden. Es wird angenommen, dass diese Attribute sich nicht gegenseitig beeinflussen, um das Modell zu vereinfachen und Berechnungen möglich zu machen, anstatt den komplexen Aufgabenversuch zu unternehmen, die Beziehungen zwischen jedem der Attribute zu berechnen. Trotz dieses vereinfachten Modells neigt Naive Bayes dazu, als Klassifizierungsalgorithmus ziemlich gut zu funktionieren, auch wenn diese Annahme wahrscheinlich nicht zutrifft (was meistens der Fall ist).

Es gibt auch häufig verwendete Varianten des Naive-Bayes-Klassifizierers, wie Multinomial Naive Bayes, Bernoulli Naive Bayes und Gaussian Naive Bayes.

Multinomial Naive Bayes-Algorithmen werden oft zur Klassifizierung von Dokumenten verwendet, da sie effektiv darin sind, die Häufigkeit von Wörtern in einem Dokument zu interpretieren.

Bernoulli Naive Bayes funktioniert ähnlich wie Multinomial Naive Bayes, aber die Vorhersagen, die der Algorithmus liefert, sind boolesch. Das bedeutet, dass bei der Vorhersage einer Klasse die Werte binär sind, nein oder ja. Im Bereich der Textklassifizierung würde ein Bernoulli-Naive-Bayes-Algorithmus die Parameter mit ja oder nein basierend darauf zuweisen, ob ein Wort im Textdokument gefunden wird.

Wenn die Werte der Prädiktoren/Merkmale nicht diskret, sondern kontinuierlich sind, kann Gaussian Naive Bayes verwendet werden. Es wird angenommen, dass die Werte der kontinuierlichen Merkmale aus einer Gauß-Verteilung stammen.

Blogger und Programmierer mit Spezialisierungen in Machine Learning und Deep Learning Themen. Daniel hofft, anderen zu helfen, die Macht von KI für das soziale Wohl zu nutzen.