Podstawy AI
Co to jest Twierdzenie Bayesa?
Jeśli uczysz się o naukach danych lub uczeniu maszynowym, istnieje duże prawdopodobieństwo, że słyszałeś już o pojęciu „Twierdzenie Bayesa” lub „klasyfikator Bayesa”. Te pojęcia mogą być nieco mylące, szczególnie jeśli nie jesteś przyzwyczajony do myślenia o prawdopodobieństwie z tradycyjnej, częstotliwej perspektywy statystyki. Artykuł ten będzie próbował wyjaśnić zasady za Twierdzeniem Bayesa i jak jest ono wykorzystywane w uczeniu maszynowym.
Co to jest Twierdzenie Bayesa?
Twierdzenie Bayesa jest metodyką obliczania warunkowego prawdopodobieństwa. Tradycyjna metoda obliczania warunkowego prawdopodobieństwa (prawdopodobieństwa, że jedno zdarzenie występuje pod warunkiem wystąpienia innego zdarzenia) polega na użyciu formuły warunkowego prawdopodobieństwa, obliczania wspólnego prawdopodobieństwa zdarzenia pierwszego i zdarzenia drugiego, a następnie dzielenia go przez prawdopodobieństwo zdarzenia drugiego. Jednak warunkowe prawdopodobieństwo można również obliczyć w nieco inny sposób, używając Twierdzenia Bayesa.
Podczas obliczania warunkowego prawdopodobieństwa za pomocą Twierdzenia Bayesa, wykonuje się następujące kroki:
- Określa się prawdopodobieństwo warunku B będącego prawdziwym, przy założeniu, że warunek A jest prawdziwy.
- Określa się prawdopodobieństwo zdarzenia A będącego prawdziwym.
- Mnoży się oba prawdopodobieństwa.
- Dzieli się przez prawdopodobieństwo zdarzenia B.
Oznacza to, że wzór na Twierdzenie Bayesa można wyrazić w następujący sposób:
P(A|B) = P(B|A)*P(A) / P(B)
Obliczanie warunkowego prawdopodobieństwa w ten sposób jest szczególnie przydatne, gdy odwrotne warunkowe prawdopodobieństwo można łatwo obliczyć lub gdy obliczanie wspólnego prawdopodobieństwa byłoby zbyt trudne.
Przykład Twierdzenia Bayesa
Może to być łatwiejsze do zrozumienia, jeśli spędzimy trochę czasu na przykładzie zastosowania rozumowania bayesowskiego i Twierdzenia Bayesa. Załóżmy, że grasz w prostej grze, w której wielu uczestników opowiada ci historię, a ty musisz określić, który z uczestników kłamie. Wypełnijmy równanie Twierdzenia Bayesa zmiennymi w tym hipotetycznym scenariuszu.
Staramy się przewidzieć, czy każdy z uczestników kłamie, czy mówi prawdę, więc jeśli jest trzech graczy poza tobą, zmienne kategorialne można wyrazić jako A1, A2 i A3. Dowody na ich kłamstwa lub prawdę to ich zachowanie. Podobnie jak w grze w pokera, szukalibyśmy pewnych „sygnałów”, które wskazują, że osoba kłamie, i używalibyśmy tych informacji, aby poinformować naszą odpowiedź. Lub gdybyśmy byli w stanie zadać im pytania, dowody byłyby wszelkimi dowodami, które wskazują, że ich historia nie jest spójna. Możemy przedstawić dowody, że osoba kłamie, jako B.
Aby być jasnym, staramy się przewidzieć Prawdopodobieństwo (A kłamie/mówi prawdę | założone dowody ich zachowania). Aby to zrobić, chcielibyśmy określić prawdopodobieństwo B założonego A, czyli prawdopodobieństwo, że ich zachowanie wystąpiłoby, gdy osoba naprawdę kłamie lub mówi prawdę. Staramy się określić, pod jakimi warunkami zachowanie, które obserwujemy, miałoby najwięcej sensu. Jeśli obserwujemy trzy zachowania, wykonalibyśmy obliczenie dla każdego zachowania. Na przykład P(B1, B2, B3 * A). Wykonalibyśmy to dla każdego wystąpienia A/dla każdej osoby w grze poza sobą. To jest ta część równania powyżej:
P(B1, B2, B3,|A) * P|A
W końcu dzielimy to przez prawdopodobieństwo B.
Jeśli otrzymalibyśmy jakiekolwiek dowody dotyczące rzeczywistych prawdopodobieństw w tym równaniu, odtworzylibyśmy nasz model prawdopodobieństwa, biorąc pod uwagę nowe dowody. Nazywa się to aktualizacją naszych a priori, ponieważ aktualizujemy nasze założenia dotyczące wcześniejszego prawdopodobieństwa obserwowanych zdarzeń.
Zastosowania uczenia maszynowego dla Twierdzenia Bayesa
Najczęstszym zastosowaniem Twierdzenia Bayesa w uczeniu maszynowym jest algorytm Naive Bayes.
Naive Bayes jest używany do klasyfikacji zarówno binarnych, jak i wieloklasowych zbiorów danych. Naive Bayes otrzymał swoją nazwę, ponieważ wartości przypisane do dowodów/cech świadków – B w P(B1, B2, B3 * A) – są zakładane jako niezależne od siebie. Zakłada się, że te atrybuty nie wpływają na siebie, aby uproszczyć model i umożliwić obliczenia, zamiast próbować obliczyć relacje między każdym z atrybutów. Pomimo tego uproszczonego modelu, Naive Bayes ma tendencję do dobrego działania jako algorytm klasyfikacji, nawet gdy to założenie prawdopodobnie nie jest prawdziwe (co jest większości czasu).
Istnieją również powszechnie używane warianty klasyfikatora Naive Bayes, takie jak Multinomial Naive Bayes, Bernoulli Naive Bayes i Gaussian Naive Bayes.
Multinomial Naive Bayes jest często używany do klasyfikacji dokumentów, ponieważ jest skuteczny w interpretowaniu częstotliwości słów w dokumencie.
Bernoulli Naive Bayes działa podobnie do Multinomial Naive Bayes, ale przewidywania generowane przez algorytm są wartościami binarnymi. Oznacza to, że podczas przewidywania klasy wartości będą binarne, tak lub nie. W dziedzinie klasyfikacji tekstu, algorytm Bernoulli Naive Bayes przypisuje parametry tak lub nie, w zależności od tego, czy słowo jest znalezione w dokumencie.
Jeśli wartości predyktorów/cech nie są dyskretne, ale są ciągłe, Gaussian Naive Bayes może być użyty. Zakłada się, że wartości cech ciągłych zostały wybrane z rozkładu normalnego.












