AI:n perusteet
Mikä on Bayesin teoreema?
Jos olet opiskellut datasta tai koneoppimisesta, on hyvä mahdollisuus, että olet kuullut termin “Bayesin teoreema” tai “Bayes-luokittelija” aiemmin. Nämä käsitteet voivat olla hieman hämäriä, etenkin jos et ole tottunut ajattelemaan todennäköisyyttä perinteisen, frekventistisen tilastotieteen näkökulmasta. Tämä artikkeli yrittää selittää Bayesin teoreeman periaatteita ja sen käyttöä koneoppimisessa.
Mikä on Bayesin teoreema?
Bayesin teoreema on menetelmä ehdollisen todennäköisyyden laskemiseen. Perinteinen menetelmä ehdollisen todennäköisyyden laskemiseen (todennäköisyys, että yksi tapahtuma tapahtuu, kun toinen tapahtuma on tapahtunut) on käyttää ehdollisen todennäköisyyden kaavaa, laskemalla yhdistetty todennäköisyys tapahtumien yhteistyöstä ja jakamalla se tapahtuman 2 todennäköisyydellä. Ehdollinen todennäköisyys voidaan kuitenkin laskea myös hieman eri tavoin käyttämällä Bayesin teoreemaa.
Kun lasketaan ehdollista todennäköisyyttä Bayesin teoreeman avulla, seuraavat vaiheet ovat tarpeen:
- Määritä ehdot B olevan tosia, olettaen, että ehdot A ovat tosia.
- Määritä tapahtuman A todennäköisyys.
- Kerro nämä kaksi todennäköisyyttä yhteen.
- Jaa tuloksella tapahtuman B todennäköisyys.
Tämä tarkoittaa, että Bayesin teoreeman kaava voidaan ilmaista seuraavasti:
P(A|B) = P(B|A)*P(A) / P(B)
Ehdollisen todennäköisyyden laskeminen tällä tavoin on erityisen hyödyllistä, kun käänteinen ehdollinen todennäköisyys voidaan laskea helposti tai kun yhdistetyn todennäköisyyden laskeminen olisi liian haasteellista.
Esimerkki Bayesin teoreemasta
Tämä saattaa olla helpompi ymmärtää, jos tarkastelemme esimerkkiä siitä, miten voitaisiin soveltaa bayesilaista päättelyä ja Bayesin teoreemaa. Oletetaan, että pelaat yksinkertaista peliä, jossa useat osallistujat kertovat sinulle tarinan, ja sinun on päätettävä, kuka osallistujista valehtelee sinulle. Täytetään Bayesin teoreeman yhtälö tällä hypoteettisella skenaariolla.
Yritämme ennustaa, kuka yksilöistä valehtelee tai puhuu totta, joten jos pelaajia on kolme sinun lisäksesi, kategoriset muuttujat voidaan ilmaista A1, A2 ja A3. Näiden valehtelun/totuuuden todisteena on heidän käyttäytyminen. Kuten pokerissa, etsitään tiettyjä “merkkejä”, jotka osoittavat, että henkilö valehtelee, ja käytetään näitä tietoja arvioidaksesi, kuka valehtelee. Tai jos sinulla on mahdollisuus kysyä heiltä, se olisi mikä tahansa todiste, joka osoittaa, että heidän tarinansa ei pitäisi paikkaansa. Voimme edustaa todisteita siitä, että henkilö valehtelee, B:llä.
On selvää, että pyrimme ennustamaan todennäköisyyttä, että A valehtelee/puhuu totta, annettuna käyttäytymisen todiste. Tämän tekemiseksi haluamme selvittää todennäköisyyden B:stä, annettuna A. Tai todennäköisyyden, että heidän käyttäytymisensä tapahtuu, kun henkilö valehtelee/tottelee. Yritämme selvittää, missä olosuhteissa käyttäytyminen, jonka näen, olisi järkevintä. Jos havaitsemiasi käyttäytymisiä on kolme, tekisit laskelman kullekin käyttäytymiselle. Esimerkiksi P(B1, B2, B3 * A). Tekisit tämän jokaiselle A:n ilmenemiselle/jokaiselle pelissä mukana olevalle henkilölle sinun lisäksesi. Se on tämä yhtälön osa:
P(B1, B2, B3,|A) * P|A
Lopuksi jaamme vain tuloksen B:n todennäköisyydellä.
Jos saamme jotain tietoa todennäköisyyksistä tässä yhtälössä, luomme uudelleen todennäköisyysmallimme, ottaen huomioon uuden todisteen. Tätä kutsutaan etuoletusten päivittämiseksi, kun päivität oletuksesi havaittujen tapahtumien aiemmasta todennäköisyydestä.
Koneoppimisen sovellukset Bayesin teoreemalle
Bayesin teoreeman yleisin käyttö koneoppimisessa on Naive Bayes -algoritmissa.
Naive Bayesia käytetään sekä binäärisen että moniluokan aineistojen luokitteluun. Naive Bayes on saanut nimensä siitä, että todisteiden todennäköisyydet/ominaisuudet – B:t P(B1, B2, B3 * A) – oletetaan olevan toisistaan riippumattomia. Oletetaan, että nämä ominaisuudet eivät vaikuta toisiinsa, jotta malli voidaan yksinkertaistaa ja laskelmat voidaan tehdä, sen sijaan, että yritettäisiin laskea ominaisuuksien välisiä suhteita. Vaikka malli on yksinkertaistettu, Naive Bayes toimii usein hyvin luokittelualgoritmina, vaikka tämä oletus ei todennäköisesti pidä paikkaansa (joka on useimmiten tapahtuva).
Naive Bayes -luokittelijan yleisimmin käytettyjä muunnelmia ovat Multinomial Naive Bayes, Bernoulli Naive Bayes ja Gaussian Naive Bayes.
Multinomial Naive Bayes -algoritmeja käytetään usein asiakirjojen luokitteluun, koska se on tehokas sanien frekvenssin tulkinnassa asiakirjassa.
Bernoulli Naive Bayes toimii samalla tavoin kuin Multinomial Naive Bayes, mutta algoritmin tekemät ennusteet ovat booleja. Tämä tarkoittaa, että luokan ennustettaessa arvot ovat binäärisiä, kyllä/ei. Tekstiluokittelun alalla Bernoulli Naive Bayes -algoritmi määrittää parametreja kyllä/ei -perusteella siitä, löytyykö sana tekstidokumentista.
Jos ennusteen/arvioiden arvot eivät ole diskreettejä, vaan jatkuvia, Gaussian Naive Bayes voidaan käyttää. Oletetaan, että jatkuvat ominaisuudet on otettu gaussian-jakaumasta.












