GrundlÃĶggende AI

Hvad er Bayes’ Teorem?

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Hvis du har lÃĶrt om datavidenskab eller maskinlÃĶring, er der en god chance, du har hÃļrt udtrykket “Bayes’ Teorem” fÃļr, eller en “Bayes-klassifikator”. Disse begreber kan vÃĶre lidt forvirrende, isÃĶr hvis du ikke er vant til at tÃĶnke pÃĨ sandsynlighed fra et traditionelt, frekventistisk statistikperspektiv. Denne artikel vil forsÃļge at forklare principperne bag Bayes’ Teorem og hvordan det bruges i maskinlÃĶring.

Hvad er Bayes’ Teorem?

Bayes’ Teorem er en metode til at beregne betinget sandsynlighed. Den traditionelle metode til at beregne betinget sandsynlighed (sandsynligheden for, at et begivenhed indtrÃĶffer, givet, at en anden begivenhed indtrÃĶffer) er at bruge betinget sandsynlighedsformlen, ved at beregne den samlede sandsynlighed for begivenhed ÃĐn og begivenhed to, og derefter dividere det med sandsynligheden for begivenhed to. Men betinget sandsynlighed kan ogsÃĨ beregnes pÃĨ en lidt anden mÃĨde ved hjÃĶlp af Bayes’ Teorem.

NÃĨr du beregner betinget sandsynlighed med Bayes’ teorem, fÃļlger du disse trin:

  • Bestem sandsynligheden for, at betingelse B er sand, givet, at betingelse A er sand.
  • Bestem sandsynligheden for, at begivenhed A er sand.
  • Gang de to sandsynligheder sammen.
  • DividÃĐr med sandsynligheden for, at begivenhed B indtrÃĶffer.

Dette betyder, at formlen for Bayes’ Teorem kan udtrykkes sÃĨledes:

P(A|B) = P(B|A)*P(A) / P(B)

At beregne betinget sandsynlighed pÃĨ denne mÃĨde er isÃĶr nyttigt, nÃĨr den omvendte betingede sandsynlighed kan beregnes let, eller nÃĨr beregning af den samlede sandsynlighed ville vÃĶre for udfordrende.

Eksempel pÃĨ Bayes’ Teorem

Dette kan vÃĶre lettere at forstÃĨ, hvis vi bruger lidt tid pÃĨ at se pÃĨ et eksempel pÃĨ, hvordan man kan anvende bayesisk tankegang og Bayes’ Teorem. Lad os antage, du spiller et simpelt spil, hvor flere deltagere fortÃĶller dig en historie, og du skal bestemme, hvem af deltagerne, der lyver for dig. Lad os udfylde ligningen for Bayes’ Teorem med variablerne i dette hypotetiske scenarie.

Vi prÃļver at forudsige, om hver enkelt person i spillet lyver eller siger sandheden, sÃĨ hvis der er tre spillere ud over dig, kan de kategoriske variabler udtrykkes som A1, A2 og A3. Beviset for deres lÃļgne/sandheden er deres adfÃĶrd. Ligesom nÃĨr du spiller poker, ville du lede efter visse “tegn” pÃĨ, at en person lyver, og bruge disse oplysninger til at informere din gÃĶt. Eller hvis du var tilladt at stille dem spÃļrgsmÃĨl, ville det vÃĶre enhver bevis for, at deres historie ikke stemmer overens. Vi kan reprÃĶsentere beviset for, at en person lyver, som B.

For at gÃļre det klart, prÃļver vi at forudsige Sandsynligheden for, at A lyver/siger sandheden|givet beviset for deres adfÃĶrd. For at gÃļre dette ville vi gerne vide sandsynligheden for B givet A, eller sandsynligheden for, at deres adfÃĶrd ville optrÃĶde, givet, at personen virkelig lyver eller siger sandheden. Du prÃļver at bestemme under hvilke betingelser, den adfÃĶrd du ser, ville have mest mening. Hvis der er tre adfÃĶrdsformer, du observerer, ville du udfÃļre beregningen for hver adfÃĶrd. For eksempel P(B1, B2, B3 * A). Du ville sÃĨ gÃļre dette for hver forekomst af A/for hver person i spillet ud over dig selv. Det er denne del af ligningen ovenfor:

P(B1, B2, B3,|A) * P|A

Til sidst dividerer vi bare med sandsynligheden for B.

Hvis vi modtog nogen oplysninger om de faktiske sandsynligheder i denne ligning, ville vi genskabe vores sandsynlighedsmodel, ved at tage den nye information i betragtning. Dette kaldes opdatering af vores a priori, da vi opdaterer vores antagelser om den a priori sandsynlighed for de observerede begivenheders forekomst.

MaskinlÃĶringsapplikationer for Bayes’ Teorem

Den mest almindelige brug af Bayes’ Teorem i forbindelse med maskinlÃĶring er i form af Naive Bayes-algoritmen.

Naive Bayes bruges til klassificering af bÃĨde binÃĶre og multi-klassedatasets, Naive Bayes fÃĨr sit navn, fordi de vÃĶrdier, der tildÃĻles vidnernes bevis/attributter – Bs i P(B1, B2, B3 * A) – antages at vÃĶre uafhÃĶngige af hinanden. Det antages, at disse attributter ikke pÃĨvirker hinanden for at simplificere modellen og gÃļre beregninger mulige, i stedet for at forsÃļge at beregne relationerne mellem hvert af attributterne. Trods denne simplificerede model, tenderer Naive Bayes til at fungere ret godt som en klassificeringsalgoritme, selv nÃĨr denne antagelse sandsynligvis ikke er sand (hvad det er mest af tiden).

Der er ogsÃĨ almindeligt brugte varianter af Naive Bayes-klassifikatoren, sÃĨsom Multinomial Naive Bayes, Bernoulli Naive Bayes og Gaussian Naive Bayes.

Multinomial Naive Bayes-algoritmer bruges ofte til at klassificere dokumenter, da det er effektivt til at fortolke hyppigheden af ord inden for et dokument.

Bernoulli Naive Bayes fungerer pÃĨ samme mÃĨde som Multinomial Naive Bayes, men forudsigelserne, der genereres af algoritmen, er booleske. Dette betyder, at nÃĨr du forudsiger en klasse, vil vÃĶrdierne vÃĶre binÃĶre, nej eller ja. I tekstklassificeringens domÃĶne ville en Bernoulli Naive Bayes-algoritme tildele parametrene et ja eller nej, afhÃĶngigt af, om et ord er fundet i tekstdokumentet eller ej.

Hvis vÃĶrdien af forudsagningsvariablerne ikke er diskrete, men i stedet kontinuerte, kan Gaussian Naive Bayes bruges. Det antages, at vÃĶrdierne af de kontinuerte funktioner er samplet fra en gaussisk distribution.

Blogger og programmÃļr med specialer i Machine Learning og Deep Learning emner. Daniel hÃĨber at hjÃĶlpe andre med at bruge AI's kraft til sociale formÃĨl.