Fundamentele AI

Ce este Teorema lui Bayes?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Teorema lui Bayes descrie cum se actualizează probabilitatea unei ipoteze după observarea dovezilor. Ea leagă probabilitatea dovezii dată o ipoteză de probabilitatea ipotezei dată acea dovadă.

Această distincție este esențială pentru raționamentul statistic și învățarea automată. Un test poate fi foarte precis când o condiție este prezentă, în timp ce un rezultat pozitiv are totuși o probabilitate modestă de a indica condiția dacă aceasta este rară.

Aspecte cheie

  • Posteriorul combină o credință anterioară cu verosimilitatea dovezii observate.
  • Termenul de dovadă normalizează ipotezele posibile.
  • Ratele de bază pot domina dovezile aparent puternice.
  • Naive Bayes presupune că trăsăturile sunt condițional independente dată clasa, nu independente în orice circumstanță.
Bayes theorem diagram showing prior probability multiplied by likelihood and normalized by evidence to produce a posterior, with a 1000-person probability tree example
Actualizarea bayesiană combină probabilitatea anterioară și dovezile noi în loc să se ia în considerare rezultatul unui test izolat.

Formula

P(A|B) = P(B|A)P(A) / P(B)

  • P(A) este probabilitatea anterioară a ipotezei A.
  • P(B|A) este verosimilitatea de a observa dovada B dacă A este adevărată.
  • P(B) este probabilitatea totală a dovezii.
  • P(A|B) este probabilitatea posterioră a lui A după observarea lui B.

Teorema rezultă din două expresii echivalente pentru probabilitatea comună: P(A ∩ B) = P(B|A)P(A) și P(A ∩ B) = P(A|B)P(B).

Un exemplu numeric al ratei de bază

Presupunem că o condiție afectă 1% dintr-o populație. Un test are o sensibilitate de 90% și o rată de fals pozitiv de 5%. Să luăm în considerare 1.000 de persoane:

  • Aproximativ 10 au condiția; testul marchează corect 9.
  • Aproximativ 990 nu o au; o rată de fals pozitiv de 5% marchează aproximativ 50.
  • Prin urmare există aproximativ 59 de rezultate pozitive, dintre care 9 sunt pozitive reale.

Probabilitatea condiției după un rezultat pozitiv este aproximativ 9 / 59 ≈ 15%, nu 90%. Sensibilitatea testului răspunde la P(pozitiv | condiție); utilizatorul de obicei dorește P(condiție | pozitiv). Teorema lui Bayes le leagă prin utilizarea ratei de bază.

Actualizare bayesiană

Pe măsură ce noi dovezi apar, un posterior poate deveni priorul pentru următoarea actualizare. Un model bayesian complet specifică ipotezele posibile, distribuțiile anterioare, verosimilitatea și cantitatea de inferat. Incertitudinea este reprezentată printr-o distribuție posterioră, nu doar printr-o estimare punctuală.

Priorul trebuie documentat și testat pentru sensibilitate. Un prior slab informativ poate regulariza valori implausibile, în timp ce un prior puternic ales prost poate domina datele limitate.

Clasificatori Naive Bayes

Naive Bayes prezice o clasă y din trăsăturile x₁ … xₙ utilizând teorema lui Bayes și presupunerea:

P(x₁, …, xₙ | y) = Π P(xᵢ | y)

Se presupune că trăsăturile sunt condițional independente odată ce clasa este cunoscută. Aceasta este adesea nerealistă, totuși clasificatorul poate funcționa bine când scorurile de clasă rezultate sunt încă utile.

Variante comune

  • Multinomial Naive Bayes modelează trăsături de tip contor și este comun în clasificarea documentelor.
  • Bernoulli Naive Bayes modelează prezența trăsăturilor binare.
  • Gaussian Naive Bayes modelează fiecare trăsătură continuă cu o distribuție Gaussiană condiționată pe clasă.
  • Categorical Naive Bayes modelează categorii discrete.

Netezire și stabilitate numerică

Dacă o valoare a unei trăsături nu apare niciodată cu o clasă în timpul antrenării, o estimare de probabilitate nesmoothată poate deveni zero și poate elimina întregul produs. Netezirea aditivă sau de tip Laplace previne acest lucru. Implementările calculează probabilitățile logaritmice, astfel încât înmulțirea multor valori mici devine adunarea valorilor log stabile.

Probabilități, scoruri și calibrare

Ieșirile de probabilitate ale Naive Bayes pot fi prost calibrate deoarece trăsăturile corelate sunt efectiv numărate de mai multe ori. Un clasificator poate clasifica bine clasele, dar să supraestimeze încrederea. Calibrarea ar trebui evaluată pe date de testare când probabilitățile guvernează deciziile.

Bayes dincolo de Naive Bayes

Inferența bayesiană susține modele ierarhice, teste A/B, estimarea parametrilor științifici, prognoze, luarea deciziilor conștiente de incertitudine și modele grafice probabilistice. Metode aproximative precum Markov chain Monte Carlo și inferența varițională sunt utilizate când un posterior nu poate fi calculat în formă închisă.

Greșeli comune de raționament

  • Confunderea P(A|B) cu P(B|A).
  • Ignorarea unei rate de bază rare sau comune.
  • Tratarea unui prior ca obiectiv sau lăsarea lui nedeclarată.
  • Presupunerea că o verosimilitate ridicată implică automat un posterior ridicat.
  • Interpretarea unei asocieri predictive ca cauzală.

Probabilitate condițională, cote și dovezi

Teorema lui Bayes leagă probabilitatea unei ipoteze după dovezi de probabilitatea sa anterioară, de verosimilitatea de a observa acea dovadă sub ipoteză și de probabilitatea totală a dovezii. În formă de cote, cotele posterior se egalează cu cotele anterioare înmulțite cu un raport de verosimilitate. Aceasta separă ceea ce se credea înainte de un test de cât de puternic testul distinge ipotezele. Un test care pare foarte precis poate totuși produce multe rezultate fals pozitive când condiția este rară, deoarece rata de bază intră în posterior.

Verosimilitatea este o funcție a ipotezei pentru date observate fixe și nu trebuie confundată cu probabilitatea ipotezei. Normalizarea dovezilor însumează sau integrează peste ipoteze concurente. Presupunerile de independență condițională pot simplifica calculul, ca în Naive Bayes, dar trebuie verificate în raport cu consecințele. Mai multe piese de dovezi nu pot fi înmulțite ca independente când împărtășesc cauze sau duplicatează informații. Direcția cauzală contează de asemenea: P(dovadă|ipoteză) nu este în general P(ipoteză|dovadă), eroarea clasică de probabilitate inversă.

Alegerea modelului, calcul și utilizare în decizie

Analiza bayesiană specifică un prior, o verosimilitate și o distribuție predictivă posterioră. Priorii pot codifica cunoștințe stabilite, pot regulariza eșantioane mici sau pot fi slab informaționali; aceștia trebuie justificați și testați prin analiză de sensibilitate. Modelele conjugate furnizează actualizări analitice, în timp ce Markov chain Monte Carlo, inferența varițională și metodele secvențiale aproximează posteriore complexe. Diagnosticați convergența, dimensiunea efectivă a eșantionului, eroarea de aproximare și plauzibilitatea predictivă a priorului, în loc să raportați un număr posterior fără verificări de calcul.

O probabilitate posterioră informează, dar nu alege singură o acțiune. Deciziile necesită pierderi, beneficii, constrângeri și alternative disponibile. Evaluați modelele probabilistice cu calibrare, reguli de scorare corecte și verificări predictive posteriori pe date noi. Actualizați numai cu dovezi colectate sub un proces modelat; biasul de selecție și schimbarea setului de date pot invalida verosimilitatea. Comunicați intervale de credibilitate și presupuneri fără a le trata ca intervale de frecvență garantate. Teorema lui Bayes este o algebră exactă a probabilităților, în timp ce calitatea unei concluzii bayesiene depinde de modelul și dovezile furnizate.

Exemplu practic: interpretarea unui test de diagnostic

Un test are o sensibilitate de 95% și o specificitate de 90%, dar condiția afectează doar 1% din populația testată. Pentru 10.000 de persoane, se așteaptă aproximativ 95 de pozitive reale și 990 de fals pozitive, rezultând o valoare predictivă pozitivă sub 9%. Teorema lui Bayes face explicit efectul ratei de bază. Calculul indică populația, pragul testului și incertitudinea, în loc să promoveze sensibilitatea ca șansa ca un rezultat pozitiv să fie corect. Această distincție este, de asemenea, fundamentală pentru știința datelor atentă.

Clinicienii actualizează probabilitatea cu dovezi suplimentare numai când dependența dintre teste este modelată. Un prag de decizie încorporează prejudiciul bolii ratate, riscul testului de confirmare, costul și preferința pacientului. Calibrarea este verificată în populația locală, iar modificările prevalenței declanșează o revizuire. Posteriorul susține discuția și pașii următori; nu înlocuiește diagnosticul de confirmare. Raportarea folosește frecvențe naturale și analiză de sensibilitate pentru ca pacienții și practicienii să vadă cum se modifică concluzia sub presupuneri plauzibile.

Dovezi de implementare și pregătire operațională

O decizie de producție necesită mai mult decât o demonstrație de succes. Definiți utilizatorii vizați, mediul de operare, intrările, ieșirile, dependențele, proprietarul și consecința fiecărui eșec important. Stabiliți o linie de bază reproductibilă și un set de evaluare versionat înainte de ajustare. Testați cazuri obișnuite, condiții de frontieră, intrări defecte sau lipsă, schimbarea distribuției, întreruperea dependențelor, utilizarea greșită și grupurile sau mediile cel mai probabil subservite. Măsurați calitatea sarcinii împreună cu calibrarea sau incertitudinea, latența, debitul, costul resurselor, accesibilitatea, confidențialitatea și securitatea. Înregistrați fiecare transformare și prag astfel încât un revizor independent să poată reproduce rezultatul și să distingă dovezile de un prototip atrăgător.

Înainte de lansare, atribuiți autoritatea pentru eliberare, excepții, modificări, revenire și retragere. Utilizați o lansare etapizată, păstrați o soluție de rezervă sigură și verificați monitorizarea cu eșecuri injectate deliberat. Telemetria operațională ar trebui să dezvăluie calitatea intrărilor, comportamentul ieșirilor, versiunea modelului sau a regulii, sănătatea dependențelor, intervențiile umane și rezultatele confirmate fără a colecta date sensibile inutile. Definiți praguri de alertă și un responsabil de răspuns, apoi revizuiți dovezile din lumea reală după implementare în loc să presupuneți că performanța offline va persista. Reevaluează ori de câte ori sursele de date, utilizatorii, modelele, furnizorii, politicile, hardware‑ul sau obiectivele se modifică. Un sistem întreținut necesită, de asemenea, recuperare documentată, învățare din incidente, proceduri de ștergere și păstrare și un punct clar la care să fie dezactivat sau înlocuit.

Întrebări frecvente

Care este diferența dintre verosimilitate și probabilitate?

Cu parametrii fixați, un model atribuie probabilitate datelor posibile. Cu datele observate fixe, aceeași expresie poate fi privită ca o funcție de verosimilitate asupra valorilor posibile ale parametrilor. Formula numerică poate coincide, în timp ce interpretarea diferă.

Este Naive Bayes o inferență bayesiană completă?

Folosește teorema lui Bayes pentru clasificare sub un model puternic de independență condițională. Inferența bayesiană mai largă plasează distribuții peste cantitățile necunoscute și raționează cu o distribuție posterioră.

Referințe principale

Blogger și programator cu specializări în Machine Learning și Deep Learning subiecte. Daniel speră să ajute pe alții să folosească puterea inteligenței artificiale pentru binele social.