Fundamentos de IA

O que ÃĐ o Teorema de Bayes?

mm
Adicione Unite.AI às suas fontes preferidas no Google

Se vocÊ estÃĄ aprendendo sobre ciÊncia de dados ou aprendizado de mÃĄquina, hÃĄ uma boa chance de que vocÊ tenha ouvido o termo “Teorema de Bayes” antes, ou um “classificador de Bayes”. Esses conceitos podem ser um pouco confusos, especialmente se vocÊ nÃĢo estÃĄ acostumado a pensar em probabilidade a partir de uma perspectiva tradicional de estatística frequentista. Este artigo tentarÃĄ explicar os princípios por trÃĄs do Teorema de Bayes e como ele ÃĐ usado no aprendizado de mÃĄquina.

O que ÃĐ o Teorema de Bayes?

O Teorema de Bayes ÃĐ um mÃĐtodo de cÃĄlculo de probabilidade condicional. O mÃĐtodo tradicional de calcular a probabilidade condicional (a probabilidade de que um evento ocorra dado o ocorrido de um evento diferente) ÃĐ usar a fÃģrmula de probabilidade condicional, calculando a probabilidade conjunta do evento um e do evento dois ocorrendo ao mesmo tempo, e entÃĢo dividindo por a probabilidade do evento dois ocorrer. No entanto, a probabilidade condicional tambÃĐm pode ser calculada de uma forma ligeiramente diferente usando o Teorema de Bayes.

Quando calculamos a probabilidade condicional com o Teorema de Bayes, usamos os seguintes passos:

  • Determinar a probabilidade de que a condiçÃĢo B seja verdadeira, supondo que a condiçÃĢo A seja verdadeira.
  • Determinar a probabilidade de que o evento A seja verdadeiro.
  • Multiplicar as duas probabilidades juntas.
  • Dividir pela probabilidade do evento B ocorrer.

Isso significa que a fÃģrmula para o Teorema de Bayes pode ser expressa assim:

P(A|B) = P(B|A)*P(A) / P(B)

Calcular a probabilidade condicional dessa forma ÃĐ especialmente Útil quando a probabilidade condicional reversa pode ser facilmente calculada, ou quando calcular a probabilidade conjunta seria muito desafiador.

Exemplo do Teorema de Bayes

Isso pode ser mais fÃĄcil de interpretar se passarmos algum tempo olhando para um exemplo de como vocÊ aplicaria o raciocínio bayesiano e o Teorema de Bayes. Vamos supor que vocÊ estivesse jogando um jogo simples onde vÃĄrios participantes contam uma histÃģria e vocÊ tem que determinar quem dos participantes estÃĄ mentindo para vocÊ. Vamos preencher a equaçÃĢo para o Teorema de Bayes com as variÃĄveis nesse cenÃĄrio hipotÃĐtico.

Estamos tentando prever se cada indivíduo no jogo estÃĄ mentindo ou dizendo a verdade, entÃĢo, se houver trÊs jogadores alÃĐm de vocÊ, as variÃĄveis categÃģricas podem ser expressas como A1, A2 e A3. A evidÊncia de suas mentiras ou verdades ÃĐ seu comportamento. Como quando se joga pÃīquer, vocÊ procuraria por certos “tells” que uma pessoa estÃĄ mentindo e usaria essas informaçÃĩes para informar sua suposiçÃĢo. Ou, se vocÊ fosse permitido questionÃĄ-los, seria qualquer evidÊncia de que sua histÃģria nÃĢo se soma. Podemos representar a evidÊncia de que uma pessoa estÃĄ mentindo como B.

Para ser claro, estamos tentando prever a Probabilidade (A estÃĄ mentindo ou dizendo a verdade | dada a evidÊncia de seu comportamento). Para fazer isso, gostaríamos de descobrir a probabilidade de B dado A, ou a probabilidade de que seu comportamento ocorreria dado que a pessoa estÃĄ realmente mentindo ou dizendo a verdade. VocÊ estÃĄ tentando determinar sob quais condiçÃĩes o comportamento que vocÊ estÃĄ vendo faria mais sentido. Se houver trÊs comportamentos que vocÊ estÃĄ testemunhando, vocÊ faria o cÃĄlculo para cada comportamento. Por exemplo, P(B1, B2, B3 * A). VocÊ faria isso para cada ocorrÊncia de A / para cada pessoa no jogo, alÃĐm de vocÊ. Essa ÃĐ a parte da equaçÃĢo acima:

P(B1, B2, B3,|A) * P|A

Finalmente, dividimos isso pela probabilidade de B.

Se recebemos alguma evidÊncia sobre as probabilidades reais nessa equaçÃĢo, recriaríamos nosso modelo de probabilidade, levando em conta a nova evidÊncia. Isso ÃĐ chamado de atualizar nossas prioridades, pois atualizamos nossas suposiçÃĩes sobre a probabilidade anterior dos eventos observados ocorrerem.

AplicaçÃĩes de Aprendizado de MÃĄquina para o Teorema de Bayes

O uso mais comum do Teorema de Bayes quando se trata de aprendizado de mÃĄquina ÃĐ na forma do algoritmo Naive Bayes.

O Naive Bayes ÃĐ usado para a classificaçÃĢo de conjuntos de dados binÃĄrios e multi-classe, o Naive Bayes recebe seu nome porque os valores atribuídos às evidÊncias / atributos – Bs em P(B1, B2, B3 * A) – sÃĢo assumidos como independentes entre si. É assumido que esses atributos nÃĢo afetam um ao outro para simplificar o modelo e tornar os cÃĄlculos possíveis, em vez de tentar a tarefa complexa de calcular as relaçÃĩes entre cada um dos atributos. Apesar desse modelo simplificado, o Naive Bayes tende a se sair muito bem como um algoritmo de classificaçÃĢo, mesmo quando essa suposiçÃĢo provavelmente nÃĢo ÃĐ verdadeira (o que ÃĐ a maior parte do tempo).

Existem tambÃĐm variantes comumente usadas do classificador Naive Bayes, como Multinomial Naive Bayes, Bernoulli Naive Bayes e Gaussian Naive Bayes.

Os algoritmos Multinomial Naive Bayes sÃĢo frequentemente usados para classificar documentos, pois sÃĢo eficazes na interpretaçÃĢo da frequÊncia de palavras dentro de um documento.

Os algoritmos Bernoulli Naive Bayes operam de forma semelhante ao Multinomial Naive Bayes, mas as previsÃĩes renderizadas pelo algoritmo sÃĢo booleanas. Isso significa que, ao prever uma classe, os valores serÃĢo binÃĄrios, sim ou nÃĢo. No domínio da classificaçÃĢo de texto, um algoritmo Bernoulli Naive Bayes atribuiria os parÃĒmetros como sim ou nÃĢo com base na presença ou ausÊncia de uma palavra no documento de texto.

Se o valor dos preditores / recursos nÃĢo for discreto, mas sim contínuo, Gaussian Naive Bayes pode ser usado. É assumido que os valores dos recursos contínuos foram amostrados a partir de uma distribuiçÃĢo gaussiana.

Blogueiro e programador com especialidades em Machine Learning e Deep Learning tÃģpicos. Daniel espera ajudar os outros a usar o poder da IA para o bem social.