Основы ИИ
Что такое Теорема Байеса?
Если вы изучали науку о данных или машинное обучение, есть большая вероятность, что вы слышали термин “Теорема Байеса” или “Классификатор Байеса”. Эти концепции могут быть несколько запутанными, особенно если вы не привыкли думать о вероятности с точки зрения традиционной, частотной статистики. В этой статье мы попытаемся объяснить принципы, лежащие в основе Теоремы Байеса, и то, как она используется в машинном обучении.
Что такое Теорема Байеса?
Теорема Байеса – это метод расчета условной вероятности. Традиционный метод расчета условной вероятности (вероятность того, что одно событие происходит, учитывая возникновение другого события) заключается в использовании формулы условной вероятности, расчете совместной вероятности событий и делении ее на вероятность возникновения второго события. Однако условную вероятность можно рассчитать и немного другим способом, используя Теорему Байеса.
При расчете условной вероятности с помощью Теоремы Байеса вы используете следующие шаги:
- Определите вероятность того, что условие Б истинно, предполагая, что условие А истинно.
- Определите вероятность того, что событие А истинно.
- Умножьте две вероятности вместе.
- Разделите на вероятность возникновения события Б.
Это означает, что формула Теоремы Байеса может быть выражена следующим образом:
P(A|B) = P(B|A)*P(A) / P(B)
Расчет условной вероятности таким образом особенно полезен, когда обратная условная вероятность может быть легко рассчитана, или когда расчет совместной вероятности был бы слишком сложным.
Пример Теоремы Байеса
Это может быть проще понять, если мы посмотрим на пример того, как вы можете применить байесовское рассуждение и Теорему Байеса. Допустим, вы играете в простую игру, где несколько участников рассказывают вам историю, и вам нужно определить, кто из них лжет. Давайте заполним уравнение Теоремы Байеса переменными в этом гипотетическом сценарии.
Мы пытаемся предсказать, лжет ли каждый участник или говорит правду, поэтому, если есть три игрока, кроме вас, категориальные переменные можно выразить как А1, А2 и А3. Доказательством их лжи/правды является их поведение. Как и при игре в покер, вы бы искали определенные “признаки”, которые указывают на то, что человек лжет, и использовали бы эти знаки, чтобы сделать предположение. Или, если вам было разрешено задавать им вопросы, это было бы любое доказательство, что их история не складывается. Мы можем представить доказательство того, что человек лжет, как Б.
Чтобы быть ясным, мы стремимся предсказать вероятность того, что А лжет/говорит правду, учитывая доказательства их поведения. Для этого нам нужно определить вероятность Б, учитывая А, или вероятность того, что их поведение будет таким, если человек действительно лжет или говорит правду. Вы пытаетесь определить, при каких условиях поведение, которое вы наблюдаете, будет иметь наибольший смысл. Если вы наблюдаете три поведения, вы бы сделали расчет для каждого поведения. Например, P(B1, B2, B3 * A). Вы бы сделали это для каждого случая А/для каждого человека в игре, кроме вас. Это та часть уравнения выше:
P(B1, B2, B3,|A) * P|A
Наконец, мы просто делим это на вероятность Б.
Если мы получим любые доказательства реальных вероятностей в этом уравнении, мы пересоздадим нашу модель вероятности, принимая во внимание новые доказательства. Это называется обновлением наших априорных предположений, поскольку мы обновляем наши предположения о вероятности наблюдаемых событий.
Применения Теоремы Байеса в Машинном Обучении
Наиболее распространенное применение Теоремы Байеса в машинном обучении – это в форме алгоритма Наивного Байеса.
Наивный Байес используется для классификации как бинарных, так и многоклассовых наборов данных. Наивный Байес получил свое название, потому что значения, присвоенные доказательствам/атрибутам свидетелей – Б в P(B1, B2, B3 * A) – предполагаются независимыми друг от друга. Предполагается, что эти атрибуты не влияют друг на друга, чтобы упростить модель и сделать возможными расчеты, вместо того, чтобы пытаться рассчитать сложные отношения между каждым из атрибутов. Несмотря на эту упрощенную модель, Наивный Байес, как правило, хорошо работает в качестве алгоритма классификации, даже когда это предположение, вероятно, не является истинным (что происходит чаще всего).
Также существуют часто используемые варианты классификатора Наивного Байеса, такие как Мультиномиальный Наивный Байес, Бернуллиев Наивный Байес и Гауссовский Наивный Байес.
Мультиномиальный Наивный Байес часто используется для классификации документов, поскольку он эффективен в интерпретации частоты слов в документе.
Бернуллиев Наивный Байес работает аналогично Мультиномиальному Наивному Байесу, но прогнозы, сделанные алгоритмом, являются булевыми. Это означает, что при прогнозировании класса значения будут бинарными, да или нет. В области классификации текста алгоритм Бернуллиевого Наивного Байеса будет присваивать параметрам значение да или нет, в зависимости от наличия слова в текстовом документе.
Если значения предикторов/функций не являются дискретными, а являются непрерывными, можно использовать Гауссовский Наивный Байес. Предполагается, что значения непрерывных функций были выбраны из гауссовского распределения.












