Основы ИИ
Что такое ансамблевое обучение?
Одним из самых мощных методов машинного обучения является ансамблевое обучение. Ансамблевое обучение – это использование нескольких моделей машинного обучения для повышения надежности и точности прогнозов. Однако, как использование нескольких моделей машинного обучения приводит к более точным прогнозам? Какие методы используются для создания моделей ансамблевого обучения? Мы рассмотрим ответы на эти вопросы, изучая обоснование использования моделей ансамблевого обучения и основные методы их создания.
Что такое ансамблевое обучение?
Просто говоря, ансамблевое обучение – это процесс обучения нескольких моделей машинного обучения и объединения их результатов. Разные модели используются как основа для создания одной оптимальной прогностической модели. Объединение разнообразного набора индивидуальных моделей машинного обучения может повысить стабильность общей модели, что приводит к более точным прогнозам. Модели ансамблевого обучения часто более надежны, чем индивидуальные модели, и поэтому они часто занимают первое место во многих соревнованиях по машинному обучению.
Существуют различные методы, которые инженер может использовать для создания модели ансамблевого обучения. Простые методы ансамблевого обучения включают такие вещи, как усреднение результатов разных моделей, а также более сложные методы и алгоритмы, разработанные специально для объединения прогнозов многих базовых моделей.
Почему использовать методы ансамблевого обучения?
Модели машинного обучения могут различаться по разным причинам. Разные модели машинного обучения могут работать с разными выборками данных, могут использоваться разные методы моделирования, и может использоваться разная гипотеза.
Представьте, что вы играете в викторину с большой группой людей. Если вы находитесь в команде один, есть bound быть некоторые темы, которые вы знаете, и многие темы, о которых вы не знаете. Теперь предположим, что вы играете в команде с другими людьми. Как и вы, они будут иметь некоторые знания по своим специальностям и не будут знать других тем. Однако, когда ваши знания объединяются, у вас будут более точные ответы на больше вопросов, и количество тем, о которых ваша команда не знает, уменьшается. Это тот же принцип, который лежит в основе ансамблевого обучения, объединяя прогнозы разных моделей (индивидуальных моделей) для повышения точности и минимизации ошибок.
Статистики доказали, что когда толпа людей спрашивается о правильном ответе на заданный вопрос с диапазоном возможных ответов, все их ответы образуют вероятностное распределение. Люди, которые действительно знают правильный ответ, выберут правильный ответ с уверенностью, а люди, которые выберут неправильные ответы, распределят свои ответы по диапазону возможных неправильных ответов. Вернувшись к примеру викторины, если вы и ваши два друга знаете, что правильный ответ – А, все трое вы проголосуете за А, а три других человека в вашей команде, которые не знают ответ, скорее всего, неправильно угадают Б, В, Г или Д. Результатом будет то, что А имеет три голоса, а другие ответы, скорее всего, имеют только один или два голоса максимум.
Все модели имеют некоторую ошибку. Ошибки одной модели будут отличаться от ошибок, произведенных другой моделью, поскольку модели сами по себе различны по вышеуказанным причинам. Когда все ошибки рассматриваются, они не будут скучаться вокруг одного ответа или другого, а будут рассредоточены. Неправильные ответы по сути распределены по всем возможным неправильным ответам, что приводит к их взаимной компенсации. Тем временем, правильные ответы от разных моделей будут скучаться вокруг истинного, правильного ответа. Когда используются методы ансамблевого обучения, правильный ответ можно найти с большей надежностью.
Простые методы ансамблевого обучения
Простые методы ансамблевого обучения обычно включают применение статистических методов суммирования, таких как определение моды, среднего или взвешенного среднего набора прогнозов.
Мода относится к наиболее часто встречающемуся элементу в наборе чисел. Чтобы получить моду, индивидуальные модели обучения возвращают свои прогнозы, которые рассматриваются как голоса за окончательный прогноз. Определение среднего прогноза производится путем простого расчета арифметического среднего прогнозов, округленного до ближайшего целого числа. Наконец, взвешенное среднее может быть рассчитано путем присвоения разным моделям, используемым для создания прогнозов, разных весов, представляющих воспринимаемую важность этой модели. Числовое представление классификационного прогноза умножается на вес от 0 до 1,0, индивидуальные взвешенные прогнозы затем суммируются, и результат округляется до ближайшего целого числа.
Сложные методы ансамблевого обучения
Существуют три основных сложных метода ансамблевого обучения, каждый из которых предназначен для решения определенной проблемы машинного обучения. “Бэггинг”-методы используются для уменьшения дисперсии прогнозов модели, где дисперсия относится к тому, насколько результат прогноза отличается при одинаковом наблюдении. “Бустинг”-методы используются для борьбы с предвзятостью моделей. Наконец, “стэкинг” используется для улучшения прогнозов в целом.
Методы ансамблевого обучения сами по себе обычно можно разделить на две разные группы: последовательные методы и параллельные методы ансамблевого обучения.
Последовательные методы ансамблевого обучения получили название “последовательные”, потому что базовые модели генерируются последовательно. В случае последовательных методов основная идея заключается в том, что зависимость между базовыми моделями используется для получения более точных прогнозов. Неправильно классифицированные примеры имеют свои веса, измененные при правильной классификации, сохраняя при этом одни и те же веса. Каждый раз, когда генерируется новый ученик, веса меняются, и точность (надеюсь) улучшается.
В отличие от последовательных моделей ансамблевого обучения, параллельные методы генерируют базовые модели параллельно. При выполнении параллельного ансамблевого обучения идея заключается в том, чтобы использовать тот факт, что базовые модели имеют независимость, поскольку общая скорость ошибок может быть уменьшена путем усреднения прогнозов индивидуальных моделей.
Методы ансамблевого обучения могут быть либо гомогенными, либо гетерогенными по своей природе. Большинство методов ансамблевого обучения являются гомогенными, то есть они используют один тип базовой модели/алгоритма обучения. Напротив, гетерогенные ансамбли используют разные алгоритмы обучения, диверсифицируя и варьируя учеников, чтобы обеспечить максимально возможную точность.
Примеры алгоритмов ансамблевого обучения

Визуализация ансамблевого бустинга. Фото: Sirakorn via Wikimedia Commons, CC BY SA 4.0, (https://commons.wikimedia.org/wiki/File:Ensemble_Boosting.svg)
Примерами последовательных методов ансамблевого обучения являются AdaBoost, XGBoost и градиентный бустинг с деревьями. Все эти методы являются бустинг-моделями. Для этих бустинг-моделей цель состоит в том, чтобы преобразовать слабые, недооцениваемые модели в более мощные модели. Модели, такие как AdaBoost и XGBoost, начинаются с многих слабых моделей, которые работают немного лучше, чем случайные догадки. По мере продолжения обучения веса применяются к данным и изменяются. Примеры, которые были неправильно классифицированы моделями в предыдущих раундах обучения, получают больший вес. После того, как этот процесс повторяется для желаемого количества раундов обучения, прогнозы объединяются путем взвешенного суммирования (для задач регрессии) и взвешенного голосования (для задач классификации).

Процесс обучения бэггинга. Фото: SeattleDataGuy via Wikimedia Commons, CC BY SA 4.0 (https://commons.wikimedia.org/wiki/File:Bagging.png)
Примером параллельной модели ансамблевого обучения является Случайный лес классификатор, и Случайные леса также являются примером бэггинг-метода. Термин “бэггинг” происходит от “бустрап-агрегации”. Образцы берутся из общего набора данных с помощью метода бустрап-выборки, которые используются базовыми моделями для создания прогнозов. Для задач классификации результаты базовых моделей объединяются с помощью голосования, а для задач регрессии они усредняются. Случайные леса используют индивидуальные деревья решений в качестве базовых моделей, и каждое дерево в ансамбле строится с помощью разных образцов из набора данных. Также используется случайный подмножество функций для генерации дерева, что приводит к высоко случайным индивидуальным деревьям решений, которые объединяются для получения надежных прогнозов.

Визуализация ансамблевого стэкинга. Фото: Supun Setunga via Wikimedia Commons, CC BY S.A 4.0 (https://commons.wikimedia.org/wiki/File:Stacking.png)
В отношении методов ансамблевого стэкинга несколько моделей регрессии или классификации объединяются вместе через более высокий уровень, мета-модель. Базовые модели низкого уровня обучаются путем подачи им всего набора данных. Результаты базовых моделей затем используются в качестве функций для обучения мета-модели. Модели ансамблевого стэкинга часто гетерогенными по своей природе.












