Основи ШІ

Що таке ансамблеве навчання?

mm
Додайте Unite.AI до бажаних джерел у Google

Одна з найпотужніших технік машинного навчання – ансамблеве навчання. Ансамблевенавчання – це використання кількох моделей машинного навчання для покращення надійності та точності прогнозів. Але як використання кількох моделей машинного навчання призводить до більш точних прогнозів? Які техніки використовуються для створення моделей ансамблевого навчання? Ми розглянемо відповіді на ці питання, розглянувши підстави використання моделей ансамблевого навчання та основні способи створення таких моделей.

Що таке ансамблеве навчання?

Просто кажучи, ансамблеве навчання – це процес навчання кількох моделей машинного навчання та об’єднання їх виходів. Різні моделі використовуються як основа для створення однієї оптимальної прогнозуючої моделі. Об’єднання різноманітного набору індивідуальних моделей машинного навчання може покращити стабільність загальної моделі, що призводить до більш точних прогнозів. Моделі ансамблевого навчання часто більш надійні, ніж окремі моделі, і тому вони часто займають перше місце у багатьох змаганнях з машинного навчання.

Існують різні техніки, які інженер може використовувати для створення моделі ансамблевого навчання. Прості техніки ансамблевого навчання включають такі речі, як середнє значення виходів різних моделей, тоді як існують також більш складні методи та алгоритми, розроблені спеціально для об’єднання прогнозів багатьох базових моделей.

Чому використовувати методи навчання ансамблевого навчання?

Моделі машинного навчання можуть відрізнятися один від одного по різним причинам. Різні моделі машинного навчання можуть працювати з різними вибірками даних населення, можуть використовуватися різні методи моделювання, і може використовуватися різна гіпотеза.

Представіть, що ви граєте в гру з великою групою людей. Якщо ви граєте самостійно, є певні теми, про які ви знаєте, і багато тем, про які ви нічого не знаєте. Тепер припустіть, що ви граєте в команді з іншими людьми. Як і ви, вони будуть мати певні знання щодо своїх спеціальностей і нічого не знають про інші теми. Однак, коли ваші знання об’єднуються, у вас є більш точні припущення щодо більшої кількості тем, і кількість тем, про які ваша команда нічого не знає, зменшується. Це той же принцип, який лежить в основі ансамблевого навчання, об’єднання прогнозів різних учасників команди (індивідуальних моделей) для покращення точності та зменшення помилок.

Статистики довели, що коли група людей просить відповісти на правильну відповідь на задане питання з діапазоном можливих відповідей, всі їхні відповіді утворюють розподіл імовірності. Люди, які дійсно знають правильну відповідь, виберуть правильну відповідь з впевненістю, тоді як люди, які виберуть неправильні відповіді, розподілуть свої припущення по діапазону неправильних відповідей. Повернувшись до прикладу гри, якщо ви і ваші два друга знаєте, що правильна відповідь – А, всі троє з вас проголосують за А, тоді як три інших людини в вашій команді, які не знають відповіді, ймовірно, неправильно виберуть Б, В, Г або Д. Результатом є те, що А має три голоси, а інші відповіді, ймовірно, мають не більше одного або двох голосів.

Усі моделі мають певну кількість помилок. Помилки однієї моделі будуть відрізнятися від помилок, створених іншою моделлю, оскільки моделі самі по собі різні з вищезазначених причин. Коли всі помилки розглядаються, вони не будуть згруповані навколо однієї відповіді чи іншої, а скоріше будуть розкидані навколо. Неправильні припущення по суті розподіляються по всіх можливих неправильних відповідях, взаємно виключając одна одну. Тим часом правильні припущення з різних моделей будуть згруповані навколо справжньої, правильної відповіді. Коли методи навчання ансамблевого навчання використовуються, правильну відповідь можна знайти з більшим надійністю.

Прості методи навчання ансамблевого навчання

Прості методи навчання ансамблевого навчання зазвичай включають застосування статистичних методів підсумовування, таких як визначення моди, середнього значення або зваженого середнього значення набору прогнозів.

Мода відноситься до найбільш часто зустрічається елемента в наборі чисел. Для визначення моди окремі моделі навчання повертають свої прогнози, які розглядаються як голоси за остаточний прогноз. Визначення середнього значення прогнозів здійснюється шляхом розрахунку арифметичного середнього прогнозів, округленого до найближчого цілого числа. Нарешті, зважене середнє значення можна розрахувати шляхом присвоєння різних ваг моделям, використовуваним для створення прогнозів, причому ваги представляють сприйняту важливість цієї моделі. Числове представлення класу прогнозу множиться разом із вагою від 0 до 1,0, окремі зважені прогнози потім сумуються разом, і результат округлюється до найближчого цілого числа.

Розширені методи навчання ансамблевого навчання

Існують три основних розширених методів навчання ансамблевого навчання, кожний з яких призначений для вирішення певного типу задач машинного навчання. “Баггінг”-методи використовуються для зменшення дисперсії прогнозів моделі, дисперсія відноситься до того, наскільки відрізняються результати прогнозів при одному і тому ж спостереженні. “Бустінг”-методи використовуються для боротьби із зміщенням моделей. Нарешті, “стекінг” використовується для покращення прогнозів загалом.

Методи навчання ансамблевого навчання можна загалом розділити на дві різні групи: послідовні методи та паралельні методи ансамблевого навчання.

Послідовні методи ансамблевого навчання отримують назву “послідовні”, оскільки базові моделі генеруються послідовно. У випадку послідовних методів основна ідея полягає в тому, щоб використати залежність між базовими моделями для отримання більш точних прогнозів. Помилково позначені приклади мають свої ваги змінені, тоді як правильно позначені приклади зберігають свої ваги. Кожного разу, коли генерується нова модель, ваги змінюються, і точність (сподіваємося) покращується.

Натомість паралельні методи ансамблевого навчання генерують базові моделі паралельно. При виконанні паралельного ансамблевого навчання ідея полягає в тому, щоб використати той факт, що базові моделі незалежні, оскільки загальна помилка може бути зменшена шляхом усереднення прогнозів окремих моделей.

Методи навчання ансамблевого навчання можуть бути як гомогенними, так і гетерогенними за своєю природою. Більшість методів навчання ансамблевого навчання є гомогенними, тобто вони використовують один тип базової моделі/алгоритму навчання. Натомість гетерогенні ансамблі використовують різні алгоритми навчання, диверсифікуючи та змінюючи моделі для забезпечення максимально можливої точності.

Приклади алгоритмів навчання ансамблевого навчання

Візуалізація ансамблевого бустингу. Фото: Sirakorn через Wikimedia Commons, CC BY SA 4.0, (https://commons.wikimedia.org/wiki/File:Ensemble_Boosting.svg)

Прикладами послідовних методів ансамблевого навчання є AdaBoost, XGBoost та градієнтний бустинг дерев. Це всі бустінг-моделі. Для цих бустінг-моделей мета полягає в тому, щоб перетворити слабкі, недооптимізовані моделі в більш потужні моделі. Моделі, такі як AdaBoost і XGBoost, починаються з багатьох слабких моделей, які працюють лише трохи краще, ніж випадкові припущення. Під час навчання ваги застосовуються до даних і змінюються. Приклади, які були неправильно класифіковані моделями в попередніх раундах навчання, отримують більшу вагу. Після повторення цього процесу за бажану кількість раундів навчання прогнози об’єднуються шляхом зваженого сумування (для задач регресії) та зваженого голосування (для задач класифікації).

Процес навчання баггінгу. Фото: SeattleDataGuy через Wikimedia Commons, CC BY SA 4.0 (https://commons.wikimedia.org/wiki/File:Bagging.png)

Прикладом паралельної моделі ансамблевого навчання є класифікатор випадкового лісу, і випадкові ліси також є прикладом методу баггінгу. Термін “баггінг” походить від “бутстреп-агрегації”. Вибірки беруться з повної вибірки даних за допомогою методу вибірки, відомого як “бутстреп-вибірка”, який використовується базовими моделями для створення прогнозів. Для задач класифікації виходи базових моделей агрегуються за допомогою голосування, тоді як вони усереднюються разом для задач регресії. Випадкові ліси використовують окремі дерева рішень як свої базові моделі, і кожне дерево в ансамблі будується за допомогою різних вибірок з набору даних. Також використовується випадковий підмножина функцій. Це призводить до високорандомізованих окремих дерев рішень, які об’єднуються разом для отримання надійних прогнозів.

Візуалізація ансамблевого стекінгу. Фото: Supun Setunga через Wikimedia Commons, CC BY S.A 4.0 (https://commons.wikimedia.org/wiki/File:Stacking.png)

Що стосується методів ансамблевого навчання, кілька регресійних або класифікаційних моделей об’єднуються разом через вищу, мета-модель. Низькорівневі базові моделі навчаються шляхом подачі їм всього набору даних. Вихід базових моделей потім використовується як функції для навчання мета-моделі. Моделі ансамблевого навчання часто гетерогенними за своєю природою.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.