Моделі та платформи ШІ

LightAutoML: Автоматична система машинного навчання для фінансових послуг

mm
Додайте Unite.AI до бажаних джерел у Google

Хоча автоматична система машинного навчання (AutoML) здобула популярність кілька років тому, перші роботи над AutoML датуються початку 90-х років, коли вчені опублікували перші статті про оптимізацію гіперпараметрів. У 2014 році ICML організував перший семінар AutoML, який привернув увагу розробників машинного навчання. Одним з основних напрямків роботи над AutoML протягом років є проблема пошуку гіперпараметрів, коли модель реалізує ряд методів оптимізації для визначення найкращих гіперпараметрів у великій області гіперпараметрів для конкретної моделі машинного навчання. Інший метод, який часто реалізується моделями AutoML, полягає в оцінці ймовірності того, що конкретний гіперпараметр є оптимальним для даної моделі машинного навчання. Модель досягає цього шляхом реалізації баєсових методів, які традиційно використовують історичні дані з попередньо оцінених моделей та інші набори даних. Крім оптимізації гіперпараметрів, інші методи намагаються вибрати найкращі моделі з простору моделей.

У цій статті ми розглянемо LightAutoML, систему AutoML, розроблену в першу чергу для європейської компанії, що працює в сфері фінансів, разом з її екосистемою. Фреймворк LightAutoML розгорнутий у різних застосунках, і результати демонструють вищу продуктивність, порівнянну з рівнем даних вчених, навіть при створенні високоякісних моделей машинного навчання. Фреймворк LightAutoML намагається зробити наступні внески. По-перше, фреймворк LightAutoML був розроблений в першу чергу для екосистеми великої європейської фінансової та банківської установи. Завдяки своїй архітектурі фреймворк LightAutoML能够 перевершити інші системи AutoML у декількох відкритих бенчмарках, а також у застосунках екосистеми. Продуктивність фреймворку LightAutoML також порівнюється з моделями, які налаштовуються вручну вченими-даними, і результати вказують на вищу продуктивність фреймворку LightAutoML.

Ця стаття має на меті розглянути фреймворк LightAutoML докладно, і ми досліджуємо механізм, методологію, архітектуру фреймворку разом з його порівнянням з іншими системами AutoML. Тому давайте почнемо.

LightAutoML: Автоматична система машинного навчання для фінансових послуг

Хоча дослідники вперше почали працювати над AutoML у середині та на початку 90-х років, AutoML привернула велику увагу за останні кілька років, з деякими промовистими промисловими рішеннями, які реалізують автоматично побудовані моделі машинного навчання, такі як AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML та багато інших. Більшість цих фреймворків реалізують загальну систему AutoML, яка розробляє моделі машинного навчання автоматично у різних класах застосунків у сфері фінансів, охорони здоров’я, освіти та інше. Основне припущення за цим горизонтальним підходом полягає в тому, що процес розробки автоматичних моделей залишається ідентичним для всіх застосунків. Однак фреймворк LightAutoML реалізує вертикальний підхід для розробки системи AutoML, яка не є загальною, а радше відповідає потребам окремих застосунків, у цьому випадку великої фінансової установи. Фреймворк LightAutoML є вертикальною системою AutoML, яка зосереджується на потребах складної екосистеми разом з її характеристиками. По-перше, фреймворк LightAutoML забезпечує швидкий і майже оптимальний пошук гіперпараметрів. Хоча модель не оптимізує ці гіперпараметри безпосередньо, вона все ж таки досягає задовільних результатів. Крім того, модель підтримує баланс між швидкістю та оптимізацією гіперпараметрів динамічно, щоб забезпечити оптимальність моделі на малих завданнях і достатню швидкість на більших завданнях. По-друге, фреймворк LightAutoML обмежує діапазон моделей машинного навчання свідомо лише двома типами: лінійними моделями та моделями градієнтного бустингу, замість реалізації великих ансамблів різних алгоритмів. Основна причина обмеження діапазону моделей машинного навчання полягає в тому, щоб прискорити час виконання фреймворку LightAutoML без негативного впливу на продуктивність для даного типу завдання та даних. По-третє, фреймворк LightAutoML пропонує унікальний метод вибору схем попередньої обробки для різних ознак, використовуваних у моделях на основі певних правил вибору та мета-статистики. Фреймворк LightAutoML оцінюється на широкому діапазоні відкритих джерел даних у різних застосунках.

LightAutoML: Методологія та архітектура

Фреймворк LightAutoML складається з модулів, відомих як Presets, які призначені для розробки моделей з кінця в кінець для типових завдань машинного навчання. На даний момент фреймворк LightAutoML підтримує модулі Preset. По-перше, Preset TabularAutoML зосереджується на вирішенні класичних завдань машинного навчання, визначених на табличних наборах даних. По-друге, Preset White-Box реалізує прості інтерпретовні алгоритми, такі як логістична регресія, замість кодування WoE або ваги доказів і дискретизованих ознак для вирішення задач бінарної класифікації на табличних даних. Реалізація простих інтерпретовних алгоритмів є звичайною практикою для моделювання ймовірності застосування через обмеження інтерпретації, пов’язані з різними факторами. По-третє, Preset NLP здатний поєднувати табличні дані з інструментами обробки природної мови, включаючи попередньо навчені глибокі моделі навчання та конкретні видобувачі ознак. Нарешті, Preset CV працює з даними зображень за допомогою деяких базових інструментів. Важливо відзначити, що хоча фреймворк LightAutoML підтримує всі чотири Presets, фреймворк використовує лише TabularAutoML у системі рівня виробництва.

Типовий конвеєр фреймворку LightAutoML включений у наступному зображенні.

Кожен конвеєр містить три компоненти. По-перше, Reader – об’єкт, який приймає тип завдання та вихідні дані як вхід, виконує важливі розрахунки метаданих, очищує початкові дані та визначає маніпуляції з даними, які потрібно виконати перед підгонкою різних моделей. Наступним, внутрішні набори даних LightAutoML містять ітератори CV та метадані, які реалізують схеми валідації для наборів даних. Третій компонент – це кілька конвеєрів машинного навчання, укладених і/або змішаних для отримання єдиного прогнозу. Конвеєр машинного навчання у архітектурі фреймворку LightAutoML – це один із кількох моделей машинного навчання, які спільно використовують єдину схему валідації та попередньої обробки даних. Крок попередньої обробки може містити до двох кроків вибору ознак, крок інженерії ознак або може бути порожнім, якщо попередня обробка не потрібна. Конвеєри машинного навчання можна обчислювати незалежно на одних і тих же наборах даних, а потім змішувати за допомогою усереднення (або зваженого усереднення). Альтернативно можна використовувати схему ансамблю стека для побудови багаторівневих архітектур ансамблю.

LightAutoML Tabular Preset

У фреймворку LightAutoML TabularAutoML є стандартним конвеєром, і він реалізований у моделі для вирішення трьох типів завдань на табличних даних: бінарної класифікації, регресії та багатокласової класифікації для широкого діапазону метрик продуктивності та функцій втрат. Таблиця з чотирма стовпцями: категорійними ознаками, числовими ознаками, метками часу та єдиною цільовою колонкою з мітками класів або безперервними значеннями, подається до компонента TabularAutoML як вхід. Одним із основних завдань при розробці фреймворку LightAutoML було створення інструменту для швидкого тестування гіпотез, тому фреймворк уникає використання методів грубої сили для оптимізації конвеєру та зосереджується лише на техніках та моделях, які працюють у широкому діапазоні наборів даних.

Авто-типізування та попередня обробка даних

Для обробки різних типів ознак по-різному модель需要 знати кожен тип ознаки. У ситуації, коли є єдине завдання з малим набором даних, користувач може вручну вказати кожен тип ознаки. Однак вказівка кожного типу ознаки вручну вже не є життєздатним варіантом у ситуаціях, які включають сотні завдань з наборами даних, що містять тисячі ознак. Для Preset TabularAutoML фреймворк LightAutoML потрібно відображати ознаки у три класи: числові, категорійні та дати. Одним із простих і очевидних рішень є використання типів даних масивів стовпців як фактичних типів ознак, тобто відображення колонок float/int у числові ознаки, колонок типу рядка, які можуть бути розібрані як дата, – у дати, і інші – у категорійні ознаки. Однак це відображення не є найкращим через часте виникнення числових типів даних у категорійних колонках.

Схеми валідації

Схеми валідації є важливим компонентом фреймворків AutoML, оскільки дані в галузі підлягають змінам з часом, і цей елемент змінювання робить припущення IID (незалежно та однаково розподілені) недійсними при розробці моделі. Моделі AutoML використовують схеми валідації для оцінки їхньої продуктивності, пошуку гіперпараметрів та генерації прогнозів за межами вибірки. Конвеєр TabularAutoML реалізує три схеми валідації:

  • KFold Перехрестна валідзація: KFold Перехрестна валідзація є стандартною схемою валідації для конвеєру TabularAutoML, включаючи GroupKFold для поведінкових моделей та стратифіковану KFold для завдань класифікації.
  • Валідзація Holdout: Схема валідації Holdout реалізується, якщо вказано набір Holdout.
  • ПUSTOM Схеми валідації: ПUSTOM схеми валідації можна створити користувачами залежно від їхніх індивідуальних потреб. ПUSTOM схеми валідації включають схеми перехрестної валідації та розрізнення часових рядів.

Вибір ознак

Хоча вибір ознак є важливим аспектом розробки моделей згідно з галузевими стандартами, оскільки він полегшує зниження витрат на висновок та реалізації моделі, більшість рішень AutoML не зосереджуються на цій проблемі. Навпаки, конвеєр TabularAutoML реалізує три стратегії вибору ознак: жодного вибору, вибору за допомогою порогу важливості та вибору вперед на основі важливості. З трьох стратегій вибір за допомогою порогу важливості є стандартним. Крім того, існують два основних способи оцінки важливості ознак: важливість дерева на основі розрізнення та важливість пермутації моделі градієнтного бустингу. Основна мета вибору за допомогою порогу важливості полягає в тому, щоб відхилити ознаки, які не корисні для моделі, що дозволяє моделі зменшити кількість ознак без негативного впливу на продуктивність, підхід, який може прискорити висновок моделі та навчання.

Вищезгадане зображення порівнює різні стратегії вибору на бінарних наборах даних банку.

Настройка гіперпараметрів

Конвеєр TabularAutoML реалізує різні підходи до настройки гіперпараметрів на основі того, що налаштовується.

  • Настройка гіперпараметрів з ранньою зупинкою вибирає кількість ітерацій для всіх моделей під час фази навчання.
  • Настройка гіперпараметрів за допомогою експертної системи є простим способом встановлення гіперпараметрів для моделей у задовільному вигляді. Вона запобігає зниженню продуктивності кінцевої моделі порівняно з жорстко налаштованими моделями.
  • Деревна структура Парзена оцінки або TPE для моделей градієнтного бустингу. TPE є змішаною стратегією налаштування, яка є стандартним вибором у конвеєрі LightAutoML. Для кожного фреймворку градієнтного бустингу фреймворк LightAutoML тренує дві моделі: перша отримує експертні гіперпараметри, друга доналаштовується для входження у бюджет часу.
  • Пошук гіперпараметрів за допомогою сітки реалізується у конвеєрі TabularAutoML для доналаштування параметрів регуляризації лінійної моделі поряд з ранньою зупинкою та теплим стартом.

Модель налаштовує всі параметри шляхом максимізації функції метрики, визначеної користувачем або за замовчуванням для вирішеного завдання.

LightAutoML: Експеримент та продуктивність

Для оцінки продуктивності Preset TabularAutoML у фреймворку LightAutoML порівнюється з існуючими відкритими рішеннями у різних завданнях, і підтверджує вищу продуктивність фреймворку LightAutoML. По-перше, порівняння проводиться на бенчмарку OpenML, який оцінюється на 35 бінарних та багатокласових завданнях класифікації. Наступна таблиця підсумовує порівняння фреймворку LightAutoML з іншими системами AutoML.

Як можна побачити, фреймворк LightAutoML перевершує інші системи AutoML у 20 наборах даних у бенчмарку. Наступна таблиця містить детальне порівняння у контексті набору даних, яке вказує на те, що фреймворк LightAutoML демонструє різну продуктивність на різних класах завдань. Для завдань бінарної класифікації фреймворк LightAutoML відстає за продуктивністю, тоді як для завдань з великою кількістю даних фреймворк LightAutoML демонструє вищу продуктивність.

Наступна таблиця порівнює продуктивність фреймворку LightAutoML з системами AutoML на 15 наборах даних банку, які містять набір різних завдань бінарної класифікації. Як можна побачити, фреймворк LightAutoML перевершує всі системи AutoML у 12 з 15 наборах даних, що становить 80% перемог.

Заключні думки

У цій статті ми говорили про LightAutoML, систему AutoML, розроблену в першу чергу для європейської компанії, що працює в сфері фінансів, разом з її екосистемою. Фреймворк LightAutoML розгорнутий у різних застосунках, і результати демонструють вищу продуктивність, порівнянну з рівнем даних вчених, навіть при створенні високоякісних моделей машинного навчання. Фреймворк LightAutoML намагається зробити наступні внески. По-перше, фреймворк LightAutoML був розроблений в першу чергу для екосистеми великої європейської фінансової та банківської установи. Завдяки своїй архітектурі фреймворк LightAutoML能够 перевершити інші системи AutoML у декількох відкритих бенчмарках, а також у застосунках екосистеми. Продуктивність фреймворку LightAutoML також порівнюється з моделями, які налаштовуються вручну вченими-даними, і результати вказують на вищу продуктивність фреймворку LightAutoML.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.