Модели и платформы ИИ

LightAutoML: Автоматизированная система машинного обучения для финансовых услуг

mm
Добавьте Unite.AI в избранные источники в Google

Хотя автоматизированное машинное обучение (AutoML) приобрело популярность несколько лет назад, первые работы по AutoML датированы началом 90-х годов, когда ученые опубликовали первые статьи по оптимизации гиперпараметров. В 2014 году на конференции ICML была организована первая рабочая группа по AutoML, и с тех пор AutoML привлекло внимание разработчиков машинного обучения. Одним из основных направлений исследований в области AutoML является проблема поиска гиперпараметров, когда модель реализует различные методы оптимизации для определения наиболее эффективных гиперпараметров для конкретной модели машинного обучения. Другой метод, часто используемый моделями AutoML, заключается в оценке вероятности того, что определенный гиперпараметр является оптимальным для данной модели машинного обучения. Для этого модель использует байесовские методы, которые традиционно используют исторические данные из предыдущих оценок моделей и другие наборы данных. Помимо оптимизации гиперпараметров, другие методы пытаются выбрать лучшие модели из набора альтернативных моделей.

В этой статье мы рассмотрим LightAutoML, систему AutoML, разработанную в основном для европейской компании, работающей в финансовом секторе, а также ее экосистемы. Фреймворк LightAutoML развернут в различных приложениях, и результаты показали превосходную производительность, сопоставимую с уровнем данных ученых, даже при построении высококачественных моделей машинного обучения. Фреймворк LightAutoML стремится сделать следующие вклады. Во-первых, фреймворк LightAutoML был разработан в основном для экосистемы крупного европейского финансового и банковского учреждения. Благодаря своей архитектуре фреймворк LightAutoML способен превосходить существующие системы AutoML по нескольким открытым бенчмаркам, а также по приложениям экосистемы. Производительность фреймворка LightAutoML также сравнивается с моделями, настроенными вручную данными учеными, и результаты показали более сильную производительность фреймворка LightAutoML.

Эта статья направлена на подробное описание фреймворка LightAutoML, и мы исследуем механизм, методологию, архитектуру фреймворка, а также его сравнение с существующими системами. Итак, давайте начнем.

LightAutoML: Автоматизированная система машинного обучения для финансовых услуг

Хотя исследователи впервые начали работать над AutoML в середине и начале 90-х годов, AutoML привлекло значительную часть внимания в последние годы, и некоторые из наиболее заметных промышленных решений реализуют автоматически построенные модели машинного обучения, такие как AutoGluon от Amazon (AMZN ), DarwinAI, H20.ai, IBM Watson AI и Microsoft (MSFT ) AzureML. Большинство этих фреймворков реализуют общую систему AutoML, которая разрабатывает модели машинного обучения автоматически для различных классов приложений в финансовых услугах, здравоохранении, образовании и других областях. Основное предположение за этой горизонтальной общей подходом заключается в том, что процесс разработки автоматических моделей остается идентичным для всех приложений. Однако фреймворк LightAutoML реализует вертикальный подход для разработки системы AutoML, которая не является общей, а rather ориентирована на потребности отдельных приложений, в данном случае крупного финансового учреждения. Фреймворк LightAutoML является вертикальной системой AutoML, которая фокусируется на требованиях сложной экосистемы, а также ее характеристик. Во-первых, фреймворк LightAutoML обеспечивает быстрый и gần оптимальный поиск гиперпараметров. Хотя модель не оптимизирует эти гиперпараметры直接, она способна доставлять удовлетворительные результаты. Кроме того, модель сохраняет баланс между скоростью и оптимизацией гиперпараметров динамически, чтобы обеспечить оптимальность модели на небольших задачах и достаточную скорость на более крупных задачах. Во-вторых, фреймворк LightAutoML ограничивает диапазон моделей машинного обучения намеренно только двумя типами: линейными моделями и моделями GBM (градиентный бустинг). Основная причина ограничения диапазона моделей машинного обучения заключается в том, чтобы ускорить время выполнения фреймворка LightAutoML без негативного влияния на производительность для данного типа задачи и данных. В-третьих, фреймворк LightAutoML представляет уникальный метод выбора схем предварительной обработки для различных функций, используемых в моделях на основе определенных правил и мета-статистики. Фреймворк LightAutoML оценивается на широком диапазоне открытых источников данных по различным приложениям.

LightAutoML: Методология и архитектура

Фреймворк LightAutoML состоит из модулей, известных как Presets, которые предназначены для разработки моделей машинного обучения от начала до конца для типичных задач машинного обучения. В настоящее время фреймворк LightAutoML поддерживает модули Preset. Во-первых, Preset TabularAutoML фокусируется на решении классических задач машинного обучения, определенных на табличных наборах данных. Во-вторых, Preset White-Box реализует простые интерпретируемые алгоритмы, такие как логистическая регрессия, вместо WoE (веса доказательств) или дискретизации функций для решения задач бинарной классификации на табличных данных. Реализация простых интерпретируемых алгоритмов является общей практикой для моделирования вероятности заявки из-за ограничений интерпретируемости, налагаемых различными факторами. В-третьих, Preset NLP способен объединять табличные данные с инструментами NLP (обработки естественного языка), включая предварительно обученные глубокие модели и конкретные извлекатели функций. Наконец, Preset CV работает с данными изображений с помощью некоторых базовых инструментов. Важно отметить, что хотя модель LightAutoML поддерживает все четыре Preset, фреймворк использует только TabularAutoML в системе производства.

Типичный конвейер фреймворка LightAutoML включен в следующем изображении.

Каждый конвейер содержит три компонента. Во-первых, Reader – объект, который получает тип задачи и сырые данные в качестве входных данных, выполняет важные расчеты метаданных, очищает начальные данные и определяет манипуляции с данными, которые необходимо выполнить перед подачей моделей. Далее, внутренние наборы данных LightAutoML содержат итераторы CV и метаданные, которые реализуют схемы проверки для наборов данных. Третий компонент – несколько конвейеров машинного обучения, сложенных и/или смешанных для получения единого прогноза. Конвейер машинного обучения в архитектуре фреймворка LightAutoML – один из нескольких моделей машинного обучения, которые делят единую схему проверки и предварительной обработки данных. Шаг предварительной обработки может иметь до двух шагов выбора функций, шаг инженерии функций или может быть пустым, если предварительная обработка не требуется. Конвейеры машинного обучения могут быть вычислены независимо на одних и тех же наборах данных, а затем смешаны вместе с помощью усреднения (или взвешенного усреднения). Альтернативно можно использовать схему стэкинга для построения многоуровневых ансамблевых архитектур.

LightAutoML Tabular Preset

В фреймворке LightAutoML TabularAutoML является конвейером по умолчанию, и он реализован в модели для решения трех типов задач на табличных данных: бинарной классификации, регрессии и многоклассовой классификации для широкого диапазона метрик производительности и функций потерь. Таблица с четырьмя столбцами: категориальные функции, числовые функции, временные метки и один столбец целей с метками классов или непрерывными значениями, подается в компонент TabularAutoML в качестве входных данных. Одной из основных целей проектирования фреймворка LightAutoML было создание инструмента для быстрого тестирования гипотез, поэтому фреймворк избегает использования методов грубой силы для оптимизации конвейера и фокусируется только на эффективных методах и моделях, которые работают на широком диапазоне наборов данных.

Авто-типизация и предварительная обработка данных

Для обработки различных типов функций по-разному модель должна знать каждый тип функции. В ситуации, когда есть одна задача с небольшим набором данных, пользователь может вручную указать каждый тип функции. Однако указание каждого типа функции вручную больше не является жизнеспособным вариантом в ситуациях, которые включают сотни задач с наборами данных, содержащими тысячи функций. Для Preset TabularAutoML фреймворк LightAutoML должен сопоставить функции с тремя классами: числовыми, категориальными и datetime. Одно простое и очевидное решение – использовать типы данных массивов столбцов в качестве фактических типов функций, т.е. сопоставить столбцы float/int с числовыми функциями, timestamp или строку, которая может быть проанализирована как timestamp, – с datetime, и другие – с категориальными. Однако это сопоставление не является лучшим из-за частого возникновения числовых типов данных в категориальных столбцах.

Схемы проверки

Схемы проверки являются важным компонентом фреймворков AutoML, поскольку данные в отрасли подвержены изменениям со временем, и этот элемент изменчивости делает предположения IID (независимые и одинаково распределенные) неактуальными при разработке модели. Модели AutoML используют схемы проверки для оценки их производительности, поиска гиперпараметров и генерации прогнозов вне折ов. Конвейер TabularAutoML реализует три схемы проверки:

  • KFold Cross Validation: KFold Cross Validation является схемой проверки по умолчанию для конвейера TabularAutoML, включая GroupKFold для поведенческих моделей и стратифицированную KFold для задач классификации.
  • Holdout Validation: Схема проверки Holdout реализуется, если указан набор holdout.
  • Пользовательские схемы проверки: Пользовательские схемы проверки могут быть созданы пользователями в зависимости от их индивидуальных требований. Пользовательские схемы проверки включают схемы перекрестной проверки и схемы разделения временных рядов.

Выбор функций

Хотя выбор функций является важным аспектом разработки моделей в соответствии с отраслевыми стандартами, поскольку он облегчает снижение затрат на вывод и реализацию моделей, большинство решений AutoML не уделяют этому проблеме достаточного внимания. Напротив, конвейер TabularAutoML реализует три стратегии выбора функций: без выбора, выбор на основе важности с отсечением и выбор на основе важности с прямым отбором. Из них стратегия выбора на основе важности с отсечением является стратегией по умолчанию. Кроме того, есть два основных способа оценить важность функций: важность на основе разбиения дерева и важность на основе перестановки модели GBM (градиентный бустинг). Основная цель стратегии выбора на основе важности с отсечением заключается в том, чтобы отклонить функции, которые не полезны для модели, позволяя модели снизить количество функций без негативного влияния на производительность, подход, который может ускорить вывод и обучение модели.

Изображение выше сравнивает различные стратегии выбора на наборе данных банка.

Настройка гиперпараметров

Конвейер TabularAutoML реализует различные подходы для настройки гиперпараметров на основе того, что настраивается.

  • Раннее остановление настройки гиперпараметров: Выбирает количество итераций для всех моделей во время фазы обучения.
  • Настройка гиперпараметров на основе экспертной системы: Простой способ задать гиперпараметры для моделей в удовлетворительном виде. Он предотвращает окончательную модель от значительного снижения балла по сравнению с жестко настроенными моделями.
  • Деревянная структура Парзена (TPE): Для моделей GBM (градиентный бустинг). TPE – это смешанная стратегия настройки, которая является выбором по умолчанию в конвейере LightAutoML. Для каждой модели GBM фреймворк LightAutoML обучает две модели: первую с экспертными гиперпараметрами, вторую – с тонкой настройкой для соответствия бюджету времени.
  • Поиск по сетке настройки гиперпараметров: Реализуется в конвейере TabularAutoML для тонкой настройки параметров регуляризации линейной модели, а также раннего останова и теплого старта.

Модель настраивает все параметры, максимизируя функцию метрики, либо определенной пользователем, либо по умолчанию для решаемой задачи.

LightAutoML: Эксперимент и производительность

Для оценки производительности Preset TabularAutoML внутри фреймворка LightAutoML сравнивается с существующими открытыми решениями по различным задачам и демонстрирует превосходную производительность фреймворка LightAutoML. Во-первых, сравнение проводится на бенчмарке OpenML, который оценивается на 35 задачах бинарной и многоклассовой классификации. Следующая таблица суммирует сравнение фреймворка LightAutoML с существующими системами AutoML.

Как видно, фреймворк LightAutoML превосходит все другие системы AutoML на 20 наборах данных в бенчмарке. Следующая таблица содержит подробное сравнение в контексте набора данных, указывающее на то, что фреймворк LightAutoML демонстрирует разную производительность на разных классах задач. Для задач бинарной классификации фреймворк LightAutoML отстает в производительности, тогда как для задач с большим количеством данных фреймворк LightAutoML демонстрирует превосходную производительность.

Следующая таблица сравнивает производительность фреймворка LightAutoML с системами AutoML на 15 наборах данных банка, содержащих набор задач бинарной классификации. Как можно наблюдать, фреймворк LightAutoML превосходит все системы AutoML на 12 из 15 наборов данных, что соответствует проценту побед в 80.

Окончательные мысли

В этой статье мы говорили о LightAutoML, системе AutoML, разработанной в основном для европейской компании, работающей в финансовом секторе, а также ее экосистемы. Фреймворк LightAutoML развернут в различных приложениях, и результаты показали превосходную производительность, сопоставимую с уровнем данных ученых, даже при построении высококачественных моделей машинного обучения. Фреймворк LightAutoML стремится сделать следующие вклады. Во-первых, фреймворк LightAutoML был разработан в основном для экосистемы крупного европейского финансового и банковского учреждения. Благодаря своей архитектуре фреймворк LightAutoML способен превосходить существующие системы AutoML по нескольким открытым бенчмаркам, а также по приложениям экосистемы. Производительность фреймворка LightAutoML также сравнивается с моделями, настроенными вручную данными учеными, и результаты показали более сильную производительность фреймворка LightAutoML.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.