Modele i platformy AI
LightAutoML: Ramowy AutoML dla Usług Finansowych
Chociaż AutoML zyskało popularność kilka lat temu, wczesne prace nad AutoML sięgają początku lat 90., kiedy naukowcy opublikowali pierwsze artykuły na temat optymalizacji hiperparametrów. W 2014 roku ICML zorganizowało pierwszy warsztat AutoML, który przyciągnął uwagę deweloperów ML. Jednym z głównych celów AutoML przez lata była optymalizacja hiperparametrów, gdzie model implementuje szereg metod optymalizacji, aby określić najlepiej wykonujące się hiperparametry w dużym przestrzeni hiperparametrów dla określonego modelu uczenia maszynowego. Inną powszechnie stosowaną metodą przez modele AutoML jest oszacowanie prawdopodobieństwa, że dany hiperparametr jest optymalnym hiperparametrem dla danego modelu uczenia maszynowego. Model ten osiąga to, implementując metody bayesowskie, które tradycyjnie wykorzystują dane historyczne z wcześniej oszacowanych modeli i innych zbiorów danych. Ponadto do optymalizacji hiperparametrów, inne metody próbują wybrać najlepsze modele z przestrzeni alternatywnych modeli.
W tym artykule omówimy LightAutoML, system AutoML opracowany głównie dla europejskiej firmy działającej w sektorze finansowym wraz z jego ekosystemem. Ramy LightAutoML są wdrożone w różnych aplikacjach, a wyniki wykazały lepszą wydajność, porównywalną do poziomu naukowców danych, nawet przy budowaniu wysokiej jakości modeli uczenia maszynowego. Ramy LightAutoML próbują wnosić następujące wkład. Po pierwsze, ramy LightAutoML zostały opracowane głównie dla ekosystemu dużej europejskiej instytucji finansowej i bankowej. Dzięki swojej strukturze i architekturze, ramy LightAutoML są w stanie przewyższyć najnowocześniejsze ramy AutoML w kilku otwartych benchmarkach, a także w aplikacjach ekosystemu. Wydajność ram LightAutoML jest również porównywana z modelami, które są dostosowane ręcznie przez naukowców danych, a wyniki wskazują na lepszą wydajność ram LightAutoML.
Ten artykuł ma na celu omówienie ram LightAutoML w szczegółach, a my będziemy badać mechanizm, metodologię, architekturę ram, a także ich porównanie z najnowocześniejszymi ramami. Zatem zacznijmy.
LightAutoML: Ramy AutoML dla Usług Finansowych
Chociaż naukowcy zaczęli pracę nad AutoML w połowie i na początku lat 90., AutoML przyciągnęło znaczną uwagę w ciągu ostatnich kilku lat, z niektórymi z najbardziej znanych rozwiązań przemysłowych, które automatycznie budują modele uczenia maszynowego, takimi jak Amazon’s (AMZN ) AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML i wiele innych. Większość tych ram implementuje ogólny cel AutoML, który rozwija modele ML automatycznie w różnych klasach aplikacji w sektorach finansowych, opieki zdrowotnej, edukacji i innych. Kluczowe założenie za tym powszechnym podejściem jest to, że proces tworzenia automatycznych modeli pozostaje identyczny we wszystkich aplikacjach. Jednak ramy LightAutoML implementują pionowe podejście do tworzenia rozwiązania AutoML, które nie jest ogólne, ale raczej dostosowane do potrzeb poszczególnych aplikacji, w tym przypadku dużej instytucji finansowej. Ramy LightAutoML są pionowym rozwiązaniem AutoML, które koncentruje się na wymaganiach złożonego ekosystemu wraz z jego cechami.
LightAutoML: Metodologia i Architektura
Ramy LightAutoML składają się z modułów zwanych Preset, które są przeznaczone do rozwoju modelu od początku do końca dla typowych zadań uczenia maszynowego. Obecnie ramy LightAutoML obsługują moduły Preset. Po pierwsze, Preset TabularAutoML koncentruje się na rozwiązywaniu klasycznych problemów uczenia maszynowego zdefiniowanych na danych tabelarycznych. Po drugie, Preset White-Box implementuje proste algorytmy interpretowalne, takie jak regresja logistyczna, zamiast WoE lub wagi dowodu i dyskretnych cech, aby rozwiązać zadania klasyfikacji binarnej na danych tabelarycznych. Implementowanie prostych algorytmów interpretowalnych jest powszechną praktyką w modelowaniu prawdopodobieństwa aplikacji ze względu na ograniczenia interpretowalności narzucane przez różne czynniki. Po trzecie, Preset NLP jest w stanie łączyć dane tabelaryczne z narzędziami NLP, w tym z pre-trenowanymi głębokimi modelami uczenia i specyficznymi wyodrębnianiami cech. Na koniec Preset CV działa z danymi obrazowymi przy użyciu podstawowych narzędzi. Ważne jest, aby zauważyć, że chociaż model LightAutoML obsługuje wszystkie cztery Preset, ramy używają tylko TabularAutoML w systemie produkcyjnym.
Typowy potok ram LightAutoML jest zawarty w poniższym obrazie.

Każdy potok składa się z trzech składników. Po pierwsze, czytelnik, obiekt, który otrzymuje typ zadania i surowe dane jako dane wejściowe, wykonuje kluczowe obliczenia metadanych, czyści dane początkowe i określa manipulacje danymi, które mają być wykonane przed dopasowaniem różnych modeli. Następnie, wewnętrzne zestawy danych LightAutoML zawierają iteratory CV i metadane, które implementują schematy walidacji dla zestawów danych. Trzeci składnik to wiele potoków uczenia maszynowego, które są stosowane i/lub mieszane, aby uzyskać pojedynczą przewidywanie. Potok uczenia maszynowego w ramach architektury LightAutoML jest jednym z wielu modeli uczenia maszynowego, które dzielą jeden schemat walidacji i przetwarzania danych. Krok przetwarzania może zawierać do dwóch kroków wyboru cech, krok inżynierii cech lub może być pusty, jeśli nie jest wymagane przetwarzanie. Potoki ML mogą być obliczane niezależnie na tych samych zestawach danych, a następnie mieszane razem za pomocą średniej (lub ważonej średniej). Alternatywnie można użyć schematu ensemble stacking, aby zbudować wielopoziomowe architektury ensemble.
LightAutoML Tabular Preset
W ramach LightAutoML, TabularAutoML jest domyślnym potokiem i jest implementowany w modelu w celu rozwiązania trzech typów zadań na danych tabelarycznych: klasyfikacji binarnej, regresji i klasyfikacji wieloklasowej dla szerokiego zakresu miar wydajności i funkcji strat. Tabela z czterema kolumnami: cechami kategorialnymi, cechami numerycznymi, znacznikami czasu i jedną kolumną docelową z etykietami klas lub ciągłymi wartościami jest podawana do komponentu TabularAutoML jako dane wejściowe. Jednym z głównych celów projektu ram LightAutoML było stworzenie narzędzia do szybkiego testowania hipotez, co jest głównym powodem, dla którego ramy unikają używania metod brute-force do optymalizacji potoku i koncentrują się tylko na technikach efektywności i modelach, które działają w szerokim zakresie zestawów danych.
Auto-Typing i Przetwarzanie Danych
Aby obsłużyć różne typy cech w różny sposób, model musi wiedzieć, jaki jest każdy typ cechy. W sytuacji, w której jest jeden zadanie z małym zestawem danych, użytkownik może ręcznie określić każdy typ cechy. Jednak określanie każdego typu cechy ręcznie nie jest już opcją w sytuacjach, które obejmują setki zadań z zestawami danych zawierającymi tysiące cech. Dla Preset TabularAutoML ramy LightAutoML muszą mapować cechy na trzy klasy: numeryczne, kategoryczne i datetime. Jednym prostym i oczywistym rozwiązaniem jest użycie typów danych tablic do rzeczywistych typów cech, czyli mapowanie kolumn float/int na cechy numeryczne, znaczniki czasu lub ciągi, które mogą być sparsowane jako znaczniki czasu — do datetime, a inne do kategorii. Jednak to mapowanie nie jest najlepsze ze względu na częste występowanie typów danych numerycznych w kolumnach kategorialnych.
Schematy Walidacji
Schematy walidacji są istotnym składnikiem ram AutoML, ponieważ dane w branży są podatne na zmiany w czasie, co sprawia, że założenia IID (niezależne i identycznie rozłożone) stają się nieistotne przy tworzeniu modelu. Modele AutoML wykorzystują schematy walidacji, aby oszacować ich wydajność, wyszukać hiperparametry i wygenerować przewidywania poza foldami. Potok TabularAutoML implementuje trzy schematy walidacji:
- KFold Cross Validation: KFold Cross Validation jest domyślnym schematem walidacji dla potoku TabularAutoML, w tym GroupKFold dla modeli behawioralnych i stratyfikowanego KFold dla zadań klasyfikacji.
- Holdout Validation: Schemat walidacji Holdout jest implementowany, jeśli zestaw Holdout jest określony.
- Custom Validation Schemes: Użytkownicy mogą tworzyć niestandardowe schematy walidacji w zależności od ich indywidualnych wymagań. Niestandardowe schematy walidacji obejmują schematy podziału krzyżowego i schematy podziału szeregów czasowych.
Wybór Cech
Chociaż wybór cech jest istotnym aspektem tworzenia modeli zgodnie z normami branżowymi, ponieważ ułatwia redukcję kosztów inferencji i wdrożenia modelu, większość rozwiązań AutoML nie koncentruje się zbyt dużo na tym problemie. Z drugiej strony, potok TabularAutoML implementuje trzy strategie wyboru cech: brak wyboru, wybór zgodnie z prógiem ważności i wybór w przód zgodnie z ważnością. Spośród trzech, wybór zgodnie z prógiem ważności jest domyślny. Ponadto istnieją dwa główne sposoby oszacowania ważności cech: ważność oparta na drzewie i ważność permutacji modelu GBM lub gradientowego drzewa decyzyjnego. Głównym celem wyboru zgodnie z prógiem ważności jest odrzucenie cech, które nie są pomocne dla modelu, co pozwala modelowi zmniejszyć liczbę cech bez negatywnego wpływu na wydajność, co może przyspieszyć inferencję modelu i szkolenie.

Powyższy obraz porównuje różne strategie wyboru na danych bankowych binarnych.
Dostosowanie Hiperparametrów
Potok TabularAutoML implementuje różne podejścia do dostosowania hiperparametrów w zależności od tego, co jest dostosowywane.
- Wczesne Zatrzymanie Dostosowania Hiperparametrów wybiera liczbę iteracji dla wszystkich modeli podczas fazy szkolenia.
- System Ekspertowy Dostosowania Hiperparametrów jest prostym sposobem ustawienia hiperparametrów dla modeli w satysfakcjonujący sposób. Zapobiega ostatecznemu modelowi dużemu spadkowi wyniku w porównaniu z modelami dostosowanymi.
- Drzewo Struktury Parzena lub TPE dla modeli GBM lub gradientowych drzew decyzyjnych. TPE jest mieszana strategią dostosowania, która jest domyślnym wyborem w potoku LightAutoML. Dla każdego modelu GBM, ramy LightAutoML trenują dwa modele: pierwszy otrzymuje hiperparametry ekspertów, a drugi jest dostosowany do dopasowania do budżetu czasowego.
- Wyszukiwanie Siatkowe Dostosowania Hiperparametrów jest implementowane w potoku TabularAutoML w celu dostosowania parametrów regularyzacji modelu liniowego wraz z wczesnym zatrzymaniem i rozgrzewką.
Model dostosowuje wszystkie parametry, maksymalizując funkcję metryki, określoną przez użytkownika lub domyślną dla rozwiązywanego zadania.

LightAutoML: Eksperyment i Wydajność
Aby ocenić wydajność, Preset TabularAutoML w ramach LightAutoML jest porównywany z istniejącymi otwartymi rozwiązaniami w różnych zadaniach i potwierdza lepszą wydajność ram LightAutoML. Po pierwsze, porównanie jest przeprowadzane na benchmarku OpenML, który jest oceniany na 35 zadaniach klasyfikacji binarnej i wieloklasowej. Poniższa tabela podsumowuje porównanie ram LightAutoML z istniejącymi systemami AutoML.

Jak widać, ramy LightAutoML przewyższają wszystkie inne systemy AutoML w 20 zestawach danych w ramach benchmarku. Poniższa tabela zawiera szczegółowe porównanie w kontekście zestawu danych, wskazując, że LightAutoML dostarcza różną wydajność w różnych klasach zadań. Dla zadań klasyfikacji binarnej, LightAutoML ma gorszą wydajność, natomiast dla zadań z dużą ilością danych, ramy LightAutoML dostarczają lepszą wydajność.

Poniższa tabela porównuje wydajność ram LightAutoML z systemami AutoML w 15 zestawach danych bankowych zawierających zestaw zadań klasyfikacji binarnej. Jak można zauważyć, LightAutoML przewyższa wszystkie systemy AutoML w 12 z 15 zestawów danych, co daje wskaźnik wygranych na poziomie 80.

Końcowe Myśli
W tym artykule omówiliśmy LightAutoML, system AutoML opracowany głównie dla europejskiej firmy działającej w sektorze finansowym wraz z jego ekosystemem. Ramy LightAutoML są wdrożone w różnych aplikacjach, a wyniki wykazały lepszą wydajność, porównywalną do poziomu naukowców danych, nawet przy budowaniu wysokiej jakości modeli uczenia maszynowego. Ramy LightAutoML próbują wnosić następujące wkład. Po pierwsze, ramy LightAutoML zostały opracowane głównie dla ekosystemu dużej europejskiej instytucji finansowej i bankowej. Dzięki swojej strukturze i architekturze, ramy LightAutoML są w stanie przewyższyć najnowocześniejsze ramy AutoML w kilku otwartych benchmarkach, a także w aplikacjach ekosystemu. Wydajność ram LightAutoML jest również porównywana z modelami, które są dostosowane ręcznie przez naukowców danych, a wyniki wskazują na lepszą wydajność ram LightAutoML.












