Modely a platformy AI

LightAutoML: AutoML Řešení pro Velké Finanční Služby

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Ačkoli se AutoML stal populárním před několika lety, raná práce na AutoML sahá až do počátku 90. let, kdy vědci publikovali první články o optimalizaci hyperparametrů. V roce 2014, kdy ICML uspořádal první AutoML workshop, AutoML získal pozornost vývojářů ML. Jedním z hlavních zaměřených oblastí AutoML v průběhu let je problém hledání hyperparametrů, kde model implementuje řadu optimalizačních metod pro určení nejlepších hyperparametrů v velkém hyperparametrickém prostoru pro konkrétní model strojového učení. Další metodou, kterou AutoML modely často implementují, je odhad pravděpodobnosti, že konkrétní hyperparametr je optimálním hyperparametrem pro daný model strojového učení. Model dosahuje tohoto implementováním bayesovských metod, které tradičně využívají historická data z předchozích odhadnutých modelů a dalších dat. Kromě optimalizace hyperparametrů se další metody snaží vybrat nejlepší modely z prostoru modelových alternativ.

V tomto článku budeme pokrývat LightAutoML, AutoML systém vyvinutý primárně pro evropskou společnost působící ve finančním sektoru a jeho ekosystému. Rámec LightAutoML je nasazen napříč různými aplikacemi a výsledky prokázaly lepší výkon, srovnatelný s úrovní datových vědců, i při vytváření vysoce kvalitních modelů strojového učení. Rámec LightAutoML se snaží učinit následující příspěvky. První, rámec LightAutoML byl vyvinut primárně pro ekosystém velké evropské finanční a bankovní instituce. Díky svému rámci a architektuře je rámec LightAutoML schopen outperformovat stávající AutoML rámce napříč několika otevřenými benchmarky a aplikacemi ekosystému. Výkon rámce LightAutoML je také porovnán s modely, které jsou ručně laděny datovými vědci, a výsledky ukazují lepší výkon rámce LightAutoML.

Tento článek si klade za cíl pokrývat rámec LightAutoML v hloubce a prozkoumáme mechanismus, metodologii, architekturu rámce a jeho srovnání se stávajícími rámci. Takže pojďme začít.

LightAutoML: AutoML Rámec pro Finanční Služby

Ačkoli výzkumníci poprvé začali pracovat na AutoML v polovině a na počátku 90. let, AutoML získal velkou pozornost v posledních letech, s některými prominentními průmyslovými řešeními, která implementují automaticky vytvořené modely strojového učení, jako je Amazonův AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML a mnoho dalších. Většina těchto rámců implementuje obecné AutoML řešení, které vyvíjí modely strojového učení automaticky napříč různými třídami aplikací ve finančních službách, zdravotnictví, vzdělávání a dalších. Hlavní předpoklad za touto horizontální obecnou přístupem je, že proces vytváření automatických modelů zůstává stejný napříč všemi aplikacemi. Nicméně, rámec LightAutoML implementuje vertikální přístup k vývoji AutoML řešení, který není obecný, ale spíše se zaměřuje na potřeby jednotlivých aplikací, v tomto případě velké finanční instituce. Rámec LightAutoML je vertikální AutoML řešení, které se zaměřuje na potřeby komplexního ekosystému a jeho charakteristik. První, rámec LightAutoML poskytuje rychlý a téměř optimální hyperparametrický výpočet. Ačkoli model tyto hyperparametry přímo neoptimalizuje, dokáže dodat uspokojivé výsledky. Kromě toho model udržuje rovnováhu mezi rychlostí a hyperparametrickou optimalizací dynamicky, aby zajistil, že model je optimální na malých problémech a dostatečně rychlý na větších problémech. Druhý, rámec LightAutoML záměrně omezuje rozsah modelů strojového učení pouze na dva typy: lineární modely a GBM nebo gradient boosted decision trees, místo implementace velkých ensemblů různých algoritmů. Hlavním důvodem omezení rozsahu modelů strojového učení je urychlit dobu provádění rámce LightAutoML bez negativního dopadu na výkon pro daný typ problému a data. Třetí, rámec LightAutoML představuje jedinečnou metodu výběru předzpracování schémat pro různé funkce používané v modelech na základě určitých výběrových pravidel a meta-statistik. Rámec LightAutoML je vyhodnocen na širokém rozsahu otevřených zdrojů dat napříč širokým rozsahem aplikací.

LightAutoML: Metodologie a Architektura

Rámec LightAutoML se skládá z modulů nazývaných Předvolby, které jsou určeny pro kompletní vývoj modelů pro typické úkoly strojového učení. V současné době rámec LightAutoML podporuje Předvolby moduly. První, Předvolba TabularAutoML se zaměřuje na řešení klasických problémů strojového učení definovaných na tabulárních datech. Druhý, Předvolba White-Box implementuje jednoduché interpretovatelné algoritmy, jako je logistická regrese, místo WoE nebo Weight of Evidence encoding a diskrétních funkcí pro řešení binárních klasifikačních úkolů na tabulárních datech. Implementace jednoduchých interpretovatelných algoritmů je běžnou praxí pro modelování pravděpodobnosti aplikace kvůli interpretovatelným omezením různých faktorů. Třetí, Předvolba NLP je schopna kombinovat tabulární data s NLP nebo Natural Language Processing nástroji, včetně předem trénovaných hlubokých učících se modelů a specifických funkcí extraktorů. Nakonec, Předvolba CV pracuje s obrazovými daty s pomocí některých základních nástrojů. Je důležité poznamenat, že ačkoli model LightAutoML podporuje všechny čtyři Předvolby, rámec používá pouze TabularAutoML v produkčním systému.

Typický pipeline rámce LightAutoML je zahrnut v následující obraz.

Každý pipeline obsahuje tři komponenty. První, Čtenář, objekt, který přijímá typ úkolu a surová data jako vstup, provádí důležité metadata výpočty, čistí počáteční data a určuje datové manipulace, které mají být provedeny před přizpůsobením různých modelů. Další, vnitřní datové sady LightAutoML obsahují CV iterátory a metadata, které implementují validační schémata pro datové sady. Třetí komponenty jsou multiple modely strojového učení zásobené a/nebo smísené, aby se získala jediná předpověď. Model strojového učení v rámci architektury rámce LightAutoML je jeden z více modelů strojového učení, které sdílejí společné validační a předzpracovací schéma. Krok předzpracování může mít až dva kroky výběru funkcí, krok inženýrství funkcí nebo může být prázdný, pokud není potřeba žádné předzpracování. Modely strojového učení lze vypočítat nezávisle na stejných datech a poté smíchat pomocí průměru (nebo vázaného průměru). Alternativně lze použít schéma zásobení pro sestavení víceúrovňových ensemblových architektur.

LightAutoML Tabulární Předvolba

V rámci rámce LightAutoML je TabularAutoML výchozím pipeline a je implementován v modelu pro řešení tří typů úkolů na tabulárních datech: binární klasifikace, regrese a multi-klasifikační úkoly pro široký rozsah výkonových metrik a funkcí ztrát. Tabulka se čtyřmi sloupci: kategoriální funkce, numerické funkce, časové razítko a jeden cílový sloupec s třídami nebo kontinuální hodnotou, je krmena do komponenty TabularAutoML jako vstup. Jedním z hlavních cílů návrhu rámce LightAutoML bylo navrhnout nástroj pro rychlé testování hypotéz, hlavní důvod, proč rámec se vyhnul použití hrubých metod pro optimalizaci pipeline a zaměřil se pouze na efektivní techniky a modely, které fungují napříč širokým rozsahem dat.

Auto-Typing a Předzpracování Dat

Pro zpracování různých typů funkcí různými způsoby model potřebuje znát každý typ funkce. V situaci, kde je jeden úkol s malou datovou sadou, uživatel může ručně specifikovat každý typ funkce. Nicméně, ruční specifikace každého typu funkce již není životaschopnou možností v situacích, které zahrnují stovky úkolů s datovými sadami obsahujícími tisíce funkcí. Pro Předvolbu TabularAutoML rámec LightAutoML potřebuje mapovat funkce do tří tříd: numerické, kategorie a datum. Jednoduché a zřejmé řešení je použít datové typy pole jako skutečné typy funkcí, tj. mapovat float/int sloupce na numerické funkce, timestamp nebo řetězec, který může být rozložen jako timestamp — na datum, a ostatní na kategorie. Nicméně, toto mapování není nejlepší kvůli častému výskytu numerických datových typů v kategoriálních sloupcích.

Validační Schémata

Validační schémata jsou vitální součástí rámců AutoML, protože data v průmyslu jsou podléhají změnám v čase, a tento prvek změny činí předpoklady IID nebo Independent Identically Distributed irelevantními při vývoji modelu. Modely AutoML využívají validační schémata pro odhad jejich výkonu, hledání hyperparametrů a generování předpovědí. Pipeline TabularAutoML implementuje tři validační schémata:

  • KFold Cross Validace: KFold Cross Validace je výchozím validačním schématem pro pipeline TabularAutoML, včetně GroupKFold pro behaviorální modely a stratifikované KFold pro klasifikační úkoly.
  • Holdout Validace: Schéma Holdout validace je implementováno, pokud je specifikována holdout sada.
  • Vlastní Vyhodnocení Schémata: Vlastní validační schémata lze vytvořit uživateli v závislosti na jejich individuálních požadavcích. Vlastní validační schémata zahrnují cross-validaci a časové rozdělení schémata.

Výběr Funkcí

Ačkoli výběr funkcí je kritickou součástí vývoje modelů podle průmyslových standardů, protože usnadňuje snížení nákladů na inference a implementaci modelů, většina řešení AutoML se na tento problém příliš nezaměřuje. Naopak, pipeline TabularAutoML implementuje tři strategie výběru funkcí: žádná selekce, selekce Importance cut off a selekce založená na Importance-based forward. Z těchto tří je selekce Importance cut off výchozí. Kromě toho existují dva hlavní způsoby, jak odhadnout důležitost funkcí: split-based tree importance a permutation importance modelu GBM nebo gradient boosted decision trees. Hlavním cílem selekce Importance cut off je odmítnout funkce, které nejsou pro model užitečné, což umožňuje modelu snížit počet funkcí bez negativního dopadu na výkon, přístup, který může urychlit inference a trénink modelu.

Výše uvedená obraz porovnává různé výběrové strategie na binárních bankovních datech.

Hyperparametrické Ladění

Pipeline TabularAutoML implementuje různé přístupy k ladění hyperparametrů na základě toho, co je laděno.

  • Brzké Ukončení Hyperparametrického Ladění: vybírá počet iterací pro všechny modely během fáze trénování.
  • Odborný Systém Hyperparametrického Ladění: je jednoduchým způsobem, jak nastavit hyperparametry pro modely v uspokojivém způsobem. Zabrání konečnému modelu před velkým poklesem skóre ve srovnání s tvrdě laděnými modely.
  • Stromové Strukturované Parzenovo Odhadnutí nebo TPE: pro modely GBM nebo gradient boosted decision trees. TPE je smíšená ladění strategie, která je výchozím výběrem v pipeline LightAutoML. Pro každý rámec GBM rámec LightAutoML trénuje dva modely: první dostává odborné hyperparametry, druhý je jemně laděn, aby se vešel do časového rozpočtu.
  • Mřížkové Hledání Hyperparametrického Ladění: je implementováno v pipeline TabularAutoML pro jemné ladění regularizačních parametrů lineárního modelu spolu s brzkým ukončením a teplým startem.

Model ladí všechny parametry maximalizací metrické funkce, buď definované uživatelem, nebo výchozí pro vyřešený úkol.

LightAutoML: Experiment a Výkon

Pro vyhodnocení výkonu je Předvolba TabularAutoML v rámci rámce LightAutoML porovnávána s již existujícími otevřenými řešeními napříč různými úkoly a prokazuje lepší výkon rámce LightAutoML. První, porovnání je provedeno na OpenML benchmarku, který je vyhodnocen na 35 binárních a multi-klasifikačních úkolových datech. Následující tabulka shrnuje porovnání rámce LightAutoML s existujícími systémy AutoML.

Jak je vidět, rámec LightAutoML outperformuje všechny ostatní systémy AutoML na 20 datech v rámci benchmarku. Následující tabulka obsahuje podrobné porovnání v kontextu dat, které ukazuje, že LightAutoML dodává různé výkony na různých třídách úkolů. Pro binární klasifikační úkoly LightAutoML pokulhává ve výkonu, zatímco pro úkoly s velkým množstvím dat rámec LightAutoML dodává lepší výkon.

Následující tabulka porovnává výkon rámce LightAutoML s systémy AutoML na 15 bankovních datech, které obsahují sadu různých binárních klasifikačních úkolů. Jak je vidět, LightAutoML outperformuje všechny systémy AutoML na 12 z 15 dat, což je výherní procento 80.

Konečné Myšlenky

V tomto článku jsme mluvili o LightAutoML, AutoML systému vyvinutém primárně pro evropskou společnost působící ve finančním sektoru a jeho ekosystému. Rámec LightAutoML je nasazen napříč různými aplikacemi a výsledky prokázaly lepší výkon, srovnatelný s úrovní datových vědců, i při vytváření vysoce kvalitních modelů strojového učení. Rámec LightAutoML se snaží učinit následující příspěvky. První, rámec LightAutoML byl vyvinut primárně pro ekosystém velké evropské finanční a bankovní instituce. Díky svému rámci a architektuře je rámec LightAutoML schopen outperformovat stávající AutoML rámce napříč několika otevřenými benchmarky a aplikacemi ekosystému. Výkon rámce LightAutoML je také porovnán s modely, které jsou ručně laděny datovými vědci, a výsledky ukazují lepší výkon rámce LightAutoML.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.