AI-modellen en platforms
LightAutoML: Een AutoML-kader voor FinanciÃŦle Diensten
Hoewel AutoML een paar jaar geleden aan populariteit won, gaat de vroege werk aan AutoML terug tot de vroege jaren 90, toen wetenschappers de eerste papers over hyperparameter-optimalisatie publiceerden. Het was in 2014, toen ICML de eerste AutoML-workshop organiseerde, dat AutoML de aandacht van ML-ontwikkelaars kreeg. Een van de belangrijkste focuspunten van AutoML in de loop der jaren is het hyperparameter-zoekprobleem, waarbij het model een reeks optimalisatiemethoden implementeert om de best presterende hyperparameters te bepalen in een grote hyperparameter-ruimte voor een bepaald machine learning-model. Een andere methode die vaak door AutoML-modellen wordt geÃŊmplementeerd, is het schatten van de waarschijnlijkheid van een bepaalde hyperparameter als de optimale hyperparameter voor een gegeven machine learning-model. Het model bereikt dit door Bayesiaanse methoden te implementeren die traditioneel historische gegevens uit eerder geschatte modellen en andere datasets gebruiken. Naast hyperparameter-optimalisatie proberen andere methoden de beste modellen te selecteren uit een ruimte van modelalternatieven.
In dit artikel zullen we LightAutoML behandelen, een AutoML-systeem dat primair is ontwikkeld voor een Europees bedrijf dat actief is in de financiÃŦle sector, evenals voor zijn ecosysteem. Het LightAutoML-kader wordt ingezet in verschillende toepassingen en de resultaten laten een superieure prestatie zien, vergelijkbaar met het niveau van data scientists, zelfs bij het opbouwen van hoge kwaliteit machine learning-modellen. Het LightAutoML-kader probeert de volgende bijdragen te leveren. Ten eerste is het LightAutoML-kader primair ontwikkeld voor het ecosysteem van een grote Europese financiÃŦle en bankinstelling. Vanwege zijn kader en architectuur is het LightAutoML-kader in staat om state-of-the-art AutoML-kaders te overtreffen op verschillende open benchmarks, evenals op toepassingen in het ecosysteem. De prestatie van het LightAutoML-kader wordt ook vergeleken met modellen die handmatig zijn afgestemd door data scientists, en de resultaten geven een betere prestatie van het LightAutoML-kader aan.
Dit artikel heeft als doel het LightAutoML-kader diepgaand te behandelen en we onderzoeken de mechanismen, de methodologie, de architectuur van het kader, evenals de vergelijking met state-of-the-art-kaders. Laten we dus beginnen.
LightAutoML: Een AutoML-kader voor FinanciÃŦle Diensten
Hoewel onderzoekers voor het eerst aan AutoML begonnen te werken in de jaren 90, won AutoML de aandacht van een groot deel van de industrie in de afgelopen jaren, met enkele van de meest prominente industriÃŦle oplossingen die automatisch machine learning-modellen implementeren, zoals Amazonâs AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML en veel meer. De meeste van deze kaders implementeren een algemene AutoML-oplossing die ML-gebaseerde modellen automatisch ontwikkelt over verschillende klassen van toepassingen in de financiÃŦle sector, de gezondheidszorg, het onderwijs en meer. De belangrijkste veronderstelling achter deze horizontale generieke aanpak is dat het proces van het ontwikkelen van automatische modellen identiek blijft over alle toepassingen. Het LightAutoML-kader implementeert echter een verticale aanpak om een AutoML-oplossing te ontwikkelen die niet generiek is, maar specifiek is ontwikkeld voor de behoeften van individuele toepassingen, in dit geval een grote financiÃŦle instelling. Het LightAutoML-kader is een verticaal AutoML-kader dat zich richt op de behoeften van het complexe ecosysteem, evenals op zijn kenmerken. Ten eerste biedt het LightAutoML-kader een snelle en bijna optimale hyperparameter-zoekoplossing. Hoewel het model deze hyperparameters niet rechtstreeks optimaliseert, levert het toch bevredigende resultaten. Bovendien houdt het model de balans tussen snelheid en hyperparameter-optimalisatie dynamisch in evenwicht, om ervoor te zorgen dat het model optimaal is voor kleine problemen en snel genoeg voor grotere problemen. Ten tweede beperkt het LightAutoML-kader de reikwijdte van machine learning-modellen bewust tot slechts twee typen: lineaire modellen en GBMâs of gradient-gebooste beslissingsbomen, in plaats van het implementeren van grote ensembles van verschillende algoritmen. De belangrijkste reden achter het beperken van de reikwijdte van machine learning-modellen is om de uitvoertijd van het LightAutoML-kader te versnellen zonder de prestatie negatief te beÃŊnvloeden voor het gegeven type probleem en gegevens. Ten derde presenteert het LightAutoML-kader een unieke methode voor het kiezen van voorbewerkingschemaâs voor verschillende kenmerken die in de modellen worden gebruikt op basis van bepaalde selectieregels en meta-statistieken. Het LightAutoML-kader wordt geÃŦvalueerd op een breed scala aan open gegevensbronnen over een breed scala aan toepassingen.
LightAutoML: Methodologie en Architectuur
Het LightAutoML-kader bestaat uit modules die bekend staan als Presets, die zijn ontwikkeld voor end-to-end modelontwikkeling voor typische machine learning-taken. Op dit moment ondersteunt het LightAutoML-kader Preset-modules. Ten eerste richt het TabularAutoML Preset zich op het oplossen van klassieke machine learning-problemen die zijn gedefinieerd op tabulaire datasets. Ten tweede implementeert het White-Box Preset eenvoudige interpreteerbare algoritmen, zoals logistische regressie, in plaats van WoE of Weight of Evidence-codering en gedispergeerde kenmerken om binaire classificatie-taken op te lossen op tabulaire gegevens. Het implementeren van eenvoudige interpreteerbare algoritmen is een gebruikelijke praktijk om de kans van een aanvraag te modelleren vanwege de interpreteerbaarheidsbeperkingen die door verschillende factoren worden opgelegd. Ten derde is het NLP Preset in staat om tabulaire gegevens te combineren met NLP- of Natural Language Processing-hulpmiddelen, waaronder vooraf getrainde diepe leermodellen en specifieke kenmerkextractoren. Ten slotte werkt het CV Preset met beeldgegevens met behulp van enkele basisgereedschappen. Het is belangrijk om op te merken dat, hoewel het LightAutoML-model alle vier de Presets ondersteunt, het kader alleen het TabularAutoML in het productiesysteem gebruikt.
De typische pipeline van het LightAutoML-kader is opgenomen in de volgende afbeelding.

Elke pipeline bevat drie componenten. Ten eerste is er de Reader, een object dat de taaktype en ruwe gegevens als invoer ontvangt, cruciale metadata-berekeningen uitvoert, de initiÃŦle gegevens schoont en bepaalt welke gegevensmanipulaties moeten worden uitgevoerd voordat verschillende modellen worden aangepast. Vervolgens bevatten de LightAutoML-interne datasets CV-iteratoren en metadata die validatieschemaâs implementeren voor de datasets. De derde component bestaat uit meerdere machine learning-pipelines die zijn gestapeld en/of gemengd om een enkele voorspelling te krijgen. Een machine learning-pipeline binnen de architectuur van het LightAutoML-kader is een van de meerdere machine learning-modellen die een enkele gegevensvalidatie- en voorbewerkingschema delen. De voorbewerkingsstap kan maximaal twee kenmerkselectiestappen hebben, een kenmerkengineeringsstap of kan leeg zijn als geen voorbewerking nodig is. De ML-pipelines kunnen onafhankelijk op dezelfde datasets worden berekend en vervolgens worden gemengd met behulp van gemiddeling (of gewogen gemiddeling). Alternatief kan een stapelensemble-schema worden gebruikt om multilevel-ensemble-architecturen te bouwen.
LightAutoML Tabular Preset
Binnen het LightAutoML-kader is TabularAutoML de standaardpipeline en wordt het geÃŊmplementeerd in het model om drie soorten taken op te lossen op tabulaire gegevens: binaire classificatie, regressie en multiclass-classificatie voor een breed scala aan prestatie-metrieken en verliesfuncties. Een tabel met de volgende vier kolommen: categorische kenmerken, numerieke kenmerken, tijdstempels en een enkele doelkolom met klasse-etiketten of continue waarden, wordt als invoer gevoerd aan de TabularAutoML-component. Een van de primaire doelstellingen achter het ontwerp van het LightAutoML-kader was om een hulpmiddel te ontwikkelen voor snelle hypothese-testen, een belangrijke reden waarom het kader brute-force-methoden voor pipeline-optimalisatie vermijdt en zich alleen richt op efficiÃŦnte technieken en modellen die werken over een breed scala aan datasets.
Auto-Typing en Gegevensvoorverwerking
Om verschillende soorten kenmerken op verschillende manieren te behandelen, moet het model elke kenmerktype kennen. In de situatie waarin er ÃĐÃĐn taak is met een kleine dataset, kan de gebruiker elk kenmerktype handmatig specificeren. Echter, het handmatig specificeren van elk kenmerktype is geen haalbare optie in situaties die honderden taken omvatten met datasets die duizenden kenmerken bevatten. Voor het TabularAutoML Preset moet het LightAutoML-kader kenmerken in drie klassen in kaart brengen: numeriek, categorie en datetime. Een eenvoudige en voor de hand liggende oplossing is om kolomarray-gegevenstypen te gebruiken als daadwerkelijke kenmerktypen, dat wil zeggen om float/int-kolommen in kaart te brengen naar numerieke kenmerken, tijdstempel of tekenreeks die kan worden geparsed als een tijdstempel â naar datetime, en anderen naar categorie. Echter, deze toewijzing is niet de beste vanwege het frequente voorkomen van numerieke gegevenstypen in categoriekolommen.
Validatieschemaâs
Validatieschemaâs zijn een essentieel onderdeel van AutoML-kaders, aangezien gegevens in de industrie onderhevig zijn aan veranderingen in de loop van de tijd, en dit element van verandering maakt IID- of Onafhankelijk Identiek Gedistribueerde veronderstellingen irrelevant bij het ontwikkelen van het model. AutoML-modellen gebruiken validatieschemaâs om hun prestatie te schatten, hyperparameters te zoeken en uit-vouwvoorspellingen te genereren. De TabularAutoML-pipeline implementeert drie validatieschemaâs:
- KFold Cross Validatie: KFold Cross Validatie is het standaardvalidatieschema voor de TabularAutoML-pipeline, inclusief GroupKFold voor gedragsmodellen en gestratificeerde KFold voor classificatie-taken.
- Holdout Validatie: Het Holdout-validatieschema wordt geÃŊmplementeerd als de holdout-set is gespecificeerd.
- Aangepaste Validatieschemaâs: Aangepaste validatieschemaâs kunnen door gebruikers worden gemaakt op basis van hun individuele vereisten. Aangepaste validatieschemaâs omvatten cross-validatie en tijdsreeks-splitschemaâs.
Kenmerkselectie
Hoewel kenmerkselectie een cruciaal aspect is van het ontwikkelen van modellen volgens de industrienormen, aangezien het een vermindering van de inferentie- en modelimplementatiekosten mogelijk maakt, letten de meeste AutoML-oplossingen niet veel op dit probleem. Integendeel, de TabularAutoML-pipeline implementeert drie kenmerkselectiestrategieÃŦn: geen selectie, belangrijkheidssnijdingselectie en belangheidsgebaseerde voorwaartse selectie. Van de drie is de belangrijkheidssnijdingselectie de standaardstrategie. Bovendien zijn er twee primaire manieren om de belangrijkheid van kenmerken te schatten: split-gebaseerde boomimportantie en permutatieimportantie van GBM-modellen of gradient-gebooste beslissingsbomen. Het primaire doel van de belangrijkheidssnijdingselectie is om kenmerken te verwerpen die niet behulpzaam zijn voor het model, waardoor het model het aantal kenmerken kan verminderen zonder de prestatie negatief te beÃŊnvloeden, een aanpak die de modelinferentie en -training mogelijk kan versnellen.

De bovenstaande afbeelding vergelijkt verschillende selectiestrategieÃŦn op binaire bankdatasets.
Hyperparameter-aftuning
De TabularAutoML-pipeline implementeert verschillende benaderingen om hyperparameters af te stemmen op basis van wat wordt afgestemd.
- Vroegtijdige Stop Hyperparameter-aftuning: selecteert het aantal iteraties voor alle modellen tijdens de trainingsfase.
- Expert System Hyperparameter-aftuning: is een eenvoudige manier om hyperparameters voor modellen in te stellen op een bevredigende manier. Het voorkomt dat het finale model een hoge daling in score heeft ten opzichte van hard-afgestemde modellen.
- Tree Structured Parzen Estimation of TPE: voor GBM- of gradient-gebooste beslissingsboommodellen. TPE is een gemengde aftuningsstrategie die de standaardkeuze is in de LightAutoML-pipeline. Voor elk GMB-kader traint het LightAutoML-kader twee modellen: het eerste krijgt expert-hyperparameters, het tweede wordt fijn afgestemd om binnen het tijdbudget te passen.
- Grid Search Hyperparameter-aftuning: wordt geÃŊmplementeerd in de TabularAutoML-pipeline om de regularisatieparameters van een lineair model fijn af te stemmen, evenals vroegtijdige stopzetting en warm start.
Het model stemt alle parameters af door de metrische functie te maximaliseren, die door de gebruiker is gedefinieerd of standaard is voor de opgeloste taak.

LightAutoML: Experiment en Prestatie
Om de prestatie te evalueren, wordt de TabularAutoML Preset binnen het LightAutoML-kader vergeleken met bestaande open source-oplossingen over verschillende taken en bevestigt de superieure prestatie van het LightAutoML-kader. Ten eerste wordt de vergelijking uitgevoerd op de OpenML-benchmark die wordt geÃŦvalueerd op 35 binaire en multiclass-classificatie-taakdatasets. De volgende tabel vat de vergelijking van het LightAutoML-kader met bestaande AutoML-systemen samen.

Zoals te zien is, overtreft het LightAutoML-kader alle andere AutoML-systemen op 20 datasets binnen de benchmark. De volgende tabel bevat een gedetailleerde vergelijking in de context van de dataset, waaruit blijkt dat het LightAutoML-kader verschillende prestaties levert op verschillende klassen van taken. Voor binaire classificatie-taken komt het LightAutoML-kader tekort in prestatie, terwijl het voor taken met een grote hoeveelheid gegevens een superieure prestatie levert.

De volgende tabel vergelijkt de prestatie van het LightAutoML-kader met AutoML-systemen op 15 bankdatasets die een reeks van verschillende binaire classificatie-taken bevatten. Zoals te zien is, overtreft het LightAutoML-kader alle AutoML-oplossingen op 12 van de 15 datasets, een winpercentage van 80.

Slotbeschouwing
In dit artikel hebben we het over LightAutoML gehad, een AutoML-systeem dat primair is ontwikkeld voor een Europees bedrijf dat actief is in de financiÃŦle sector, evenals voor zijn ecosysteem. Het LightAutoML-kader wordt ingezet in verschillende toepassingen en de resultaten laten een superieure prestatie zien, vergelijkbaar met het niveau van data scientists, zelfs bij het opbouwen van hoge kwaliteit machine learning-modellen. Het LightAutoML-kader probeert de volgende bijdragen te leveren. Ten eerste is het LightAutoML-kader primair ontwikkeld voor het ecosysteem van een grote Europese financiÃŦle en bankinstelling. Vanwege zijn kader en architectuur is het LightAutoML-kader in staat om state-of-the-art AutoML-kaders te overtreffen op verschillende open benchmarks, evenals op toepassingen in het ecosysteem. De prestatie van het LightAutoML-kader wordt ook vergeleken met modellen die handmatig zijn afgestemd door data scientists, en de resultaten geven een betere prestatie van het LightAutoML-kader aan.












