AI-modeller og platforme
LightAutoML: En AutoML-løsning til Finanssektoren
Selvom AutoML for nylig er blevet populært, går det tidlige arbejde med AutoML tilbage til begyndelsen af 90’erne, hvor videnskabsmænd offentliggjorde de første artikler om hyperparameteroptimering. Det var i 2014, da ICML arrangerede det første AutoML-workshop, at AutoML fik opmærksomhed fra ML-udviklere. En af de vigtigste fokusområder for AutoML gennem årene har været hyperparametersøgeproblemet, hvor modellen implementerer en række optimeringsmetoder for at bestemme de bedst performende hyperparametre i et stort hyperparameter-rum for en given maskinlæringsmodel. En anden metode, der ofte implementeres af AutoML-modeller, er at estimere sandsynligheden for, at en given hyperparameter er den optimale hyperparameter for en given maskinlæringsmodel. Modellen opnår dette ved at implementere Bayesianske metoder, der traditionelt bruger historiske data fra tidligere estimerede modeller og andre datasæt. Ud over hyperparameteroptimering prøver andre metoder at vælge de bedste modeller fra et rum af modelleralternativer.
I denne artikel vil vi dække LightAutoML, et AutoML-system udviklet primært til en europæisk virksomhed, der opererer i finanssektoren samt dets økosystem. LightAutoML-rammen er implementeret på tværs af forskellige anvendelser, og resultaterne har vist overlegen præstation, sammenlignelig med niveauet af datavidenskabsmænd, selv ved opbygning af højkvalitets maskinlæringsmodeller. LightAutoML-rammen forsøger at bidrage med følgende. Først og fremmest blev LightAutoML-rammen udviklet primært til økosystemet for en stor europæisk finans- og bankinstitution. Takket være sin ramme og arkitektur er LightAutoML-rammen i stand til at overgå state of the art AutoML-rammer på tværs af flere åbne benchmarks samt økosystemanvendelser. Præstationen af LightAutoML-rammen er også sammenlignet med modeller, der er justeret manuelt af datavidenskabsmænd, og resultaterne indikerer en stærkere præstation af LightAutoML-rammen.
Denne artikel har til formål at dække LightAutoML-rammen i dybden, og vi udforsker mekanismen, metodikken, arkitekturen i rammen samt dens sammenligning med state of the art-rammer. Så lad os komme i gang.
LightAutoML: En AutoML-ramme til Finanssektoren
Selvom forskere først begyndte at arbejde med AutoML i midten og begyndelsen af 90’erne, har AutoML tiltrukket sig en stor del af opmærksomheden i de seneste år, med nogle af de prominente industrielle løsninger, der implementerer automatisk opbygning af maskinlæringsmodeller, som Amazon’s (AMZN ) AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML og mange flere. De fleste af disse rammer implementerer en generel formål AutoML-løsning, der udvikler ML-baserede modeller automatisk på tværs af forskellige klasser af anvendelser i finanssektoren, sundhedssektoren, uddannelsessektoren og mere. Den vigtigste antagelse bag denne horisontale generiske tilgang er, at processen med at udvikle automatiske modeller forbliver identisk på tværs af alle anvendelser. Imidlertid implementerer LightAutoML-rammen en vertikal tilgang til at udvikle en AutoML-løsning, der ikke er generisk, men snarere tilpasset behovene i enkeltanvendelser, i dette tilfælde en stor finansinstitution. LightAutoML-rammen er en vertikal AutoML-løsning, der fokuserer på kravene i det komplekse økosystem samt dets karakteristika. Først og fremmest giver LightAutoML-rammen en hurtig og næsten optimal hyperparametersøgning. Selvom modellen ikke optimerer disse hyperparametre direkte, lykkes den med at levere tilfredsstillende resultater. Derudover holder modellen balancen mellem hastighed og hyperparameteroptimering dynamisk for at sikre, at modellen er optimal på små problemer og hurtig nok på større problemer. Anden, LightAutoML-rammen begrænser området af maskinlæringsmodeller bevidst til kun to typer: lineære modeller og GBM eller gradient-forstærkede beslutningstræer, i stedet for at implementere store ensembler af forskellige algoritmer. Den primære grund til at begrænse området af maskinlæringsmodeller er at accelerere eksekveringstiden af LightAutoML-rammen uden at påvirke præstationen negativt for den given type af problem og data. Tredje, LightAutoML-rammen præsenterer en unik metode til at vælge forarbejdnings-skemaer for forskellige funktioner, der bruges i modellerne på basis af bestemte valgeregler og meta-statistik. LightAutoML-rammen er evaluueret på et bredt udvalg af åbne datakilder på tværs af en bred vifte af anvendelser.
LightAutoML: Metodik og Arkitektur
LightAutoML-rammen består af moduler kendt som Presets, der er dedikeret til end-to-end modeludvikling for typiske maskinlæringsopgaver. For tiden understøtter LightAutoML-rammen Preset-moduler. Først og fremmest fokuserer TabularAutoML-Preset på at løse klassiske maskinlæringsproblemer defineret på tabeldata. Anden, White-Box-Preset implementerer simple fortolkelige algoritmer som Logistisk Regression i stedet for WoE eller Weight of Evidence-kodning og diskretiserede funktioner til at løse binære klassifikationsopgaver på tabeldata. Implementering af simple fortolkelige algoritmer er en almindelig praksis for at modelere sandsynligheden for en ansøgning på grund af fortolkningsbegrænsningerne, der påføres af forskellige faktorer. Tredje, NLP-Preset er i stand til at kombinere tabeldata med NLP eller Natural Language Processing-værktøjer, herunder forudtrænede dybe læringsmodeller og specifikke funktionsekstraktorer. Endelig arbejder CV-Preset med billeddata med hjælp af nogle grundlæggende værktøjer. Det er vigtigt at bemærke, at selvom LightAutoML-modellen understøtter alle fire Presets, bruger rammen kun TabularAutoML i produktionsniveau-systemet.
Den typiske pipeline for LightAutoML-rammen er inkluderet i følgende billede.

Hver pipeline indeholder tre komponenter. Først og fremmest er Reader et objekt, der modtager opgavetype og rådata som input, udfører kritiske metadata-beregninger, renskaber de oprindelige data og finder ud af data-manipulationer, der skal udføres før modelfitting. Næste, LightAutoML-interne datasæt indeholder CV-iteratore og metadata, der implementerer valideringsskemaer for datasættene. Tredje komponent er de multiple maskinlærings-pipelines, der er stablet og/eller blandet for at få en enkelt prædiktionsværdi. En maskinlærings-pipeline inden for LightAutoML-arkitekturen er en af flere maskinlæringsmodeller, der deler en enkelt data-validering og forarbejdnings-skema. Forarbejdnings-trinnet kan have op til to funktionssøgnings-trin, et funktionsekstraktions-trin eller kan være tom, hvis ingen forarbejdnings-trin er nødvendige. ML-pipelines kan beregnes uafhængigt på samme datasæt og derefter blandes sammen ved hjælp af gennemsnit (eller vægtet gennemsnit). Alternativt kan en stacking ensemble-skema bruges til at opbygge multi-niveau ensemble-arkitekturer.
LightAutoML Tabular Preset
Inden for LightAutoML-rammen er TabularAutoML den standard-pipeline, og den er implementeret i modellen til at løse tre typer opgaver på tabeldata: binær klassifikation, regression og multi-klassifikation for en bred vifte af præstationsmetrikker og tab-funktioner. En tabel med følgende fire kolonner: kategoriske funktioner, numeriske funktioner, tidsstempel og en enkelt mål-kolonne med klasse-etiketter eller kontinuerte værdier, gives som input til TabularAutoML-komponenten. En af de primære mål med designet af LightAutoML-rammen var at designe et værktøj til hurtig hypotesetestning, en stor grund til, at rammen undgår at bruge brute-force-metoder til pipeline-optimering og fokuserer kun på effektivitets-teknikker og modeller, der fungerer på tværs af en bred vifte af datasæt.
Auto-Typing og Data Forarbejdnings
For at håndtere forskellige typer funktioner på forskellige måder, har modellen brug for at kende hver funktionstype. I situationer, hvor der er en enkelt opgave med et lille datasæt, kan brugeren manuelt specificere hver funktionstype. Imidlertid er det ikke længere en praktisk mulighed i situationer, der inkluderer hundredvis af opgaver med datasæt, der indeholder tusindvis af funktioner. For TabularAutoML-Preset har LightAutoML-rammen brug for at kortlægge funktioner til tre klasser: numerisk, kategori og datetime. En enkel og åbenlys løsning er at bruge kolonne-array-data-typer som faktiske funktionstyper, dvs. at kortlægge float/int-kolonner til numeriske funktioner, tidsstempel eller streng, der kan parses som et tidsstempel, til datetime, og andre til kategori. Imidlertid er denne kortlægning ikke den bedste på grund af den hyppige forekomst af numeriske data-typer i kategori-kolonner.
Valideringsskemaer
Valideringsskemaer er en vital komponent i AutoML-rammer, da data i industrien er underlagt ændringer over tid, og dette ændringsaspekt gør IID eller Independent Identically Distributed-antagelser irrelevante, når man udvikler modellen. AutoML-modeller anvender valideringsskemaer til at estimere deres præstation, søge efter hyperparametre og ud af fold-prædiktionsgenerering. TabularAutoML-pipeline implementerer tre valideringsskemaer:
- KFold Cross Validering: KFold Cross Validering er det standard valideringsskema for TabularAutoML-pipeline, herunder GroupKFold for adfærdsmodeller og stratificeret KFold for klassifikationsopgaver.
- Holdout Validering: Holdout valideringsskemaet implementeres, hvis holdout-sættet er specificeret.
- Brugerdefinerede Valideringsskemaer: Brugerdefinerede valideringsskemaer kan oprettes af brugere afhængigt af deres enkelte krav. Brugerdefinerede valideringsskemaer inkluderer cross-validering og tids-serie-splitteskemaer.
Funktionssøgning
Selvom funktionssøgning er en kritisk aspekt af modelludvikling i overensstemmelse med industri-standarder, da det faciliterer reduktion i inferens- og modelimplementeringsomkostninger, fokuserer de fleste AutoML-løsninger ikke meget på dette problem. Til gengæld implementerer TabularAutoML-pipeline tre funktionssøgnings-strategier: Ingen søgning, Vigtighedsafskærings-søgning og Vigtighedsbaseret fremadrettet søgning. Af disse er Vigtighedsafskærings-søgning den standard-søgningsstrategi. Derudover er der to primære måder at estimere funktionssvigtighed på: split-baseret træ-vigtighed og permutation-vigtighed af GBM-modellen eller gradient-forstærkede beslutningstræer. Det primære formål med Vigtighedsafskærings-søgning er at afvise funktioner, der ikke er nyttige for modellen, hvilket tillader modellen at reducere antallet af funktioner uden at påvirke præstationen negativt, en tilgang, der kan accelerere model-inferens og træning.

Billedet ovenfor sammenligner forskellige søgnings-strategier på binære bank-datasæt.
Hyperparameter-justering
TabularAutoML-pipeline implementerer forskellige tilgange til at justere hyperparametre på basis af, hvad der justeres.
- Tidlig Stop Hyperparameter-justeringvælger antallet af iterationer for alle modeller under træningsfasen.
- Ekspertsystem Hyperparameter-justeringer en enkel måde at indstille hyperparametre for modeller på en tilfredsstillende måde. Det forhindrer den endelige model fra en stor nedgang i score i forhold til hårdt-justerede modeller.
- Træstruktureret Parzen-estimation eller TPEfor GBM eller gradient-forstærkede beslutningstræ-modeller. TPE er en blandet justerings-strategi, der er standardvalget i LightAutoML-pipeline. For hvert GMB-ramme træner LightAutoML-rammen to modeller: den første får ekspert-hyperparametre, den anden er finjusteret til at passe inden for tidsbudgettet.
- Retskema Hyperparameter-justeringer implementeret i TabularAutoML-pipeline til at finjustere regulariseringsparametrene af en lineær model sammen med tidlig stop og varm start.
Modellen justerer alle parametrene ved at maksimere metrik-funktionen, enten defineret af brugeren eller som standard for den løste opgave.

LightAutoML: Eksperiment og Præstation
For at evaluere præstationen sammenlignes TabularAutoML-Preset inden for LightAutoML-rammen med eksisterende åbne kilde-løsninger på tværs af forskellige opgaver og cementerer den overlegne præstation af LightAutoML-rammen. Først og fremmest udføres sammenligningen på OpenML-benchmark, der evalueres på 35 binære og multi-klassifikationsopgave-datasæt. Følgende tabel sammenligner LightAutoML-rammen med eksisterende AutoML-systemer.

Som det kan ses, overgår LightAutoML-rammen alle andre AutoML-systemer på 20 datasæt inden for benchmarket. Følgende tabel indeholder en detaljeret sammenligning i datasæt-konteksten, hvilket indikerer, at LightAutoML leverer forskellige præstationer på forskellige klasser af opgaver. For binære klassifikationsopgaver falder LightAutoML kort i præstation, mens for opgaver med en stor mængde data leverer LightAutoML-rammen en overlegen præstation.

Følgende tabel sammenligner præstationen af LightAutoML-rammen med AutoML-systemer på 15 bank-datasæt, der indeholder en samling af forskellige binære klassifikationsopgaver. Som det kan observeres, overgår LightAutoML alle AutoML-løsninger på 12 af 15 datasæt, en sejrprocent på 80.

Afsluttende Tanker
I denne artikel har vi talt om LightAutoML, et AutoML-system udviklet primært til en europæisk virksomhed, der opererer i finanssektoren samt dets økosystem. LightAutoML-rammen er implementeret på tværs af forskellige anvendelser, og resultaterne har vist overlegen præstation, sammenlignelig med niveauet af datavidenskabsmænd, selv ved opbygning af højkvalitets maskinlæringsmodeller. LightAutoML-rammen forsøger at bidrage med følgende. Først og fremmest blev LightAutoML-rammen udviklet primært til økosystemet for en stor europæisk finans- og bankinstitution. Takket være sin ramme og arkitektur er LightAutoML-rammen i stand til at overgå state of the art AutoML-rammer på tværs af flere åbne benchmarks samt økosystemanvendelser. Præstationen af LightAutoML-rammen er også sammenlignet med modeller, der er justeret manuelt af datavidenskabsmænd, og resultaterne indikerer en stærkere præstation af LightAutoML-rammen. LightAutoML-rammen er i stand til at overgå state of the art AutoML-rammer på tværs af flere åbne benchmarks samt økosystemanvendelser, og dens præstation er også sammenlignet med modeller, der er justeret manuelt af datavidenskabsmænd, og resultaterne indikerer en stærkere præstation af LightAutoML-rammen.












