AI-modeller och plattformar
LightAutoML: Ett AutoML-ramverk för finansiella tjänster
Även om AutoML blev populärt för några år sedan, så går den tidiga forskningen om AutoML tillbaka till början av 90-talet när forskare publicerade de första artiklarna om hyperparameteroptimering. Det var 2014 när ICML anordnade den första AutoML-workshopen som AutoML fick uppmärksamhet från ML-utvecklare. En av de stora fokusområdena under AutoML:s år har varit hyperparametersökproblemet, där modellen implementerar en mängd olika optimeringsmetoder för att bestämma de bäst presterande hyperparametrarna i ett stort hyperparameterutrymme för en specifik maskinlärningsmodell. En annan metod som ofta implementeras av AutoML-modeller är att uppskatta sannolikheten för att en specifik hyperparameter är den optimala hyperparametern för en given maskinlärningsmodell. Modellen uppnår detta genom att implementera Bayesmetoder som traditionellt använder historiska data från tidigare uppskattade modeller och andra datamängder. Utöver hyperparameteroptimering försöker andra metoder välja ut de bästa modellerna från ett utrymme av modellalternativ.
I den här artikeln kommer vi att täcka LightAutoML, ett AutoML-system som utvecklats främst för ett europeiskt företag som verkar inom finanssektorn och dess ekosystem. LightAutoML-ramverket distribueras över olika applikationer, och resultaten visar en överlägsen prestanda, jämförbar med nivån hos dataexperter, även när det gäller att bygga högkvalitativa maskinlärningsmodeller. LightAutoML-ramverket försöker bidra med följande. Först utvecklades LightAutoML-ramverket främst för ekosystemet för ett stort europeiskt finansiellt och bankinstitut. På grund av sin struktur och arkitektur kan LightAutoML-ramverket prestera bättre än state-of-the-art-AutoML-ramverk över flera öppna benchmark och ekosystemapplikationer. Prestandan för LightAutoML-ramverket jämförs också med modeller som justeras manuellt av dataexperter, och resultaten visar en starkare prestanda för LightAutoML-ramverket.
Denna artikel syftar till att täcka LightAutoML-ramverket i detalj, och vi undersöker mekanismen, metodiken, arkitekturen för ramverket samt dess jämförelse med state-of-the-art-ramverk. Så låt oss komma igång.
LightAutoML: Ett AutoML-ramverk för finansiella tjänster
Även om forskare först började arbeta med AutoML i mitten och början av 90-talet, så fick AutoML en stor del av uppmärksamheten under de senaste åren, med några av de mest framträdande industriella lösningarna som implementerar automatiskt byggda maskinlärningsmodeller som Amazon (AMZN ) AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML och många fler. De flesta av dessa ramverk implementerar en allmän AutoML-lösning som utvecklar ML-baserade modeller automatiskt över olika klasser av applikationer inom finansiella tjänster, hälsovård, utbildning och mer. Den viktigaste antagandet bakom denna horisontella generiska tillvägagångssätt är att processen att utveckla automatiska modeller förblir densamma över alla applikationer. Men LightAutoML-ramverket implementerar ett vertikalt tillvägagångssätt för att utveckla en AutoML-lösning som inte är generisk, utan snarare tillgodoser behoven hos enskilda applikationer, i detta fall ett stort finansiellt institut. LightAutoML-ramverket är ett vertikalt AutoML-ramverk som fokuserar på kraven för det komplexa ekosystemet och dess egenskaper. Först tillhandahåller LightAutoML-ramverket snabb och nära optimal hyperparametersök. Även om modellen inte optimerar dessa hyperparametrar direkt, så lyckas den leverera tillfredsställande resultat. Dessutom håller modellen balansen mellan hastighet och hyperparameteroptimering dynamiskt, för att säkerställa att modellen är optimal på små problem och tillräckligt snabb på större problem. För det andra begränsar LightAutoML-ramverket medvetet utbudet av maskinlärningsmodeller till endast två typer: linjära modeller och GBM eller gradientförstärkta beslutsfattningsträd, snarare än att implementera stora ensembler av olika algoritmer. Den primära anledningen till att begränsa utbudet av maskinlärningsmodeller är att påskynda exekveringstiden för LightAutoML-ramverket utan att påverka prestandan negativt för det givna problemet och datat. För det tredje presenterar LightAutoML-ramverket en unik metod för att välja förbehandlings-schema för olika funktioner som används i modellerna baserat på vissa urvalskriterier och meta-statistik. LightAutoML-ramverket utvärderas på ett brett utbud av öppna datakällor över ett brett utbud av applikationer.
LightAutoML: Metodik och arkitektur
LightAutoML-ramverket består av moduler som kallas Presets som är dedikerade för slut-till-slut-modellutveckling för typiska maskinlärningsuppgifter. För närvarande stöder LightAutoML-ramverket Preset-moduler. Först fokuserar TabularAutoML-Preset på att lösa klassiska maskinlärningsproblem definierade på tabellformade datamängder. För det andra implementerar White-Box-Preset enkla tolkningsbara algoritmer som logistisk regression snarare än WoE eller vikt av beviskodning och diskretiserade funktioner för att lösa binära klassificeringsuppgifter på tabellformade data. Att implementera enkla tolkningsbara algoritmer är en vanlig praxis för att modellera sannolikheten för en ansökan på grund av tolkningsbegränsningarna som påverkas av olika faktorer. För det tredje kan NLP-Preset kombinera tabellformade data med NLP eller naturlig språkbehandling-verktyg, inklusive förtränade djupa inlärningsmodeller och specifika funktionsextraherare. Slutligen fungerar CV-Preset med bilddata med hjälp av några grundläggande verktyg. Det är viktigt att notera att även om LightAutoML-modellen stöder alla fyra Presets, så använder ramverket endast TabularAutoML i produktions-systemet.
Den typiska pipelinen för LightAutoML-ramverket ingår i följande bild.

Varje pipeline innehåller tre komponenter. Först är Reader ett objekt som tar emot uppgiftstyp och rådata som indata, utför viktiga metadataberäkningar, rensar den initiala datan och fastställer datamanipulationer som ska utföras innan olika modeller passas. Nästa är LightAutoML interna datamängder som innehåller CV-iteratorer och metadata som implementerar valideringsschema för datamängderna. Den tredje komponenten är de flera maskinlärningspipeliner som staplas och/eller blandas för att få en enda förutsägelse. En maskinlärningspipeline inom LightAutoML-arkitekturen är en av flera maskinlärningsmodeller som delar en enda data-validering och förbehandlingsschema. Förbehandlingssteget kan ha upp till två funktionella urvalssteg, ett funktionellt ingenjörsteg eller kan vara tomt om ingen förbehandling behövs. ML-pipeliner kan beräknas oberoende på samma datamängder och sedan blandas samman med hjälp av genomsnitt (eller viktat genomsnitt). Alternativt kan ett staplingsensemble-schema användas för att bygga flernivåensemblearkitekturer.
LightAutoML Tabellformad Preset
Inom LightAutoML-ramverket är TabularAutoML standardpipelinen, och den implementeras i modellen för att lösa tre typer av uppgifter på tabellformade data: binär klassificering, regression och flerklassklassificering för ett brett utbud av prestandamått och förlustfunktioner. En tabell med följande fyra kolumner: kategoriska funktioner, numeriska funktioner, tidsstämplar och en enda målkolumn med klassetiketter eller kontinuerliga värden matas in i TabularAutoML-komponenten som indata. En av de primära målen bakom designen av LightAutoML-ramverket var att utforma ett verktyg för snabb hypotesprövning, en viktig anledning till att ramverket undviker att använda brutala metoder för pipeline-optimering och fokuserar endast på effektivitetsmetoder och modeller som fungerar över ett brett utbud av datamängder.
Auto-Typning och dataförbehandling
För att hantera olika typer av funktioner på olika sätt behöver modellen veta varje funktionstyp. I situationer där det finns en enda uppgift med en liten datamängd kan användaren manuellt ange varje funktionstyp. Men att ange varje funktionstyp manuellt är inte längre ett genomförbart alternativ i situationer som omfattar hundratals uppgifter med datamängder som innehåller tusentals funktioner. För TabularAutoML-Preset behöver LightAutoML-ramverket kartlägga funktioner till tre klasser: numerisk, kategori och datum. En enkel och uppenbar lösning är att använda kolumnarraydatatyper som faktiska funktionstyper, det vill säga kartlägga flytkolumner till numeriska funktioner, tidsstämplar eller strängar som kan tolkas som tidsstämplar till datum och andra till kategori. Men denna kartläggning är inte den bästa på grund av den frekventa förekomsten av numeriska datatyper i kategorikolumner.
Valideringsschema
Valideringsschema är en viktig komponent i AutoML-ramverk eftersom data i branschen är föremål för förändring över tiden, och detta element av förändring gör IID eller oberoende identiskt distribuerade antaganden irrelevanta när man utvecklar modellen. AutoML-modeller använder valideringsschema för att uppskatta deras prestanda, söka efter hyperparametrar och generera förutsägelse utanför veckan. TabularAutoML-pipelinen implementerar tre valideringsschema:
- KFold-korsvalidering: KFold-korsvalidering är standardvalideringsschemat för TabularAutoML-pipelinen, inklusive GroupKFold för beteendemodeller och stratifierad KFold för klassificeringsuppgifter.
- Holdout-validering: Holdout-valideringsschemat implementeras om holdout-sättet anges.
- Anpassade valideringsschema: Anpassade valideringsschema kan skapas av användare beroende på deras enskilda krav. Anpassade valideringsschema innehåller korsvalidering och tidsserieuppdelningsschema.
Funktionell urval
Även om funktionell urval är en viktig aspekt av att utveckla modeller enligt branschstandarder, eftersom det underlättar minskning av inferens och modellimplementeringskostnader, så fokuserar de flesta AutoML-lösningar inte mycket på detta problem. Å andra sidan implementerar TabularAutoML-pipelinen tre funktionella urvalsstrategier: ingen urval, urval baserat på betydelse och urval baserat på betydelse och framåtriktad selektion. Av de tre är urval baserat på betydelse standard. Dessutom finns det två primära sätt att uppskatta funktionell betydelse: split-baserad trädbetydelse och permutation av GBM-modell eller gradientförstärkt beslutsfattningsträd. Det primära målet med urval baserat på betydelse är att avvisa funktioner som inte är till nytta för modellen, vilket tillåter modellen att minska antalet funktioner utan att påverka prestandan negativt, en tillvägagångssätt som kan påskynda modellinferens och utbildning.

Bilden ovan jämför olika urvalsstrategier på binära bankdatamängder.
Hyperparameterjustering
TabularAutoML-pipelinen implementerar olika tillvägagångssätt för att justera hyperparametrar baserat på vad som justeras.
- Tidig stopp hyperparameterjustering: Väljer antalet iterationer för alla modeller under utbildningsfasen.
- Expertsystem hyperparameterjustering: Är ett enkelt sätt att ställa in hyperparametrar för modeller på ett tillfredsställande sätt. Det förhindrar att den slutliga modellen får en stor minskning av poäng jämfört med hårt justerade modeller.
- Trädstrukturerad Parzen-estimering eller TPE: för GBM eller gradientförstärkt beslutsfattningsträdmodeller. TPE är en blandad justeringsstrategi som är standardvalet i LightAutoML-pipelinen. För varje GMB-ramverk tränar LightAutoML-ramverket två modeller: den första får expert hyperparametrar, den andra är finjusterad för att passa inom tidsbudgeten.
- Grid Search hyperparameterjustering: Implementeras i TabularAutoML-pipelinen för att finjustera regleringsparametrarna för en linjär modell tillsammans med tidig stopp och varm start.
Modellen justerar alla parametrar genom att maximera metric-funktionen, antingen definierad av användaren eller standard för den lösta uppgiften.

LightAutoML: Experiment och prestanda
För att utvärdera prestandan jämförs TabularAutoML-Preset inom LightAutoML-ramverket med befintliga öppna käll-lösningar över olika uppgifter och cementerar den överlägsna prestandan för LightAutoML-ramverket. Först utförs jämförelsen på OpenML-benchmark som utvärderas på 35 binära och flerklassklassificeringsuppgifter. Följande tabell sammanfattar jämförelsen mellan LightAutoML-ramverket och befintliga AutoML-system.

Som det kan ses, så presterar LightAutoML-ramverket bättre än alla andra AutoML-system på 20 datamängder inom benchmarken. Följande tabell innehåller en detaljerad jämförelse i datamängds-sammanhang som indikerar att LightAutoML levererar olika prestanda på olika klasser av uppgifter. För binära klassificeringsuppgifter så presterar LightAutoML sämre, medan för uppgifter med en stor mängd data så presterar LightAutoML-ramverket bättre.

Följande tabell jämför prestandan för LightAutoML-ramverket mot AutoML-system på 15 bankdatamängder som innehåller en uppsättning binära klassificeringsuppgifter. Som det kan observeras, så presterar LightAutoML bättre än alla AutoML-lösningar på 12 av 15 datamängder, en vinstprocent på 80.

Slutliga tankar
I den här artikeln har vi talat om LightAutoML, ett AutoML-system som utvecklats främst för ett europeiskt företag som verkar inom finanssektorn och dess ekosystem. LightAutoML-ramverket distribueras över olika applikationer, och resultaten visar en överlägsen prestanda, jämförbar med nivån hos dataexperter, även när det gäller att bygga högkvalitativa maskinlärningsmodeller. LightAutoML-ramverket försöker bidra med följande. Först utvecklades LightAutoML-ramverket främst för ekosystemet för ett stort europeiskt finansiellt och bankinstitut. På grund av sin struktur och arkitektur kan LightAutoML-ramverket prestera bättre än state-of-the-art-AutoML-ramverk över flera öppna benchmark och ekosystemapplikationer. Prestandan för LightAutoML-ramverket jämförs också med modeller som justeras manuellt av dataexperter, och resultaten visar en starkare prestanda för LightAutoML-ramverket. LightAutoML-ramverket är able to outperform state of the art AutoML frameworks across several open benchmarks as well as ecosystem applications. The performance of the LightAutoML framework is also compared against models that are tuned manually by data scientists, and the results indicated stronger performance by the LightAutoML framework.












