AI-mallit ja alustat

LightAutoML: AutoML-ratkaisu suurelle rahoituspalvelujen ekosysteemille

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Vaikka AutoML nousi suosioon muutama vuosi sitten, varhaiset työt AutoML: n parissa juontavat juurensa 1990-luvun alkuun, jolloin tutkijat julkaisivat ensimmäiset tutkimukset hyperparametrien optimoinnista. Vuonna 2014 ICML järjesti ensimmäisen AutoML-työpajan, jolloin AutoML sai ML-kehittäjien huomion. Yksi AutoML: n tärkeimmistä painopisteistä on hyperparametrien etsintäongelma, jossa malli toteuttaa useita optimointimenetelmiä parhaiden suorituskykyisten hyperparametrien määrittämiseksi suuressa hyperparametritilassa tietyn koneoppimismallin osalta. Toinen yleisesti AutoML-malleissa toteutettu menetelmä on arvioida tietyn hyperparametrin todennäköisyys olemasta optimaalinen hyperparametri tietyn koneoppimismallin osalta. Malli saavuttaa tämän toteuttamalla Bayes-menetelmiä, jotka perinteisesti käyttävät historiallista dataa aiemmin arvioituista malleista ja muista tietokannoista. Hyperparametrien optimoinnin lisäksi muut menetelmät pyrkivät valitsemaan parhaat mallit mallivaihtoehtojen avaruudesta.

Tässä artikkelissa käsittelemme LightAutoML: ää, AutoML-järjestelmää, joka on kehitetty ensisijaisesti eurooppalaisen rahoitussektorilla toimivan yrityksen ekosysteemin tarpeisiin. LightAutoML-kehys on käytössä useissa sovelluksissa, ja tulokset osoittavat sen suorituskyvyn olevan vertailukelpoinen data- tutkijoiden tasoon, jopa korkealaatuisissa koneoppimismalleissa. LightAutoML-kehys pyrkii tekemään seuraavat panokset. Ensinnäkin, LightAutoML-kehys kehitettiin ensisijaisesti suuren eurooppalaisen rahoitus- ja pankkisektorin ekosysteemin tarpeisiin. Sen kehys- ja arkkitehtuurinsa ansiosta LightAutoML-kehys pystyy ylittämään nykyiset AutoML-kehykset useilla avoimilla vertailuilla sekä ekosysteemisovelluksissa. LightAutoML-kehyksen suorituskyky on myös verrattu malleihin, jotka on säätelty manuaalisesti data-tutkijoilla, ja tulokset osoittavat vahvemman suorituskyvyn LightAutoML-kehyksessä.

Tämä artikkeli pyrkii käsittelemään LightAutoML-kehystä syvällisemmin ja tarkastelemaan sen mekanismia, metodologiaa, arkkitehtuuria sekä vertailua nykyisiin kehyksiin. Joten aloitetaan.

LightAutoML: AutoML-kehys rahoituspalveluille

Vaikka tutkijat alkoivat työskennellä AutoML: n parissa 1990-luvun alussa, AutoML on saavuttanut suuren suosion viime vuosina, ja jotkut merkittävät teolliset ratkaisut ovat toteuttaneet automaattisesti rakennetut koneoppimismallit, kuten Amazonin AutoGluon, DarwinAI, H20.ai, IBM Watson AI, Microsoft (MSFT ) AzureML ja monet muut. Useimmat näistä kehyksistä toteuttavat yleispätevän AutoML-ratkaisun, joka kehittää ML-pohjaisia malleja automaattisesti eri sovellusluokissa, kuten rahoituspalveluissa, terveydenhuollossa, koulutuksessa ja muissa. Tämän horisontaalisen yleispätevän lähestymistavan taustalla oleva oletus on, että automaattisten mallien kehittämisen prosessi on identtinen kaikissa sovelluksissa. LightAutoML-kehys toteuttaa kuitenkin pystysuoran lähestymistavan kehittääkseen AutoML-ratkaisun, joka ei ole yleispätevä, vaan palvelee yksittäisten sovellusten tarpeita, tässä tapauksessa suuren rahoituslaitoksen. LightAutoML-kehys on pystysuora AutoML-ratkaisu, joka keskittyy monimutkaisen ekosysteemin vaatimuksiin ja ominaispiirteisiin. Ensinnäkin, LightAutoML-kehys tarjoaa nopean ja lähes optimaalisen hyperparametrien etsinnän. Vaikka malli ei optimoi näitä hyperparametreja suoraan, se saavuttaa tyydyttävät tulokset. Lisäksi malli pitää tasapainon nopeuden ja hyperparametrien optimoinnin dynaamisena, jotta malli on optimaalinen pienissä ongelmissa ja tarpeeksi nopea suuremmilla ongelmilla. Toiseksi, LightAutoML-kehys rajoittaa tietoisesti koneoppimismallien valikoimaa vain kahteen tyyppiin: lineaarisiin malleihin ja GBM: iin eli gradient-boost-päätöksentekopuihin, sen sijaan, että se toteuttaisi suuria ensemble-algoritmeja. Primäärinen syy koneoppimismallien valikoiman rajoittamiseen on nopeuttaa LightAutoML-kehyksen suoritusaikaa ilman, että se vaikuttaa negatiivisesti mallin suorituskykyyn annetun ongelman ja datan osalta. Kolmanneksi, LightAutoML-kehys esittää ainutlaatuisen menetelmän valita eri mallien käyttämien piirreiden esikäsittelyschemoja tiettyjen valintasääntöjen ja meta-tilastojen perusteella. LightAutoML-kehys on arvioitu laajalla valikoimalla avoimia tietolähteitä useissa sovelluksissa.

LightAutoML: Metodologia ja arkkitehtuuri

LightAutoML-kehys koostuu Presets-nimisistä moduuleista, jotka on omistettu loppuun asti mallin kehittämiseen tyypillisille koneoppimistehtäville. Tällä hetkellä LightAutoML-kehys tukee Preset-moduuleja. Ensinnäkin, TabularAutoML-Preset keskittyy ratkaisemaan klassisia koneoppimistehtäviä, jotka on määritelty taulukkomuotoisissa tietoaineistoissa. Toiseksi, White-Box-Preset toteuttaa yksinkertaisia tulkittavissa olevia algoritmeja, kuten logistista regressiota, sen sijaan, että se käyttäisi WoE: ta (Weight of Evidence) -koodausta ja diskreettejä piirteitä binäärisen luokittelutehtävän ratkaisemiseen taulukkomuotoisissa tietoaineistoissa. Yksinkertaisten tulkittavissa olevien algoritmien toteuttaminen on yleinen käytäntö mallintaa sovelluksen todennäköisyyttä eri tekijöiden asettamien tulkittavuusrajoitusten vuoksi. Kolmanneksi, NLP-Preset pystyy yhdistämään taulukkomuotoiset tiedot NLP-työkalujen kanssa, mukaan lukien esikoulutetut syvät oppimismallit ja tiettyjen piirreiden erottimet. Viimeksi, CV-Preset toimii kuvadatalla perustuvilla työkaluilla. On tärkeää huomata, että vaikka LightAutoML-malli tukee kaikkia neljää Preset-moduulia, kehys käyttää vain TabularAutoML: ää tuotantotason järjestelmässä.

LightAutoML-kehyksen tyypillinen putki on sisällytetty seuraavaan kuvaan.

Jokainen putki sisältää kolme komponenttia. Ensinnäkin, Reader on objekti, joka vastaanottaa tehtävän tyypin ja raakadatan syötteenä, suorittaa tärkeitä metadata-laskelmia, puhdistaa alkuperäisen datan ja määrittää datamanipulaatiot, jotka on suoritettava ennen eri mallien sovittamista. Seuraavaksi, LightAutoML:n sisäiset tietokannat sisältävät CV-iteraattorit ja metadata, jotka toteuttavat validointischemat tietokannoissa. Kolmas komponentti on useita koneoppimispuitteita, jotka on pinottu ja / tai sekoitettu yhdistämään yksittäinen ennuste. Koneoppimispuitteessa LightAutoML-kehyksen arkkitehtuuri on yksi useista koneoppimismalleista, jotka jakavat yhteisen datan validointi- ja esikäsittelyskeeman. Esikäsittelyvaiheessa voi olla jopa kaksi piirrevalintavaihetta, piirretekniikkavaihe tai se voi olla tyhjä, jos esikäsittelyä ei tarvita. ML-puitteita voidaan laskea itsenäisesti samojen tietokantojen kanssa ja sitten sekoittaa yhteen keskiarvon (tai painotetun keskiarvon) avulla. Vaihtoehtoisesti voidaan käyttää pinottua ensemble-skeemaa monitasoisten ensemble-arkkitehtuurien luomiseen.

LightAutoML Tabular Preset

LightAutoML-kehyksessä TabularAutoML on oletusarvoinen putki, ja se on toteutettu malliin ratkaisemaan kolmea tehtävää taulukkomuotoisissa tietoaineistoissa: binäärisen luokittelun, regressiota ja moniluokkaisen luokittelun laajalle valikoimalle suorituskykymittareita ja häviämismenetelmiä varten. Taulu, jossa on seuraavat neljä saraketta: kategoriat, numeeriset piirteet, aikaleimat ja yksi kohdesarake luokkaluokilla tai jatkuvalla arvolla, syötetään TabularAutoML-komponenttiin syötteenä. Yksi LightAutoML-kehyksen suunnittelun tärkeimmistä tavoitteista oli suunnitella työkalu nopealle hypoteesien testaukselle, josta johtuen kehys välttää brutaali- menetelmiä putken optimointiin ja keskittyy vain tehokkuusmenetelmiin ja malleihin, jotka toimivat laajalla valikoimalla tietoaineistoja.

Auto-Typing ja datan esikäsittely

Erilaisten piirteiden käsittelyssä eri tavoilla mallin on tiedettävä kunkin piirteen tyyppi. Tilanteessa, jossa on yksittäinen tehtävä pienellä tietoaineistolla, käyttäjä voi määrittää kunkin piirteen tyypin manuaalisesti. Kuitenkin määrittäminen kunkin piirteen tyyppiä manuaalisesti ei ole enää käytännöllinen vaihtoehto tilanteissa, jotka sisältävät satoja tehtäviä, joissa on tuhansia piirteitä. TabularAutoML-Presetin osalta LightAutoML-kehyksen on kartoitettava piirteet kolmeen luokkaan: numeerinen, kategoria ja aikaleima. Yksi yksinkertainen ja ilmeinen ratkaisu on käyttää sarakkeen tietotyyppiä itse piirretyyppinä, eli kartoittaa float / int -sarakkeet numeerisiin piirteisiin, aikaleima tai merkkijono, joka voidaan parsia aikaleimaksi, aikaleimaan ja muut kategoriaan. Kuitenkin tämä kartoitus ei ole paras, koska numeeristen tietotyyppien esiintyminen kategoriapalstoissa on usein.

Validointischemat

Validointischemat ovat tärkeä osa AutoML-kehyksiä, koska teollisuuden data on altis muutoksille ajan myötä, ja tämä muutos tekee IID- eli identtisesti jakautuneiden oletukset irrelevantiksi mallin kehittämisessä. AutoML-mallit käyttävät validointischemoja arvioidakseen suorituskykyään, etsimään hyperparametreja ja ulosjakautuvan ennusteen luomiseksi. TabularAutoML-pipeline toteuttaa kolme validointischemaa:

  • KFold Cross Validation: KFold Cross Validation on oletusarvoinen validointischema TabularAutoML-pipelineen, mukaan lukien GroupKFold käyttäytymismalleille ja stratifioitu KFold-luokittelutehtäville.
  • Pidä-ulos-validointi: Pidä-ulos-validointischema toteutetaan, jos pidä-ulosjoukko on määritelty.
  • Mukautettavat validointischemat: Mukautettavia validointischemoja voidaan luoda käyttäjien yksittäisten tarpeiden mukaan. Mukautettavat validointischemat sisältävät ristivalidoinnin ja aikasarja-jakojen.

Piirrevalinta

Vaikka piirrevalinta on tärkeä osa mallien kehittämistä teollisuuden standardeina, koska se mahdollistaa vähentämisen inference- ja mallin toteutuskustannuksissa, useimmat AutoML-ratkaisut eivät keskity tähän ongelmaan. Toisaalta TabularAutoML-pipeline toteuttaa kolme piirrevalintastrategiaa: Ei valintaa, Merkityksen leikkausvalinta ja Merkityksen perusteella eteenpäin valinta. Näistä kolmesta Merkityksen leikkausvalinta on oletusarvoinen valintastrategia. Lisäksi on kaksi pääasiallista tapaa arvioida piirreiden merkitystä: split-pohjainen puun merkitys ja GBM-mallin eli gradient-boost-päätöksentekopuiden permuutio-merkitys. Merkityksen leikkausvalinnan pääasiallinen tavoite on hylätä piirteet, jotka eivät ole hyödyllisiä mallille, jotta malli voi vähentää piirteiden määrää ilman, että se vaikuttaa suorituskykyyn negatiivisesti, lähestymistapa, joka voi nopeuttaa mallin inference- ja koulutusnopeutta.

Yllä oleva kuva vertaa eri valintastrategioita binäärisissä pankkidataaineistoissa.

Hyperparametrien säätö

TabularAutoML-pipeline toteuttaa eri lähestymistapoja hyperparametrien säätöön sen mukaan, mitä säädellään.

  • Varhainen lopettaminen hyperparametrien säätö valitsee iterointien määrän kaikille malleille koulutusvaiheessa.
  • Asiantuntija-järjestelmä hyperparametrien säätö on yksinkertainen tapa asettaa hyperparametreja malleille tyydyttävällä tavalla. Se estää lopullisen mallin suuren laskun suorituskyvystä verrattuna kovin sääteltyihin malleihin.
  • Puu-rakenteinen Parzen-estimaatio eli TPE GBM- eli gradient-boost-päätöksentekopuille. TPE on sekoitettu säätöstrategia, joka on oletusvalinta LightAutoML-pipelineen. Jokaiselle GMB-kehykselle LightAutoML-kehys kouluttaa kaksi mallia: ensimmäinen saa asiantuntija-hyperparametreja, toinen on hienosäädetty sopimaan aikabudjettiin.
  • Ruudukko-haku hyperparametrien säätö toteutetaan TabularAutoML-pipelineen hienosäätääkseen lineaarisen mallin säännöstysparametreja varhaisen lopettamisen ja lämmittämisen kanssa.

Malli säätää kaikki parametriensa maksimoidakseen metrijärjestelmän, joko määritelty käyttäjän toimesta tai oletusarvo ratkaistavalle tehtävälle.

LightAutoML: Kokeilu ja suorituskyky

Arvioidakseen suorituskykyä, TabularAutoML-Preset LightAutoML-kehyksessä verrataan olemassa oleviin avoimiin ratkaisuihin useissa tehtävissä ja vahvistaa LightAutoML-kehyksen ylivoimaisen suorituskyvyn. Ensinnäkin, vertailu tehdään OpenML-benchmarkilla, joka arvioidaan 35 binäärisen ja moniluokkaisen luokittelutehtävän tietoaineistojen kanssa. Seuraava taulukko tiivistää LightAutoML-kehyksen vertailun olemassa oleviin AutoML-järjestelmiin.

Kuten voidaan nähdä, LightAutoML-kehys ylittää kaikki muut AutoML-järjestelmät 20 tietoaineistossa benchmarkissa. Seuraava taulukko sisältää yksityiskohtaisen vertailun tietoaineiston kontekstissa, osoittaen, että LightAutoML toimii eri tehtävien luokissa eri tavoin. Binäärisissä luokittelutehtävissä LightAutoML jää suorituskyvyltään jälkeen, kun taas tehtävissä, joissa on paljon dataa, LightAutoML-kehys saavuttaa ylivoimaisen suorituskyvyn.

Seuraava taulukko vertaa LightAutoML-kehyksen suorituskykyä AutoML-järjestelmiin 15 pankkidataaineistossa, jotka sisältävät joukon eri binäärisiä luokittelutehtäviä. Kuten voidaan havaita, LightAutoML ylittää kaikki AutoML-ratkaisut 12: lla 15 tietoaineistosta, voittoprosentti 80.

Lopputajat

Tässä artikkelissa olemme puhuneet LightAutoML: stä, AutoML-järjestelmästä, joka on kehitetty ensisijaisesti eurooppalaisen rahoitussektorilla toimivan yrityksen ekosysteemin tarpeisiin. LightAutoML-kehys on käytössä useissa sovelluksissa, ja tulokset osoittavat sen suorituskyvyn olevan vertailukelpoinen data-tutkijoiden tasoon, jopa korkealaatuisissa koneoppimismalleissa. LightAutoML-kehys pyrkii tekemään seuraavat panokset. Ensinnäkin, LightAutoML-kehys kehitettiin ensisijaisesti suuren eurooppalaisen rahoitus- ja pankkisektorin ekosysteemin tarpeisiin. Sen kehys- ja arkkitehtuurinsa ansiosta LightAutoML-kehys pystyy ylittämään nykyiset AutoML-kehykset useilla avoimilla vertailuilla sekä ekosysteemisovelluksissa. LightAutoML-kehyksen suorituskyky on myös verrattu malleihin, jotka on säätelty manuaalisesti data-tutkijoilla, ja tulokset osoittavat vahvemman suorituskyvyn LightAutoML-kehyksessä.

Ammattina insinööri, sydämen vuoksi kirjailija. Kunal on tekninen kirjailija, jolla on syvä rakkaus ja ymmärrys AI: sta ja ML: stä, omistautunut yksinkertaistamaan monimutkaisia käsitteitä näissä aloissa hänen viihdyttävän ja informatiivisen dokumentaationsa kautta.