AI-mallit ja alustat
Joustavaus > Tarkkuus: Miksi “mallin joustavuus” pitäisi olla oikea mittari mallien operatiiviselle käytölle
Ingo Mierswa, perustaja, presidentti ja päädata- tutkija RapidMiner:issa.
Data-tiede on edennyt viime vuosina ja monet organisaatiot käyttävät edistynyttä analytiikkaa tai koneoppimismalleja saadakseen syvemmän ymmärryksen prosesseista ja joissain tapauksissa jopa ennustamaan tulevia tuloksia. Muissa “tieteissä” ei usein ole selvää, onko projekti onnistunut vai ei, ja on raportoitu, että jopa 87% data-tiedeprojekteista ei koskaan pääse tuotantoon. Vaikka 100%:n onnistumisaste ei voida odottaa, data-tiedeprojekteissa on joitain ongelmallisia malleja, jotka johtavat korkeampiin onnistumisasteisiin kuin mitä pitäisi pitää hyväksyttävänä alalla. Nämä ongelmalliset mallit näyttävät olevan olemassa riippumatta teollisuudesta tai käyttötarkoituksesta, mikä viittaa siihen, että data-tieteessä on yleinen ongelma, joka on ratkaistava.
Koneoppimisen onnistumisen mittaaminen
Data-tieteilijät, jotka luovat koneoppimismalleja, luottavat hyvin määriteltyihin matemaattisiin kriteereihin, joilla mitataan mallien suorituskykyä. Käytettävät kriteerit riippuvat mallin tyypistä. Oletetaan, että mallin on ennustettava luokat tai kategoriat uusille tilanteille – esimerkiksi, jos asiakas aikoo lopettaa asiakkuuden vai ei. Tällaisissa tilanteissa data-tieteilijät käyttävät mittareita, kuten tarkkuutta (kuinka usein malli on oikein) tai tarkkuutta (kuinka usein asiakkaat ovat todella lopettamassa, kun ennustamme lopettamisen).
Data-tieteilijöiden tarvitsee objektiivisia kriteerejä, koska osa heidän työstään on optimoida näitä arviokriteerejä tuottamaan paras mahdollinen malli. Itse asiassa datan valmistelu mallin tekemiseen on siellä, missä data-tieteilijät viettävät suurimman osan ajastaan.
Tämän huonona puolena on, että data-tieteilijät eivät keskity riittävästi mallejen tuottamiseen, mikä on ongelma useasta syystä. Ensisijaisesti ja ennen kaikkea, mallit, jotka eivät tuota onnistuneita tuloksia, eivät voi tuottaa liiketoimintavaikutusta organisaatioille, jotka käyttävät niitä. Toiseksi, koska nämä organisaatiot ovat käyttäneet aikaa ja rahaa kehittääkseen, kouluttamaan ja operatiivisesti käyttääkseen malleja, jotka eivät ole tuottaneet onnistuneita tuloksia “oikeassa maailmassa”, he ovat todennäköisemmin kuin ei pitäisi pitää koneoppimista ja muita data-tieteen työkaluja hyödyttömänä organisaatiolleen ja kieltäytyvät edistämästä tulevia data-tieteen aloitteita.
Totuus on, että data-tieteilijät nauttivat mallien säätämisestä ja viettävät paljon aikaa siihen. Mutta ilman liiketoimintavaikutusta tämä aika ei ole viisasta käytettävissä, mikä on erityisen tuskallista, koska data-tieteilijät ovat niin harvinaisia nykyään.
Netflix-palkinto ja tuotantovirhe
Olemme nähneet tämän ilmiön, jossa panostetaan liikaa mallin rakentamiseen eikä mallin operatiiviseen käyttöön, viime vuosina. Netflix-palkinto (NFLX ) oli avoin kilpailu parhaasta yhteistyöllisestä suodatusalgoritmista ennustamaan käyttäjien arvosteluita elokuville. Jos antaisit uudelle elokuvalle korkean arvostelun, todennäköisesti nautit elokuvasta – joten käyttäen tätä arvostelujärjestelmää, Netflix suosittelee tietyt nimikkeet sinulle, ja jos nautit suositellusta sisällöstä, todennäköisesti pysyt pidempään Netflixin asiakkaana. Pääpalkinto oli 1 miljoonan dollarin summa, joka annettiin tiimille, joka pystyi parantamaan Netflixin omaa algoritmia vähintään 10%.

Kilpailu alkoi vuonna 2006, ja seuraavien kolmen vuoden aikana yli 40 000 data-tieteen tiimin osallistuminen maailmanlaajuisesti johti vaikuttavaan parantumiseen yli 10% elokuvasuositusten onnistumisessa. Kuitenkin voittajatiimin mallit eivät koskaan operatiivisesti käytetty. Netflix sanoi, että “tarkkuuden parantuminen ei näyttänyt oikeuttavan tarvittavaa ponnistelua näiden mallien operatiiviseen käyttöön”.
Miksi optimaalinen ei aina ole optimaalinen
Mallin tarkkuus ja muut data-tieteen kriteerit on pitkään käytetty mittareina mallin menestyksen mittaamiseen ennen mallin operatiivista käyttöä. Kuten olemme nähneet, monet mallit eivät koskaan pääse tähän vaiheeseen – mikä on resurssien haaskauksia sekä energiana että ajana, jota data-tieteilijät viettävät.
Mutta on enemmän ongelmia tässä kulttuurissa, jossa panostetaan liikaa mallin säätöön. Ensinnäkin on tahaton ylisopeutuminen testidataan, josta seuraa malleja, jotka näyttävät hyvältä datatieteilijöille, mutta jotka todella suorittavat heikosti operatiivisessa käytössä – joskus jopa aiheuttaen vahinkoa. Tämä johtuu kahteen seuraavaan syyhyn:
- On tunnettu ero testivirheen ja siinä, mitä näet operatiivisessa käytössä
- Liiketoimintavaikutus ja data-tieteen suorituskykykriteerit ovat usein korreloivia, mutta “optimaaliset” mallit eivät aina toista suurinta vaikutusta
Ensimmäinen kohta on myös kutsuttu “ylisopeutumiseksi testijoukkoon“. Se on tunnettu ilmiö, erityisesti data-tieteen kilpailujen osanottajille, kuten Kaggle:n. Näissä kilpailuissa voit nähdä vahvemman version tästä ilmiöstä jo julkaistulla ja yksityisellä leaderboardilla. Itse asiassa osanottaja voisi voittaa julkaistun leaderboardin Kaggle-kilpailussa ilman koskaan lukematta dataa. Samoin yksityisen leaderboardin ja koko kilpailun voittaja ei välttämättä ole tuottanut mallia, joka voi ylläpitää suorituskykyään minkään muun kuin arvioitujen datojen kanssa.
Tarkkuus ei ole sama kuin liiketoimintavaikutus
Liian kauan olemme hyväksyneet tämän käytännön, joka johtaa hitaaseen sopeutumiseen testidataryhmiin. Seurauksena on, että mikä näyttää parhaalta mallilta, osoittautuu keskinkertaiseksi parhaassa tapauksessa:
- Mittaukset, kuten ennustettava tarkkuus, eivät usein vastaa liiketoimintavaikutusta
- Tarkkuuden parantuminen 1%:lla ei voida kääntää 1%:n paremmaksi liiketoimintatulokseksi
- On tapauksia, joissa matalan suorituskyvyn malli suorittaa muita paremmin liiketoimintavaikutuksen suhteen
- Muita tekijöitä, kuten ylläpito, pisteytysnopeus tai luotettavuus muutoksia vastaan (jota kutsutaan “joustavuudeksi”), on otettava huomioon myös.
Tämä viimeinen kohta on erityisen tärkeä. Parhaat mallit eivät vain voita kilpailuja tai näytä hyvältä data-tieteen laboratoriossa, vaan ne myös kestävät operatiivisessa käytössä ja suorittavat hyvin useilla testijoukoilla. Nämä mallit ovat niitä, joita kutsumme joustaviksi malleiksi.
Viive ja joustavuuden tärkeys
Kaikki mallit heikentyvät ajan myötä. Ainoa kysymys on, kuinka nopeasti tämä tapahtuu ja kuinka hyvin malli suorittaa muuttuneissa olosuhteissa. Syy tähän heikentymiseen on se, että maailma ei ole staattinen. Sen vuoksi data, jolle malli sovelletaan, muuttuu myös ajan myötä. Jos nämä muutokset tapahtuvat hitaasti, kutsutaan tätä “käsitteen viiveksi”. Jos muutokset tapahtuvat äkkiä, kutsutaan tätä “käsitteen muutokseksi”. Esimerkiksi asiakkaat voivat muuttaa kulutusvälineitänsä hitaasti ajan myötä, vaikuttaen trendeihin ja/tai markkinointiin. Taipumusmallit eivät välttämättä toimi enää tiettynä vaiheena. Nämä muutokset voivat kiihdyttää jyrkkästi tietyissä tilanteissa. COVID-19 on esimerkiksi kiihdyttänyt tiettyjen artikkeleiden, kuten wc-paperin ja desinfektioaineiden, myyntiä – odottamaton terävä nousu tiettyjen tuotteiden myyntiin, joka voi heittää mallin täysin raiteiltaan.
Joustava malli ei välttämättä ole paras malli mittareiden, kuten tarkkuuden tai tarkkuuden, perusteella, mutta se suorittaa hyvin laajemmassa dataryhmässä. Sen vuoksi se myös suorittaa paremmin pidemmän ajan kuluessa ja on paremmin kykenevä tuottamaan kestävää liiketoimintavaikutusta.
Lineaariset ja muut yksinkertaiset mallit ovat usein joustavampia, koska niitä on vaikeampi ylisopeuttaa tiettyyn testijoukkoon tai ajankohtaan. Voimakkaammat mallit voidaan ja pitäisi käyttää “haastajina” yksinkertaisemmalle mallille, jotta data-tieteilijät voivat nähdä, pystyykö se kestämään ajan myötä. Mutta tämä tulisi tehdä matkan lopussa, ei alussa.
Vaikka virallista KPI:ä joustavuuden mittaamiseen ei ole vielä otettu data-tieteen alalle, on useita tapoja, joilla data-tieteilijät voivat arvioida, kuinka joustavia heidän mallinsa ovat:
- Pienemmät keskihajonnat ristiinvalidoinnissa tarkoittavat, että mallin suorituskyky riippui vähemmän eri testijoukkojen yksityiskohdista
- Vaikka data-tieteilijät eivät suorita täysiä ristiinvalidointeja, he voivat käyttää kahta eri datajoukkoa testeihin ja validointiin. Vähemmän eroa virheiden välillä testi- ja validointidatajoukoissa osoittaa suurempaa joustavuutta
- jos malli seurataan operatiivisessa käytössä, virheiden määrä voidaan nähdä ajan myötä. Virheiden määrän johdonmukaisuus ajan myötä on hyvä osoitus mallin joustavuudesta.
- jos mallin seurantaratkaisu ottaa huomioon viiveen, data-tieteilijöiden tulisi myös kiinnittää huomiota siihen, kuinka hyvin malli on vaikuttunut syötteiden muutoksesta.
Data-tieteen kulttuurin muuttaminen
Kun malli on käytössä operatiivisessa vaiheessa, on edelleen uhkia mallin tarkkuudelle. Kaksi viimeistä kohtaa mallin joustavuudesta edellyttävät mallin asianmukaista seurantaa. Data-tieteen kulttuurin muutoksen aloittamiseksi yritykset ovat hyvin neuvottaneet sijoittamaan asianmukaiseen mallin seurantaan ja alkamaan pitämään data-tieteilijöitä vastuussa puutteellisesta suorituskyvystä mallien jälkeen, kun ne on otettu käyttöön. Tämä muuttaa kulttuurin välittömästi mallinrakennus- ja arvonluomiskulttuuriksi data-tieteen alalla.
Kuten viimeaikaiset maailmanlaajuiset tapahtumat ovat osoittaneet, maailma muuttuu nopeasti. Nyt enemmän kuin koskaan tarvitsemme joustavia malleja – ei vain tarkkoja malleja – saadaksemme merkittävää liiketoimintavaikutusta ajan myötä. Kaggle esimerkiksi isännöi haastetta, joka kutsuu data-tieteilijöitä ympäri maailmaa auttamaan malliratkaisujen kehittämisessä COVID-19:ää vastaan. Odotan, että tämän haasteen myötä tuotetut menestyksekkäimmät mallit ovat joustavimpia, ei tarkimmista, koska olemme nähneet, kuinka nopeasti COVID-19 -data voi muuttua yhden päivän aikana. Data-tiede tulisi olla totuuden etsimisestä, ei “parhaan” mallin tuottamisesta. Pitämällä itseämme korkeamman joustavuuden standardin kuin tarkkuuden, data-tieteilijät voivat toimittaa enemmän liiketoimintavaikutusta organisaatioillemme ja auttaa muokkaamaan tulevaisuutta myönteisesti.












