Ajatusjohtajat
Ihmisen datavalmistelu koneoppimiselle on resursseja vaativaa: Nämä kaksi lähestymistapaa ovat kriittisiä kustannusten laskemiseksi

Toimittaja: Dattaraj Rao, Chief Data Scientist, Persistent Systems
Koneoppimisella (ML) on yhteinen ominaisuus muiden järjestelmien kanssa, jotka riippuvat data-syötteistä: “roska sisään, roska ulos”. Puhdas ja oikein merkitty data on perusta minkä tahansa ML-mallin rakentamiselle. ML-koulutusohjelma ymmärtää mallit perusdatasta ja oppii yleistämään näkemättömästä datasta. Jos koulutusdatan laatu on huono, on vaikea odottaa, että ML-algoritmi oppii jatkuvasti ja extrapoloi.
Ajattele tätä kouluttamalla kotihiiri. Jos et kouluta koira oikein perus käyttäytymisen komentoja (syötteitä) tai teet sen väärin/epätarkasti, et voi odottaa, että koira opi ja laajenee havainnoista monimutkaisiin myönteisiin käyttäytymismalleihin, koska perus syötteet puuttuvat tai ovat virheellisiä alusta alkaen. Oikea koulutus on aikaa vievää ja jopa kallista, jos otat asiantuntijan, mutta palkkio on suuri, jos teet sen oikein alusta alkaen.
Kun koulutat ML-mallia, laadukkaan datan luominen vaatii, että domain-asiantuntija viettää aikaa datan merkinnässä. Tämä voi sisältää valitsemisen halutun kohteen ikkunan valitsemisen kuvasta tai merkinnän liittämisen tekstin merkintään tai tietokantatietueeseen. Erityisesti rakenteettomalle dataille, kuten kuville, videoille ja teksteille, merkintälaatu määrittää mallin laadun. Yleensä merkittämättömät datat, kuten raakakuvat ja teksti, ovat runsaasti saatavilla – mutta merkintä on siellä, missä ponnistelu tarvitaan optimoimaan. Tämä on ihmisen rooli ML- elinkaaren keskellä ja yleensä se on kallein ja työntäyteisin osa mitään ML-projektia.
Data-merkintätyökalut, kuten Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS ja DataRobot human-in-the-loop, paranevat jatkuvasti laadussa ja tarjoavat helppokäyttöisiä käyttöliittymiä domain-asiantuntijoille. Kuitenkin domain-asiantuntijoiden ajan vähentäminen datan merkintään on edelleen merkittävä haaste yrityksille tänään – erityisesti ympäristössä, jossa data-tiede osaamista on rajoitettu, mutta suurella kysynnällä. Tässä kohdassa kaksi uutta lähestymistapaa data-valmisteluun tulevat peliin.
Aktiivinen oppiminen
Aktiivinen oppiminen on menetelmä, jossa ML-malli aktiivisesti kysyy domain-asiantuntijalta tiettyjä merkintöjä. Tässä keskitytään siihen, että saadaan oikeat datapisteet merkitty, jotta malli voi oppia paremmin. Otetaan esimerkki terveydenhuollosta ja elämän tieteistä, diagnostiikkayritys, joka erikoistuu varhaiseen syöpän havaitsemiseen, jotta klinikoille voidaan tehdä perusteltuja tietopohjaisia päätöksiä potilashoidosta. Osana diagnosiprosessia heidän on merkittävä CT-skannauskuvat, joissa on kasvaimia, jotka on korostettava.
Kun ML-malli on oppinut muutamista kuvista, joissa on kasvaimia, aktiivinen oppiminen pyytää käyttäjiä merkittämään kuvat, joissa se epäilee kasvaimen läsnäoloa. Nämä ovat rajapisteitä, jotka, kun ne on merkitty, lisäävät mallin luottamusta. Siellä, missä malli on luottavainen ylittäen tietyn kynnyksen, se tekee itsemerkintän sijaan pyytäisi käyttäjää merkintään. Tässä tapahtuu aktiivinen oppiminen, jolla pyritään rakentamaan tarkat mallit vähentäen datan merkintään tarvittavaa aikaa ja vaivaa. Rakenteet, kuten modAL, voivat auttaa parantamaan luokittelusuorituskykyä älykkäästi kysymällä domain-asiantuntijoilta merkintöjä informaatiivisimmista tapauksista.
Heikko valvonta
Heikko valvonta on lähestymistapa, jossa meluisaa ja epätarkkaa dataa tai abstrakteja käsitteitä voidaan käyttää antamaan vihjeitä suuren määrän valvomattoman datan merkintään. Tämä lähestymistapa käyttää yleensä heikkoja merkintöjä ja yrittää yhdistää ne ensemblessä lähestymistavassa rakentamaan laadukkaita merkittyjä dataa. Pyrkimyksenä on yhdistää domain-tietämys automaattiseen merkintätoimintaan.
Esimerkiksi, jos Internet-palveluntarjoaja tarvitsi järjestelmän, joka merkitsee sähköpostiaineistot roskapostiksi tai ei roskapostiksi, voimme kirjoittaa heikkoja sääntöjä, kuten tarkistamalla lauseita, kuten “tarjous”, “onnittele”, “ilmainen” jne., jotka yleensä liittyvät roskapostiviesteihin. Muita sääntöjä voivat olla sähköposteja tietyn lähteiden osoitteiden malleista, joita voidaan etsiä säännöllisillä lausekkeilla. Nämä heikot funktiot voidaan yhdistää heikon valvonnan kehyksellä, kuten Snorkel ja Skweak, jotta voidaan rakentaa parannettua laadukkaita koulutusdataa.
ML on ydin, joka auttaa yrityksiä skaalautumaan prosesseja eksponentiaalisesti tavoin, jotka ovat fyysisesti mahdottomia saavuttaa manuaalisesti. Kuitenkin ML ei ole magiaa, ja se edelleen riippuu ihmisistä, jotka a) asettavat ja kouluttavat mallit oikein alusta alkaen ja b) puuttuvat, kun tarvitaan, varmistaakseen, että malli ei mene liian kauas, jotta tulokset eivät ole enää hyödyllisiä ja voivat olla vastakkaisia tai negatiivisia.
Tavoitteena on löytää keinoja, jotka auttavat virtaviivaistamaan ja automatisoimaan osia ihmisten osallistumisesta lisätäkseen markkinoille tulon ja tulokset, mutta pysyen optimaalisen tarkin luokan rajoissa. On yleisesti hyväksytty, että laadukkaiden merkittyjen datan saaminen on kallein, mutta erittäin tärkeä osa ML-projektia. Tämä on kehittyvä alue, ja paljon työtä on tekeillä vähentääksesi aikaa, jota domain-asiantuntijat viettävät datan merkintään, ja parantamaan datan laatuun. Aktiivisen oppimisen ja heikon valvonnan tutkiminen ja hyödyntäminen on vankka strategia saavuttaa tämä useiden teollisuudenalojen ja käyttötapauksien yli.












