Tankeledere

Menneskelig dataforberedelse for maskinlæring er ressurskrevende: Disse to tilnærmingene er kritiske for å redusere kostnadene

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Av: Dattaraj Rao, Chief Data Scientist, Persistent Systems

Som med alle systemer som avhenger av datainndata, er maskinlæring (ML) underlagt aksiomet “skralle inn – skralle ut”. Rent og nøyaktig merket data er grunnlaget for å bygge noen ML-modell. En ML-treningsalgoritme forstår mønster fra grunn-sannheten data og lærer deretter måter å generalisere på usette data. Hvis kvaliteten på din treningsdata er lav, vil det være svært vanskelig for ML-algoritmen å fortsette å lære og ekstrapolere.

Tenker på det i sammenheng med å trene en hund. Hvis du ikke ordentlig trener hunden med grunnleggende adferdskommandoer (inndata) eller gjør det feil/uvakt, kan du aldri forvente at hunden skal lære og utvide gjennom observasjon til mer komplekse positive adferd, fordi de underliggende inndata var fraværende eller feil, fra starten av. Riktig trening er tidkrevende og kan være kostbar hvis du bringer inn en ekspert, men gevinsten er stor hvis du gjør det riktig fra starten.

Når du trener en ML-modell, krever å lage kvalitetsdata at en domene-ekspert må bruke tid på å annotere dataene. Dette kan inkludere å velge et vindu med det ønskede objektet i et bilde eller å tildele en merking til en tekstinnføring eller en databasepost. Spesielt for ustrukturert data som bilder, videoer og tekst, spiller annoteringskvaliteten en stor rolle i å bestemme modellkvaliteten. Vanligvis er umerket data som råbilder og tekst rikelig tilgjengelig – men merking er der anstrengelsen må optimeres. Dette er mennesket-i-løkken delen av ML-livet og er vanligvis den mest kostbare og arbeidskrevende delen av noen ML-prosjekt.

Data-annoteringsverktøy som Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS og DataRobot menneske-i-løkken er konstant forbedret i kvalitet og tilbyr intuitive grensesnitt for domene-eksperter. Likevel er det å minimere tiden som domene-eksperter må bruke på å annotere data fremdeles en betydelig utfordring for bedrifter i dag – spesielt i en omgang hvor data-vitenskapelig talent er begrenset, men høyt etterspurt. Her kommer to nye tilnærminger til dataforberedelse inn i bildet.

Aktiv læring

Aktiv læring er en metode hvor en ML-modell aktivt spør en domene-ekspert om bestemte annoteringer. Her er fokuset ikke på å få en fullstendig annotering på umerket data, men bare på å få de riktige datapunktene annotert så modellen kan lære bedre. Ta for eksempel helse- og livsvitenskap, et diagnostisk selskap som spesialiserer seg på tidlig kreftdiagnose for å hjelpe kliniske beslutninger om pasientbehandling. Som en del av deres diagnoseprosess, må de annotere CT-skanningsbilder med svulster som må markeres.

Etter at ML-modellen har lært fra noen bilder med svulstblokker merket, vil aktiv læring gjøre at modellen bare spør brukerne om å annotere bilder hvor den er usikker på svulstens tilstedeværelse. Disse vil være grensepunkter, som når de er annotert, vil øke modellens tillit. Hvor modellen er sikker over en bestemt terskel, vil den gjøre en selv-annotering i stedet for å spørre brukeren om å annotere. Dette er hvordan aktiv læring prøver å bygge nøyaktige modeller samtidig som den reduserer tiden og anstrengelsen som kreves for å annotere data. Rammer som modAL kan hjelpe med å øke klassifiseringsytelsen ved å inteligent spørre domene-eksperter om å merke de mest informative eksemplene.

Svag tilsyn

Svag tilsyn er en tilnærming hvor støyende og upresise data eller abstrakte konsepter kan brukes til å gi indikasjoner for å merke en stor mengde uovervåket data. Denne tilnærmingen bruker vanligvis svake merkerere og prøver å kombinere disse i en ensemble-tilnærming for å bygge kvalitets-annotert data. Anstrengelsen er å prøve å inkorporere domenekunnskap i en automatisert merkingaktivitet.

For eksempel, hvis en Internett-tilbyder (ISP) trengte et system for å flagge e-postdatasett som spam eller ikke-spam, kunne vi skrive svake regler som å sjekke for fraser som “tilbud”, “gratulerer”, “gratis” osv., som vanligvis er forbundet med spam-e-post. Andre regler kunne være e-post fra bestemte mønster av kildeadresser som kan søkes med regulære uttrykk. Disse svake funksjonene kunne deretter kombineres av en svag tilsynsramme som Snorkel og Skweak for å bygge forbedret kvalitets-treningdata.

ML i sin kjerne handler om å hjelpe selskaper å skalerer prosesser eksponentielt på måter som er fysisk umulig å oppnå manuelt. Likevel er ML ikke magi og avhenger fortsatt av mennesker for å a) sette opp og trene modellene riktig fra starten og b) gripe inn når det er nødvendig for å sikre at modellen ikke blir for skjev til hvor resultater ikke lenger er nyttige og kan være kontraproduktive eller negative.

Målet er å finne måter som hjelper med å strømlinje og automatisere deler av menneskelig involvering for å øke tid-til-marked og resultater, men samtidig holde seg innenfor rammene av optimal nøyaktighet. Det er universelt akseptert at å få kvalitets-annotert data er den mest kostbare, men ekstremt viktige delen av et ML-prosjekt. Dette er et utviklingsområde, og mye arbeid er i gang for å redusere tiden som domene-eksperter må bruke på å annotere data og forbedre kvaliteten på data-annoteringer. Å utforske og utnytte aktiv læring og svag tilsyn er en solid strategi for å oppnå dette på tvers av flere industrier og brukstilfeller.

Dattaraj Rao, Chief Data Scientist ved Persistent Systems, er forfatteren av boken “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Ved Persistent Systems, leder Dattaraj AI Research Lab som utforsker state-of-the-art algoritmer i Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI, etc. og demonstrerer anvendelighet i helsetjenester, banking og industrielle domener. Dattaraj har 11 patenter i Machine Learning og Computer Vision.