Tankeledere

Menneskelig dataforberedelse til maskinlæring er ressourcekrævende: To tilgange er afgørende for at reducere omkostningerne

mm
Føj Unite.AI til dine foretrukne kilder på Google

Af: Dattaraj Rao, Chief Data Scientist, Persistent Systems

Som med enhver system, der afhænger af dataindtastninger, er Maskinlæring (ML) underlagt aksiomet “skrald-ind-skrald-ud”. Rent og korrekt mærket data er grundlaget for at bygge enhver ML-model. En ML-træningsalgoritme forstår mønstre fra grundsandhedsdata og lærer herefter at generalisere på usete data. Hvis kvaliteten af din træningsdata er lav, vil det være meget svært for ML-algoritmen at lære og extrapolere kontinuerligt.

Tænk på det i forhold til træning af en hund. Hvis du ikke træner hunden korrekt med grundlæggende adfærdskommandoer (indtastninger) eller gør det forkert/ukorrekt, kan du aldrig forvente, at hunden lærer og udvikler sig gennem observation til mere komplekse positive adfærd, fordi de underliggende indtastninger var fraværende eller fejlbehæftede fra starten. Korrekt træning er tidskrævende og kan endda være kostbar, hvis du hyrer en ekspert, men gevinsten er stor, hvis du gør det rigtigt fra starten.

Når du træner en ML-model, kræver oprettelse af kvalitetsdata, at en domæneekspert bruger tid på at annotere data. Dette kan inkludere valg af et vindue med det ønskede objekt i et billede eller tildeling af en mærkning til en tekstindtastning eller en databasepost. Især for ustruktureret data som billeder, videoer og tekst spiller annotationskvalitet en stor rolle i bestemmelse af modelkvalitet. Som regel er uannoteret data som rå billeder og tekst overflodigt – men mærkning er, hvor indsatsen skal optimeres. Dette er den menneskelige del af ML-livscyklussen og er som regel den dyreste og mest arbejdskrævende del af enhver ML-projekt.

Dataannotationsværktøjer som Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS og DataRobot human-in-the-loop forbedrer konstant i kvalitet og tilbyder intuitive grænseflader for domæneeksperter. Men minimising af den tid, som domæneeksperter skal bruge til at annotere data, er stadig en stor udfordring for virksomheder i dag – især i en situation, hvor datavidenskabskompetence er begrænset, men meget efterspurt. Her kommer to nye tilgange til dataforberedelse ind i billedet.

Aktiv læring

Aktiv læring er en metode, hvor en ML-model aktivt spørger en domæneekspert om bestemte annotationer. Her er fokus ikke på at få en komplet annotation på uannoteret data, men kun på at få de rigtige datapunkter annoteret, så modellen kan lære bedre. Tag for eksempel sundheds- og livsvidenskab, et diagnostisk selskab, der specialiserer sig i tidlig kræftopdækkelse for at hjælpe kliniske beslutningstagere med at træffe informerede data-drevne beslutninger om patientpleje. Som en del af deres diagnostiske proces skal de annotere CT-skanningsbilleder med tumorer, der skal fremhæves.

Efter ML-modellen har lært af nogle billeder med tumorblokke markeret, vil modellen med aktiv læring herefter kun bede brugeren om at annotere billeder, hvor den er usikker på tilstedeværelsen af en tumor. Disse vil være grænsepunkter, som når de annoteres, vil øge modellens tillid. Hvor modellen er sikker over en bestemt grænseværdi, vil den selv annotere i stedet for at bede brugeren om at annotere. Dette er, hvordan aktiv læring forsøger at hjælpe med at bygge præcise modeller, samtidig med at den reducerer den tid og indsats, der kræves til at annotere data. Rammer som modAL kan hjælpe med at øge klassificeringspræstationen ved at intelligent spørge domæneeksperter om at mærke de mest informative eksempler.

Svag tilsyn

Svag tilsyn er en tilgang, hvor støjende og upræcise data eller abstrakte begreber kan bruges til at give indikationer for mærkning af en stor mængde uovervåget data. Denne tilgang bruger som regel støjende mærkere og forsøger at kombinere disse i en ensemble-tilgang for at bygge kvalitetsannoteret data. Bevægelsen er at forsøge at inkorporere domæneviden i en automatiseret mærkningsaktivitet.

For eksempel, hvis en internetudbyder (ISP) havde brug for et system til at markere e-mail-datasæt som spam eller ikke-spam, kunne vi skrive svage regler som at tjekke for fraser som “tilbud”, “tillykke”, “gratis” osv., som oftest er forbundet med spam-e-mail. Andre regler kunne være e-mail fra bestemte mønstre af kildeadresser, som kan søges med regulære udtryk. Disse svage funktioner kunne herefter kombineres af en svag tilsynsramme som Snorkel og Skweak for at bygge forbedret træningsdata.

ML i sin kerne handler om at hjælpe virksomheder med at skala processer eksponentielt på måder, der fysisk er umulige at opnå manuelt. Men ML er ikke magi og afhænger stadig af mennesker til a) at opsætte og træne modellerne korrekt fra starten og b) intervenere, når det er nødvendigt, for at sikre, at modellen ikke bliver forvrænget, så resultaterne ikke længere er nyttige og kan være kontraproduktive eller negative.

Målet er at finde måder at strømline og automatisere dele af den menneskelige involvering for at øge tid-til-marked og resultater, samtidig med at man holder sig inden for rammerne af optimal nøjagtighed. Det er universelt accepteret, at det at få kvalitetsannoteret data er den dyreste, men ekstremt vigtige del af et ML-projekt. Dette er et udviklende område, og der er stor indsats for at reducere den tid, som domæneeksperter skal bruge, og forbedre kvaliteten af dataannotationer. At udforske og udnytte aktiv læring og svag tilsyn er en solid strategi til at opnå dette på tværs af multiple brancher og anvendelsesområder.

Dattaraj Rao, Chief Data Scientist hos Persistent Systems, er forfatteren til bogen “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” Hos Persistent Systems leder Dattaraj AI Research Lab, der udforsker state-of-the-art algoritmer i Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI osv. og demonstrerer anvendelighed i sundheds-, bank- og industriområder. Dattaraj har 11 patenter inden for Machine Learning og Computer Vision.