Tankeledere

Succesfult maskinlæringsudvikling kræver en ny paradigme – Tankeledere

mm
Føj Unite.AI til dine foretrukne kilder på Google

Af Victor Thu, præsident, Datatron

Initiativer, der anvender maskinlæringsalgoritmer, kan ikke behandles på samme måde som projekter, der involverer traditionel software. Det er afgørende at arbejde hurtigt, så du kan teste og korrigere fejl og teste igen. Med andre ord skal du være i stand til at fejle hurtigt – og gøre det tidligt i processen. At vente, til senere i processen at finde fejl, kan ende med at blive meget dyrt og tidskrævende.

AI kræver en ny tilgang

Når du udvikler software med den traditionelle metode, bruger du beslutningslogik. For at være så præcis som muligt, indarbejder du logik, der giver softwaren mulighed for at fungere korrekt. Der (typisk) er ingen behov for ændringer efter, at programmets logik er udviklet, bortset fra fejlrettelser. Det er en meget metodisk udviklingsproces; du skrider frem gradvist ved at sikre, at hvert trin i processen er nøjagtigt, før du går videre til det næste. Det er en beprøvet strategi, der konsekvent har vist sin effektivitet for softwareudvikling.

Men du kan ikke bruge samme strategi for AI/ML-projekter, fordi det simpelthen ikke vil virke. I stedet skal du have evnen til at iterere hurtigt og hyppigt for at finde succes med et ML-projekt. Da ML kræver initial træning og er en proces, skal du nærme dig det med viden om, at det ikke vil være nøjagtigt første gang, det deployes.

Denne proces kræver multiple iterationer. Realiteten er, at dit første model vil møde uventede resultater 99% af tiden. Selv hvis du bruger måneder på at træne din model i laboratoriet, vil den uden tvivl ændre sig, når den møder rigtige data og trafik.

Ikke sigt efter umiddelbar perfektion

Så, for at teste en model og bestemme, hvilke ændringer der er nødvendige, skal du være i stand til at sætte den i produktion hurtigt. Du kan derefter foretage justeringer, udgive den igen og forfine den. Af denne grund bør du ikke lægge for megen indsats i at gøre din model fejl fri, før du tester den i produktion; det første forsøg vil ikke være perfekt, og ingen bør forvente, at det er.

Mens modellen udvikles i laboratoriet, kan de ekstra forbedringer fra 92% til 95% nøjagtighed ikke være betydelige for visse brugstilfælde. Hvorfor ikke? Kun en lille del af træningsdataene er blevet brugt til at træne din AI-model. Du kan ende med at investere meget tid og penge for at opnå den ekstra bit af nøjagtighed, mens du samtidig går glip af de fordele, din model kan give dig undervejs.

Effektive skridt i ML-udrulning

Fordi der er en chance for, at en model kan fejle eller producere forkerte forudsigelser, er ML-videnskabsmænd nogle gange tilbageholdende med at sætte en model i produktion. Det giver en vis mening. Du har brug for et system, der giver dig mulighed for at se begivenheder, mens de sker i realtid. Med denne tilgang kan du straks trække og opdatere din model og derefter hurtigt udgive en ny model. I stedet for at blive fanget i “analyse-lammelse” er dette den mest effektive metode til at sætte maskinlæringsmodeller i produktion.

Det er langt bedre at bare lancere modellen og lade den få noget livserfaring. Dette eliminerer dog ikke behovet for, at datavidenskabsmændene udvikler modellen så nøjagtigt som muligt fra starten. Men så snart du er færdig med den første version, bør du starte med at indsamle den vigtige data med det samme.

Du kan også ønske at køre dine modeller i A/B-test-mode eller skygge-mode mod rigtige data som en del af denne proces. På den måde kan du grundlæggende sammenligne præstationerne af de forskellige modeller og have mange data og beviser, før du vælger, hvilken model du skal fremme eller nedrykke.

At opbygge en lokal model i stedet for at fokusere på at skabe en enkelt global model til at forudsige adfærd for makromiljøet er en anden bedste praksis. Med en lokal model kan du bruge data fra bestemte situationer, så modellen opfører sig, som den skal, for hver af disse situationer. Dette sparer tid, data og indsats i forhold til en altomfattende model, der ville kræve en betydelig mængde af disse ressourcer for at sikre, at den fungerer.

At bestemme efterspørgslen efter tilpassede sneakers vil fungere som et eksempel her. Den globale model ville måske være anvendelig for resten af Nordamerika, hvis den var baseret på befolkningen i New York City. Men den ville sandsynligvis ikke repræsentere efterspørgslen i andre dele af landet nøjagtigt. En lokal modelstrategi ville have givet dig mulighed for at opnå højere profitmarginer, som du nu går glip af.

Modeller kræver regelmæssige opdateringer, naturligvis. Modeller kræver løbende opdateringer, fordi miljøets data altid ændrer sig, i modsætning til traditionel software, der kan sættes en gang og efterlades alene. ML-modeller forringes over tid, hvis de ikke itereres på en regelmæssig basis. Dette skal ske under modellens levetid og skal overvåges nøje.

Maskinlærings nye paradigme

At sammenligne maskinlæringsmodeller med traditionel software er uklogt. Men ML-eksperter kan drage fordel af en hurtig udrulningsteknik for AI/ML-modeller, ligesom software-ingeniører har gjort med DevOps. Til ML-projekter har du brug for et system, der giver dig mulighed for hurtigt at lancere modeller. Du skal være i stand til at sammenligne forskellige modeller, effektivt kontrasterende en, der er live, med en, der ikke er. Disse og de andre bedste praksisser, der er nævnt ovenfor, vil hjælpe dig med at omgå analyse-lammelse og fejle hurtigt og tidligt, så du kan skala din maskinlæringsudvikling.

Victor Thu er præsident for Datatron. Gennem sin karriere har Victor specialiseret sig i produktmarkedsføring, go-to-market og produktledelse i C-niveau og direktørstillinger for virksomheder som Petuum, VMware og Citrix.