Tankeledare

Mänsklig datormaskinutbildning för maskinlärning är resurskrävande: Dessa två tillvägagångssätt är avgörande för att minska kostnaderna

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Av: Dattaraj Rao, Chef för data vetenskap, Persistent Systems

Som med alla system som är beroende av datainmatningar är maskinlärning (ML) underkastad aksiomet “skräp-in-skräp-ut”. Rent och korrekt märkt data är grunden för att bygga någon ML-modell. En ML-träningsalgoritm förstår mönster från grund-sanning-data och lär sig sedan att generalisera på osynliga data. Om kvaliteten på din träningsdata är låg, kommer det att vara mycket svårt för ML-algoritmen att kontinuerligt lära och extrapolera.

Tänk på det i termer av att träna en hund. Om du misslyckas med att korrekt träna hunden med grundläggande beteendekommandon (inmatningar) eller gör det felaktigt/inkorrekt, kan du aldrig förvänta dig att hunden ska lära och expandera genom observation till mer komplexa positiva beteenden, eftersom de underliggande inmatningarna var frånvarande eller felaktiga från början. Korrekt träning är tidskrävande och kan även vara kostsam om du anlitar en expert, men avkastningen är stor om du gör det rätt från början.

När du tränar en ML-modell kräver skapandet av kvalitetsdata att en domänexpert tillbringar tid med att annotera data. Detta kan inkludera att välja ett fönster med det önskade objektet i en bild eller tilldela en etikett till en textinmatning eller en databaspost. Särskilt för ostrukturerad data som bilder, videor och text spelar annoteringskvaliteten en stor roll för att bestämma modellkvaliteten. Vanligtvis är oannoterad data som råbilder och text riklig, men märkning är där ansträngningen behöver optimeras. Detta är den mänskliga delen av ML-livet och är vanligtvis den mest kostsamma och arbetsintensiva delen av något ML-projekt.

Data annoteringsverktyg som Prodigy, Amazon Sagemaker Ground Truth, NVIDIA RAPIDS och DataRobot human-in-the-loop förbättras konstant i kvalitet och tillhandahåller intuitiva gränssnitt för domänexperter. Men att minimera den tid som domänexperter behöver för att annotera data är fortfarande en betydande utmaning för företag idag – särskilt i en miljö där data science-talang är begränsad men efterfrågad. Här kommer två nya tillvägagångssätt för datormaskinutbildning in i bilden.

Aktivt lärande

Aktivt lärande är en metod där en ML-modell aktivt frågar en domänexpert om specifika annoteringar. Här ligger fokus inte på att få en fullständig annotering av oannoterad data, utan bara på att få de rätta datapunkterna annoterade så att modellen kan lära sig bättre. Ta till exempel hälso- och livsvetenskaper, ett diagnostikföretag som specialiserar sig på tidig cancerdetektering för att hjälpa kliniker fatta informerade, data-drivna beslut om patientvård. Som en del av deras diagnostiska process behöver de annotera CT-skanningsbilder med tumörer som behöver markeras.

Efter att ML-modellen har lärt sig från ett fåtal bilder med tumörblock markerade, kommer modellen med aktivt lärande att sedan bara be användarna att annotera bilder där den är osäker på närvaron av en tumör. Dessa kommer att vara gränspunkter, som när de är annoterade kommer att öka modellens tillförlitlighet. Där modellen är tillförlitlig ovanför en viss tröskel, kommer den att göra en själv-annotering istället för att be användaren att annotera. Detta är hur aktivt lärande försöker hjälpa till att bygga precisa modeller samtidigt som det minskar den tid och ansträngning som krävs för att annotera data. Ramverk som modAL kan hjälpa till att öka klassificeringsprestanda genom att intelligent fråga domänexperter att märka de mest informativa instanserna.

Svag tillsyn

Svag tillsyn är ett tillvägagångssätt där bullrig och ofullständig data eller abstrakta koncept kan användas för att ge indikationer för märkning av en stor mängd oövervakad data. Detta tillvägagångssätt använder vanligtvis svaga märkare och försöker kombinera dessa i en ensemble-tillvägagångssätt för att bygga kvalitetsmärkt data. Ansträngningen är att försöka inkorporera domänkunskap i en automatiserad märkningsaktivitet.

Exempelvis, om en Internet-leverantör (ISP) behövde ett system för att flagga e-postdataset som skräp eller inte skräp, kunde vi skriva svaga regler som att kontrollera efter fraser som “erbjudande”, “grattis”, “gratis” etc., som vanligtvis är associerade med skräp-e-post. Andra regler kunde vara e-post från specifika mönster av källadresser som kan sökas med reguljära uttryck. Dessa svaga funktioner kunde sedan kombineras av ett svagt tillsyns-ramverk som Snorkel och Skweak för att bygga förbättrad kvalitets-träningsdata.

ML i sin kärna handlar om att hjälpa företag skala processer exponentiellt på sätt som är fysiskt omöjliga att uppnå manuellt. Men ML är inte magi och beror fortfarande på människor för att a) konfigurera och träna modellerna korrekt från början och b) ingripa när det behövs för att säkerställa att modellen inte blir för snedvriden till den grad att resultaten inte längre är användbara och kan vara kontraproduktiva eller negativa.

Målet är att hitta sätt som hjälper till att strömlinjeforma och automatisera delar av det mänskliga engagemanget för att öka tid-till-marknad och resultat, men samtidigt stanna inom ramarna för optimal noggrannhet. Det är allmänt accepterat att få kvalitetsmärkt data är den mest kostsamma men extremt viktiga delen av ett ML-projekt. Detta är ett utvecklande område, och mycket arbete pågår för att minska den tid som domänexperter tillbringar med att annotera data och förbättra kvaliteten på data-märkningar. Att utforska och utnyttja aktivt lärande och svag tillsyn är en solid strategi för att uppnå detta över flera branscher och användningsfall.

Dattaraj Rao, Chief Data Scientist på Persistent Systems, är författare till boken “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” På Persistent Systems leder Dattaraj AI Research Lab som utforskar state-of-the-art-algoritmer inom Computer Vision, Natural Language Understanding, Probabilistic programming, Reinforcement Learning, Explainable AI, etc. och demonstrerar tillämpbarhet inom hälso- och sjukvård, bank och industriella områden. Dattaraj har 11 patent inom Machine Learning och Computer Vision.