Tankeledere
Hvordan kan vi bruke dyp læring med små data? – Tankeledere

Når det gjelder å holde oss oppdatert med nye trender innen cybersikkerhet, kan prosessen med å følge med de siste utviklingene bli ganske kjedelig, siden det er mye nyheter å holde styr på. Disse dagene har imidlertid situasjonen endret seg dramatisk, siden cybersikkerhetsområdene synes å dreie seg rundt to ord – dyp læring.
Selv om vi initialt ble overrasket av den massive dekningen som dyp læring mottok, ble det raskt klart at all oppmerksomheten rundt dyp læring var vel fortjent. På en måte ligner dyp læring menneskehjernen, og gjør det mulig for en AI-modell å oppnå svært nøyaktige resultater ved å utføre oppgaver direkte fra tekst, bilder og lydkilder.
Frem til dette punktet trodde man at dyp læring avhenger av en enorm mengde data, lignende størrelsen på data som Silicon Valley-gigantene Google og Facebook har tilgang til, for å løse de mest kompliserte problemene innen en organisasjon. I motsetning til hva mange tror, kan imidlertid bedrifter utnytte kraften til dyp læring, selv med begrensede data.
I et forsøk på å hjelpe våre lesere med den nødvendige kunnskapen til å utruste deres organisasjon med dyp læring, har vi samlet en artikkel som dykker dypt (uten å være for åndssvag) inn i noen av måtene bedrifter kan utnytte fordelen av dyp læring på tross av begrensede data.
Men før vi kan gå inn i kjernen av artikkelen, ønsker vi å gi et lite, men svært viktig råd – start enkelt. Før du begynner å utforme komplekse neurale nettverk som kunne være med i en science fiction-film, start med å eksperimentere med noen enkle og konvensjonelle modeller (for eksempel random forest) for å få kjennskap til programvaren.
Med det sagt, la oss gå rett inn i noen av måtene bedrifter kan kombinere dyp læringsteknologi med begrensede data.
#1- Finjustering av baseline-modellen:
Som vi allerede har nevnt ovenfor, er det første skrittet bedrifter må ta etter å ha utformet en enkel baseline-dyp læring-modell å finjustere den for det spesifikke problemet som skal løses.
Finjustering av en baseline-modell høres imidlertid mye vanskeligere ut på papir enn det faktisk er. Den grunnleggende ideen bak finjustering av en stor datamengde for å tilpasse den til de spesifikke behovene til en bedrift er enkel – du tar en stor datamengde som ligner på domenet du opererer i, og finjusterer detaljene i den opprinnelige datamengden med din begrensede data.
Så langt som å skaffe den store datamengden angår, kan bedriftseiere stole på ImageNet, som også tilbyr en enkel løsning på problemer med bildeklassifisering. Datamengden som vertservert av ImageNet gir organisasjoner tilgang til millioner av bilder, som er fordelt over flere klasser av bilder, som kan være nyttige for bedrifter fra en rekke domener, inkludert, men ikke begrenset til, bilder av dyr osv.
Hvis prosessen med å finjustere en forhåndsdefinert modell for å tilpasse den til de spesifikke behovene til din organisasjon fortsatt synes å være for mye arbeid for deg, anbefaler vi å søke hjelp på internettet, da en enkel søkning på Google vil gi deg hundredvis av tutoriale om hvordan du kan finjustere en datamengde.
#2- Samle inn mer data:
Selv om det andre punktet på vår liste kan synes unødvendig for noen av våre mer skeptiske lesere, er faktum at når det gjelder dyp læring, jo større datamengden er, jo mer sannsynlig er det at du vil oppnå mer nøyaktige resultater.
Selv om kjernen i denne artikkelen består i å gi bedrifter med begrensede datamengder muligheten til å utnytte fordelen av dyp læring, har vi ofte hatt ulempen av å møte for mange “høyere opp” som behandler investering i datasamling som en kardinal synd.
Det er alt for ofte at bedrifter overseer fordelen av dyp læring, bare fordi de er motvillige til å investere tid og innsats i datasamlingen. Hvis din bedrift er usikker på hvor mye data som må samles inn, anbefaler vi å tegne læringskurver, og observere endringen i modellens ytelse når den ekstra datamen er integrert i modellen.
I motsetning til den vanlige oppfatningen som holdes av de fleste CSO’er og CISO’er, er det ofte slik at den beste måten å løse problemer på er gjennom å samle inn mer relevant data. Rollen til CSO og CISO er ekstremt viktig i dette tilfelle, siden det alltid er en trussel mot cyberangrep. Det er funnet at i 2019, var den totale globale utgift på cybersikkerhet på 103,1 milliarder dollar, og tallet fortsatt å øke. For å sette dette i perspektiv, la oss betrakte et enkelt eksempel – forestill deg at du prøvde å klassifisere sjeldne diamanter, men hadde begrensede data. Som den mest åpenbare løsningen på problemet, istedenfor å ha en fest med baseline-modellen, samle inn mer data!
#3- Dataforbedring:
Selv om de to første punktene vi har diskutert ovenfor er begge svært effektive i å gi en enkel løsning på de fleste problemene som omgir implementeringen av dyp læring i bedrifter med begrensede datamengder, avhenger de tungt av en viss grad av flaks for å få jobben gjort.
Hvis du ikke kan ha noen suksess med å finjustere en eksisterende datamengde heller, anbefaler vi å prøve dataforbedring. Måten å forbedre data på er enkel. Gjennom prosessen med dataforbedring, endres inndata-mengden, eller forbedres, på en måte som gir en ny utdata, uten å endre verdiene.
For å sette ideen om dataforbedring i perspektiv for våre lesere, la oss betrakte et bilde av en hund. Når det roteres, vil seeren av bildet fortsatt kunne se at det er et bilde av en hund. Dette er akkurat hva god dataforbedring håper å oppnå, i motsetning til et rotert bilde av en vei, som endrer vinkelen og lar mye plass for den dype læring-algoritmen til å komme til en feilaktig konklusjon, og motvirker formålet med å implementere dyp læring i første omgang.
Når det gjelder å løse problemer relatert til bildeklassifisering, fungerer dataforbedring som en nøkkelaktør på feltet og har en rekke dataforbedrings-teknikker som hjelper den dype læring-modellen til å få en dyp forståelse av de forskjellige klassifiseringene av bilder.
Merover, når det gjelder å forbedre data – mulighetene er praktisk talt ubegrensede. Bedrifter kan implementere dataforbedring på en rekke måter, som inkluderer NLP og eksperimentering med GAN’er, som gjør det mulig for algoritmen til å generere ny data.
#4- Implementering av en ensemble-effekt:
Teknologien bak dyp læring dikterer at nettverket er bygget opp av flere lag. Imidlertid, i motsetning til den vanlige oppfatningen som holdes av mange, istedenfor å se på hvert lag som en “økende” hierarki av funksjoner, tjener det siste laget formålet med å tilby en ensemble-mekanisme.
Troen på at bedrifter med begrensede datamengder bør bygge sine nettverk dypt, ble også delt i en NIPs-papir, som speilet den troen vi har uttrykt ovenfor. Bedrifter med små datamengder kan lett manipulere ensemble-effekten til deres fordel, bare ved å bygge sine dype læring-nettverk dypt, gjennom finjustering eller noen annen alternativ.
#5- Inkorporering av autoencodere:
Selv om det femte punktet vi har betraktet har mottatt en relativt begrenset suksess – er vi fortsatt positive til å bruke autoencodere for å forhåndsdefinere et nettverk og initialisere det korrekt.
En av de største grunnene, bortsett fra cyberangrep, til at bedrifter ikke klarer å komme over de første hindrene i å integrere dyp læring, er på grunn av dårlig initialisering, og dens mange fallgruber. Uovervåket forhåndsdefinering kan ofte føre til dårlig eller feilaktig eksekvering av den dype læring-teknologien, som er der autoencodere kan skille seg ut.
Den grunnleggende ideen bak et neuralt nettverk dikterer skapelsen av et neuralt nettverk som forutsier naturen til datamengden som blir input. Hvis du er usikker på hvordan du kan bruke en autoencoder, finnes det flere tutoriale på nettet som gir klare instruksjoner.
Sammentrekning:
Til slutt på artikkelen, ønsker vi å gjøre opp for det vi har sagt gjennom hele artikkelen, med en tillegg – inkorporering av domene-spesifikk kunnskap i læreprosessen! Ikke bare hjelper inkorporeringen av verdifull innsikt til å akselerere læreprosessen, men den tillater også den dype læring-teknologien til å produsere bedre og mer nøyaktige resultater.












