AI-modeller och plattformar

Vad ÃĪr syntetisk data?

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Vad ÃĪr syntetisk data?

Syntetisk data ÃĪr en snabbt vÃĪxande trend och ett framvÃĪxande verktyg inom datavetenskapens omrÃĨde. Vad ÃĪr syntetisk data egentligen? Det korta svaret ÃĪr att syntetisk data bestÃĨr av data som inte baseras pÃĨ nÃĨgon verklig vÃĪrldsfenomen eller hÃĪndelse, utan genereras via en datorprogram. Men varfÃķr blir syntetisk data sÃĨ viktigt fÃķr datavetenskap? Hur skapas syntetisk data? LÃĨt oss utforska svaren pÃĨ dessa frÃĨgor.

Vad ÃĪr en syntetisk datamÃĪngd?

Som termen “syntetisk” antyder, genereras syntetiska datamÃĪngder genom datorprogram, snarare ÃĪn att de samlas in genom dokumentation av verkliga hÃĪndelser. Det primÃĪra syftet med en syntetisk datamÃĪngd ÃĪr att vara tillrÃĪckligt flexibel och robust fÃķr att vara anvÃĪndbar fÃķr utbildning av maskinlÃĪrningsmodeller.

FÃķr att vara anvÃĪndbar fÃķr en maskinlÃĪrningsklassificerare bÃķr den syntetiska datan ha vissa egenskaper. Medan datan kan vara kategorisk, binÃĪr eller numerisk, bÃķr datamÃĪngdens lÃĪngd vara godtycklig och datan bÃķr genereras slumpmÃĪssigt. De slumpmÃĪssiga processer som anvÃĪnds fÃķr att generera datan bÃķr vara kontrollerbara och baseras pÃĨ olika statistiska fÃķrdelningar. SlumpmÃĪssigt brus kan ocksÃĨ lÃĪggas till i datamÃĪngden.

Om den syntetiska datan anvÃĪnds fÃķr en klassificeringsalgoritm, bÃķr mÃĪngden klassseparation vara anpassningsbar, sÃĨ att klassificeringsproblemet kan gÃķras enklare eller svÃĨrare beroende pÃĨ problemets krav. Samtidigt, fÃķr en regressionsuppgift, kan icke-linjÃĪra genereringsprocesser anvÃĪndas fÃķr att generera datan.

VarfÃķr anvÃĪnda syntetisk data?

Medan maskinlÃĪrningsramverk som TensorFlow och PyTorch blir lÃĪttare att anvÃĪnda och fÃĪrdiga modeller fÃķr datorseende och naturligt sprÃĨkbecoming mer allmÃĪnt fÃķrekommande och kraftfulla, ÃĪr det primÃĪra problem som datavetare mÃĨste hantera insamlingen och hanteringen av data. FÃķretag har ofta svÃĨrt att samla in stora mÃĪngder data fÃķr att utbilda en exakt modell inom en given tidsram. HandmÃĪrkning av data ÃĪr en tidskrÃĪvande och kostsam process. Men genom att generera och anvÃĪnda syntetisk data kan datavetare och fÃķretag Ãķvervinna dessa utmaningar och utveckla tillfÃķrlitliga maskinlÃĪrningsmodeller pÃĨ ett snabbare sÃĪtt.

Det finns flera fÃķrdelar med att anvÃĪnda syntetisk data. Det mest uppenbara sÃĪttet som anvÃĪndningen av syntetisk data gynnar datavetenskap ÃĪr att den minskar behovet av att samla in data frÃĨn verkliga hÃĪndelser, och dÃĪrmed kan data genereras och en datamÃĪngd konstrueras mycket snabbare ÃĪn en datamÃĪngd som ÃĪr beroende av verkliga hÃĪndelser. Detta innebÃĪr att stora mÃĪngder data kan produceras pÃĨ en kort tid. Detta ÃĪr sÃĪrskilt sant fÃķr hÃĪndelser som sÃĪllan intrÃĪffar, eftersom mer data kan skapas frÃĨn nÃĨgra ÃĪkta dataexempel. UtÃķver detta kan datan mÃĪrkas automatiskt nÃĪr den genereras, vilket drastiskt minskar den tid som behÃķvs fÃķr att mÃĪrka data.

Syntetisk data kan ocksÃĨ vara anvÃĪndbar fÃķr att fÃĨ trÃĪningdata fÃķr randfall, som ÃĪr instanser som kan intrÃĪffa sÃĪllan men ÃĪr kritiska fÃķr AI:s framgÃĨng. Randfall ÃĪr hÃĪndelser som ÃĪr mycket lika det primÃĪra mÃĨlet fÃķr en AI, men skiljer sig pÃĨ viktiga sÃĪtt. Till exempel kan fÃķremÃĨl som bara delvis syns i vy betraktas som randfall nÃĪr man utformar en bildklassificerare.

Slutligen kan syntetiska datamÃĪngder minimera integritetsproblem. FÃķrsÃķk att anonymisera data kan vara ineffektiva, eftersom ÃĪven om kÃĪnsliga/identifierande variabler tas bort frÃĨn datamÃĪngden, kan andra variabler fungera som identifierare nÃĪr de kombineras. Detta ÃĪr inte ett problem med syntetisk data, eftersom den aldrig baserades pÃĨ en verklig person eller en verklig hÃĪndelse frÃĨn bÃķrjan.

AnvÃĪndningsfall fÃķr syntetisk data

Syntetisk data har en stor mÃĪngd anvÃĪndningsfall, eftersom den kan tillÃĪmpas pÃĨ nÃĪstan alla maskinlÃĪrningsuppgifter. Vanliga anvÃĪndningsfall fÃķr syntetisk data inkluderar sjÃĪlvkÃķrande fordon, sÃĪkerhet, robotik, bedrÃĪgeriskydd och hÃĪlsovÃĨrd.

Ett av de fÃķrsta anvÃĪndningsfallen fÃķr syntetisk data var sjÃĪlvkÃķrande bilar, eftersom syntetisk data anvÃĪnds fÃķr att skapa trÃĪningdata fÃķr bilar i situationer dÃĪr det ÃĪr svÃĨrt eller farligt att fÃĨ verklig, pÃĨ-vÃĪg-trÃĪning. Syntetisk data ÃĪr ocksÃĨ anvÃĪndbar fÃķr att skapa data som anvÃĪnds fÃķr att trÃĪna bildigenkÃĪnningsystem, som Ãķvervakningssystem, mycket mer effektivt ÃĪn att manuellt samla in och mÃĪrka en mÃĪngd trÃĪningdata. Robotiksystem kan vara lÃĨngsamma att trÃĪna och utveckla med traditionella datainsamling och trÃĪningsmetoder. Syntetisk data tillÃĨter robotikfÃķretag att testa och utveckla robotiksystem genom simuleringar. BedrÃĪgeriskyddssystem kan dra nytta av syntetisk data, och nya bedrÃĪgeridetektionsmetoder kan trÃĪnas och testas med data som alltid ÃĪr nytt nÃĪr syntetisk data anvÃĪnds. Inom hÃĪlsovÃĨrdsomrÃĨdet kan syntetisk data anvÃĪndas fÃķr att utforma hÃĪlsoklassificerare som ÃĪr precisa, men som samtidigt skyddar mÃĪnniskors integritet, eftersom datan inte baseras pÃĨ verkliga mÃĪnniskor.

Utmaningar med syntetisk data

Medan anvÃĪndningen av syntetisk data medfÃķr mÃĨnga fÃķrdelar, medfÃķr den ocksÃĨ mÃĨnga utmaningar.

NÃĪr syntetisk data skapas, saknar den ofta avvikare. Avvikare fÃķrekommer naturligt i data, och ÃĪven om de ofta tas bort frÃĨn trÃĪningsdatamÃĪngder, kan deras existens vara nÃķdvÃĪndig fÃķr att trÃĪna tillfÃķrlitliga maskinlÃĪrningsmodeller. UtÃķver detta kan kvaliteten pÃĨ syntetisk data vara mycket varierande. Syntetisk data genereras ofta med en ingÃĨng, eller seed, data, och dÃĪrfÃķr kan datans kvalitet bero pÃĨ kvaliteten pÃĨ ingÃĨngsdatan. Om datan som anvÃĪnds fÃķr att generera den syntetiska datan ÃĪr partisk, kan den genererade datan fÃķrstÃĪrka den partiskheten. Syntetisk data krÃĪver ocksÃĨ nÃĨgon form av utdata/kvalitetskontroll. Den mÃĨste kontrolleras mot mÃĪnskligt annoterad data, eller annan ÃĪkta data i nÃĨgon form.

Hur skapas syntetisk data?

Syntetisk data skapas programmerat med maskinlÃĪrningstekniker. Klassiska maskinlÃĪrningstekniker som beslutsfattande trÃĪd kan anvÃĪndas,liksom djupinlÃĪrningstekniker. Kraven pÃĨ den syntetiska datan kommer att pÃĨverka vilken typ av algoritm som anvÃĪnds fÃķr att generera datan. Beslutsfattande trÃĪd och liknande maskinlÃĪrningsmodeller lÃĨter fÃķretag skapa icke-klassiska, multimodala datafÃķrdelningar, trÃĪnade pÃĨ exempel pÃĨ verkliga data. Att generera data med dessa algoritmer kommer att ge data som ÃĪr starkt korrelerad med den ursprungliga trÃĪningsdatan. FÃķr situationer dÃĪr den typiska fÃķrdelningen av data ÃĪr kÃĪnd, kan ett fÃķretag generera syntetisk data genom att anvÃĪnda en Monte Carlo-metod.

DjupinlÃĪrningsbaserade metoder fÃķr att generera syntetisk data anvÃĪnder vanligtvis antingen en variational autoencoder (VAE) eller en generativt adversarial nÃĪtverk (GAN). VAE:er ÃĪr oÃķvervakade maskinlÃĪrningsmodeller som anvÃĪnder encoders och decoders. Encodern i en VAE ÃĪr ansvarig fÃķr att komprimera datan till en enklare, kompakt version av den ursprungliga datamÃĪngden, som decodern sedan analyserar och anvÃĪnder fÃķr att generera en representation av basdatan. En VAE trÃĪnas med mÃĨlet att ha en optimal relation mellan indata och utdata, en dÃĪr bÃĨde indata och utdata ÃĪr extremt lika.

NÃĪr det gÃĪller GAN-modeller kallas de “adversariala” nÃĪtverk pÃĨ grund av att GAN:er faktiskt ÃĪr tvÃĨ nÃĪtverk som tÃĪvlar mot varandra. Generatoren ÃĪr ansvarig fÃķr att generera syntetisk data, medan det andra nÃĪtverket (diskriminatoren) fungerar genom att jÃĪmfÃķra den genererade datan med en verklig datamÃĪngd och fÃķrsÃķker avgÃķra vilken data som ÃĪr falsk. NÃĪr diskriminatoren upptÃĪcker falsk data, meddelas generatoren och den gÃķr ÃĪndringar fÃķr att fÃķrsÃķka fÃĨ en ny mÃĪngd data frÃĨn diskriminatoren. I gengÃĪld blir diskriminatoren allt bÃĪttre pÃĨ att upptÃĪcka falska data. De tvÃĨ nÃĪtverken trÃĪnas mot varandra, med falska data som blir allt mer realistiska.

Blogger och programmerare med specialomrÃĨden inom Machine Learning och Deep Learning ÃĪmnen. Daniel hoppas pÃĨ att hjÃĪlpa andra att anvÃĪnda kraften frÃĨn AI fÃķr socialt vÃĪl.