Intervjuer

Amy Steier, Principal Machine Learning Scientist i Gretel.ai – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Amy Steier er Principal Machine Learning Scientist i Gretel.ai, verdens mest avanserte plattform for privat ingeniørkunst. Gretel gjør det enkelt å integrere privatliv i design i datadrevne teknologier. Deres AI-baserte, åpne biblioteker er designet for å transformere, anonymisere og syntetisere følsom informasjon.

Amy er en meget erfaren maskinlærings- og data scientist med over 20 års erfaring. Hennes lidenskap er stor data og å avdekke den skjulte intelligensen innenfor ved hjelp av teknikker fra maskinlæring, data mining, kunstig intelligens og statistikk. Hun er meget dyktig i prediktiv modellering, klassifisering, klaster, anomali oppdaging, data visualisering, ensemble metoder, informasjons gjenvinning, cybersikkerhetsanalyse, NLP, anbefalingsmodeller og brukeradferd analyser.

Hva var det som først tiltalte deg til å søke en karriere innen datavitenskap og maskinlæring?

Min rene, ubesvarte, varige kjærlighet til data. Kraften, mysteriet, intrigen og potensialet i data har alltid fascinert meg. Datavitenskap og maskinlæring er verktøy for å utnytte dette potensialet. Det er også veldig morsomt å jobbe i et felt hvor kunnskapsnivået beveger seg så raskt. Jeg elsker krysningspunktet mellom forskning og produkt. Det er veldig tilfredsstillende å ta banebrytende ideer, skyve dem litt videre og så forme dem til å passe eksisterende, konkrete produktbehov.

For lesere som ikke er kjent med dette, kan du forklare hva syntetisk data er?

Syntetisk data er data som ser ut og oppfører seg som originaldata, men som også er forskjellig nok til å tilfredsstille et bestemt brukstilfelle. Det vanligste brukstilfellet er behovet for å beskytte privatlivet til informasjonen i originaldata. Et annet brukstilfelle er behovet for å skape ekstra data for å øke størrelsen på originaldatasettet. Et tredje brukstilfelle er å hjelpe med å håndtere en klassisk ubalanse eller demografisk forvrengning i originaldatasettet.

Syntetisk data lar oss fortsette å utvikle nye og innovative produkter og løsninger når dataene nødvendig for å gjøre dette ellers ikke ville være til stede eller tilgjengelige.

Hvordan fungerer Gretel-plattformen for å skape syntetisk data via API-er?

Gretel sine privatlivsingeniør-API-er lar deg importere data til Gretel og utforske dataene vi kan trekke ut. Disse er de samme API-ene som brukes av vår konsoll. Ved å eksponere API-ene gjennom et intuitivt grensesnitt, håper vi å gi utviklere og data scientists mulighet til å bygge sine egne arbeidsflyter rundt Gretel.

Mens konsollen gjør det veldig enkelt å skape syntetisk data, lar API-ene deg integrere skapingen av syntetisk data i din arbeidsflyt. Jeg elsker å bruke API-ene fordi de lar meg tilpasse skapingen av syntetisk data til et svært bestemt brukstilfelle.

Kan du diskutere noen av verktøyene som tilbys av Gretel for å hjelpe med å vurdere kvaliteten på den syntetiske dataen?

Etter skapingen av syntetisk data, vil Gretel generere en syntetisk rapport. I denne rapporten kan du se Syntetisk Data Kvalitet Score (SQS), samt en Privatlivsbeskyttelsesnivå-vurdering (PPL).

SQS-poengsummen er en estimat av hvor godt den genererte syntetiske dataen opprettholder de samme statistiske egenskapene som originaldatasettet. I denne forstand kan SQS-poengsummen sees på som en nyttepoengsum eller en tillitspoengsum til om vitenskapelige konklusjoner trekkes fra den syntetiske datasetten ville være de samme hvis man hadde brukt originaldatasettet i stedet.

Syntetisk Data Kvalitet Score beregnes ved å kombinere de enkelte kvalitetsmetrikker: Feltfordelingsstabilitet, Feltkorrelasjonsstabilitet og Dyptestrukturstabilitet.

Feltfordelingsstabilitet er en måling av hvor godt den syntetiske dataen opprettholder de samme feltfordelingene som i originaldataene. Feltkorrelasjonsstabilitet er en måling av hvor godt korrelasjonene mellom feltene er opprettholdt i den syntetiske dataen. Og til slutt måler Dyptestrukturstabiliteten den statistiske integriteten til dyptere, multifelt-distribusjoner og korrelasjoner. For å estimere dette, sammenligner Gretel en Principal Component Analysis (PCA) beregnet først på originaldataene, og deretter på den syntetiske dataen.

Hvordan fungerer Gretel sine privatlivsfilter?

Gretel sine privatlivsfilter var kulminasjonen av mye forskning på naturen til adversarial angrep på syntetisk data. Privatlivsfilterne forhindrer skapingen av syntetisk data med svakheter som vanligvis utnyttes av adversarials. Vi har to privatlivsfilter, det første er Lignende filter, og det andre er Utviklingsfilter. Lignende filter forhindrer skapingen av syntetiske poster som er for lik originalpostene. Disse er primært mål for adversarials som søker å få innsikt i originaldataene. Det andre privatlivsfilteret er Utviklingsfilteret. Dette forhindrer skapingen av syntetiske poster som ville bli ansett som en outlier i rommet definert av treningsdataene. Outliers avdekket i en syntetisk datasett kan utnyttes av Medlemskapsinferenceangrep, Attributinference og en rekke andre adversarial angrep. De er en alvorlig privatlivsrisk.

Hvordan kan syntetisk data hjelpe med å redusere AI-forvrengning?

Den vanligste teknikken er å håndtere den representative forvrengningen av dataene som mates inn i et AI-system. For eksempel, hvis det er en sterk klassisk ubalanse i dine data, eller hvis det eksisterer en demografisk forvrengning i dine data, tilbyr Gretel verktøy for å hjelpe med å måle og deretter løse denne ubalansen i den syntetiske dataen. Ved å fjerne forvrengningen i dataene, fjerner du ofte også forvrengningen i AI-systemet bygget på dataene.

Du synes å nyte å lære om nye maskinlærings-teknologier, hvordan holder du personlig opp med alle endringene?

Les, les og så les litt mer, lol! Jeg nyter å starte dagen min med å lese om nye ML-teknologier. Medium kjenner meg så godt. Jeg nyter å lese artikler i Towards Data Science, Analytics Vidhya og nyhetsbrev som The Sequence. Facebook (META ) AI, Google (GOOGL ) AI og OpenMined har alle gode blogger. Det er en rekke gode konferanser å følge, som NeurIPS, ICML, ICLR, AISTATS.

Jeg nyter også verktøy som sporer sitat-spor, hjelper deg med å finne papirer som ligner på de du liker og som lærer dine spesifikke interesser og alltid ser etter en papir som kan interessere deg. Zeta Alpha er et slikt verktøy jeg bruker mye.

Til slutt kan du ikke undervurdere fordelen av å ha kolleger med lignende interesser. I Gretel, ML-teamet sporer forskningspapirer relevante for feltene vi utforsker og møtes ofte for å diskutere interessante papirer.

Hva er din visjon for fremtiden til maskinlæring?

Enkelt tilgang til data vil initiere en stor tid med innovasjon i maskinlæring, som deretter akselerer innovasjon i et bredt spekter av felt, som helse, finans, produksjon og biovitenskap. Historisk sett kan mange banebrytende fremgang i ML tilskrives en stor mengde rik data. Likevel har mye forskning historisk sett vært hindret av mangelen på tilgang eller deling av data på grunn av privatlivsproblemer. Når verktøy som Gretel fjerner denne barrieren, vil tilgangen til data bli demokratisert. Hele maskinlærings-samfunnet vil dra nytte av tilgang til rik, stor datasett, i stedet for bare noen få elite-megavirksomheter.

Er det noe annet du ønsker å dele om Gretel?

Hvis du elsker data, vil du elske Gretel (så jeg elsker tydeligvis Gretel!). Enkelt tilgang til data har vært torne i siden på hver eneste data scientist jeg noensinne har kjent. I Gretel, tar vi stor ake great pride i having created a console and set of APIs that make the creation of private, shareable data as simple as possible. We profoundly believe that data is more valuable when it is shared. Thank you for the great interview and for sharing your insights, readers who wish to learn more should visit Gretel.ai.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.