Intervjuer

Amy Steier, Principal Machine Learning Scientist på Gretel.ai – Intervju-serie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Amy Steier är Principal Machine Learning Scientist på Gretel.ai, världens mest avancerade plattform för privat ingenjörskonst. Gretel gör det enkelt att integrera privatlivsdesign i datadriven teknik. Deras AI-baserade, öppna bibliotek är utformade för att transformera, anonymisera och syntetisera känslig information.

Amy är en mycket erfaren maskinlärnings- och data scientist med mer än 20 års erfarenhet. Hennes passion är stora data och att avslöja den dolda intelligensen med hjälp av tekniker från maskinlärning, data mining, artificiell intelligens och statistik. Hon är mycket skicklig inom prediktiv modellering, klassificering, klusteranalys, avvikelseupptäckt, data visualisering, ensemble metoder, informationsåtervinning, cybersäkerhetsanalys, NLP, rekommendationsmodeller och användarbetenedeanalys.

Vad var det som initialt lockade dig att följa en karriär inom datavetenskap och maskinlärning?

Min ren, obeslöjade och varaktiga kärlek till data. Datans makt, mysterium, intriger och potential har alltid fascinerat mig. Datavetenskap och maskinlärning är verktyg för att utnyttja denna potential. Det är också oerhört roligt att arbeta inom ett område där den senaste utvecklingen rör sig så snabbt. Jag älskar skärningspunkten mellan forskning och produkt. Det är mycket tillfredsställande att ta framkantstankar, driva dem ett steg längre och sedan anpassa dem till befintliga, konkreta produktbehov.

För läsare som inte är bekanta, kan du förklara vad syntetisk data är?

Syntetisk data är data som ser ut och beter sig som den ursprungliga datan, men som också är tillräckligt annorlunda för att tillfredsställa ett visst användningsfall. Det vanligaste användningsfallet är behovet av att skydda den ursprungliga datans sekretess. Ett annat användningsfall är behovet av att skapa ytterligare data för att öka storleken på den ursprungliga datamängden. Ännu ett användningsfall är att hjälpa till att hantera en klassobalans eller perhaps demografisk bias i den ursprungliga datamängden.

Syntetisk data möjliggör för oss att fortsätta utveckla nya och innovativa produkter och lösningar när den nödvändiga datan annars inte skulle finnas tillgänglig.

Hur fungerar Gretel-plattformen för att skapa syntetisk data via API:er?

Gretels API:er för privat ingenjörskonst tillåter dig att mata in data till Gretel och undersöka den data som vi kan extrahera. Dessa är samma API:er som används av vår konsol. Genom att exponera API:erna via ett intuitivt gränssnitt, hoppas vi kunna ge utvecklare och data scientists möjlighet att bygga sina egna arbetsflöden runt Gretel.

Medan konsolen gör det mycket enkelt att skapa syntetisk data, möjliggör API:erna för dig att integrera skapandet av syntetisk data i ditt arbetsflöde. Jag älskar att använda API:erna eftersom de möjliggör för mig att anpassa skapandet av syntetisk data till ett mycket specifikt användningsfall.

Kan du diskutera några av de verktyg som erbjuds av Gretel för att hjälpa till att bedöma kvaliteten på den syntetiska datan?

Efter skapandet av syntetisk data, genererar Gretel en syntetisk rapport. I denna rapport kan du se Syntetisk Datakvalitet Poäng (SQS), samt en sekretessskyddsnivå betyg (PPL).

SQS-poängen är en uppskattning av hur väl den genererade syntetiska datan upprätthåller samma statistiska egenskaper som den ursprungliga datamängden. I denna mening kan SQS-poängen ses som en nyttighetspoäng eller en förtroendepoäng för om vetenskapliga slutsatser som dras från den syntetiska datamängden skulle vara desamma om man hade använt den ursprungliga datamängden istället.

Syntetisk Datakvalitet Poäng beräknas genom att kombinera de enskilda kvalitetsmåtten: Fältfördelningsstabilitet, Fältkorrelationsstabilitet och Djupstruktur Stabilitet.

Fältfördelningsstabilitet är ett mått på hur väl den syntetiska datan upprätthåller samma fältfördelningar som i den ursprungliga datan. Fältkorrelationsstabilitet är ett mått på hur väl korrelationer mellan fält upprätthålls i den syntetiska datan. Och slutligen mäter Djupstruktur Stabilitet den statistiska integriteten hos djupare, multifältfördelningar och korrelationer. För att uppskatta detta, jämför Gretel en Principal Component Analysis (PCA) beräknad först på den ursprungliga datan, sedan igen på den syntetiska datan.

Hur fungerar Gretels sekretessfilter?

Gretels sekretessfilter var kulminationen av mycket forskning om naturen av adverserella attacker på syntetisk data. Sekretessfilter förhindrar skapandet av syntetisk data med svagheter som vanligtvis utnyttjas av adverserella. Vi har två sekretessfilter, det första är likhetsfiltret, och det andra är utbrytningsfiltret. Likhetsfiltret förhindrar skapandet av syntetiska poster som är alltför lika en utbildningspost. Dessa är primära mål för adverserella som försöker få insikt i den ursprungliga datan. Det andra sekretessfiltret är utbrytningsfiltret. Detta förhindrar skapandet av syntetiska poster som skulle betraktas som en utbrytning i utrymmet definierat av utbildningsdatan. Utbrytningar som avslöjas i en syntetisk datamängd kan utnyttjas av medlemsinferencesattacker, attributinferencesattacker och en mängd andra adverserella attacker. De utgör en allvarlig sekretessrisk.

Hur kan syntetisk data hjälpa till att reducera AI-bias?

Den vanligaste tekniken är att hantera den representativa biasen i datan som matas in i ett AI-system. Till exempel, om det finns en stark klassobalans i din data, eller om det finns en demografisk bias i din datamängd, erbjuder Gretel verktyg för att hjälpa till att mäta obalansen och sedan lösa den i den syntetiska datan. Genom att ta bort biasen i datan, tar du ofta bort biasen i AI-systemet som byggs på datan.

Du verkar tycka om att lära dig om nya maskinlärningstekniker, hur håller du personligen koll på alla förändringarna?

Läs, läs och sedan läs lite till, lol! Jag börjar min dag med att läsa om nya ML-tekniker. Jag tycker om att läsa artiklar i Towards Data Science, Analytics Vidhya och nyhetsbrev som The Sequence. Facebook (META ) AI, Google (GOOGL ) AI och OpenMined har alla bra bloggar. Det finns en mängd bra konferenser att följa, som NeurIPS, ICML, ICLR, AISTATS.

Jag tycker också om verktyg som spårar citeringsspår, hjälper dig hitta papper som liknar de du gillar och som lär känna dina specifika intressen och alltid håller utkik i bakgrunden efter ett papper som kan intressera dig. Zeta Alpha är ett sådant verktyg som jag använder mycket.

Slutligen, man kan inte underskatta fördelen av att ha kollegor med liknande intressen. På Gretel, spårar ML-teamet forskningspapper som är relevanta för de områden vi utforskar och träffas ofta för att diskutera intressanta papper.

Vad är din vision för maskinlärningens framtid?

Lätt tillgång till data kommer att initiera en stor era av innovation inom maskinlärning, som i sin tur kommer att accelerera innovation inom en bred spektrum av områden, som hälsovård, finans, tillverkning och biovetenskap. Historiskt sett har många banbrytande framsteg inom ML kunnat tillskrivas en stor mängd rik data. Men historiskt sett har mycket forskning också hämmats av oförmågan att få tillgång till eller dela data på grund av sekretessproblem. När verktyg som Gretel tar bort denna barriär, kommer tillgången till data att demokratiseras. Hela maskinlärningssamhället kommer att dra nytta av tillgång till rik, stor datamängd, istället för bara ett fåtal elitmega-företag.

Finns det något annat du vill dela om Gretel?

Om du älskar data, kommer du att älska Gretel (så jag älskar tydligt Gretel!). Lätt tillgång till data har varit taggen i sidan på varje data scientist jag någonsin har känt. På Gretel, tar vi stort ansvar för att ha skapat en konsol och en uppsättning API:er som gör det möjligt att skapa privat, delbar data så enkelt som möjligt. Vi tror djupt att data är mer värdefull när den delas.

Tack för det underbara intervjun och för att dela dina insikter, läsare som vill lära sig mer bör besöka Gretel.ai.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.