Intervjuer
Bailey Kacsmar, doktorand vid University of Waterloo – Intervjuserie

Bailey Kacsmar är doktorand vid Skolan för datavetenskap vid University of Waterloo och blivande lärare vid University of Alberta. Hennes forskningsintressen ligger i utvecklingen av användarmedvetna teknik för att förbättra sekretessen, genom parallell studie av tekniska tillvägagångssätt för privat beräkning samt motsvarande användaruppfattningar, bekymmer och förståelse för dessa tekniker. Hennes arbete syftar till att identifiera potentialen och begränsningarna för sekretess i maskinlärningsapplikationer.
Dina forskningsintressen ligger i utvecklingen av användarmedvetna teknik för att förbättra sekretessen, varför är sekretess i AI så viktig?
Sekretess i AI är så viktig, till stor del för att AI i vår värld inte existerar utan data. Data, medan en användbar abstraktion, är i slutändan något som beskriver människor och deras beteenden. Vi arbetar sällan med data om trädpopulationer och vattennivåer; så, varje gång vi arbetar med något som kan påverka verkliga människor måste vi vara medvetna om detta och förstå hur vårt system kan göra gott eller skada. Detta är särskilt sant för AI där många system drar nytta av stora mängder data eller hoppas på att använda mycket känslig data (såsom hälsodata) för att försöka utveckla nya förståelser av vår värld.
Vilka är några sätt som du har sett att maskinlärning har svikit användarnas sekretess?
Svikit är ett starkt ord. Men, varje gång ett system använder information om människor utan deras samtycke, utan att informera dem och utan att överväga potentiella skador, löper det risken att svika enskilda personers eller samhällets sekretessnormer. I princip resulterar detta i svik genom tusentals små snitt. Sådana metoder kan innefatta att träna en modell på användarnas e-postinkorg, träna på användarnas textmeddelanden eller på hälsodata; allt utan att informera ämnet för data.
Kan du definiera vad differentiell sekretess är och vad dina åsikter om det är?
differentiell sekretess är en definition eller teknik som har vuxit i popularitet när det gäller att uppnå teknisk sekretess. Tekniska definitioner av sekretess inkluderar vanligtvis två nyckelaspekter; vad som skyddas och från vem. Inom teknisk sekretess är sekretessgarantier skydd som uppnås om en serie antaganden uppfylls. Dessa antaganden kan handla om potentiella motståndare, systemkomplexitet eller statistik. Det är en otroligt användbar teknik som har ett brett tillämpningsområde. Men, vad som är viktigt att komma ihåg är att differentiell sekretess inte är ekvivalent med sekretess.
Sekretess är inte begränsad till en definition eller koncept, och det är viktigt att vara medveten om begrepp bortom det. Till exempel kontextuell integritet, som är ett konceptuellt begrepp för sekretess som tar hänsyn till saker som hur olika applikationer eller organisationer förändrar en persons sekretessuppfattning i förhållande till en situation. Det finns också juridiska begrepp för sekretess, såsom de som omfattas av Kanadas PIPEDA, Europas GDPR och Kaliforniens konsumentsskyddslag (CCPA). Allt detta är för att säga att vi inte kan behandla tekniska system som om de existerar i ett vakuum, fria från andra sekretessfaktorer, även om differentiell sekretess används.
En annan sekretessförbättrande typ av maskinlärning är federerad inlärning, hur skulle du definiera vad detta är och vad är dina åsikter om det?
Federerad inlärning är ett sätt att utföra maskinlärning när modellen ska tränas på en samling dataset som är distribuerade över flera ägare eller platser. Det är inte intrinsikalt en sekretessförbättrande typ av maskinlärning. En sekretessförbättrande typ av maskinlärning behöver formellt definiera vad som skyddas, vem som skyddas från och villkoren som måste uppfyllas för att dessa skydd ska gälla. Till exempel, när vi tänker på en enkel differentiellt privat beräkning, garanterar den att någon som ser utdata inte kan avgöra om en viss datapunkt bidrog eller inte.
Ytterligare, differentiell sekretess ger inte denna garanti om, till exempel, det finns korrelation mellan datapunkterna. Federerad inlärning har inte denna funktion; den tränar en modell på en samling data utan att kräva att dataägarna direkt tillhandahåller sina dataset till varandra eller en tredje part. Medan det låter som en sekretessfunktion, behövs en formell garanti för att man inte kan lära sig det skyddade informationsutbytet givet mellanhänder och utdata som de otillförlitliga parterna kommer att observera. Denna formalitet är särskilt viktig i den federerade inställningen där de otillförlitliga parterna inkluderar alla som tillhandahåller data för att träna den kollektiva modellen.
Vilka är några av de nuvarande begränsningarna för dessa tillvägagångssätt?
Nuvarande begränsningar kan bäst beskrivas som naturen hos sekretess-nytta-handeln. Även om du gör allt annat, kommunicerar sekretesskonsekvenserna till de som påverkas, utvärderar systemet för vad du försöker göra, etc., kommer det fortfarande ner till att uppnå perfekt sekretess innebär att vi inte skapar systemet, att uppnå perfekt nytta vanligtvis inte har några sekretessskydd, så frågan är hur vi bestämmer vad som är “ideala” handeln. Hur hittar vi rätt balanspunkt och bygger mot den så att vi fortfarande uppnår önskad funktionalitet medan vi tillhandahåller nödvändiga sekretessskydd.
Du syftar för närvarande till att utveckla användarmedveten sekretessteknik genom parallell studie av tekniska lösningar för privat beräkning. Kan du gå in på några detaljer om vad några av dessa lösningar är?
Vad jag menar med dessa lösningar är att vi kan, löst talat, utveckla vilket tekniskt sekretesssystem som helst. Men, när vi gör detta är det viktigt att avgöra om sekretessgarantierna når de som påverkas. Detta kan innebära att utveckla ett system efter att ha funnit ut vad för slags skydd befolkningen värderar. Detta kan innebära att uppdatera ett system efter att ha funnit ut hur människor faktiskt använder ett system med hänsyn till deras verkliga hot- och riskbedömningar. En teknisk lösning kan vara ett korrekt system som uppfyller definitionen jag nämnde tidigare. En användarmedveten lösning skulle utforma sitt system baserat på indata från användare och andra som påverkas i den avsedda tillämpningsdomänen.
Du söker för närvarande intresserade doktorander som ska börja i september 2024, varför tror du att studenter ska vara intresserade av AI-sekretess?
Jag tror att studenter ska vara intresserade eftersom det är något som bara kommer att växa i sin omfattning inom vår samhälle. För att ha en uppfattning om hur snabbt dessa system växer, se inte längre än den nyliga Chat-GPT-förstärkningen genom nyhetsartiklar, sociala medier och debatter om dess konsekvenser. Vi existerar i ett samhälle där insamling och användning av data är så inbäddat i vår dagliga liv att vi nästan konstant tillhandahåller information om oss själva till olika företag och organisationer. Dessa företag vill använda data, i vissa fall för att förbättra sina tjänster, i andra för vinst. Vid den här punkten verkar det orealistiskt att tro att dessa företags dataanvändningspraxis kommer att ändras. Men, existensen av sekretessbevarande system som skyddar användare medan de fortfarande tillåter viss analys som önskas av företag kan hjälpa till att balansera risk-nytta-handeln som har blivit en så implicit del av vår samhälle.
Tack för den underbara intervjun, läsare som är intresserade av att lära sig mer bör besöka Bailey Kacsmars Github-sida.












