Interviews

Bailey Kacsmar, PhD-kandidat ved University of Waterloo – Interviewserie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Bailey Kacsmar er en PhD-kandidat på School of Computer Science ved University of Waterloo og en kommende medlem af fakultetet ved University of Alberta. Hendes forskningsinteresser ligger i udviklingen af brugerbevidste teknologier til beskyttelse af privatliv, gennem parallellæsning af tekniske tilgange til privat beregning samt de tilsvarende brugeres perceptioner, bekymringer og forståelse af disse teknologier. Hendes arbejde sigter mod at identificere potentialet og begrænsningerne for privatliv i maskinlæringsapplikationer.

Dine forskningsinteresser ligger i udviklingen af brugerbevidste teknologier til beskyttelse af privatliv, hvorfor er privatliv i AI så vigtigt?

Privatliv i AI er så vigtigt, delvist fordi AI i vores verden ikke eksisterer uden data. Data, selvom det er en nyttig abstraktion, er i sidste ende noget, der beskriver mennesker og deres adfærd. Vi arbejder sjældent med data om træpopulationer og vandniveauer; så når vi arbejder med noget, der kan påvirke rigtige mennesker, har vi brug for at være bevidste om det og forstå, hvordan vores system kan gøre godt eller skade. Dette er særligt sandt for AI, hvor mange systemer fordeler sig på enorme mængder af data eller søger at bruge meget følsomme data (såsom sundhedsdata) for at udvikle nye forståelser af vores verden.

Hvad er nogle måder, du har set, at maskinlæring har forrådt brugernes privatliv?

Forrådt er et stærkt ord. Dog hver gang et system bruger information om mennesker uden deres samtykke, uden at informere dem og uden at overveje mulige skader, løber det risiko for at forråde enkeltpersoners eller samfunds privatlivsnormer. Dette resulterer i forræderi gennem tusindvis af små snit. Sådanne praksisser kan være træning af en model på brugeres email-indbakke, træning på brugeres tekstbeskeder eller på sundhedsdata; alt dette uden at informere dataemnerne.

Kan du definere, hvad differentialprivatliv er, og hvad dine synspunkter på det er?

Differentialprivatliv er en definition eller teknik, der er steget til prominens i forhold til brug af teknisk privatliv. Tekniske definitioner af privatliv omfatter generelt to nøgleaspekter; hvad der beskyttes, og fra hvem. Inden for teknisk privatliv er privatlivsgarantier beskyttelser, der opnås, når en række antagelser er opfyldt. Disse antagelser kan være om potentielle modstandere, systemkompleksiteter eller statistik. Det er en utrolig nyttig teknik, der har en bred vifte af anvendelser. Dog er det vigtigt at huske, at differentialprivatliv ikke er ensbetydende med privatliv.

Privatliv er ikke begrænset til en definition eller koncept, og det er vigtigt at være bevidst om begreber ud over dette. For eksempel kontekstuel integritet, der er et konceptuelt begreb om privatliv, der tager hensyn til, hvordan forskellige applikationer eller organisationer ændrer privatlivsperceptionen hos en person i forhold til en situation. Der er også juridiske begreber om privatliv, såsom dem, der er omfattet af Canadas PIPEDA, Europas GDPR og Californiens forbrugerbeskyttelseslov (CCPA). Alt dette er for at sige, at vi ikke kan behandle tekniske systemer, som om de eksisterer i et vakuum fri for andre privatlivsfaktorer, selvom differentialprivatliv er i brug.

En anden privatlivsforbedrende type maskinlæring er federeret læring, hvordan ville du definere, hvad dette er, og hvad dine synspunkter på det er?

Federeret læring er en måde at udføre maskinlæring, når modellen skal trænes på en samling af datasæt, der er fordelt over flere ejere eller lokaliteter. Det er ikke intrinsisk en privatlivsforbedrende type maskinlæring. En privatlivsforbedrende type maskinlæring har brug for at definere, hvad der beskyttes, hvem der beskyttes fra, og under hvilke betingelser disse beskyttelser skal opfyldes. For eksempel, når vi tænker på en simpel differentielt privat beregning, garanterer det, at nogen, der ser output, ikke kan bestemme, om en bestemt datapunkt blev bidraget eller ej.

Desuden garanterer differentialprivatliv ikke dette, hvis der for eksempel er korrelation mellem datapunkterne. Federeret læring har ikke denne funktion; det træner blot en model på en samling af data uden at kræve, at datasæts ejere direkte giver deres datasæt til hinanden eller en tredjepart. Selvom det lyder som en privatlivsfunktion, er det, der er nødvendigt, en formel garanti for, at man ikke kan lære de beskyttede oplysninger, givet mellemlederne og output, som de upålidelige parter vil observere. Denne formalitet er særligt vigtig i den federerede indstilling, hvor de upålidelige parter inkluderer alle, der bidrager med data til at træne den kollektive model.

Hvad er nogle af de nuværende begrænsninger for disse tilgange?

Nuværende begrænsninger kan bedst beskrives som privatliv-nyttafvejningen. Selvom man gør alt andet, kommunikerer privatlivsimplikationerne til dem, der er berørt, vurderer systemet for, hvad man søger at opnå, osv., kommer det til sidst ned til at opnå perfekt privatliv betyder, vi ikke laver systemet, opnå perfekt nytte vil generelt ikke have nogen privatlivsbeskyttelse, så spørgsmålet er, hvordan vi bestemmer, hvad der er den “ideelle” afvejning. Hvordan finder vi det rette vippepunkt og bygger mod det, så vi stadig opnår den ønskede funktionalitet, mens vi giver den nødvendige privatlivsbeskyttelse.

Du søger for tiden at udvikle brugerbevidste privatlivsteknologier gennem parallellæsning af tekniske løsninger for privat beregning. Kan du gå i detaljer om, hvad nogle af disse løsninger er?

Det, jeg mener med disse løsninger, er, at vi kan, løst talt, udvikle ethvert antal tekniske privatlivssystemer. Dog er det, når vi gør dette, vigtigt at bestemme, om privatlivsgarantierne når dem, der er berørt. Dette kan indebære at udvikle et system efter at have fundet ud af, hvilke slags beskyttelser befolkningen værdsætter. Dette kan indebære at opdatere et system efter at have fundet ud af, hvordan folk faktisk bruger et system, givet deres reelle trussels- og risikobetragtninger. En teknisk løsning kan være et korrekt system, der tilfredsstiller definitionen, jeg nævnte tidligere. En brugerbevidst løsning vil designe sit system baseret på input fra brugere og andre, der er berørt i den påtænkte anvendelsesdomæne.

Du søger for tiden interesserede studerende til at starte i september 2024, hvorfor tror du, studerende skal være interesseret i AI-privatliv?

Jeg tror, studerende skal være interesseret, fordi det er noget, der kun vil vokse i sin udbredelse i vores samfund. For at have en idé om, hvor hurtigt disse systemer ser ud, behøver man kun at se på den seneste Chat-GPT-forstærkning gennem nyhedsartikler, sociale medier og debatter om dets implikationer. Vi eksisterer i et samfund, hvor indsamling og brug af data er så indlejret i vores daglige liv, at vi næsten konstant giver informationer om os selv til forskellige virksomheder og organisationer. Disse virksomheder ønsker at bruge dataene, i nogle tilfælde for at forbedre deres tjenester, i andre for profit. På dette punkt synes det urealistisk at tro, at disse virksomhedsdataanvendelsespraksisser vil ændre sig. Dog kan eksistensen af privatlivsbeskyttende systemer, der beskytter brugere, mens de tillader visse analyser, som virksomhederne ønsker, hjælpe med at afbalancere risiko-belønningsafvejningen, der er blevet en så implicit del af vores samfund.

Tak for det gode interview, læsere, der er interesseret i at lære mere, skal besøge Bailey Kacsmars Github-side.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.