Tankeledere

Tre tekniker til beskyttelse af privatliv i maskinlæring, der løser dette årtis vigtigste problem

mm
Føj Unite.AI til dine foretrukne kilder på Google

Af Amogh Tarcar, maskinlæring og AI-forsker, Persistent Systems.

Data privatliv, ifølge eksperter fra en bred vifte af områder, vil være det vigtigste problem i dette årti. Dette er særligt sandt for maskinlæring (ML), hvor algoritmerne får store mængder data.

Traditionelt har maskinlæringsmodelleringsteknikker afhængigt af centralisering af data fra multiple kilder til et enkelt datacenter. ML-modeller er på deres stærkeste, når de har adgang til enorme mængder data. Men der er en række privatlivsudfordringer forbundet med denne teknik. At samle diverse data fra multiple kilder er mindre gennemførligt i dag på grund af reguleringsmæssige bekymringer som HIPAA, GDPR og CCPA. Desuden øger centralisering af data omfanget og skalaen af data misbrug og sikkerhedstrusler i form af data lækager.

For at overvinde disse udfordringer er der udviklet flere søjler af privatlivsbeskyttende maskinlæring (PPML) med specifikke tekniker, der reducerer privatlivsrisiko og sikrer, at data forbliver rimeligt sikre. Her er nogle af de vigtigste:

1. Fordelt læring

Fordelt læring er en ML-træningsteknik, der vender data-samling-problemet på hovedet. I stedet for at samle data for at oprette en enkelt ML-model, samler fordelte læring ML-modeller selv. Dette sikrer, at data aldrig forlader deres kildeposition, og det tillader multiple parter at samarbejde og opbygge en fælles ML-model uden direkte at dele følsomme data.

Det fungerer således. Du starter med en basis ML-model, der derefter deles med hver klientnode. Disse noder kører derefter lokal træning på denne model ved hjælp af deres eget data. Modelopdateringer deles periodisk med koordinatornoden, som behandler disse opdateringer og fusionerer dem sammen for at opnå en ny global model. På denne måde får du indsigt fra diverse datasæt uden at skulle dele disse datasæt.

Kilde: Persistent Systems

I sundhedsområdet er dette et utroligt kraftfuldt og privatlivsbevidst værktøj til at holde patientdata sikre, samtidig med at forskerne får indsigt fra mængden. Ved ikke at samle data skaber fordelte læring en ekstra sikkerhedslag. Men modellerne og modelopdateringerne selv udgør stadig en sikkerhedsrisiko, hvis de efterlades sårbare.

2. Differensiel privatliv

ML-modeller er ofte mål for medlemskabsinferenceangreb. Sådan at du delte dine sundhedsdata med et hospital for at hjælpe med at udvikle en kræftvaccine. Hospitalet holder dine data sikre, men bruger fordelte læring til at træne en offentligt tilgængelig ML-model. Et par måneder senere bruger hackere en medlemskabsinferenceangreb til at bestemme, om dine data blev brugt i modellens træning eller ej. De giver derefter indsigt til et forsikringsselskab, som kan hæve dine præmier baseret på din kræft-risiko.

Differensiel privatliv sikrer, at fjendtlige angreb på ML-modeller ikke kan identificere specifikke data, der blev brugt under træning, og dermed mindske risikoen for at afsløre følsomme træningsdata i maskinlæring. Dette opnås ved at anvende “statistisk støj” for at forstyrre data eller ML-modelparametre under træning, og gøre det svært at køre angreb og bestemme, om en bestemt persons data blev brugt til at træne modellen.

For eksempel har Facebook nyligt udgivet Opacus, en højhastighedsbibliotek til træning af PyTorch-modeller med en differensiel privatlivs-baseret maskinlærings-træningsalgoritme kaldet Differentially Private Stochastic Gradient Descent (DP-SGD). Gif’en nedenfor viser, hvordan den bruger støj til at maskere data.

 

Denne støj reguleres af en parameter kaldet Epsilon. Hvis Epsilon-værdien er lav, har modellen perfekt data privatliv, men dårlig nytte og præcision. Omvendt, hvis du har en høj Epsilon-værdi, vil dit data privatliv gå ned, mens din præcision går op. Trickket er at finde en balance for at optimere for begge.

3. Homomorft kryptering

Standardkryptering er traditionelt ikke kompatibel med maskinlæring, fordi når data er krypteret, kan det ikke længere forstås af ML-algoritmen. Men homomorft kryptering er en særlig krypteringsordning, der tillader os at udføre visse typer af beregninger.

Kilde: OpenMined

Kraften heri er, at træningen kan ske i et fuldstændigt krypteret rum. Det beskytter ikke kun data ejere, men også model ejere. Model ejeren kan køre inference på krypteret data uden at se det eller misbruge det.

Når det anvendes på fordelte læring, kan fusion af modelopdateringer ske sikkert, fordi de sker i et fuldstændigt krypteret miljø, og reducerer drastisk risikoen for medlemskabsinferenceangreb.

Årtiet for privatliv

Da vi indtræder 2021, er privatlivsbeskyttende maskinlæring et fremvoksende felt med bemærkelsesværdig aktiv forskning. Hvis det sidste årti handlede om at fjernelse af data siloer, vil dette årti handle om at fjernelse af ML-modeller, samtidig med at privatlivet for de underliggende data beskyttes via fordelte læring, differensiel privatliv og homomorft kryptering. Disse præsenterer en lovende ny måde at fremme maskinlæringsløsninger på en privatlivsbevidst måde.

Amogh er en Machine Learning-forsker og en del af AI Research Lab på Persistent Systems. Hans nuværende forskning fokuserer på Federated Learning-applikationer og opbygning af NLP-værktøjer til videnekstraktion.