Tankeledere

Tre privatbeskyttende maskinlærings-teknikker som løser dette tiårets viktigste problem

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Av Amogh Tarcar, maskinlærings- og AI-forsker, Persistent Systems.

Data.privacy, ifølge eksperter over et bredt spekter av domener, vil være det viktigste problemet i dette tiåret. Dette er særlig sant for maskinlæring (ML) hvor algoritmene mates med mengder av data.

Tradisjonelt har ML-modelleringsteknikker avhengt av å sentralisere data fra multiple kilder til ett enkelt datasenter. Etter all, ML-modeller er på sitt mest kraftfulle når de har tilgang til enorme mengder data. Imidlertid er det en rekke privatlivsutfordringer som følger med denne teknikken. Å samle inn diverse data fra multiple kilder er mindre gjennomførbart i dag på grunn av regulatoriske bekymringer som HIPAA, GDPR og CCPA. Videre øker sentraliseringen av data omfanget og skalaen av data-misbruk og sikkerhetstrusler i form av datalekkasjer.

For å overvinne disse utfordringene, er flere søyler av privatbeskyttende maskinlæring (PPML) blitt utviklet med spesifikke tekniker som reduserer privatlivsrisk og sikrer at data forblir rimelig trygg. Her er noen av de viktigste:

1. Fordelt læring

Fordelt læring er en ML-treningsteknikk som snur data-samling-problemet på hodet. I stedet for å samle inn data for å lage en enkelt ML-modell, samler fordelte læring ML-modeller selv. Dette sikrer at data aldri forlater sin kildelokasjon, og det tillater multiple parter å samarbeide og bygge en felles ML-modell uten å direkte dele følsomme data.

Det fungerer slik. Du starter med en basis-ML-modell som så deles med hver klientknode. Disse nodene kjører lokale treninger på denne modellen ved hjelp av deres eget data. Modell-oppdateringer deles periodisk med koordinator-noden, som prosesserer disse oppdateringene og fusjonerer dem sammen for å få en ny global modell. På denne måten får du innsikt fra diverse datasett uten å måtte dele disse datasettene.

Kilde: Persistent Systems

I sammenheng med helsevesen, er dette et usedvanlig kraftfullt og privatlivs-bevisst verktøy for å holde pasientdata trygg mens forskerne får visdommen fra mengden. Ved ikke å samle inn data, skaper fordelte læring en ekstra sikkerhetslag. Imidlertid presenterer modellene og modell-oppdateringene selv en sikkerhetsrisiko hvis de blir sårbar.

2. Differensialt privatliv

ML-modeller er ofte mål for medlemskaps-inferens-angrep. Si at du delte din helse-data med et sykehus for å hjelpe med å utvikle en kreftvaksine. Sykehuset holder dine data trygg, men bruker fordelte læring for å trene en offentlig tilgjengelig ML-modell. Et par måneder senere, bruker hackere en medlemskaps-inferens-angrep for å bestemme om dine data ble brukt i modellens trening eller ikke. De deler så innsikt med et forsikringsselskap, som, basert på din risiko for kreft, kunne øke dine premier.

Differensialt privatliv sikrer at motstander-angrep på ML-modeller ikke vil kunne identifisere spesifikke data-punkter som ble brukt under trening, og dermed mitigere risikoen for å avsløre følsomme trening-data i maskinlæring. Dette gjøres ved å bruke “statistisk støy” for å perturbere data eller ML-modell-parametre under trening, og gjøre det vanskelig å kjøre angrep og bestemme om en bestemt enkelts data ble brukt til å trene modellen.

For eksempel, har Facebook nylig lansert Opacus, en høyhastighets-bibliotek for å trene PyTorch-modeller ved hjelp av en differensialt privatliv-basert maskinlærings-trening-algoritme kalt Differentially Private Stochastic Gradient Descent (DP-SGD). Gif-bildet under viser hvordan det bruker støy for å maskere data.

 

Denne støyen styres av en parameter kalt Epsilon. Hvis Epsilon-verdien er lav, har modellen perfekt data-privatliv, men dårlig nytte og nøyaktighet. Omvendt, hvis du har en høy Epsilon-verdi, vil ditt data-privatliv gå ned, mens din nøyaktighet øker. Trikset er å finne en balanse for å optimalisere for begge.

3. Homomorfe kryptering

Standard kryptering er tradisjonelt uforenlig med maskinlæring fordi når data er kryptert, kan det ikke lenger forstås av ML-algoritmen. Imidlertid er homomorfe kryptering en spesial krypterings-skjema som tillater oss å fortsette å gjøre visse typer beregninger.

Kilde: OpenMined

Kraften i dette er at treningen kan skje i et fullstendig kryptert rom. Det beskytter ikke bare data-eiere, men også modell-eiere. Modell-eieren kan kjøre inferens på kryptert data uten å se det eller misbruke det.

Når det brukes i fordelte læring, kan fusjonen av modell-oppdateringer skje trygt fordi de skjer i et fullstendig kryptert miljø, og drastisk reduserer risikoen for medlemskaps-inferens-angrep.

Det private tiåret

Etter hvert som vi går inn i 2021, er privatbeskyttende maskinlæring et fremvoksende felt med bemerkelsesverdig aktiv forskning. Hvis det siste tiåret handlet om å fjernet data, vil dette tiåret handle om å fjernet ML-modeller mens man beskytter privatlivet til de underliggende data via fordelte læring, differensialt privatliv og homomorfe kryptering. Disse presenterer en løftende ny måte å fremme maskinlærings-løsninger på en privatlivs-bevisst måte. det siste tiåret var om å fjernet data, dette tiåret vil være om å fjernet ML-modeller mens man beskytter privatlivet til de underliggende data via fordelte læring, differensialt privatliv og homomorfe kryptering. Disse presenterer en løftende ny måte å fremme maskinlærings-løsninger på en privatlivs-bevisst måte.

Amogh er en maskinlæringsforsker og en del av AI-forskningslaboratoriet ved Persistent Systems. Hans nåværende forskning fokuserer på Federated Learning-applikasjoner og bygging av NLP-verktøy for kunnskapsutvinning.