Thought leaders
Drie technieken voor privacybehoud in machine learning die het belangrijkste probleem van deze decennium oplossen

Door Amogh Tarcar, onderzoeker naar machine learning en AI, Persistent Systems.
Volgens experts uit een breed scala aan domeinen zal gegevensbescherming het belangrijkste probleem van dit decennium zijn. Dit is met name het geval voor machine learning (ML), waarbij algoritmen grote hoeveelheden gegevens krijgen.
Traditioneel zijn ML-modelleringstechnieken afhankelijk van het centraliseren van gegevens van meerdere bronnen in een enkel gegevenscentrum. Immers, ML-modellen zijn het krachtigst wanneer ze toegang hebben tot enorme hoeveelheden gegevens. Echter, er zijn veel privacy-uitdagingen verbonden aan deze techniek. Het centraliseren van gegevens verhoogt het risico van gegevensmisbruik en beveiligingsbedreigingen in de vorm van gegevensleks.
Om deze uitdagingen te overwinnen, zijn verschillende pijlers van privacybehoud in machine learning (PPML) ontwikkeld met specifieke technieken die het privacysrisico verminderen en ervoor zorgen dat gegevens redelijkerwijs veilig blijven. Hier zijn een paar van de belangrijkste:
1. Federated Learning
Federated learning is een ML-trainingsmethode die het gegevensaggregatieprobleem op zijn kop zet. In plaats van gegevens te centraliseren om een enkel ML-model te creëren, worden ML-modellen zelf geaggregeerd. Hierdoor verlaten gegevens nooit hun bronlocatie en kunnen meerdere partijen samenwerken om een gemeenschappelijk ML-model te bouwen zonder gevoelige gegevens rechtstreeks te delen.
Het werkt als volgt. U begint met een basis-ML-model dat wordt gedeeld met elk clientknooppunt. Deze knooppunten voeren vervolgens lokale training uit op dit model met behulp van hun eigen gegevens. Modelupdates worden periodiek gedeeld met het coördinatorknooppunt, dat deze updates verwerkt en samenvoegt om een nieuw globaal model te verkrijgen. Op deze manier krijgt u inzichten uit diverse datasets zonder deze datasets te hoeven delen.

Bron: Persistent Systems
In de context van de gezondheidszorg is dit een enorm krachtig en privacybewust instrument om patiëntgegevens veilig te houden en onderzoekers de wijsheid van de massa te geven. Door gegevens niet te centraliseren, creëert federated learning een extra laag van beveiliging. Echter, de modellen en modelupdates zelf vormen nog steeds een beveiligingsrisico als ze kwetsbaar worden gelaten.
2. Differentiële privacy
ML-modellen zijn vaak het doelwit van membership-inferentie-aanvallen. Stel dat u uw gezondheidsgegevens deelt met een ziekenhuis om te helpen bij de ontwikkeling van een kankervaccin. Het ziekenhuis houdt uw gegevens veilig, maar gebruikt federated learning om een openbaar beschikbaar ML-model te trainen. Een paar maanden later gebruiken hackers een membership-inferentie-aanval om te bepalen of uw gegevens zijn gebruikt voor de training van het model of niet. Ze delen vervolgens inzichten met een verzekeraar, die, op basis van uw kankerrisico, uw premies kan verhogen.
_differentiële privacy zorgt ervoor dat aanvallen op ML-modellen geen specifieke gegevenspunten kunnen identificeren die tijdens de training zijn gebruikt, waardoor het risico van blootstelling van gevoelige trainingsgegevens in machine learning wordt geminimaliseerd. Dit gebeurt door “statistische ruis” toe te passen om de gegevens of de ML-modelparameters te verstoren tijdens de training, waardoor het moeilijk wordt om aanvallen uit te voeren en te bepalen of een bepaald individu’s gegevens zijn gebruikt voor de training van het model.
Bijvoorbeeld heeft Facebook onlangs Opacus uitgebracht, een high-speed-bibliotheek voor het trainen van PyTorch-modellen met behulp van een differentiële privacymethode genaamd Differentially Private Stochastic Gradient Descent (DP-SGD). De gif hieronder toont hoe het ruis gebruikt om gegevens te maskeren.

Bron: Facebook’s Opacus Blog
Deze ruis wordt beheerst door een parameter genaamd Epsilon. Als de Epsilon-waarde laag is, heeft het model perfecte gegevensprivacyscherming, maar slechte bruikbaarheid en nauwkeurigheid. Omgekeerd, als u een hoge Epsilon-waarde heeft, zal uw gegevensprivacyscherming afnemen, terwijl uw nauwkeurigheid toeneemt. De truc is om een balans te vinden om zowel privacyscherming als nauwkeurigheid te optimaliseren.
3. Homomorfische encryptie
Standaardencryptie is traditioneel onverenigbaar met machine learning, omdat gegevens eenmaal geëncrypteerd niet langer door het ML-algoritme kunnen worden begrepen. Homomorfische encryptie is echter een speciaal encryptieschema dat ons toestaat bepaalde soorten berekeningen uit te voeren.

Bron: OpenMined
Het vermogen hiervan is dat de training kan plaatsvinden in een volledig geëncrypteerd domein. Het beschermt niet alleen gegevenseigenaren, maar ook model-eigenaren. De model-eigenaar kan inferentie uitvoeren op geëncrypteerde gegevens zonder deze ooit te zien of te misbruiken.
Wanneer toegepast op federated learning, kan de fusie van modelupdates veilig plaatsvinden, omdat deze zich in een volledig geëncrypteerd domein bevinden, waardoor het risico van membership-inferentie-aanvallen aanzienlijk wordt verkleind.
Het decennium van de privacyscherming
Nu we 2021 ingaan, is privacybehoud in machine learning een opkomend veld met opvallend actief onderzoek. Als het vorige decennium over het centraliseren van gegevens ging, zal dit decennium over het decentraliseren van ML-modellen gaan, terwijl de privacyscherming van de onderliggende gegevens via federated learning, differentiële privacy en homomorfische encryptie wordt behouden. Deze presenteren een veelbelovende nieuwe manier voor het ontwikkelen van machine learning-oplossingen op een privacyschermende manier.












