Vordenker
Drei Techniken zum Erhalt der PrivatsphÃĪre in der maschinellen Lernen, die das wichtigste Problem dieses Jahrzehnts lÃķsen

Von Amogh Tarcar, Forscher fÞr maschinelles Lernen und KI, Persistent Systems.
Die DatenprivatsphÃĪre wird, laut Experten aus verschiedenen Bereichen, das wichtigste Problem dieses Jahrzehnts sein. Dies gilt insbesondere fÞr das maschinelle Lernen (ML), bei dem Algorithmen mit groÃen Mengen an Daten gefÞttert werden.
Traditionell haben ML-Modellierungstechniken auf der Zentralisierung von Daten aus verschiedenen Quellen in einem einzigen Rechenzentrum basiert. SchlieÃlich sind ML-Modelle am leistungsfÃĪhigsten, wenn sie Zugang zu groÃen Mengen an Daten haben. Es gibt jedoch eine Vielzahl von Datenschutzproblemen, die mit dieser Technik verbunden sind. Die Aggregation von diversen Daten aus verschiedenen Quellen ist heute aufgrund von regulatorischen Bedenken wie HIPAA, DSGVO und CCPA weniger machbar. DarÞber hinaus erhÃķht die Zentralisierung von Daten den Umfang und die GrÃķÃe von Datenmissbrauch und Sicherheitsbedrohungen in Form von Datenlecks.
Um diese Herausforderungen zu Þberwinden, wurden mehrere SÃĪulen des Datenschutzes in der maschinellen Lernen (PPML) entwickelt, mit spezifischen Techniken, die das Datenschutzrisiko reduzieren und sicherstellen, dass die Daten vernÞnftigerweise sicher bleiben. Hier sind einige der wichtigsten:
1. Federated Learning
Federated Learning ist eine ML-Trainingsmethode, die das Datenaggregationsproblem auf den Kopf stellt. Anstatt Daten zu aggregieren, um ein einzelnes ML-Modell zu erstellen, aggregiert das federale Lernen die ML-Modelle selbst. Dies stellt sicher, dass die Daten nie ihre Quellposition verlassen und es mehreren Parteien ermÃķglicht, zusammenzuarbeiten und ein gemeinsames ML-Modell ohne direktes Teilen von sensiblen Daten zu erstellen.
Es funktioniert wie folgt. Sie beginnen mit einem Basis-ML-Modell, das dann mit jedem Clientknoten geteilt wird. Diese Knoten fÞhren dann lokale Trainings auf diesem Modell mit ihren eigenen Daten durch. Modellaktualisierungen werden regelmÃĪÃig an den Koordinierungsknoten gesendet, der diese Aktualisierungen verarbeitet und sie zusammenfÞgt, um ein neues globales Modell zu erhalten. Auf diese Weise erhalten Sie die Erkenntnisse aus verschiedenen DatensÃĪtzen, ohne diese DatensÃĪtze teilen zu mÞssen.

Quelle: Persistent Systems
Im Kontext des Gesundheitswesens ist dies ein unglaublich leistungsfÃĪhiges und datenschutzorientiertes Werkzeug, um Patientendaten sicher zu halten, wÃĪhrend Forschern die Weisheit der Menge gegeben wird. Durch die Nichtaggregation von Daten schafft das federale Lernen eine zusÃĪtzliche Sicherheitsebene. Die Modelle und Modellaktualisierungen selbst stellen jedoch immer noch ein Sicherheitsrisiko dar, wenn sie verletzlich bleiben.
2. Differenzieller Datenschutz
ML-Modelle sind oft Ziel von Mitgliedschaftsinferenzangriffen. Angenommen, Sie teilen Ihre Gesundheitsdaten mit einem Krankenhaus, um bei der Entwicklung eines Krebsimpfstoffs zu helfen. Das Krankenhaus hÃĪlt Ihre Daten sicher, verwendet jedoch das federale Lernen, um ein Ãķffentlich verfÞgbares ML-Modell zu trainieren. Einige Monate spÃĪter verwenden Hacker eine Mitgliedschaftsinferenz, um zu bestimmen, ob Ihre Daten fÞr die Modelltrainierung verwendet wurden oder nicht. Sie geben dann Erkenntnisse an eine Versicherungsgesellschaft weiter, die, basierend auf Ihrem Krebsrisiko, Ihre PrÃĪmien erhÃķhen kÃķnnte.
Der differenzielle Datenschutz stellt sicher, dass Angriffe auf ML-Modelle nicht in der Lage sind, bestimmte Datenpunkte zu identifizieren, die wÃĪhrend der Trainierung verwendet wurden, und damit das Risiko des Offenlegens sensibler Trainingsdaten im maschinellen Lernen verringert. Dies geschieht durch die Anwendung von âstatistischem Rauschenâ, um die Daten oder die ML-Modellparameter wÃĪhrend der Trainierung zu stÃķren, was es schwierig macht, Angriffe durchzufÞhren und zu bestimmen, ob die Daten einer bestimmten Person fÞr die Modelltrainierung verwendet wurden.
Beispielsweise hat Facebook kÞrzlich Opacus verÃķffentlicht, eine Bibliothek mit hoher Geschwindigkeit fÞr die Trainierung von PyTorch-Modellen mit einem differenziellen Datenschutz basierten ML-Trainingsalgorithmus namens Differentially Private Stochastic Gradient Descent (DP-SGD). Das folgende GIF zeigt, wie es Rauschen verwendet, um Daten zu maskieren.
Â

Quelle: Facebooks Opacus-Blog
Dieses Rauschen wird durch einen Parameter namens Epsilon gesteuert. Wenn der Epsilon-Wert niedrig ist, hat das Modell perfekten Datenschutz, aber schlechte NÞtzlichkeit und Genauigkeit. Umgekehrt, wenn Sie einen hohen Epsilon-Wert haben, verringert sich der Datenschutz, wÃĪhrend die Genauigkeit steigt. Der Trick besteht darin, ein Gleichgewicht zu finden, um sowohl Datenschutz als auch NÞtzlichkeit zu optimieren.
3. Homomorphe VerschlÞsselung
Die StandardverschlÞsselung ist traditionell mit dem maschinellen Lernen unvereinbar, da die Daten nach der VerschlÞsselung nicht mehr vom ML-Algorithmus verstanden werden kÃķnnen. Die homomorphe VerschlÞsselung ist jedoch ein spezielles VerschlÞsselungsschema, das es uns ermÃķglicht, bestimmte Arten von Berechnungen durchzufÞhren.

Quelle: OpenMined
Die Macht dieser Technik liegt darin, dass die Trainierung in einem vollstÃĪndig verschlÞsselten Raum stattfinden kann. Sie schÞtzt nicht nur die Datenbesitzer, sondern auch die Modellbesitzer. Der Modellbesitzer kann Inferenz auf verschlÞsselten Daten durchfÞhren, ohne sie jemals zu sehen oder zu missbrauchen.
Wenn diese Technik auf das federale Lernen angewendet wird, kann die Fusion von Modellaktualisierungen sicher stattfinden, da sie in einem vollstÃĪndig verschlÞsselten Umfeld stattfindet, was das Risiko von Mitgliedschaftsinferenzangriffen erheblich reduziert.
Das Jahrzehnt des Datenschutzes
Wenn wir 2021 betreten, ist der Datenschutz in der maschinellen Lernen ein aufstrebendes Feld mit bemerkenswerter Forschung. Wenn das letzte Jahrzehnt darum ging, Daten aus den Silos zu befreien, wird dieses Jahrzehnt darum gehen, ML-Modelle aus den Silos zu befreien, wÃĪhrend der Datenschutz der zugrunde liegenden Daten durch das federale Lernen, den differenziellen Datenschutz und die homomorphe VerschlÞsselung gewÃĪhrleistet wird. Diese Techniken bieten eine vielversprechende neue MÃķglichkeit, maschinelle LernlÃķsungen auf eine datenschutzorientierte Weise voranzutreiben.












