Cybersicherheit

Erklärbares KI-System kann vertrauliche Daten leichter preisgeben

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Forscher der National University of Singapore sind zu dem Schluss gekommen, dass das erklärbare KI-System umso leichter zu umgehen ist, je mehr es erklärt wird. Sie fanden auch heraus, dass es möglich ist, Erklärungen ähnlicher Modelle zu verwenden, um sensible Daten in nicht erklärbaren Modellen zu “entschlüsseln”.

Die Studie, betitelt Exploiting Explanations for Model Inversion Attacks, hebt die Risiken hervor, die mit der Verwendung der “zufälligen” Undurchsichtigkeit der Funktionsweise von neuronalen Netzen als Sicherheitsfunktion verbunden sind – nicht zuletzt, weil eine Welle neuer globaler Initiativen, einschließlich der Entwurfsrichtlinien der Europäischen Union für künstliche Intelligenz, erklärbare KI (XAI) als Voraussetzung für die eventuelle Normalisierung von Machine Learning in der Gesellschaft charakterisieren.

In der Studie wird eine tatsächliche Identität erfolgreich aus angeblich anonymen Daten in Bezug auf Gesichtsausdrücke rekonstruiert, indem multiple Erklärungen des Machine-Learning-Systems ausgenutzt werden. Quelle: https://arxiv.org/pdf/2108.10800.pdf

In der Studie wird eine tatsächliche Identität erfolgreich aus angeblich anonymen Daten in Bezug auf Gesichtsausdrücke rekonstruiert, indem multiple Erklärungen des Machine-Learning-Systems ausgenutzt werden. Quelle: https://arxiv.org/pdf/2108.10800.pdf

Die Forscher kommentieren:

‘Erklärbares künstliches Intelligenzsystem (XAI) bietet mehr Informationen, um Benutzern zu helfen, Modellentscheidungen zu verstehen, doch diese zusätzliche Kenntnis birgt zusätzliche Risiken für Datenschutzangriffe. Daher schadet die Bereitstellung von Erklärungen dem Datenschutz.’

Re-Identifizierung von privaten Daten

Teilnehmer in Machine-Learning-Datensätzen haben möglicherweise zugestimmt, auf der Annahme der Anonymität aufgenommen zu werden; im Falle von personenbezogenen Daten (PII), die über ad-hoc-Datenerfassung (z.B. über soziale Netzwerke) in KI-Systeme gelangen, kann die Teilnahme technisch rechtlich sein, aber die Vorstellung von “Zustimmung” belasten.

Mehrere Methoden sind in den letzten Jahren entwickelt worden, die in der Lage sind, PII aus scheinbar undurchsichtigen Machine-Learning-Datenflüssen zu de-anonymisieren. Model-Extraktion verwendet API-Zugriff (d.h. “Black-Box”-Zugriff, ohne besondere Verfügbarkeit des Quellcodes oder der Daten) zur Extraktion von PII, sogar aus großen MLaaS-Anbietern, einschließlich Amazon Web Services, während Membership-Inference-Angriffe (MIAs), unter ähnlichen Einschränkungen, möglicherweise vertrauliche medizinische Informationen erhalten können; zusätzlich können Attribution-Inference-Angriffe (AIAs) sensible Daten aus API-Ausgaben wiederherstellen.

Enthüllung von Gesichtern

Für die neue Studie haben die Forscher sich auf einen Modell-Inversions-Angriff konzentriert, der darauf abzielt, eine Identität aus einem Teil von Gesichtsausdrucksdaten zu erhalten, die nicht in der Lage sein sollten, diese Informationen preiszugeben.

Das Ziel des Systems bestand darin, Bilder, die im Internet gefunden wurden (entweder casual im Internet oder in einem potenziellen Datenleck), mit ihrer Aufnahme in die Datensätze in Verbindung zu bringen, die die Grundlage für ein Machine-Learning-Algorithmus bilden.

Die Forscher trainierten ein Inversions-Angriffs-Modell, das in der Lage war, das beitragende Bild aus der anonymisierten API-Ausgabe zu rekonstruieren, ohne speziellen Zugriff auf die ursprüngliche Architektur. Frühere Arbeiten in diesem Bereich haben sich auf Systeme konzentriert, bei denen die Identifizierung (Schutz oder Enthüllung) das Ziel sowohl des Ziel- als auch des Angreifersystems war; in diesem Fall wurde das Framework entwickelt, um die Ausgabe eines Bereichs auszunutzen und auf einen anderen Bereich anzuwenden.

Ein transponierter konvolutioneller neuronalen Netzwerk (CNN) wurde verwendet, um ein “originales” Quellgesicht basierend auf dem Zielvorhersungsvektor (Saliency-Karte) für ein Emotions-Erkennungssystem vorherzusagen, unter Verwendung einer U-Net-Architektur, um die Gesichtsrekonstruktionsleistung zu verbessern.

Das Re-Identifizierungssystem wird durch erklärbares KI (XAI) angetrieben und informiert, wobei die Kenntnis der Neuronenaktivierung unter vielen öffentlichen XAI-Aspekten ausgenutzt wird, um die internen Mechanismen der Architektur nur aus ihrer Ausgabe zu rekonstruieren, was die Re-Identifizierung der beitragenden Datensätze ermöglicht.

Das Re-Identifizierungssystem wird durch erklärbares KI (XAI) angetrieben und informiert, wobei die Kenntnis der Neuronenaktivierung unter vielen öffentlichen XAI-Aspekten ausgenutzt wird, um die internen Mechanismen der Architektur nur aus ihrer Ausgabe zu rekonstruieren, was die Re-Identifizierung der beitragenden Datensätze ermöglicht.

Testen

Bei der Testung des Systems wendeten die Forscher es gegen drei Datensätze an: iCV-MEFED Gesichtsausdrücke; CelebA; und MNIST handschriftliche Ziffern. Um die Modellgröße, die von den Forschern verwendet wurde, zu berücksichtigen, wurden die drei Datensätze auf 128×128, 265×256 und 32×32 Pixel verkleinert. 50% jeder Menge wurden als Trainingsdaten verwendet, und die andere Hälfte wurde als Angriffsdatensatz verwendet, um die antagonistischen Modelle zu trainieren.

Jeder Datensatz hatte unterschiedliche Zielmodelle, und jedes Angriffsnetzwerk wurde auf die Einschränkungen der Erklärungen, die den Prozess untermauern, skaliert, anstatt tieferer neuronaler Modelle, deren Komplexität die Verallgemeinerung der Erklärungen überschreiten würde.

Die XAI-Erklärungstypen, die zur Antrieb der Versuche verwendet wurden, umfassten Gradient-Erklärung, Gradient-Eingabe, Grad-CAM und Layer-Weise Relevanz-Propagierung (LRP). Die Forscher bewerteten auch mehrere Erklärungen über die Experimente hinweg.

Bildrekonstruktion, die durch einen XAI-bewussten Inversions-Angriff über die drei Datensätze hinweg ermöglicht wird, mit identischen Ziel- und Angriffsaufgaben.

Bildrekonstruktion, die durch einen XAI-bewussten Inversions-Angriff über die drei Datensätze hinweg ermöglicht wird, mit identischen Ziel- und Angriffsaufgaben.

Die Metriken für den Test waren pixelweise Ähnlichkeit, die durch den mittleren quadratischen Fehler (MSE) bewertet wurde; Bildähnlichkeit (SSIM), ein wahrnehmungsbasierter Ähnlichkeitsindex; Angriffspräzision, bestimmt durch die Fähigkeit eines Klassifizierers, ein rekonstruiertes Bild erfolgreich neu zu beschriften; und Angriffs-Ähnlichkeit der Einbettung, die die Feature-Einbettungen der bekannten Quelldaten mit den rekonstruierten Daten vergleicht.

Re-Identifizierung wurde erreicht, mit unterschiedlichen Niveaus gemäß der Aufgabe und den Datensätzen, über alle drei Datensätze hinweg. Darüber hinaus fanden die Forscher heraus, dass es möglich war, eine Surrogat-Ziel-Modell (das sie natürlich vollständig kontrollierten) zu erstellen, um Re-Identifizierung von Daten aus externen, “geschlossenen” Modellen zu erreichen, basierend auf bekannten XAI-Prinzipien.

Die Forscher fanden heraus, dass die genauesten Ergebnisse durch aktivierte (Saliency-Karte)-Erklärungen erhalten wurden, die mehr PII als sensitivitätsbasierte (Gradient)-Ansätze preisgaben.

In zukünftigen Arbeiten plant das Team, unterschiedliche Arten von XAI-Erklärungen in neue Angriffe einzubauen, wie z.B. Feature-Visualisierungen und Konzept-Aktivierungsvektoren.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai