Cyberbezpieczeństwo

Wyjaśnialna Sztuczna Inteligencja Może Zdradzić Poufne Dane Łatwiej

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Narodowego Uniwersytetu w Singapurze doszli do wniosku, że im bardziej wyjaśnialna jest sztuczna inteligencja, tym łatwiej będzie ominąć ważne funkcje prywatności w systemach machine learning. Stwierdzili również, że nawet w przypadku, gdy model nie jest wyjaśnialny, możliwe jest wykorzystanie wyjaśnień podobnych modeli do “odkodowania” wrażliwych danych w modelu niewyjaśnialnym.

W badaniu, zatytułowanym Wykorzystanie wyjaśnień do ataków inwersyjnych modelu, podkreśla się ryzyko korzystania z “przypadkowej” nieprzezroczystości sposobu, w jaki funkcjonują sieci neuronowe, jak gdyby była to funkcja zabezpieczeń zaprojektowana z wyprzedzeniem – nie tylko dlatego, że fala nowych inicjatyw globalnych, w tym projektu regulacji AI Unii Europejskiej, charakteryzuje wyjaśnialną sztuczną inteligencję (XAI) jako warunek wstępny dla ostatecznej normalizacji machine learning w społeczeństwie.

W badaniu udaje się odtworzyć rzeczywistą tożsamość z anonimowych danych dotyczących wyrazów twarzy, wykorzystując wyjaśnienia systemu machine learning. Źródło: https://arxiv.org/pdf/2108.10800.pdf

W badaniu udaje się odtworzyć rzeczywistą tożsamość z anonimowych danych dotyczących wyrazów twarzy, wykorzystując wyjaśnienia systemu machine learning. Źródło: https://arxiv.org/pdf/2108.10800.pdf

Badacze komentują:

‘Wyjaśnialna sztuczna inteligencja (XAI) dostarcza więcej informacji, aby pomóc użytkownikom zrozumieć decyzje modelu, jednak ta dodatkowa wiedza naraża na dodatkowe ryzyko ataków na prywatność. Zatem, dostarczanie wyjaśnień szkodzi prywatności.’

Re-Identifikacja Danych Prywatnych

Uczestnicy w zbiorach danych machine learning mogli wyrazić zgodę na udział w założeniu anonimowości; w przypadku danych osobowych, które trafiają do systemów AI za pośrednictwem nieformalnego gromadzenia danych (na przykład za pośrednictwem sieci społecznościowych), udział może być technicznie legalny, ale nadwyręża pojęcie “zgody”.

W ostatnich latach pojawiły się różne metody, które okazały się w stanie deanonimizować dane osobowe z pozornie nieprzezroczystych przepływów danych machine learning. Ekstrakcja modelu wykorzystuje dostęp do API (tj. “czarnej skrzynki” z dostępem do danych lub kodu źródłowego), aby wydobyć dane osobowe nawet z dużych dostawców usług machine learning, w tym Amazon Web Services, podczas gdy ataki inferencyjne (MIAs) mogą potencjalnie uzyskać poufne informacje medyczne; dodatkowo ataki inferencyjne atrybucji (AIAs) mogą odzyskać wrażliwe dane z danych wyjściowych API.

Ujawnianie Twarzy

W ramach nowego artykułu badacze skoncentrowali się na ataku inwersyjnym modelu, który miał na celu uzyskanie tożsamości z podzbioru danych o wyrazach twarzy, które nie powinny być w stanie ujawniać tej informacji.

Celem systemu było skojarzenie obrazów znalezionych w sieci (opublikowanych przypadkowo w Internecie lub w potencjalnym wycieku danych) z ich umieszczeniem w zbiorach danych, które są podstawą algorytmu machine learning.

Badacze przeszkolili model ataku inwersyjnego, który mógł odtworzyć przyczynowy obraz z anonimowego wyjścia API, bez specjalnego dostępu do oryginalnej architektury. Poprzednie prace w tej dziedzinie koncentrowały się na systemach, w których identyfikacja (ochrona lub ujawnienie) była celem zarówno systemu docelowego, jak i systemu atakującego; w tym przypadku ramy zostały zaprojektowane do wykorzystania danych wyjściowych jednego domeny i zastosowania ich w innej domenie.

Zastosowano transponowany sieć neuronową (CNN) do przewidywania “oryginalnego” źródłowego oblicza na podstawie wektora predykcji (mapy saliency) dla systemu rozpoznawania emocji, wykorzystując architekturę U-Net, aby poprawić wydajność rekonstrukcji twarzy.

System re-identyfikacji jest napędzany i informowany przez wyjaśnialną sztuczną inteligencję (XAI), gdzie wiedza o aktywacji neuronów, wśród wielu publicznych aspektów XAI, jest wykorzystywana do odtworzenia wewnętrznych mechanizmów architektury tylko z jej wyjścia, umożliwiając re-identyfikację obrazów z zbioru danych.

System re-identyfikacji jest napędzany i informowany przez wyjaśnialną sztuczną inteligencję (XAI), gdzie wiedza o aktywacji neuronów, wśród wielu publicznych aspektów XAI, jest wykorzystywana do odtworzenia wewnętrznych mechanizmów architektury tylko z jej wyjścia, umożliwiając re-identyfikację obrazów z zbioru danych.

Testowanie

Podczas testowania systemu, badacze zastosowali go do trzech zbiorów danych: iCV-MEFED wyrazów twarzy; CelebA; oraz MNIST cyfry ręcznie pisane. Aby dostosować się do rozmiaru modelu używanego przez badaczy, trzy zbiory danych zostały przeskalowane odpowiednio do 128×128, 265×256 i 32×32 pikseli. 50% każdego zestawu zostało użyte jako dane szkoleniowe, a pozostała połowa została użyta jako zestaw danych ataku, aby przeszkolić modele antagonistyczne.

Każdy zestaw danych miał różne modele docelowe, a każda sieć atakująca została skalibrowana do ograniczeń wyjaśnień, które podlegały procesowi, a nie użyto głębszych modeli neuronowych, których złożoność przekraczałaby uogólnienie wyjaśnień.

Typy wyjaśnień XAI użyte do napędzania prób obejmowały wyjaśnienie gradientu, wejście gradientu, Grad-CAM oraz propagację istotności warstwowej (LRP). Badacze ocenili również wiele wyjaśnień w ramach eksperymentów.

Rekonstrukcja obrazu ułatwiona przez atak inwersyjny z wykorzystaniem XAI w trzech zestawach danych, z tymi samymi zadaniami docelowymi i atakującymi.

Rekonstrukcja obrazu ułatwiona przez atak inwersyjny z wykorzystaniem XAI w trzech zestawach danych, z tymi samymi zadaniami docelowymi i atakującymi.

Metryki testowe obejmowały podobieństwo pikseli oceniane przez błąd średniokwadratowy (MSE); podobieństwo obrazu (SSIM), który jest wskaźnikiem podobieństwa percepcyjnego; dokładność ataku, określoną przez to, czy klasyfikator może pomyślnie ponownie oznaczyć odtworzony obraz; oraz podobieństwo osadzania ataku, które porównuje osadzanie funkcji danych źródłowych z odtworzonymi danymi.

Re-identyfikacja została osiągnięta, z różnymi poziomami w zależności od zadania i zestawów danych, we wszystkich zestawach. Ponadto badacze stwierdzili, że poprzez stworzenie modelu docelowego (którymi naturalnie dysponowali), możliwe było osiągnięcie re-identyfikacji danych z zewnętrznych, “zamkniętych” modeli, w oparciu o znane zasady XAI.

Badacze stwierdzili, że najdokładniejsze wyniki uzyskano dzięki wyjaśnieniom opartym na aktywacji (mapie saliency), które ujawniły więcej danych osobowych niż podejścia oparte na wrażliwości (gradient).

W przyszłych badaniach zespół planuje włączyć różne typy wyjaśnień XAI do nowych ataków, takich jak wizualizacje funkcji i wektory aktywacji pojęć.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai