Kąt Andersona

Dane syntetyczne nie chronią w sposób niezawodny prywatności, twierdzą badacze

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badanie przeprowadzone we współpracy między Francją a Wielką Brytanią budzi wątpliwości co do rosnącej pewności siebie branży, że dane syntetyczne mogą rozwiązać problemy związane z prywatnością, jakością i dostępnością (wśród innych problemów), które zagrażają postępom w sektorze szkolenia maszynowego.

Wśród kilku kluczowych punktów omówionych przez autorów, twierdzą oni, że dane syntetyczne opracowane na podstawie danych rzeczywistych zawierają wystarczająco dużo informacji, aby nie zapewnić niezawodnej ochrony przed atakami inferencyjnymi i atakami na członkostwo, które mają na celu deanonimizację danych i ponowne skojarzenie ich z rzeczywistymi osobami.

Ponadto, osoby, które są najbardziej narażone na takie ataki, w tym te z krytycznymi stanami zdrowia lub wysokimi rachunkami szpitalnymi (w przypadku anonimizacji danych medycznych), są, ze względu na “outlier” charakter ich stanu, najbardziej prawdopodobne do ponownego zidentyfikowania przez te techniki.

W artykule zauważa się:

‘Dostęp do zbioru danych syntetycznych pozwala strategicznemu przeciwnikowi na inferencję, z wysokim poziomem ufności, obecności rekordu docelowego w oryginalnych danych.’

Artykuł zwraca również uwagę, że dane syntetyczne z różnicową ochroną prywatności, które ukrywają sygnaturę poszczególnych rekordów, rzeczywiście chronią prywatność osób, ale tylko poprzez znaczne ograniczenie użyteczności systemów odzyskiwania informacji, które z nich korzystają.

Jeśli cokolwiek, badacze zauważają, że podejścia z różnicową ochroną prywatności – które wykorzystują “rzeczywiste” informacje “w odległości jednego poziomu” za pośrednictwem danych syntetycznych – sprawiają, że sytuacja bezpieczeństwa jest gorsza niż byłaby inaczej:

‘Zbiory danych nie zapewniają żadnej przejrzystości co do tego kompromisu. Nie jest możliwe przewidzenie, jakie cechy danych zostaną zachowane, a jakie wzory zostaną stłumione.’

Nowy artykuł, zatytułowany Dane syntetyczne – Dzień anonimizacji, pochodzi od dwóch badaczy z École Polytechnique Fédérale de Lausanne (EPFL) w Paryżu i badacza z University College London (UCL).

Badacze przeprowadzili testy istniejących algorytmów szkolenia modeli generatywnych z ochroną prywatności i stwierdzili, że pewne decyzje implementacyjne naruszają formalne gwarancje prywatności zapewnione w ramach, pozostawiając różnorodne rekordy narażone na ataki inferencyjne.

Autorzy oferują zmodyfikowaną wersję każdego algorytmu, która potencjalnie łagodzi te ekspozycje, i udostępniają kod jako bibliotekę open source. Twierdzą, że pomoże to badaczom w ocenie zysków prywatności danych syntetycznych i użytecznym porównaniu popularnych metod anonimizacji. Nowy framework obejmuje dwa istotne metody ataków na prywatność, które mogą być stosowane w przypadku dowolnego algorytmu szkolenia modelu generatywnego.

Dane syntetyczne

Dane syntetyczne są wykorzystywane do szkolenia modeli maszynowych w różnych scenariuszach, w tym w przypadkach, w których brak kompletnych informacji może być uzupełniony przez dane ersatz. Przykładem tego jest możliwość wykorzystania twarzy wygenerowanych komputerowo do dostarczenia “trudnych” lub rzadkich zdjęć twarzy do syntez danych obrazowych, gdzie zdjęcia profilowe, ostre kąty lub nietypowe wyrażenia są często rzadko spotykane w materiałach źródłowych.

Inne rodzaje grafiki komputerowej były wykorzystywane do zaludniania zbiorów danych, które ostatecznie będą uruchamiane na danych niesyntetycznych, takich jak zbiory danych zawierające ręce i meble.

W kwestii ochrony prywatności dane syntetyczne mogą być generowane z danych rzeczywistych za pomocą systemów Generative Adversarial Network (GAN), które wyodrębniają cechy z danych rzeczywistych i tworzą podobne, fikcyjne rekordy, które mają się dobrze generalizować do późniejszych (niewidocznych, rzeczywistych) danych, ale mają na celu zaciemnić szczegóły osób rzeczywistych przedstawionych w danych źródłowych.

Metodologia

W celu nowych badań autorzy ocenili zyski prywatności w przypadku pięciu algorytmów szkolenia modeli generatywnych. Trzy z tych modeli nie oferują jawnej ochrony prywatności, podczas gdy dwa pozostałe mają gwarancje różnicowej ochrony prywatności. Te tabularne modele zostały wybrane w celu reprezentowania szerokiego zakresu architektur.

Atakowane modele to BayNet, PrivBay (pochodna PrivBayes/BayNet), CTGAN, PATEGAN i IndHist.

Ramka oceny dla modeli została zaimplementowana jako biblioteka Python z dwoma podstawowymi klasami – GenerativeModels i PrivacyAttacks. Ostatnia z nich zawiera dwa aspekty – przeciwnika inferencji członkowskiej i ataku inferencji członkowskiej. Ramka jest również w stanie ocenić korzyści prywatności “oczyszczonych” (tj. anonimizowanych) danych i danych syntetycznych.

Dwa zbiory danych wykorzystane w testach to Zbiór danych Adult z Repozytorium Uczania Maszynowego UCI i Plik danych publicznych o wyładunkach szpitalnych z Texas Department of State Health Services. Wersja zbioru danych z Teksasu wykorzystana przez badaczy zawiera 50 000 rekordów wybranych z rekordów pacjentów za rok 2013.

Ataki i wyniki

Ogólnym celem badań jest ustalenie “łączności” (ponowne skojarzenie danych rzeczywistych z danymi syntetycznymi, które zostały zainspirowane przez nie). Modele ataków wykorzystane w badaniu obejmują regresję logistyczną, lasy losowe i klasyfikatory najbliższych sąsiadów.

Autorzy wybrali dwie grupy docelowe składające się z pięciu losowo wybranych rekordów dla “mniejszościowych” kategorii populacji, ponieważ są one najbardziej narażone na atak łączności. Wybrali również rekordy z “rzadkimi wartościami atrybutów kategorialnych” poza 95. percentyle tego atrybutu. Przykładami są rekordy związane z wysokim ryzykiem śmierci, wysokimi ogólnymi kosztami szpitalnymi i ciężkością choroby.

Chociaż artykuł nie rozwinął tego aspektu, z punktu widzenia prawdopodobnych rzeczywistych atakujących, są to właśnie tego rodzaju “drogie” lub “wysokiego ryzyka” pacjenci, którzy najbardziej prawdopodobnie będą celem ataków inferencji członkowskiej i innych rodzajów podejść do wykradania danych pacjentów.

Wielokrotne modele ataków zostały przeszkolone w celu rozwoju “modeli cieni” nad dziesięcioma celami. Wyniki w przypadku szeregu eksperymentów (jak opisano wcześniej) wskazują, że wiele rekordów było “wysoce narażonych” na ataki łączności skierowane przeciwko nim przez badaczy. Wyniki również wykazały, że 20% wszystkich celów w próbach otrzymało zysk prywatności zero z danych syntetycznych wyprodukowanych przez metody GAN.

Badacze zauważają, że wyniki różnią się w zależności od metody wykorzystanej do generowania danych syntetycznych, wektora ataku i cech zbioru danych docelowego. Raport stwierdza, że w wielu przypadkach skuteczne tłumienie tożsamości za pomocą podejść syntetycznych obniża użyteczność wynikających systemów. Skutecznie, użyteczność i dokładność takich systemów mogą w wielu przypadkach być bezpośrednim wskaźnikiem tego, jak są one narażone na ataki ponownej identyfikacji.

Badacze konkludują:

‘Jeśli zbiór danych syntetycznych zachowuje cechy danych oryginalnych z wysoką dokładnością, a tym samym zachowuje użyteczność danych dla przypadków użycia, dla których są reklamowane, jednocześnie umożliwia przeciwnikom wyodrębnienie wrażliwych informacji o osobach.

‘Wysoki zysk w prywatności za pomocą któregokolwiek z mechanizmów anonimizacji, które oceniliśmy, może być osiągnięty tylko wtedy, gdy opublikowany syntetyczny lub oczyszczony zbiór danych oryginalnych nie przenosi sygnału rekordu indywidualnego w danych surowych i skutecznie tłumi ich rekord.’

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai