Kąt Andersona
Ponowne identyfikowanie danych źródłowych dla generatorów GAN

Nowe badania przeprowadzone we Francji zaproponowały technikę “ponownej identyfikacji” tożsamości, które przyczyniły się do wygenerowania danych syntetycznych, takich jak twarze wygenerowane przez GAN w projektach takich jak This Person Does Not Exist.
Metoda opisana w artykule, zatytułowanym This Person (Probably) Exists. Identity Membership Attacks Against GAN Generated Faces, nie wymaga (nieprawdopodobnego) dostępu do architektury szkoleniowej lub danych modelu i może być stosowana w różnych aplikacjach, w których używa się Sieci Przeciwstawnych Generatywnych (GAN) jako metody anonimizacji danych osobowych (PII) lub jako sposób generowania syntetycznych danych przy jednoczesnej ochronie danych źródłowych.
Badacze opracowali metodę zwaną Atak na członkostwo tożsamości, która ocenia prawdopodobieństwo wystąpienia pojedynczej tożsamości często w zbiorze danych, zamiast próbować zidentyfikować konkretną cechę tożsamości (tj. grupy pikseli oryginalnego obrazu, który był użyty do szkolenia modelu generatywnego).
Na powyższym obrazie z badań, każdy wiersz zaczyna się od obrazu wygenerowanego przez StyleGAN. Lewy blok obrazów został utworzony z bazy danych 40 000 obrazów, środkowy z 80 000, a prawy blok z 46 000 obrazów. Wszystkie obrazy pochodzą z zestawu danych VGG2Face2.
Niektóre próbki mają ulotną podobieństwo, podczas gdy inne silnie korelują z danymi szkoleniowymi. Twarze zostały pomyślnie zidentyfikowane przez badaczy przy użyciu sieci identyfikacji twarzy.
Więcej niż wartość nominalna
Podejścia do ponownej identyfikacji tego rodzaju mają wiele implikacji w wielu dziedzinach badawczych; badacze, związani z Uniwersytetem w Caen we Francji, podkreślają, że ich technika nie jest ograniczona do zestawów twarzy i ramowych GAN, ale jest równie stosowalna do zestawów danych medycznych i danych biometrycznych, wśród innych możliwych powierzchni ataku w ramach syntezowania obrazów.
‘Uważamy, że jeśli taki atak będzie udany, ujawni się jako poważna przeszkoda dla bezpiecznej wymiany GAN w wrażliwych kontekstach. Na przykład, w kontekście obrazów lub innych dzieł sztuki, dystrybucja nieprywatnego generatora może być wykluczona z oczywistych powodów praw autorskich. Co więcej, rozważmy firmę biometryczną A, która udostępnia generator, który ujawnia tożsamość jej konsumenta. Inna firma B mogłaby potencjalnie wykryć, którzy z jej własnych konsumentów są również klientami firmy A. Podobne sytuacje mogą stanowić poważne problemy dla danych medycznych, gdzie ujawnienie GAN mogłoby naruszyć informacje osobiste o chorobie pacjenta.’
Ponowna identyfikacja nielegalnie pobranych lub prywatnych danych
Chociaż artykuł tylko lekko porusza ten temat, możliwość identyfikacji oryginalnych danych źródłowych z abstrakcyjnego wyjścia (takiego jak twarze wygenerowane przez GAN, choć dotyczy to również systemów encoder/decoder i innych architektur) ma znaczące implikacje dla wdrożeń ochrony praw autorskich w ciągu najbliższych 5-10 lat.
Obecnie większość krajów stosuje laissez faire podejście do pobierania publicznie dostępnych danych internetowych, aby nie pozostać w tyle w rozwoju gospodarki opartej na uczeniu maszynowym. Gdy ten klimat komercjalizuje się i konsoliduje, istnieje duży potencjał dla nowego pokolenia “Data Trolls”, aby zgłaszać roszczenia dotyczące praw autorskich do obrazów potwierdzonych jako użytych historycznie w zestawach danych, które przyczyniły się do algorytmów uczenia maszynowego.
Gdy rozwijane algorytmy dojrzewają i stają się bardziej wartościowe z czasem, każde niezatwierdzone zdjęcie, które było użyte w ich wczesnym rozwoju, a które można wywnioskować z ich wyjścia przy użyciu metod podobnych do tych proponowanych w nowym francuskim artykule, jest potencjalnym ryzykiem prawnym na skalę sporu SCO Vs IBM (legendarnie długiego procesu sądowego, który nadal zagraża systemowi operacyjnemu Linux).
Wykorzystywanie meksykańskiego patu różnorodności a częstotliwości
Główna technika użyta przez francuskich badaczy wykorzystuje częstotliwość oryginalnych danych w zbiorze jako klucz do ponownej identyfikacji. Im częściej występuje określona tożsamość w zbiorze danych, tym bardziej prawdopodobne jest, że będzie można zidentyfikować tę oryginalną tożsamość, korelując wyniki ataku z publicznie lub prywatnie dostępnymi zestawami danych.
Badacze zauważają, że można to złagodzić, włączając znacznie większą różnorodność danych (na przykład twarzy) do zestawu danych źródłowych, oraz nie szkoląc zestawu tak długo, aby przeuczenie wystąpiło. Problem polega na tym, że model musi osiągnąć dobrą abstrakcję w znacznie wyższej przestrzeni wymiarowej i z znacznie większą ilością danych, niż jest to ściśle konieczne do uzyskania wiarygodnych wyników syntetycznych.
Aby osiągnąć optymalną generalizację, jest to kosztowne i czasochłonne: przestrzeń latentna (część analityczna modelu uczenia maszynowego, do której wprowadzane są dane) będzie wymagać więcej zasobów; zestaw danych będzie wymagał więcej kuracji; a ponieważ ilość danych musi być znacząca, rozmiary partii i harmonogramy będą musiały być zoptymalizowane pod kątem jakości i wysokiego poziomu generalizacji, zamiast szybkości szkolenia i ekonomii, co prowadzi do wyższych kosztów rozwoju i dłuższych czasów rozwoju.
Ponadto, przeuczone algorytmy generatywne mogą osiągnąć bardzo realistyczne dane syntetyczne, nawet jeśli wyjściowe dane (tj. twarze, mapy, obrazy biomedyczne itp.) nie są całkowicie abstrakcyjne, ale posiadają większe cechy rozróżniające od danych źródłowych, niż byłoby to idealne – kuszące skróty. W obecnej “dzikiej” atmosferze sektora uczenia maszynowego, gdzie mniejsze inicjatywy próbują wyzwaniać przewagę FAANG z mniejszymi zasobami (lub else zdobyć uwagę na wykup), jest uy-out), wątpliwe, czy standardy zawsze osiągają ten poziom.
Artykuł również obserwuje, że różnorodność punktów danych źródłowych (takich jak twarze) nie jest wystarczająca sama w sobie, aby zapobiec ponownej identyfikacji za pomocą tych i podobnych metod, ponieważ wczesne zatrzymanie szkolenia może pozostawić tożsamości źródłowe niewystarczająco abstrakcyjnymi.













