Kąt Andersona
Metoda danych sądowych dla nowego pokolenia deepfake’ów

Chociaż deepfaking osób prywatnych stał się rosnącą troską publiczną i jest coraz częściej zakazany w różnych regionach, udowodnienie, że model stworzony przez użytkownika – taki jak ten, który umożliwia zemstę pornograficzną – został wyraźnie przeszkolony na konkretnych zdjęciach danej osoby, pozostaje niezwykle trudne.
Aby umieścić problem w kontekście: kluczowym elementem ataku deepfake jest fałszywe twierdzenie, że dany obraz lub film przedstawia konkretną osobę. Po prostu stwierdzenie, że ktoś na filmie jest identyfikowany jako #A, a nie tylko podobny, jest wystarczające do spowodowania szkody, i nie jest wymagane użycie AI w tym scenariuszu.
Jednakże, jeśli atakujący generuje obrazy lub filmy AI przy użyciu modeli przeszkolonych na danych rzeczywistej osoby, systemy rozpoznawania twarzy w mediach społecznościowych i wyszukiwarkach automatycznie łączą fałszywe treści z ofiarą – bez konieczności podawania nazw w postach lub metadanych. Samo AI-generowane wizualizacja zapewnia skojarzenie.
Im bardziej charakterystyczny jest wygląd osoby, tym bardziej nieuniknione staje się to, aż fałszywe treści pojawiają się w wynikach wyszukiwania obrazów i ostatecznie dochodzą do ofiary.
Twarzą w twarz
Najczęstszym sposobem rozpowszechniania modeli zorientowanych na tożsamość jest obecnie Low-Rank Adaptation (LoRA), w ramach którego użytkownik trenuje niewielką liczbę obrazów przez kilka godzin w oparciu o wagi dużego modelu podstawowego, takiego jak Stable Diffusion (głównie dla statycznych obrazów) lub Hunyuan Video, dla filmowych deepfake’ów.
Najczęstszymi celami LoR są sławne osoby, których sława naraża je na tego rodzaju traktowanie z mniejszą krytyką publiczną niż w przypadku “nieznanych” ofiar, ze względu na założenie, że takie pochodne dzieła są objęte “uczciwym użytkowaniem” (przynajmniej w USA i Europie).

Sławne osoby dominują na liście LoRA i Dreambooth na portalu civit.ai. Najpopularniejszy LoRA ma obecnie ponad 66 000 pobrań, co jest znaczące, biorąc pod uwagę, że takie użycie AI jest nadal postrzegane jako “fringe” działalność.
Nie ma takiego publicznego forum dla ofiar deepfakingu, które pojawiają się w mediach tylko wtedy, gdy pojawiają się przypadki ścigania lub gdy ofiary mówią o tym w popularnych mediach.
Jednakże, w obu przypadkach, modele użyte do sfałszowania tożsamości “wydestylowały” swoje dane szkoleniowe tak całkowicie w przestrzeń latentną modelu, że trudno jest zidentyfikować źródłowe obrazy, które zostały użyte.
Jeśli byłoby możliwe zrobić to w ramach akceptowalnego marginesu błędu, umożliwiłoby to ściganie tych, którzy udostępniają LoRA, ponieważ nie tylko dowodzi zamiaru sfałszowania konkretnego tożsamości (tj. tej osoby, nawet jeśli sprawca nie wymienia jej imienia podczas procesu zniesławienia), ale także naraża uploadera na zarzuty naruszenia praw autorskich, tam gdzie ma to zastosowanie.
Ostatnie z nich byłoby przydatne w jurysdykcjach, w których regulacja prawna technologii deepfakingu jest nieobecna lub opóźniona.
Nadmiernie eksponowane
Celem trenowania modelu podstawowego, takiego jak wielogigabajtowy model podstawowy, który użytkownik może pobrać z Hugging Face, jest to, aby model stał się dobrze uogólniony i giętki. Obejmuje to trenowanie na wystarczającej liczbie różnorodnych obrazów i z odpowiednimi ustawieniami, a także zakończenie trenowania przed tym, jak model “przeuczy się” do danych.
Model przeuczycony widział dane tak wiele razy (w nadmiarze) podczas procesu trenowania, że będzie tendencja do odtwarzania obrazów, które są bardzo podobne, tym samym ujawniając źródło danych szkoleniowych.

Tożsamość ‘Ann Graham Lotz’ może być prawie idealnie odtworzona w modelu Stable Diffusion V1.5. Rekonstrukcja jest prawie identyczna z danymi szkoleniowymi (po lewej stronie powyższego obrazu). Source: https://arxiv.org/pdf/2301.13188
Jednak modele przeuczone są zwykle odrzucane przez ich twórców, zamiast rozpowszechniane, ponieważ są one w każdym przypadku niezdolne do pełnienia swojej funkcji. Dlatego jest to mało prawdopodobne “znalezisko policyjne”. W każdym przypadku zasada ta ma zastosowanie bardziej do kosztownego i wielkoobjętościowego trenowania modeli podstawowych, gdzie wiele wersji tego samego obrazu, które dostały się do ogromnego zbioru danych, mogą sprawić, że pewne obrazy szkoleniowe będą łatwe do wywołania (patrz obraz i przykład powyżej).
Rzeczy mają się nieco inaczej w przypadku modeli LoRA i Dreambooth (choć Dreambooth wyszedł z mody ze względu na duże rozmiary plików). Tutaj użytkownik wybiera bardzo ograniczoną liczbę różnorodnych obrazów obiektu i używa ich do trenowania LoRA.

Po lewej, wynik z Hunyuan Video LoRA. Po prawej, dane, które umożliwiły podobieństwo (obrazy użyte za zgodą osoby przedstawionej).
Często LoRA ma wytrenowany słowo-wywołujące, takie jak [nazwa sławnej osoby]. Jednak bardzo często specjalnie wytrenowany obiekt pojawia się w generowanych wynikach bez takich podpowiedzi, ponieważ nawet dobrze zbalansowany (tj. nieprzeuczone) LoRA jest nieco “zafiksowany” na materiale, na którym został wytrenowany, i będzie tendencja do uwzględniania go w każdym wyniku.
Ta skłonność, w połączeniu z ograniczoną liczbą obrazów optymalnych dla zestawu danych LoRA, naraża model na analizę policyjną, jak zobaczymy.
Demaskowanie danych
Te sprawy są poruszone w nowym artykule z Danii, który oferuje metodę identyfikacji źródłowych obrazów (lub grup źródłowych obrazów) w czarnej skrzynce Atak na członkostwo (MIA). Technika ta obejmuje w części użycie niestandardowo wytrenowanych modeli, które są zaprojektowane tak, aby pomóc ujawnić dane źródłowe, generując własne “deepfakes”:

Przykłady ‘sfałszowanych’ obrazów wygenerowanych przez nowy podejście, na coraz to większych poziomach Classifier-Free Guidance (CFG), aż do punktu zniszczenia. Źródło: https://arxiv.org/pdf/2502.11619
Chociaż praca, zatytułowana Ataki na członkostwo dla obrazów twarzy przeciwko modelom latentnym, jest najbardziej interesującym wkładem do literatury na temat tego konkretnego tematu, jest to także niedostępny i zwięzły artykuł, który wymaga znacznego “odkodowania”. Dlatego też przedstawimy tutaj co najmniej podstawowe zasady założone za tym projektem i wybrane wyniki.
W istocie, jeśli ktoś dostosuje model AI do Twojej twarzy, metoda autorów może pomóc udowodnić to, szukając charakterystycznych oznak zapamiętania w generowanych obrazach modelu.
W pierwszej kolejności docelowy model AI jest dostosowany do zestawu danych obrazów twarzy, co sprawia, że jest bardziej prawdopodobne, że odtworzy szczegóły z tych obrazów w swoich wynikach. Następnie tryb ataku jest trenowany przy użyciu AI-generowanych obrazów z docelowego modelu jako “pozytywów” (podejrzanych członków zestawu danych) i innych obrazów z innego zestawu danych jako “negatywów” (nie-członków).
Poprzez naukę subtelnych różnic między tymi grupami, model ataku może przewidzieć, czy dany obraz był częścią oryginalnego zestawu danych dostosowania docelowego modelu.
Atak jest najbardziej skuteczny w przypadkach, w których model AI został dostosowany w znacznym stopniu, co oznacza, że im bardziej model jest wyspecjalizowany, tym łatwiej jest wykryć, czy określone obrazy zostały użyte. Ogólnie dotyczy to LoR, zaprojektowanych do odtworzenia sławnych osób lub osób prywatnych.
Autorzy również stwierdzili, że dodanie widocznych znaków wodnych do obrazów szkoleniowych ułatwia wykrywanie jeszcze bardziej – chociaż ukryte znaki wodne nie pomagają zbyt wiele.
Impresjonująco, podejście to jest testowane w czarnej skrzynce, co oznacza, że działa bez dostępu do wewnętrznych szczegółów modelu, tylko jego wyników.
Metoda ta jest obliczeniowo intensywna, jak autorzy przyznają; jednak wartość tej pracy polega na wskazaniu kierunku dalszych badań i na dowodzeniu, że dane mogą być realistycznie wyodrębnione w akceptowalnym zakresie tolerancji; dlatego, biorąc pod uwagę jego przełomowy charakter, nie musi on działać na smartfonie na tym etapie.
Metoda/Dane
W badaniu użyto kilku zestawów danych z Duńskiego Uniwersytetu Technicznego (DTU, instytucji goszczącej trzech badaczy), zarówno do dostosowania docelowego modelu, jak i do trenowania i testowania trybu ataku.
Użyte zestawy danych pochodzą z DTU Orbit:
DseenDTU Podstawowy zestaw obrazów.
DDTU Obrazy pobrane z DTU Orbit.
DseenDTU Część DDTU użyta do dostosowania docelowego modelu.
DunseenDTU Część DDTU, która nie została użyta do dostosowania żadnego modelu generowania obrazów i została zamiast tego użyta do testowania lub trenowania modelu ataku.
wmDseenDTU Część DDTU z widocznymi znakami wodnymi użyta do dostosowania docelowego modelu.
hwmDseenDTU Część DDTU z ukrytymi znakami wodnymi użyta do dostosowania docelowego modelu.
DgenDTU Obrazy wygenerowane przez model dyfuzji latentnej (LDM), który został dostosowany do zestawu obrazów DseenDTU.
Zestawy danych użyte do dostosowania docelowego modelu składają się z par obrazów i podpisów opisanych przez model podpisu BLIP (może nieprzypadkowo jeden z najpopularniejszych nieocenzurowanych modeli w społeczności AI).
BLIP został ustawiony tak, aby dołączyć frazę ‘a dtu headshot of a’ do każdego opisu.
Ponadto w testach użyto kilku zestawów danych z Uniwersytetu w Aalborgu (AAU), pochodzących z korpusu AU VBN:
DAAU Obrazy pobrane z AAU vbn.
DseenAAU Część DAAU użyta do dostosowania docelowego modelu.
DunseenAAU Część DAAU, która nie została użyta do dostosowania żadnego modelu generowania obrazów, ale zamiast tego została użyta do testowania lub trenowania modelu ataku.
DgenAAU Obrazy wygenerowane przez LDM dostosowany do zestawu obrazów DseenAAU.
Również tutaj fraza ‘a aau headshot of a’ została użyta. Zapewniło to, że wszystkie etykiety w zestawie danych DTU są w formacie ‘a dtu headshot of a (…)’, wzmocnienie cech rdzenia zestawu danych podczas dostosowania.
Testy
Przeprowadzono wiele eksperymentów, aby ocenić, jak dobrze ataki na członkostwo sprawdzają się przeciwko docelowemu modelowi. Każdy test miał na celu ustalenie, czy możliwe jest przeprowadzenie udanego ataku w ramach schematu poniżej, gdzie docelowy model jest dostosowany do zestawu danych obrazów, który został uzyskany bez autoryzacji.

Schemat podejścia.
Z dostosowanym modelem zapytanym o wygenerowanie obrazów wynikowych, te obrazy są następnie używane jako przykłady pozytywne do trenowania modelu ataku, podczas gdy dodatkowe niezwiązane obrazy są uwzględniane jako przykłady negatywne.
Model ataku jest trenowany przy użyciu nauki nadzorowanej i jest następnie testowany na nowych obrazach, aby ustalić, czy zostały one pierwotnie częścią zestawu danych dostosowania docelowego modelu. Aby ocenić dokładność ataku, 15% danych testowych jest odłożone do walidacji.
Ponieważ docelowy model jest dostosowany do znanych danych, rzeczywisty status członkostwa każdego obrazu jest już ustalony podczas tworzenia danych szkoleniowych dla modelu ataku. To kontrolowane ustawienie pozwala na jasną ocenę, jak skutecznie model ataku może odróżnić obrazy, które były częścią zestawu danych dostosowania, od tych, których nie było.
Do tych testów użyto Stable Diffusion V1.5. Chociaż ten dość stary model pojawia się często w badaniach ze względu na potrzebę spójnego testowania i obszernego korpusu wcześniejszych prac, które go używają, jest to odpowiednie zastosowanie; V1.5 pozostał popularny do tworzenia LoRA w społeczności hobbystów Stable Diffusion przez długi czas, pomimo wielu późniejszych wersji, i nawet pomimo pojawienia się Flux – ponieważ model jest całkowicie nieocenzurowany.
Model ataku badaczy oparty był na Resnet-18, z zachowanymi wstępnie wytrenowanymi wagami. Warstwa ResNet-18 z 1000 neuronów została zastąpiona przez warstwę w pełni połączoną z dwoma neuronami. Ucząca strata była kategorialna entropia krzyżowa, a optymalizator Adam został użyty.
Dla każdego testu model ataku był trenowany pięć razy przy użyciu różnych losowych nasion, aby obliczyć 95% przedziałów ufności dla kluczowych metryk. Zero-shot klasyfikacja z modelem CLIP została użyta jako punkt odniesienia.
(Proszę zauważyć, że oryginalna tabela wyników w artykule jest zwięzła i niezwykle trudna do zrozumienia. Dlatego też sformułowałem ją poniżej w bardziej przyjaznej formie. Proszę kliknąć na obraz, aby zobaczyć go w lepszej rozdzielczości)

Podsumowanie wyników z wszystkich testów. Kliknij na obraz, aby zobaczyć go w wyższej rozdzielczości
Metoda ataku badaczy okazała się najbardziej skuteczna przy atakowaniu dostosowanych modeli, szczególnie tych wytrenowanych na określonym zestawie obrazów, takim jak twarz osoby. Jednakże, chociaż atak może ustalić, czy zestaw danych został użyty, ma trudności z identyfikacją poszczególnych obrazów w tym zestawie.
W praktyce ostatnie nie jest koniecznie przeszkodą w użyciu podejścia takiego jak to do celów policyjnych; podczas gdy jest relatywnie mało wartości w ustaleniu, czy znany zestaw danych, taki jak ImageNet, został użyty w modelu, atakujący na osobę prywatną (a nie sławną) będzie miał znacznie mniej wyboru danych źródłowych i będzie musiał w pełni wykorzystać dostępne grupy danych, takie jak albumy w mediach społecznościowych i inne kolekcje online. Te efektywnie tworzą “hasz”, który może być odkryty przez metody opisane powyżej.
Artykuł zauważa, że innym sposobem poprawy dokładności jest użycie AI-generowanych obrazów jako “nie-członków”, zamiast polegania wyłącznie na rzeczywistych obrazach. Zapobiega to sztucznie wysokim wskaźnikom powodzenia, które mogą w przeciwnym razie mylić wyniki.
Jeszcze jednym czynnikiem, który znacznie wpływa na wykrywanie, autorzy zauważają, jest znakowanie wodne. Kiedy obrazy szkoleniowe zawierają widoczne znaki wodne, atak staje się bardzo skuteczny, podczas gdy ukryte znaki wodne oferują niewielką lub żadną przewagę.

Prawy obraz pokazuje rzeczywisty “ukryty” znak wodny użyty w testach.
Wreszcie, poziom sterowania w generowaniu obrazu z tekstu również odgrywa rolę, z optymalnym balansem znalezionym na poziomie sterowania około 8. Nawet gdy nie jest używany bezpośredni podpowiedź, dostosowany model nadal tendencja do produkcji wyników, które przypominają jego dane szkoleniowe, wzmacniając skuteczność ataku.
Wnioski
To szkoda, że ten interesujący artykuł został napisany w taki sposób, który jest nieprzystępny, ponieważ powinien on być interesujący zarówno dla obrońców prywatności, jak i hobbystów AI.
Chociaż ataki na członkostwo mogą okazać się interesującym i owocnym narzędziem policyjnym, ważniejsze jest, aby ten nurt badań rozwinął ogólne, stosowalne zasady, aby nie skończyć się w tej samej grze w “kreta” (whack-a-mole), jaka miała miejsce w przypadku wykrywania deepfake’ów w ogóle, kiedy wydanie nowszego modelu negatywnie wpływa na wykrywanie i podobne systemy policyjne.
Od czasu, gdy istnieją pewne dowody wyższego poziomu zasadniczej zasady, oczyszczonych w tym nowym badaniu, możemy mieć nadzieję, że zobaczymy więcej pracy w tym kierunku.
Pierwotnie opublikowane w piątek, 21 lutego 2025












