Kąt Andersona

Kreatywne ‘twarze’ weryfikacji z sieciami przeciwadwersaryjnymi

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowy artykuł z Uniwersytetu Stanforda zaproponował nową metodę oszukiwania systemów uwierzytelniania twarzy na platformach takich jak aplikacje randkowe, wykorzystując sieć przeciwadwersaryjną (GAN) do tworzenia alternatywnych obrazów twarzy zawierających te same istotne informacje identyfikacyjne, co prawdziwa twarz.

Metoda ta pomyślnie ominęła procesy weryfikacji twarzy w aplikacjach randkowych Tinder i Bumble, w jednym przypadku nawet udając męską twarz jako autentyczną wobec tożsamości źródłowej (żeńskiej).

Różne wygenerowane tożsamości, które zawierają specyficzną kodowanie autora artykułu (wyświetlone w pierwszym obrazie powyżej). Źródło: https://arxiv.org/pdf/2203.15068.pdf

Różne wygenerowane tożsamości, które zawierają specyficzną kodowanie autora artykułu (wyświetlone w pierwszym obrazie powyżej). Źródło: https://arxiv.org/pdf/2203.15068.pdf

Zgodnie z autorem, praca ta stanowi pierwszą próbę ominięcia weryfikacji twarzy za pomocą wygenerowanych obrazów, które zostały wniesione z określonymi cechami tożsamości, ale które próbują reprezentować alternatywną lub znacznie zmienioną tożsamość.

Technika ta została przetestowana na niestandardowym lokalnym systemie weryfikacji twarzy, a następnie przeprowadzono testy czarne skrzynki przeciwko dwóm aplikacjom randkowym, które wykonują weryfikację twarzy na obrazach przesłanych przez użytkowników.

Nowy artykuł nosi tytuł Ominięcie weryfikacji twarzy, a pochodzi od Sanjany Sardy, badaczki w Departamencie Inżynierii Elektrycznej na Uniwersytecie Stanforda.

Kontrolowanie przestrzeni twarzy

Chociaż “wstrzykiwanie” cech specyficznych dla tożsamości (tj. z twarzy, znaków drogowych itp.) do spreparowanych obrazów jest podstawą ataków przeciwadwersaryjnych, nowe badanie sugeruje coś innego: że rosnąca zdolność sektora badawczego do kontrolowania przestrzeni latentnej GAN w końcu umożliwi opracowanie architektur, które mogą tworzyć spójne alternatywne tożsamości użytkownika – i skutecznie umożliwić ekstrakcję cech tożsamości z dostępnych w sieci obrazów nieświadomego użytkownika, aby je zaadaptować do “cieniowej” spreparowanej tożsamości.

Spójność i nawigowalność były głównymi wyzwaniami dotyczącymi przestrzeni latentnej GAN od momentu powstania sieci przeciwadwersaryjnych. GAN, który pomyślnie zaadaptował kolekcję obrazów szkoleniowych do swojej przestrzeni latentnej, nie zapewnia łatwej mapy do “przesunięcia” cech z jednej klasy do innej.

Pomimo że techniki i narzędzia takie jak Gradient-weighted Class Activation Mapping (Grad-CAM) mogą pomóc w ustaleniu kierunków latentnych między ustalonymi klasami i umożliwić transformacje (patrz poniższy obraz), dalszym wyzwaniem jest rozplątywanie zwykle sprawia, że jest to “przybliżona” podróż, z ograniczoną kontrolą przejścia.

Prawie podróż między zakodowanymi wektorami w przestrzeni latentnej GAN, przesuwając pochodzącą z danych męską tożsamość do

Prawie podróż między zakodowanymi wektorami w przestrzeni latentnej GAN, przesuwając pochodzącą z danych męską tożsamość do “żeńskich” kodowań na drugiej stronie jednej z wielu liniowych hiperpłaszczyzn w złożonej i tajemniczej przestrzeni latentnej. Obraz pochodzi z materiału na https://www.youtube.com/watch?v=dCKbRCUyop8

Możliwość “zamrożenia” i ochrony cech specyficznych dla tożsamości podczas ich przenoszenia do transformatywnych kodowań w innych miejscach przestrzeni latentnej potencjalnie umożliwia stworzenie spójnej (i nawet animowalnej) jednostki, której tożsamość jest odczytywana przez systemy maszynowe jako ktoś inny.

Metoda

Autor wykorzystał dwa zestawy danych jako podstawę do eksperymentów: zestaw danych użytkowników ludzkich składający się z 310 obrazów twarzy autora, rozciągających się na okres czterech lat, z różnymi warunkami oświetlenia, wiekiem i kątami widzenia), z wyciętymi twarzami za pomocą Caffe; oraz zestaw danych FairFace zawierający 108 501 obrazów, również wyciętych i skropionych.

Model weryfikacji twarzy został pochodny od podstawowej implementacji FaceNet i DeepFace, wstępnie przeszkolonych na ConvNet Inception, z każdym obrazem reprezentowanym przez 128-wymiarowy wektor.

Podejście wykorzystuje obrazy twarzy z przeszkolonego podzestawu z FairFace. Aby przejść weryfikację twarzy, obliczona odległość spowodowana przez normę Frobeniusa obrazu jest przesunięta w stosunku do użytkownika docelowego w bazie danych. Każdy obraz poniżej progu 0,7 jest równy tej samej tożsamości, w przeciwnym razie weryfikacja jest uważana za nieudaną.

Model StyleGAN został dostosowany do zestawu danych osobistych autora, wytwarzając model, który generował rozpoznawalne wariacje tożsamości autora, chociaż żaden z tych wygenerowanych obrazów nie był identyczny z danymi szkoleniowymi. To zostało osiągnięte przez zamrożenie pierwszych czterech warstw w dyskryminatorze, aby uniknąć przeuczenia danych i wytworzyć zróżnicowane dane wyjściowe.

Chociaż różnorodne obrazy zostały uzyskane z podstawowego modelu StyleGAN, niska rozdzielczość i wierność skłoniły do drugiej próby z StarGAN V2, który pozwala na szkolenie obrazów nasionowych w kierunku docelowego obrazu twarzy.

Model StarGAN V2 został wstępnie przeszkolony przez około 10 godzin przy użyciu zestawu walidacyjnego FairFace, o rozmiarze partii 4 i rozmiarze walidacji 8. W najbardziej udanym podejściu, zestaw danych osobistych autora został użyty jako źródło z danymi szkoleniowymi jako odniesieniem.

Eksperymenty weryfikacyjne

Model weryfikacji twarzy został zbudowany na podstawie podzestawu 1000 obrazów, z zamiarem zweryfikowania dowolnego obrazu z zestawu. Obrazy, które pomyślnie przeszły weryfikację, zostały następnie przetestowane wobec tożsamości autora.

Po lewej, autor artykułu, prawdziwa fotografia; środek, dowolny obraz, który nie przeszedł weryfikacji; prawo, niezwiązany obraz z zestawu, który przeszedł weryfikację jako autor.

Po lewej, autor artykułu, prawdziwa fotografia; środek, dowolny obraz, który nie przeszedł weryfikacji; prawo, niezwiązany obraz z zestawu, który przeszedł weryfikację jako autor.

Celem eksperymentów było stworzenie jak największej przerwy między postrzeganą tożsamością wizualną, a jednocześnie zachowaniem cech definiujących tożsamość docelową. To zostało ocenione za pomocą odległości Mahalanobisa, miary używanej w przetwarzaniu obrazów do wyszukiwania wzorców i szablonów.

Dla modelu generatywnego bazowego wyniki o niskiej rozdzielczości wykazują ograniczoną różnorodność, pomimo pomyślnego przejścia lokalnej weryfikacji twarzy. StarGAN V2 okazał się bardziej zdolny do tworzenia różnorodnych obrazów, które mogły uwierzytelnić.

Wszystkie wyświetlone obrazy przeszły lokalną weryfikację twarzy. Powyżej są niskiej rozdzielczości generacje bazowego StyleGAN, poniżej, wyższej rozdzielczości i jakości generacje StarGAN V2.

Wszystkie wyświetlone obrazy przeszły lokalną weryfikację twarzy. Powyżej są niskiej rozdzielczości generacje bazowego StyleGAN, poniżej, wyższej rozdzielczości i jakości generacje StarGAN V2.

Ostatnie trzy obrazy wyświetlone powyżej wykorzystywały zestaw danych autora jako źródło i odniesienie, podczas gdy poprzednie obrazy wykorzystywały dane szkoleniowe jako odniesienie i zestaw danych autora jako źródło.

Wynikowe obrazy wygenerowane zostały przetestowane wobec systemów weryfikacji twarzy aplikacji randkowych Bumble i Tinder, z tożsamością autora jako bazą, i przeszły weryfikację. “Męska” generacja twarzy autora również przeszła weryfikację Bumble, chociaż oświetlenie musiało zostać dostosowane w wygenerowanym obrazie, zanim zostało zaakceptowane. Tinder nie zaakceptował wersji męskiej.

Wersje 'męskie' tożsamości autora (żeńskiej).

Wersje ‘męskie’ tożsamości autora (żeńskiej).

Wnioski

To są przełomowe eksperymenty w projekcji tożsamości, w kontekście manipulacji przestrzenią latentną GAN, która pozostaje nadzwyczajnym wyzwaniem w syntezie obrazu i badaniach deepfake. Niemniej jednak, praca ta otwiera pojęcie wbudowywania wysoko specyficznych cech w sposób spójny w różnorodnych tożsamościach, oraz tworzenia “alternatywnych” tożsamości, które “czytają” jako ktoś inny.

 

Pierwotnie opublikowane 30 marca 2022 r.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai