Kąt Andersona
Wykrywanie Deepfake’ów na podstawie oryginalnych cech biometrycznych człowieka

Nowy artykuł naukowy z Włoch i Niemiec proponuje metodę wykrywania filmów deepfake’owych na podstawie zachowania biometrycznego twarzy i głosu, a nie artefaktów stworzonych przez systemy syntezy twarzy, drogie rozwiązania watermarkingowe lub inne bardziej nieporęczne podejścia.
Rama wymaga wejścia co najmniej 10 różnych, niefałszywych filmów z danego podmiotu. Nie wymaga jednak specjalnego szkolenia, przeszkolenia ani uzupełnienia w przypadku filmów, ponieważ jego wbudowany model już w sposób ogólny z абstrahował prawdopodobne odległości wektorowe między filmami prawdziwymi a fałszywymi.

Kontrastowe uczenie jest podstawą podejścia POI-Forensics. Wektory pochodzące z materiału źródłowego w przypadku każdego podmiotu są porównywane z tymi samymi wektorami w potencjalnym fałszywym filmie, z cechami i atrybutami pobranymi z obu składników wideo i audio potencjalnie sfałszowanego filmu. Źródło: https://arxiv.org/pdf/2204.03083.pdf
Tytuł POI-Forensics, podejście opiera się na ruchu i sygnałach audio unikalnych dla prawdziwej osoby, której deepfake dotyczy.
Chociaż taki system mógłby umożliwić całkowicie zautomatyzowane, “wstępnie wyrenderowane” ramy uwierzytelniania dla celebrytów, polityków, influencerów YouTube i innych osób, dla których dostępny jest duży materiał wideo, mógłby również zostać dostosowany do ramy, w której zwykłe ofiary technologii deepfake mogłyby potencjalnie mieć platformę do udowodnienia nieautentyczności ataków na nie.

Wizualizacje wyodrębnionych cech z prawdziwych i sfałszowanych filmów w czterech podmiotach w POI-Forensics, za pomocą ramy t-SNE.
Autorzy twierdzą, że POI-Forensics osiąga nowy stan sztuki w wykrywaniu deepfake’ów. Przez różne powszechnie stosowane zestawy danych w tej dziedzinie, ramy osiągają poprawę wyników o 3%, 10% i 7% dla filmów o wysokiej jakości, niskiej jakości i “zaatakowanych” filmów, odpowiednio. Naukowcy obiecują, że wkrótce opublikują kod.

Wyniki POI-Forensics w porównaniu z rywalizującymi ramami pDFDC, DeepFakeTIMIT, FakeAVCelebV2 i KoDF. Trening w każdym przypadku został przeprowadzony na FaceForensics++ i własnej ID-Reveal autorów na VoxCeleb2. Wyniki obejmują filmy o wysokiej i niskiej jakości.
Autorski zespół stwierdza:
‘Trening jest prowadzony wyłącznie na prawdziwych filmach z talking-face, więc detektor nie zależy od konkretnych metod manipulacji i daje najwyższą ogólną zdolność generalizacji. Ponadto, nasza metoda może wykrywać ataki jednej modalności (tylko audio, tylko wideo) i wielomodalności (audio-wideo), i jest odporna na filmy o niskiej jakości lub uszkodzone, budując tylko na wysokopoziomowych cechach semantycznych.’
Nowy artykuł, który zawiera elementy niektórych projektów autorów z 2021 roku ID-Reveal, nosi tytuł Wykrywanie Deepfake’ów Audio-Visual Person-of-Interest i jest wspólnym przedsięwzięciem Uniwersytetu Federico II w Neapolu i Technische Universität München.
Wyścig zbrojeń Deepfake’ów
Aby pokonać system wykrywania takiego rodzaju, systemy deepfake i syntezy ludzkiej wymagałyby możliwości symulowania wizualnych i audio biometrycznych sygnałów od celu syntezy – technologii, która jest jeszcze kilka lat przed nami i prawdopodobnie pozostanie w dziedzinie drogich i zamkniętych systemów opracowanych przez firmy VFX, które będą miały przewagę dzięki współpracy i udziałowi celu (lub ich spadkobierców w przypadku symulacji zmarłych ludzi).

Poprzednie podejście autorów, ID-Reveal, koncentrowało się wyłącznie na informacjach wizualnych. Źródło: https://arxiv.org/pdf/2012.02512.pdf
Udane i popularne metody deepfake, takie jak FaceSwap i DeepFaceLab/Live, obecnie nie mają możliwości tworzenia tak szczegółowych przybliżeń biometrycznych, opierając się na utalentowanych impersonatorach na których jest nakładany sfałszowany tożsamość, i znacznie częściej na odpowiednich filmach z “podobnych” ludzi. Nie ma również możliwości dodania takiej funkcjonalności ze względu na strukturę rdzenia kodu z 2017 roku, który ma niewielką modularyzację i pozostaje źródłem dla DFL i FaceSwap.
Te dwa dominujące pakiety deepfake są oparte na autoencoderach. Alternatywne metody syntezy ludzkiej mogą wykorzystywać podejście Generative Adversarial Network (GAN) lub Neural Radiance Field (NeRF) do odtwarzania tożsamości ludzkiej; ale obie te linie badań mają przed sobą lata pracy, aby wyprodukować w pełni fotorealistyczne filmy ludzkie.
Wyjątkiem jest audio (sfałszowane głosy), symulacja biometryczna jest bardzo daleko na liście wyzwań stojących przed syntezą obrazu ludzkiego. W każdym razie, odtwarzanie barwy i innych cech głosu ludzkiego nie odtwarza jego cech i “sygnałów”, lub sposobu, w jaki prawdziwy podmiot używa konstrukcji semantycznej. Dlatego nawet doskonała symulacja głosu generowana przez AI nie rozwiązuje potencjalnego problemu autentyczności biometrycznej.
Na Arxiv, wiele strategii wykrywania deepfake’ów i innowacji jest opublikowanych co tydzień. Ostatnie podejścia opierały się na jednolitości głosu i twarzy, histogramie lokalnego wzorca binarnego (FF-LBPH), ludzkiej percepcji deepfake’ów audio, analizie granic twarzy, uwzględnianiu degradacji wideo i ‘ballistyce sądowej’ – wśród wielu innych.

Analiza histogramu jest jedną z najnowszych technik oferowanych do poprawy wykrywania deepfake’ów. Źródło: https://arxiv.org/pdf/2203.09928.pdf
Podejście, Dane i Architektura
POI-Forensics stosuje podejście wielomodalne do weryfikacji tożsamości, wykorzystując miękkie cechy biometryczne oparte na wizualnych i audio sygnałach. Ramy składają się z oddzielnych sieci audio i wideo, które ostatecznie dają charakterystyczne dane wektorowe, które mogą być porównane z tymi samymi wyodrębnionymi cechami w potencjalnym filmie deepfake poddawanym badaniu.

Koncepcyjna architektura POI-Forensics.
Można prowadzić analizę oddzielną (audio lub wideo) i fuzją na klipach docelowych, docierając ostatecznie do indeksu podobieństwa POI. Funkcja straty kontrastowej oparta jest na współpracy akademickiej z 2021 roku między Google Research, Boston University, Snap Inc. (SNAP ) i MIT.
Baza danych została podzielona na podstawie tożsamości. 4608 tożsamości zostało wykorzystanych do treningu, a 512 pozostało do walidacji. 500 tożsamości wykorzystanych w FakeAVCelebV2 (kandydacie do testowania, patrz poniżej) zostało wykluczonych w celu uzyskania niepolarizowanych wyników.
Dwie sieci zostały przeszkolone przez 12 epok przy niezwykle dużej wielkości partii 2304 partii na epokę, z każdą partią składającą się z 8×8 segmentów wideo – 8 segmentów dla 8 różnych tożsamości. Optymalizator Adam został wykorzystany z rozłączonym rozkładem wag przy szybkości uczenia 10−4, i rozkładem wag 0,01.
Testowanie i Wyniki
Zestawy danych deepfake testowane w ramach projektu to zestaw danych wyzwania wykrywania DeepFake, który zawiera face-swap w 68 podmiotach, z których 44 tożsamości zostały wybrane, które mają więcej niż 9 powiązanych filmów, łącznie 920 prawdziwych filmów i 2925 fałszywych filmów; DeepFake-TIMIT, zestaw danych oparty na GAN, zawierający 320 filmów 32 podmiotów, łącznie 290 prawdziwych filmów i 580 fałszywych filmów o długości co najmniej 4 sekund; FakeAVCelebV2, składający się z 500 prawdziwych filmów z Voxceleb2, i około 20 000 fałszywych filmów z różnych zestawów danych, do których dodano fałszywe klony audio z SV2TTS w celu zapewnienia kompatybilności; oraz KoDF, koreański zestaw danych deepfake z 403 tożsamościami sfałszowanymi za pomocą FaceSwap, DeepFaceLab i FSGAN, a także trzy pierwsze modele ruchu (FOMM).
Ostatni zestaw danych zawiera również syntezę twarzy napędzaną audio ATFHP i dane wyjściowe z Wav2Lip, przy czym autorzy wykorzystali pochodny zestaw danych zawierający 276 prawdziwych filmów i 544 fałszywe filmy.
Wykorzystano miary, takie jak powierzchnia pod krzywą charakterystyki odbioru (AUC), i przybliżone 10% “fałszywej stopy alarmu”, co byłoby problematyczne w ramach, które obejmują i trenują fałszywe dane, ale które nie jest problemem, ponieważ POI-Forensics wykorzystuje tylko prawdziwe filmy jako dane wejściowe.
Metody zostały przetestowane w porównaniu z detektorem deepfake Seferbekova, który zajął pierwsze miejsce w wyzwaniu Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), współpraca między Uniwersytetem Xiamen w Chinach i Microsoft (MSFT ) Research Asia; LipForensics, wspólna praca z 2021 roku między Imperial College London i Facebook; oraz ID-Reveal, poprzedni projekt kilku autorów nowego artykułu, który pomija aspekt audio i wykorzystuje 3D Morphable Models w połączeniu z grą przeciwną do wykrywania fałszywych danych wyjściowych.
Wyniki (patrz tabela powyżej) POI-Forensics przewyższają lidera Seferbekova o 2,5% w AUC i 1,5% w zakresie dokładności. Wyniki były bardziej konkurencyjne w przypadku innych zestawów danych o wysokiej jakości.
Jednak nowe podejście wykazało znaczną przewagę nad wszystkimi porównywanymi metodami odniesienia w przypadku filmów o niskiej jakości, co pozostaje najbardziej prawdopodobnym scenariuszem, w którym deepfake mogą oszukać przypadkowych widzów, na podstawie “rzeczywistych” kontekstów.
Autorzy twierdzą:
‘W istocie, w tym trudnym scenariuszu, tylko podejścia oparte na tożsamości zapewniają dobrą wydajność, ponieważ opierają się na wysokopoziomowych cechach semantycznych, które są dość odporne na uszkodzenia obrazu.’
Uwzględniając, że POI-Forensics wykorzystuje tylko prawdziwe filmy jako materiał źródłowy, osiągnięcie jest w zasadzie powiększone, i sugeruje, że wykorzystanie rodzimych cech biometrycznych potencjalnych ofiar deepfake jest wartą drogą do ucieczki od “wojny artefaktów” między oprogramowaniem deepfake a rozwiązaniami wykrywania deepfake.
W finale testu, naukowcy dodali szum przeciwny do danych wejściowych, metodę, która może niezawodnie oszukać klasyfikatory. Stary, ale nadal skuteczny szybki znak metody gradientu okazał się szczególnie skuteczny w tym zakresie.
Strategie ataku spowodowały spadek wskaźnika powodzenia we wszystkich metodach i zestawach danych, przy czym AUC spadło o 10% do 38%. Jednak tylko POI-Forensics i poprzednia metoda autorów ID-Reveal były w stanie utrzymać rozsądną wydajność w tym scenariuszu ataku, co sugeruje, że wysokopoziomowe cechy związane z miękkimi cechami biometrycznymi są nadzwyczaj odporne na unikanie wykrywania deepfake.
Autorzy kończą:
‘Ogólnie, uważamy, że nasza metoda jest pierwszym kamieniem milowym; w szczególności, użycie wyższych poziomów cech semantycznych jest obiecującą drogą do przyszłych badań. Ponadto, analiza wielomodalna może być dalej wzbogacona o uwzględnienie większej ilości informacji z innych dziedzin, takich jak dane tekstowe.’
Pierwotnie opublikowane 8 kwietnia 2022.












