Kąt Andersona

Wykrywanie Deepfake’Ãģw na podstawie oryginalnych cech biometrycznych człowieka

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

Nowy artykuł naukowy z Włoch i Niemiec proponuje metodę wykrywania filmÃģw deepfake’owych na podstawie zachowania biometrycznego twarzy i głosu, a nie artefaktÃģw stworzonych przez systemy syntezy twarzy, drogie rozwiązania watermarkingowe lub inne bardziej nieporęczne podejścia.

Rama wymaga wejścia co najmniej 10 rÃģÅžnych, niefałszywych filmÃģw z danego podmiotu. Nie wymaga jednak specjalnego szkolenia, przeszkolenia ani uzupełnienia w przypadku filmÃģw, poniewaÅž jego wbudowany model juÅž w sposÃģb ogÃģlny z Ð°Ðąstrahował prawdopodobne odległości wektorowe między filmami prawdziwymi a fałszywymi.

Kontrastowe uczenie jest podstawą podejścia POI-Forensics. Wektory pochodzące z materiału ÅšrÃģdłowego w przypadku kaÅždego podmiotu są porÃģwnywane z tymi samymi wektorami w potencjalnym fałszywym filmie, z cechami i atrybutami pobranymi z obu składnikÃģw wideo i audio potencjalnie sfałszowanego filmu. ÅđrÃģdło: https://arxiv.org/pdf/2204.03083.pdf

Kontrastowe uczenie jest podstawą podejścia POI-Forensics. Wektory pochodzące z materiału ÅšrÃģdłowego w przypadku kaÅždego podmiotu są porÃģwnywane z tymi samymi wektorami w potencjalnym fałszywym filmie, z cechami i atrybutami pobranymi z obu składnikÃģw wideo i audio potencjalnie sfałszowanego filmu. ÅđrÃģdło: https://arxiv.org/pdf/2204.03083.pdf

Tytuł POI-Forensics, podejście opiera się na ruchu i sygnałach audio unikalnych dla prawdziwej osoby, ktÃģrej deepfake dotyczy.

ChociaÅž taki system mÃģgłby umoÅžliwić całkowicie zautomatyzowane, “wstępnie wyrenderowane” ramy uwierzytelniania dla celebrytÃģw, politykÃģw, influencerÃģw YouTube i innych osÃģb, dla ktÃģrych dostępny jest duÅžy materiał wideo, mÃģgłby rÃģwnieÅž zostać dostosowany do ramy, w ktÃģrej zwykłe ofiary technologii deepfake mogłyby potencjalnie mieć platformę do udowodnienia nieautentyczności atakÃģw na nie.

Wizualizacje wyodrębnionych cech z prawdziwych i sfałszowanych filmÃģw w czterech podmiotach w POI-Forensics, za pomocą ramy t-SNE.

Wizualizacje wyodrębnionych cech z prawdziwych i sfałszowanych filmÃģw w czterech podmiotach w POI-Forensics, za pomocą ramy t-SNE.

Autorzy twierdzą, Åže POI-Forensics osiąga nowy stan sztuki w wykrywaniu deepfake’Ãģw. Przez rÃģÅžne powszechnie stosowane zestawy danych w tej dziedzinie, ramy osiągają poprawę wynikÃģw o 3%, 10% i 7% dla filmÃģw o wysokiej jakości, niskiej jakości i “zaatakowanych” filmÃģw, odpowiednio. Naukowcy obiecują, Åže wkrÃģtce opublikują kod.

Wyniki POI-Forensics w porÃģwnaniu z rywalizującymi ramami pDFDC, DeepFakeTIMIT, FakeAVCelebV2 i KoDF. Trening w kaÅždym przypadku został przeprowadzony na FaceForensics++, ID-Reveal i metodzie autorÃģw na VoxCeleb2. Wyniki obejmują filmy o wysokiej i niskiej jakości.

Wyniki POI-Forensics w porÃģwnaniu z rywalizującymi ramami pDFDC, DeepFakeTIMIT, FakeAVCelebV2 i KoDF. Trening w kaÅždym przypadku został przeprowadzony na FaceForensics++ i własnej ID-Reveal autorÃģw na VoxCeleb2. Wyniki obejmują filmy o wysokiej i niskiej jakości.

Autorski zespÃģł stwierdza:

‘Trening jest prowadzony wyłącznie na prawdziwych filmach z talking-face, więc detektor nie zaleÅžy od konkretnych metod manipulacji i daje najwyÅžszą ogÃģlną zdolność generalizacji. Ponadto, nasza metoda moÅže wykrywać ataki jednej modalności (tylko audio, tylko wideo) i wielomodalności (audio-wideo), i jest odporna na filmy o niskiej jakości lub uszkodzone, budując tylko na wysokopoziomowych cechach semantycznych.’

Nowy artykuł, ktÃģry zawiera elementy niektÃģrych projektÃģw autorÃģw z 2021 roku ID-Reveal, nosi tytuł Wykrywanie Deepfake’Ãģw Audio-Visual Person-of-Interest i jest wspÃģlnym przedsięwzięciem Uniwersytetu Federico II w Neapolu i Technische UniversitÃĪt MÞnchen.

Wyścig zbrojeń Deepfake’Ãģw

Aby pokonać system wykrywania takiego rodzaju, systemy deepfake i syntezy ludzkiej wymagałyby moÅžliwości symulowania wizualnych i audio biometrycznych sygnałÃģw od celu syntezy – technologii, ktÃģra jest jeszcze kilka lat przed nami i prawdopodobnie pozostanie w dziedzinie drogich i zamkniętych systemÃģw opracowanych przez firmy VFX, ktÃģre będą miały przewagę dzięki wspÃģłpracy i udziałowi celu (lub ich spadkobiercÃģw w przypadku symulacji zmarłych ludzi).

Poprzednie podejście autorÃģw, ID-Reveal, koncentrowało się wyłącznie na informacjach wizualnych. ÅđrÃģdło: https://arxiv.org/pdf/2012.02512.pdf

Poprzednie podejście autorÃģw, ID-Reveal, koncentrowało się wyłącznie na informacjach wizualnych. ÅđrÃģdło: https://arxiv.org/pdf/2012.02512.pdf

Udane i popularne metody deepfake, takie jak FaceSwap i DeepFaceLab/Live, obecnie nie mają moÅžliwości tworzenia tak szczegÃģłowych przybliÅžeń biometrycznych, opierając się na utalentowanych impersonatorach na ktÃģrych jest nakładany sfałszowany toÅžsamość, i znacznie częściej na odpowiednich filmach z “podobnych” ludzi. Nie ma rÃģwnieÅž moÅžliwości dodania takiej funkcjonalności ze względu na strukturę rdzenia kodu z 2017 roku, ktÃģry ma niewielką modularyzację i pozostaje ÅšrÃģdłem dla DFL i FaceSwap.

Te dwa dominujące pakiety deepfake są oparte na autoencoderach. Alternatywne metody syntezy ludzkiej mogą wykorzystywać podejście Generative Adversarial Network (GAN) lub Neural Radiance Field (NeRF) do odtwarzania toÅžsamości ludzkiej; ale obie te linie badań mają przed sobą lata pracy, aby wyprodukować w pełni fotorealistyczne filmy ludzkie.

Wyjątkiem jest audio (sfałszowane głosy), symulacja biometryczna jest bardzo daleko na liście wyzwań stojących przed syntezą obrazu ludzkiego. W kaÅždym razie, odtwarzanie barwy i innych cech głosu ludzkiego nie odtwarza jego cech i “sygnałÃģw”, lub sposobu, w jaki prawdziwy podmiot uÅžywa konstrukcji semantycznej. Dlatego nawet doskonała symulacja głosu generowana przez AI nie rozwiązuje potencjalnego problemu autentyczności biometrycznej.

Na Arxiv, wiele strategii wykrywania deepfake’Ãģw i innowacji jest opublikowanych co tydzień. Ostatnie podejścia opierały się na jednolitości głosu i twarzy, histogramie lokalnego wzorca binarnego (FF-LBPH), ludzkiej percepcji deepfake’Ãģw audio, analizie granic twarzy, uwzględnianiu degradacji wideo i ‘ballistyce sądowej’ – wśrÃģd wielu innych.

Analiza histogramu jest jedną z najnowszych technik oferowanych do poprawy wykrywania deepfake'Ãģw. ÅđrÃģdło: https://arxiv.org/pdf/2203.09928.pdf

Analiza histogramu jest jedną z najnowszych technik oferowanych do poprawy wykrywania deepfake’Ãģw. ÅđrÃģdło: https://arxiv.org/pdf/2203.09928.pdf

Podejście, Dane i Architektura

POI-Forensics stosuje podejście wielomodalne do weryfikacji toÅžsamości, wykorzystując miękkie cechy biometryczne oparte na wizualnych i audio sygnałach. Ramy składają się z oddzielnych sieci audio i wideo, ktÃģre ostatecznie dają charakterystyczne dane wektorowe, ktÃģre mogą być porÃģwnane z tymi samymi wyodrębnionymi cechami w potencjalnym filmie deepfake poddawanym badaniu.

Architektura POI-Forensics.

Koncepcyjna architektura POI-Forensics.

MoÅžna prowadzić analizę oddzielną (audio lub wideo) i fuzją na klipach docelowych, docierając ostatecznie do indeksu podobieństwa POI. Funkcja straty kontrastowej oparta jest na wspÃģłpracy akademickiej z 2021 roku między Google Research, Boston University, Snap Inc. i MIT.

Baza danych została podzielona na podstawie toÅžsamości. 4608 toÅžsamości zostało wykorzystanych do treningu, a 512 pozostało do walidacji. 500 toÅžsamości wykorzystanych w FakeAVCelebV2 (kandydacie do testowania, patrz poniÅžej) zostało wykluczonych w celu uzyskania niepolarizowanych wynikÃģw.

Dwie sieci zostały przeszkolone przez 12 epok przy niezwykle duÅžej wielkości partii 2304 partii na epokę, z kaÅždą partią składającą się z 8×8 segmentÃģw wideo – 8 segmentÃģw dla 8 rÃģÅžnych toÅžsamości. Optymalizator Adam został wykorzystany z rozłączonym rozkładem wag przy szybkości uczenia 10−4, i rozkładem wag 0,01.

Testowanie i Wyniki

Zestawy danych deepfake testowane w ramach projektu to zestaw danych wyzwania wykrywania DeepFake, ktÃģry zawiera face-swap w 68 podmiotach, z ktÃģrych 44 toÅžsamości zostały wybrane, ktÃģre mają więcej niÅž 9 powiązanych filmÃģw, łącznie 920 prawdziwych filmÃģw i 2925 fałszywych filmÃģw; DeepFake-TIMIT, zestaw danych oparty na GAN, zawierający 320 filmÃģw 32 podmiotÃģw, łącznie 290 prawdziwych filmÃģw i 580 fałszywych filmÃģw o długości co najmniej 4 sekund; FakeAVCelebV2, składający się z 500 prawdziwych filmÃģw z Voxceleb2, i około 20 000 fałszywych filmÃģw z rÃģÅžnych zestawÃģw danych, do ktÃģrych dodano fałszywe klony audio z SV2TTS w celu zapewnienia kompatybilności; oraz KoDF, koreański zestaw danych deepfake z 403 toÅžsamościami sfałszowanymi za pomocą FaceSwap, DeepFaceLab i FSGAN, a takÅže trzy pierwsze modele ruchu (FOMM).

Ostatni zestaw danych zawiera rÃģwnieÅž syntezę twarzy napędzaną audio ATFHP i dane wyjściowe z Wav2Lip, przy czym autorzy wykorzystali pochodny zestaw danych zawierający 276 prawdziwych filmÃģw i 544 fałszywe filmy.

Wykorzystano miary, takie jak powierzchnia pod krzywą charakterystyki odbioru (AUC), i przybliÅžone 10% “fałszywej stopy alarmu”, co byłoby problematyczne w ramach, ktÃģre obejmują i trenują fałszywe dane, ale ktÃģre nie jest problemem, poniewaÅž POI-Forensics wykorzystuje tylko prawdziwe filmy jako dane wejściowe.

Metody zostały przetestowane w porÃģwnaniu z detektorem deepfake Seferbekova, ktÃģry zajął pierwsze miejsce w wyzwaniu Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), wspÃģłpraca między Uniwersytetem Xiamen w Chinach i Microsoft Research Asia; LipForensics, wspÃģlna praca z 2021 roku między Imperial College London i Facebook; oraz ID-Reveal, poprzedni projekt kilku autorÃģw nowego artykułu, ktÃģry pomija aspekt audio i wykorzystuje 3D Morphable Models w połączeniu z grą przeciwną do wykrywania fałszywych danych wyjściowych.

Wyniki (patrz tabela powyÅžej) POI-Forensics przewyÅžszają lidera Seferbekova o 2,5% w AUC i 1,5% w zakresie dokładności. Wyniki były bardziej konkurencyjne w przypadku innych zestawÃģw danych o wysokiej jakości.

Jednak nowe podejście wykazało znaczną przewagę nad wszystkimi porÃģwnywanymi metodami odniesienia w przypadku filmÃģw o niskiej jakości, co pozostaje najbardziej prawdopodobnym scenariuszem, w ktÃģrym deepfake mogą oszukać przypadkowych widzÃģw, na podstawie “rzeczywistych” kontekstÃģw.

Autorzy twierdzą:

‘W istocie, w tym trudnym scenariuszu, tylko podejścia oparte na toÅžsamości zapewniają dobrą wydajność, poniewaÅž opierają się na wysokopoziomowych cechach semantycznych, ktÃģre są dość odporne na uszkodzenia obrazu.’

Uwzględniając, Åže POI-Forensics wykorzystuje tylko prawdziwe filmy jako materiał ÅšrÃģdłowy, osiągnięcie jest w zasadzie powiększone, i sugeruje, Åže wykorzystanie rodzimych cech biometrycznych potencjalnych ofiar deepfake jest wartą drogą do ucieczki od “wojny artefaktÃģw” między oprogramowaniem deepfake a rozwiązaniami wykrywania deepfake.

W finale testu, naukowcy dodali szum przeciwny do danych wejściowych, metodę, ktÃģra moÅže niezawodnie oszukać klasyfikatory. Stary, ale nadal skuteczny szybki znak metody gradientu okazał się szczegÃģlnie skuteczny w tym zakresie.

Strategie ataku spowodowały spadek wskaÅšnika powodzenia we wszystkich metodach i zestawach danych, przy czym AUC spadło o 10% do 38%. Jednak tylko POI-Forensics i poprzednia metoda autorÃģw ID-Reveal były w stanie utrzymać rozsądną wydajność w tym scenariuszu ataku, co sugeruje, Åže wysokopoziomowe cechy związane z miękkimi cechami biometrycznymi są nadzwyczaj odporne na unikanie wykrywania deepfake.

Autorzy kończą:

‘OgÃģlnie, uwaÅžamy, Åže nasza metoda jest pierwszym kamieniem milowym; w szczegÃģlności, uÅžycie wyÅžszych poziomÃģw cech semantycznych jest obiecującą drogą do przyszłych badań. Ponadto, analiza wielomodalna moÅže być dalej wzbogacona o uwzględnienie większej ilości informacji z innych dziedzin, takich jak dane tekstowe.’

 

Pierwotnie opublikowane 8 kwietnia 2022.

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]