KÄ t Andersona
Wykrywanie Deepfake’Ãģw na podstawie oryginalnych cech biometrycznych czÅowieka

Nowy artykuÅ naukowy z WÅoch i Niemiec proponuje metodÄ wykrywania filmÃģw deepfakeâowych na podstawie zachowania biometrycznego twarzy i gÅosu, a nie artefaktÃģw stworzonych przez systemy syntezy twarzy, drogie rozwiÄ zania watermarkingowe lub inne bardziej nieporÄczne podejÅcia.
Rama wymaga wejÅcia co najmniej 10 rÃģÅžnych, niefaÅszywych filmÃģw z danego podmiotu. Nie wymaga jednak specjalnego szkolenia, przeszkolenia ani uzupeÅnienia w przypadku filmÃģw, poniewaÅž jego wbudowany model juÅž w sposÃģb ogÃģlny z Ð°ÐąstrahowaÅ prawdopodobne odlegÅoÅci wektorowe miÄdzy filmami prawdziwymi a faÅszywymi.

Kontrastowe uczenie jest podstawÄ podejÅcia POI-Forensics. Wektory pochodzÄ ce z materiaÅu ÅšrÃģdÅowego w przypadku kaÅždego podmiotu sÄ porÃģwnywane z tymi samymi wektorami w potencjalnym faÅszywym filmie, z cechami i atrybutami pobranymi z obu skÅadnikÃģw wideo i audio potencjalnie sfaÅszowanego filmu. ÅđrÃģdÅo: https://arxiv.org/pdf/2204.03083.pdf
TytuÅ POI-Forensics, podejÅcie opiera siÄ na ruchu i sygnaÅach audio unikalnych dla prawdziwej osoby, ktÃģrej deepfake dotyczy.
ChociaÅž taki system mÃģgÅby umoÅžliwiÄ caÅkowicie zautomatyzowane, âwstÄpnie wyrenderowaneâ ramy uwierzytelniania dla celebrytÃģw, politykÃģw, influencerÃģw YouTube i innych osÃģb, dla ktÃģrych dostÄpny jest duÅžy materiaÅ wideo, mÃģgÅby rÃģwnieÅž zostaÄ dostosowany do ramy, w ktÃģrej zwykÅe ofiary technologii deepfake mogÅyby potencjalnie mieÄ platformÄ do udowodnienia nieautentycznoÅci atakÃģw na nie.

Wizualizacje wyodrÄbnionych cech z prawdziwych i sfaÅszowanych filmÃģw w czterech podmiotach w POI-Forensics, za pomocÄ ramy t-SNE.
Autorzy twierdzÄ , Åže POI-Forensics osiÄ ga nowy stan sztuki w wykrywaniu deepfakeâÃģw. Przez rÃģÅžne powszechnie stosowane zestawy danych w tej dziedzinie, ramy osiÄ gajÄ poprawÄ wynikÃģw o 3%, 10% i 7% dla filmÃģw o wysokiej jakoÅci, niskiej jakoÅci i âzaatakowanychâ filmÃģw, odpowiednio. Naukowcy obiecujÄ , Åže wkrÃģtce opublikujÄ kod.

Wyniki POI-Forensics w porÃģwnaniu z rywalizujÄ cymi ramami pDFDC, DeepFakeTIMIT, FakeAVCelebV2 i KoDF. Trening w kaÅždym przypadku zostaÅ przeprowadzony na FaceForensics++ i wÅasnej ID-Reveal autorÃģw na VoxCeleb2. Wyniki obejmujÄ filmy o wysokiej i niskiej jakoÅci.
Autorski zespÃģÅ stwierdza:
âTrening jest prowadzony wyÅÄ cznie na prawdziwych filmach z talking-face, wiÄc detektor nie zaleÅžy od konkretnych metod manipulacji i daje najwyÅžszÄ ogÃģlnÄ zdolnoÅÄ generalizacji. Ponadto, nasza metoda moÅže wykrywaÄ ataki jednej modalnoÅci (tylko audio, tylko wideo) i wielomodalnoÅci (audio-wideo), i jest odporna na filmy o niskiej jakoÅci lub uszkodzone, budujÄ c tylko na wysokopoziomowych cechach semantycznych.â
Nowy artykuÅ, ktÃģry zawiera elementy niektÃģrych projektÃģw autorÃģw z 2021 roku ID-Reveal, nosi tytuÅ Wykrywanie DeepfakeâÃģw Audio-Visual Person-of-Interest i jest wspÃģlnym przedsiÄwziÄciem Uniwersytetu Federico II w Neapolu i Technische UniversitÃĪt MÞnchen.
WyÅcig zbrojeÅ DeepfakeâÃģw
Aby pokonaÄ system wykrywania takiego rodzaju, systemy deepfake i syntezy ludzkiej wymagaÅyby moÅžliwoÅci symulowania wizualnych i audio biometrycznych sygnaÅÃģw od celu syntezy â technologii, ktÃģra jest jeszcze kilka lat przed nami i prawdopodobnie pozostanie w dziedzinie drogich i zamkniÄtych systemÃģw opracowanych przez firmy VFX, ktÃģre bÄdÄ miaÅy przewagÄ dziÄki wspÃģÅpracy i udziaÅowi celu (lub ich spadkobiercÃģw w przypadku symulacji zmarÅych ludzi).

Poprzednie podejÅcie autorÃģw, ID-Reveal, koncentrowaÅo siÄ wyÅÄ cznie na informacjach wizualnych. ÅđrÃģdÅo: https://arxiv.org/pdf/2012.02512.pdf
Udane i popularne metody deepfake, takie jak FaceSwap i DeepFaceLab/Live, obecnie nie majÄ moÅžliwoÅci tworzenia tak szczegÃģÅowych przybliÅžeÅ biometrycznych, opierajÄ c siÄ na utalentowanych impersonatorach na ktÃģrych jest nakÅadany sfaÅszowany toÅžsamoÅÄ, i znacznie czÄÅciej na odpowiednich filmach z âpodobnychâ ludzi. Nie ma rÃģwnieÅž moÅžliwoÅci dodania takiej funkcjonalnoÅci ze wzglÄdu na strukturÄ rdzenia kodu z 2017 roku, ktÃģry ma niewielkÄ modularyzacjÄ i pozostaje ÅšrÃģdÅem dla DFL i FaceSwap.
Te dwa dominujÄ ce pakiety deepfake sÄ oparte na autoencoderach. Alternatywne metody syntezy ludzkiej mogÄ wykorzystywaÄ podejÅcie Generative Adversarial Network (GAN) lub Neural Radiance Field (NeRF) do odtwarzania toÅžsamoÅci ludzkiej; ale obie te linie badaÅ majÄ przed sobÄ lata pracy, aby wyprodukowaÄ w peÅni fotorealistyczne filmy ludzkie.
WyjÄ tkiem jest audio (sfaÅszowane gÅosy), symulacja biometryczna jest bardzo daleko na liÅcie wyzwaÅ stojÄ cych przed syntezÄ obrazu ludzkiego. W kaÅždym razie, odtwarzanie barwy i innych cech gÅosu ludzkiego nie odtwarza jego cech i âsygnaÅÃģwâ, lub sposobu, w jaki prawdziwy podmiot uÅžywa konstrukcji semantycznej. Dlatego nawet doskonaÅa symulacja gÅosu generowana przez AI nie rozwiÄ zuje potencjalnego problemu autentycznoÅci biometrycznej.
Na Arxiv, wiele strategii wykrywania deepfakeâÃģw i innowacji jest opublikowanych co tydzieÅ. Ostatnie podejÅcia opieraÅy siÄ na jednolitoÅci gÅosu i twarzy, histogramie lokalnego wzorca binarnego (FF-LBPH), ludzkiej percepcji deepfakeâÃģw audio, analizie granic twarzy, uwzglÄdnianiu degradacji wideo i âballistyce sÄ dowejâ â wÅrÃģd wielu innych.

Analiza histogramu jest jednÄ z najnowszych technik oferowanych do poprawy wykrywania deepfakeâÃģw. ÅđrÃģdÅo: https://arxiv.org/pdf/2203.09928.pdf
PodejÅcie, Dane i Architektura
POI-Forensics stosuje podejÅcie wielomodalne do weryfikacji toÅžsamoÅci, wykorzystujÄ c miÄkkie cechy biometryczne oparte na wizualnych i audio sygnaÅach. Ramy skÅadajÄ siÄ z oddzielnych sieci audio i wideo, ktÃģre ostatecznie dajÄ charakterystyczne dane wektorowe, ktÃģre mogÄ byÄ porÃģwnane z tymi samymi wyodrÄbnionymi cechami w potencjalnym filmie deepfake poddawanym badaniu.

Koncepcyjna architektura POI-Forensics.
MoÅžna prowadziÄ analizÄ oddzielnÄ (audio lub wideo) i fuzjÄ na klipach docelowych, docierajÄ c ostatecznie do indeksu podobieÅstwa POI. Funkcja straty kontrastowej oparta jest na wspÃģÅpracy akademickiej z 2021 roku miÄdzy Google Research, Boston University, Snap Inc. i MIT.
Baza danych zostaÅa podzielona na podstawie toÅžsamoÅci. 4608 toÅžsamoÅci zostaÅo wykorzystanych do treningu, a 512 pozostaÅo do walidacji. 500 toÅžsamoÅci wykorzystanych w FakeAVCelebV2 (kandydacie do testowania, patrz poniÅžej) zostaÅo wykluczonych w celu uzyskania niepolarizowanych wynikÃģw.
Dwie sieci zostaÅy przeszkolone przez 12 epok przy niezwykle duÅžej wielkoÅci partii 2304 partii na epokÄ, z kaÅždÄ partiÄ skÅadajÄ cÄ siÄ z 8Ã8 segmentÃģw wideo â 8 segmentÃģw dla 8 rÃģÅžnych toÅžsamoÅci. Optymalizator Adam zostaÅ wykorzystany z rozÅÄ czonym rozkÅadem wag przy szybkoÅci uczenia 10â4, i rozkÅadem wag 0,01.
Testowanie i Wyniki
Zestawy danych deepfake testowane w ramach projektu to zestaw danych wyzwania wykrywania DeepFake, ktÃģry zawiera face-swap w 68 podmiotach, z ktÃģrych 44 toÅžsamoÅci zostaÅy wybrane, ktÃģre majÄ wiÄcej niÅž 9 powiÄ zanych filmÃģw, ÅÄ cznie 920 prawdziwych filmÃģw i 2925 faÅszywych filmÃģw; DeepFake-TIMIT, zestaw danych oparty na GAN, zawierajÄ cy 320 filmÃģw 32 podmiotÃģw, ÅÄ cznie 290 prawdziwych filmÃģw i 580 faÅszywych filmÃģw o dÅugoÅci co najmniej 4 sekund; FakeAVCelebV2, skÅadajÄ cy siÄ z 500 prawdziwych filmÃģw z Voxceleb2, i okoÅo 20 000 faÅszywych filmÃģw z rÃģÅžnych zestawÃģw danych, do ktÃģrych dodano faÅszywe klony audio z SV2TTS w celu zapewnienia kompatybilnoÅci; oraz KoDF, koreaÅski zestaw danych deepfake z 403 toÅžsamoÅciami sfaÅszowanymi za pomocÄ FaceSwap, DeepFaceLab i FSGAN, a takÅže trzy pierwsze modele ruchu (FOMM).
Ostatni zestaw danych zawiera rÃģwnieÅž syntezÄ twarzy napÄdzanÄ audio ATFHP i dane wyjÅciowe z Wav2Lip, przy czym autorzy wykorzystali pochodny zestaw danych zawierajÄ cy 276 prawdziwych filmÃģw i 544 faÅszywe filmy.
Wykorzystano miary, takie jak powierzchnia pod krzywÄ charakterystyki odbioru (AUC), i przybliÅžone 10% âfaÅszywej stopy alarmuâ, co byÅoby problematyczne w ramach, ktÃģre obejmujÄ i trenujÄ faÅszywe dane, ale ktÃģre nie jest problemem, poniewaÅž POI-Forensics wykorzystuje tylko prawdziwe filmy jako dane wejÅciowe.
Metody zostaÅy przetestowane w porÃģwnaniu z detektorem deepfake Seferbekova, ktÃģry zajÄ Å pierwsze miejsce w wyzwaniu Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), wspÃģÅpraca miÄdzy Uniwersytetem Xiamen w Chinach i Microsoft Research Asia; LipForensics, wspÃģlna praca z 2021 roku miÄdzy Imperial College London i Facebook; oraz ID-Reveal, poprzedni projekt kilku autorÃģw nowego artykuÅu, ktÃģry pomija aspekt audio i wykorzystuje 3D Morphable Models w poÅÄ czeniu z grÄ przeciwnÄ do wykrywania faÅszywych danych wyjÅciowych.
Wyniki (patrz tabela powyÅžej) POI-Forensics przewyÅžszajÄ lidera Seferbekova o 2,5% w AUC i 1,5% w zakresie dokÅadnoÅci. Wyniki byÅy bardziej konkurencyjne w przypadku innych zestawÃģw danych o wysokiej jakoÅci.
Jednak nowe podejÅcie wykazaÅo znacznÄ przewagÄ nad wszystkimi porÃģwnywanymi metodami odniesienia w przypadku filmÃģw o niskiej jakoÅci, co pozostaje najbardziej prawdopodobnym scenariuszem, w ktÃģrym deepfake mogÄ oszukaÄ przypadkowych widzÃģw, na podstawie ârzeczywistychâ kontekstÃģw.
Autorzy twierdzÄ :
âW istocie, w tym trudnym scenariuszu, tylko podejÅcia oparte na toÅžsamoÅci zapewniajÄ dobrÄ wydajnoÅÄ, poniewaÅž opierajÄ siÄ na wysokopoziomowych cechach semantycznych, ktÃģre sÄ doÅÄ odporne na uszkodzenia obrazu.â
UwzglÄdniajÄ c, Åže POI-Forensics wykorzystuje tylko prawdziwe filmy jako materiaÅ ÅšrÃģdÅowy, osiÄ gniÄcie jest w zasadzie powiÄkszone, i sugeruje, Åže wykorzystanie rodzimych cech biometrycznych potencjalnych ofiar deepfake jest wartÄ drogÄ do ucieczki od âwojny artefaktÃģwâ miÄdzy oprogramowaniem deepfake a rozwiÄ zaniami wykrywania deepfake.
W finale testu, naukowcy dodali szum przeciwny do danych wejÅciowych, metodÄ, ktÃģra moÅže niezawodnie oszukaÄ klasyfikatory. Stary, ale nadal skuteczny szybki znak metody gradientu okazaÅ siÄ szczegÃģlnie skuteczny w tym zakresie.
Strategie ataku spowodowaÅy spadek wskaÅšnika powodzenia we wszystkich metodach i zestawach danych, przy czym AUC spadÅo o 10% do 38%. Jednak tylko POI-Forensics i poprzednia metoda autorÃģw ID-Reveal byÅy w stanie utrzymaÄ rozsÄ dnÄ wydajnoÅÄ w tym scenariuszu ataku, co sugeruje, Åže wysokopoziomowe cechy zwiÄ zane z miÄkkimi cechami biometrycznymi sÄ nadzwyczaj odporne na unikanie wykrywania deepfake.
Autorzy koÅczÄ :
âOgÃģlnie, uwaÅžamy, Åže nasza metoda jest pierwszym kamieniem milowym; w szczegÃģlnoÅci, uÅžycie wyÅžszych poziomÃģw cech semantycznych jest obiecujÄ cÄ drogÄ do przyszÅych badaÅ. Ponadto, analiza wielomodalna moÅže byÄ dalej wzbogacona o uwzglÄdnienie wiÄkszej iloÅci informacji z innych dziedzin, takich jak dane tekstowe.â
Â
Pierwotnie opublikowane 8 kwietnia 2022.












