Andersonův úhel

Detekce Deepfake na základě původních lidských biometrických rysů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

Nová studie italských a německých výzkumníků navrhuje metodu pro detekci deepfake videí na základě biometrického chování obličeje a hlasu, spíše než na základě artefaktů vytvořených systémy face synthesis, drahých řešení watermarkingu nebo jiných více zásadních přístupů.

Rámec vyžaduje vstup 10 nebo více různých, nefalšovaných videí subjektu. Nicméně, nevyžaduje speciální trénink, re-trénink nebo rozšíření na případové videí, protože jeho začleněný model již abstrahoval pravděpodobné vektorové vzdálenosti mezi skutečnými a falešnými videi obecným způsobem.

Kontrastivní učení je základem přístupu POI-Forensics. Vektory odvozené ze zdrojového materiálu na případové bázi jsou porovnány se stejnými vektory v potenciálním falešném videu, s aspekty a rysy odvozenými z obou video a audio komponent potentially falešného videa. Source: https://arxiv.org/pdf/2204.03083.pdf

Kontrastivní učení je základem přístupu POI-Forensics. Vektory odvozené ze zdrojového materiálu na případové bázi jsou porovnány se stejnými vektory v potenciálním falešném videu, s aspekty a rysy odvozenými z obou video a audio komponent potentially falešného videa. Source: https://arxiv.org/pdf/2204.03083.pdf

Název POI-Forensics, přístup spoléhá na pohyb a audio signály jedinečné pro skutečnou osobu, která je deepfakována.

Although takový systém by mohl umožnit zcela automatizované, ‘pre-rendered’ ověřovací rámce pro celebrity, politiky, YouTube influencery a další lidi, pro které je k dispozici velké množství video materiálu, mohl by být také adaptován do rámce, kde obvyklí oběti deepfake technologií by mohli potenciálně mít platformu pro prokázání neautentičnosti útoků proti nim.

Visualizace extrahovaných rysů z skutečných a falešných videí přes čtyři subjekty v POI-Forensics, prostřednictvím rámce t-SNE.

Visualizace extrahovaných rysů z skutečných a falešných videí přes čtyři subjekty v POI-Forensics, prostřednictvím rámce t-SNE.

Autorům se podařilo dosáhnout nového stavu umění v detekci deepfake. Napříč různými běžnými datovými soubory v tomto oboru, rámec dosáhl zlepšení AUC skóre o 3%, 10% a 7% pro vysoké kvality, nízké kvality a “útoky” videí, resp. Výzkumníci slibují, že brzy uvolní kód.

Výkon POI-Forensics proti rivalům SOTA rámcům pDFDC, DeepFakeTIMIT, FakeAVCelebV2 a KoDF. Trénink v každém případě byl proveden na FaceForensics++, ID-Reveal a autorů metodě na VoxCeleb2. Výsledky zahrnují vysoké a nízké kvality videa.

Výkon POI-Forensics proti rivalům SOTA rámcům pDFDC, DeepFakeTIMIT, FakeAVCelebV2 a KoDF. Trénink v každém případě byl proveden na FaceForensics++ a autorů vlastní ID-Reveal na VoxCeleb2. Výsledky zahrnují vysoké a nízké kvality videa.

Autorům se podařilo dosáhnout nového stavu umění v detekci deepfake.

Výroba deepfake zbraní

Aby porazil detekční systém této povahy, deepfake a human synthesis systémy by vyžadovaly schopnost alespoň simulovat vizuální a audio biometrické signály z cílové syntézy – technologie, která je mnoho let pryč, a pravděpodobně zůstane v oblasti drahých a proprietárních uzavřených systémů vyvinutých společnostmi VFX, které budou mít výhodu spolupráce a účasti cílových subjektů (nebo jejich dědiců, v případě simulace zesnulých osob).

Předchozí přístup autorů, ID-Reveal, se soustředil entirely na vizuální informace. Source: https://arxiv.org/pdf/2012.02512.pdf

Předchozí přístup autorů, ID-Reveal, se soustředil entirely na vizuální informace. Source: https://arxiv.org/pdf/2012.02512.pdf

Úspěšné a populární deepfake metody, jako FaceSwap a DeepFaceLab/Live目前 nemají žádnou kapacitu pro vytvoření takových granulárních biometrických aproximací, spoléhají na nejlepších talentovaných impersonátory na nichž je falešná identita uvalena, a mnohem častěji na vhodné in-the-wild záběry “podobných” lidí. Ani struktura jádrového kódu z roku 2017, který má málo modularity a který zůstává upstream zdrojem pro DFL a FaceSwap, nedovoluje přidání této funkcionality.

Tyto dvě dominantní deepfake balíčky jsou založeny na autoencoderech. Alternativní human synthesis metody mohou použít Generative Adversarial Network (GAN) nebo Neural Radiance Field (NeRF) přístup k rekreaci lidské identity; ale obě tyto linie výzkumu mají roky práce před sebou, aby produkovaly plně fotorealistické lidské video.

S výjimkou audio (falešných hlasů), biometrická simulace je velmi daleko dolů na seznamu výzev, kterým čelí human image synthesis. V každém případě, reprodukce tónu a jiných kvalit lidského hlasu nezahrnuje jeho excentricity a “tells”, nebo způsob, jakým skutečný subjekt používá sémantickou konstrukci. Proto i dokončení AI-generované hlasové simulace nevyřeší potenciální firewall biometrické autenticity.

Na Arxiv alone, několik deepfake detekčních strategií a inovací je vydáno každý týden. Nedávné přístupy se opírají o Voice-Face Homogeneity, Local Binary Pattern Histogram (FF-LBPH), lidské vnímání audio deepfakes, analýzu obličejových hran, zohlednění video degradace, a ‘Forensic Ballistics’ – mezi mnoha jinými.

Segmented histogram analýza je mezi nejnovějšími technikami nabízenými ke zlepšení detekce deepfake. Source: https://arxiv.org/pdf/2203.09928.pdf

Segmented histogram analýza je mezi nejnovějšími technikami nabízenými ke zlepšení detekce deepfake. Source: https://arxiv.org/pdf/2203.09928.pdf

Přístup, data a architektura

POI-Forensics používá multi-modální přístup k ověření identity, využívající soft biometrické rysy založené na vizuálních a audio signálech. Rámec obsahuje samostatné audio a video sítě, které nakonec odvozují charakteristické vektorové údaje, které lze porovnat se stejnými extrahovanými rysy v potenciálním deepfake videu pod studiem.

Architektura POI-Forensics.

Konceptuální architektura POI-Forensics.

Obě samostatné (audio nebo video) a fúzní analýzy lze provést na cílových klipech, nakonec dosahující POI podobnosti indexu. Kontrastivní ztrátová funkce použita je založena na akademické spolupráci z roku 2021 mezi Google Research, Boston University, Snap Inc. (SNAP ) a MIT.

Základní datový soubor byl rozdělen na případové bázi. 4608 identit bylo použito pro trénink, s 512 zbývajícími pro validaci. 500 identit použitých ve FakeAVCelebV2 (testovacím kandidátem, viz níže) bylo vyloučeno, aby se získaly nepolarizované výsledky.

Obě sítě byly trénovány po dobu 12 epoch s neobvykle velkým batch-size 2304 batchů na epochu, s každým batchem složeným z 8×8 video segmentů – 8 segmentů pro 8 různých identit. Optimizátor Adam byl použit s decoupled weight decay na learning rate 10−4, a weight decay 0,01.

Testování a výsledky

Deepfake datové soubory testované pro projekt byly preview DeepFake Detection Challenge dataset, který obsahuje face-swapy přes 68 subjektů, z nichž 44 identit bylo vybráno, které mají více než devět souvisejících videí, celkem 920 skutečných videí a 2925 falešných videí; DeepFake-TIMIT, GAN-založený datový soubor obsahující 320 videí 32 subjektů, celkem 290 skutečných videí a 580 falešných videí o délce alespoň čtyř sekund; FakeAVCelebV2, který zahrnuje 500 skutečných videí z Voxceleb2, a přibližně 20 000 falešných videí z různých datových souborů, na které byly přidány falešné klony audio pomocí SV2TTS pro kompatibilitu; a KoDF, korejský deepfake datový soubor s 403 identitami falešnými pomocí FaceSwap, DeepFaceLab a FSGAN, jakož i tři First Order Motion Models (FOMM).

Poslední také obsahuje audio-driven face synthesis ATFHP, a výstup z Wav2Lip, s autory, kteří použili odvozený datový soubor obsahující 276 skutečných videí a 544 falešných videí.

Metriky použité zahrnovaly oblast pod přijímací operativní charakteristikou (AUC), a aproximovaný 10% “falešný poplachový poměr”, který by byl problematický ve rámcích, které zahrnují a trénují na falešná data, ale který je zmírněn skutečností, že POI-Forensics bere v úvahu pouze skutečné video snímky jako vstup.

Metody byly testovány proti Seferbekov deepfake detektoru, který dosáhl první místo v Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), spolupráci mezi Čínou Xiamen University a Microsoft (MSFT ) Research Asia; LipForensics, společnou práci z roku 2021 mezi Imperial College London a Facebook; a ID-Reveal, předchozí projekt několika z autorů nové studie, který vynechává audio aspekt, a který používá 3D Morphable Models v kombinaci s adversarial hrou pro detekci falešného výstupu.

Výsledky (viz výše uvedená tabulka) ukazují, že POI-Forensics překonal referenční leader Seferbekov o 2,5% v AUC, a 1,5% z hlediska přesnosti. Výkon byl více konkurenceschopný na ostatních datech na HQ.

Ale nový přístup prokázal pozoruhodný náskok nad všemi ostatními referenčními metodami pro nízkokvalitní videa, která zůstávají nejpravděpodobnějším scénářem, ve kterém jsou deepfakes náchylné k oklamání náhodných diváků, založených na “reálném světě” kontextech.

Autorům se podařilo dosáhnout nového stavu umění v detekci deepfake.

‘Skutečně, v tomto náročném scénáři, pouze identity-založené přístupy poskytují dobré výkony, protože spoléhají na vysoké úrovni sémantické rysy, které jsou poměrně robustní vůči obrazovým poškozením.’

Zohledňující, že POI-Forensics používá pouze skutečné video jako vstupní materiál, je dosažení zřejmě větší, a naznačuje, že použití rodilých biometrických rysů potenciálních deepfake obětí je cennou cestou vpřed k uniknutí z “artefakt studené války” mezi deepfake softwarem a deepfake detekčními řešeními.

Ve finálním testu, výzkumníci přidali adversativní šum do vstupu, metodu, která může spolehlivě oklamat klasifikátory. Nyní starý fast gradient sign method se stále ukázal být zvláště efektivní v tomto ohledu.

Předpokladem, že adversativní útoky sníží úspěšnost napříč všemi metodami a datovými soubory, s AUC klesajícím v rozmezí 10% až 38%. Nicméně, pouze POI-Forensics a autorů předchozí metoda ID-Reveal byly schopny udržet rozumný výkon v tomto scénáři útoku, naznačující, že vysoké úrovni rysy spojené s měkkými biometrickými rysy jsou mimořádně odolné vůči deepfake detekčnímu úniku.

Autorům se podařilo dosáhnout nového stavu umění v detekci deepfake.

‘Celkově, věříme, že naše metoda je prvním krokem; zejména, použití vyšších úrovní sémantických rysů je slibnou budoucí cestou pro budoucí výzkum. Kromě toho, multimodální analýza by mohla být dále obohacena zahrnutím více informací z jiných domén, jako je textová data.’

Poprvé publikováno 8. dubna 2022.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai