Andersons vinkel

Detektion af Deepfakes baseret på originale menneskelige biometriske træk

mm
Føj Unite.AI til dine foretrukne kilder på Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

En ny artikel fra forskere i Italien og Tyskland foreslår en metode til at detektere deepfake-videoer baseret på biometrisk ansigts- og stemmeadfærd, snarere end kunstige artefakter skabt af ansigtssynthesesystemer, dyre vandmærke-løsninger eller andre mere besværlige tilgange.

Ramdannelsen kræver en indtastning af 10 eller flere varierede, ikke-falske videoer af emnet. Men den kræver ikke at være specifikt trænet, gen-trænet eller udvidet med per-sag-videoer, da den inkorporerede model allerede har abstraheret de sandsynlige vektorafstande mellem rigtige og falske videoer på en bredt anvendelig måde.

Kontrastiv læring danner grundlag for POI-Forensics' tilgang. Vektorer afledt fra kildematerialet på en per-sag-basis sammenlignes med de samme vektorer i en potentiel falsk video, med aspekter og træk hentet fra både video- og audio-komponenter af den potentielt falske footage. Kilde: https://arxiv.org/pdf/2204.03083.pdf

Kontrastiv læring danner grundlag for POI-Forensics’ tilgang. Vektorer afledt fra kildematerialet på en per-sag-basis sammenlignes med de samme vektorer i en potentiel falsk video, med aspekter og træk hentet fra både video- og audio-komponenter af den potentielt falske footage. Kilde: https://arxiv.org/pdf/2204.03083.pdf

Titel POI-Forensics, tilgangenen afhænger af bevægelses- og lyd-signaler, der er unikke for den rigtige person, der deepfakes.

En sådan system kunne muligvis tillade fuldstændigt automatiserede, ‘forudindspillede’ godkendelsesrammer for kendisser, politikere, YouTube-influencere og andre personer, for hvem der er en stor mængde video-materiale til rådighed. Men det kunne også tilpasses til en ramme, hvor almindelige ofre for deepfake-teknologier potentielt kunne have en platform til at bevise uægthed af angreb mod dem.

Visualiseringer af udtrækne funktioner fra ægte og falske videoer over fire emner i POI-Forensics, via t-SNE-rammen.

Visualiseringer af udtrækne funktioner fra ægte og falske videoer over fire emner i POI-Forensics, via t-SNE-rammen.

Forfatterne hævder, at POI-Forensics opnår en ny tilstand af kunst i deepfake-detektion. Over en række almindelige datasets i dette felt opnår rammen en forbedring af 3%, 10% og 7% i AUC-scores for højkvalitets-, lavkvalitets- og ‘angrebs’-videoer, henholdsvis. Forskerne lover at udgive koden snart.

POI-Forensics' præstation over for rivaliserende SOTA-rammer pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Træning blev udført på FaceForensics++, ID-Reveal og forfatternes metode på VoxCeleb2. Resultaterne inkluderer høj- og lavkvalitetsvideoer.

POI-Forensics’ præstation over for rivaliserende SOTA-rammer pDFDC, DeepFakeTIMIT, FakeAVCelebV2 og KoDF. Træning blev udført på FaceForensics++ og forfatternes egen ID-Reveal på VoxCeleb2. Resultaterne inkluderer høj- og lavkvalitetsvideoer.

Forfatterne siger:

‘Træning udføres udelukkende på rigtige talende-ansigtsvideoer, så detektoreren afhænger ikke af nogen specifik manipulationsmetode og giver den højeste generaliseringsfærdighed. Desuden kan vores metode detektere både enkelt-modalitets- (kun-lyd, kun-video) og multi-modalitets- (lyd-video) angreb, og er robust over for lavkvalitets- eller korrupte videoer ved at bygge kun på højniveaufunktioner.’

Den nye artikel, der inkorporerer elementer fra nogle af forfatternes vision-baserede ID-Reveal-projekt fra 2021, er titlen Audio-Visuel Person-of-Interest DeepFake Detektion, og er et fælles arbejde mellem Universitetet i Federico II i Napoli og Den Tekniske Universitet i München.

Deepfake-våbenkapløbet

For at besejre et detektionssystem af denne art ville deepfake- og menneskesynthesesystemer kræve evnen til at simulere visuelle og audio-biometriske signaler fra det ønskede mål for syntesen – teknologi, der er mange år væk, og sandsynligvis vil forblive i området for dyre og proprietære lukkede systemer udviklet af VFX-virksomheder, der vil have fordelene af samarbejdet og deltagelsen af de ønskede mål (eller deres estates, i tilfælde af simulation af afdøde personer).

Forfatternes tidligere tilgang, ID-Reveal, koncentrerede sig udelukkende om visuel information. Kilde: https://arxiv.org/pdf/2012.02512.pdf

Forfatternes tidligere tilgang, ID-Reveal, koncentrerede sig udelukkende om visuel information. Kilde: https://arxiv.org/pdf/2012.02512.pdf

Vellykkede og populære deepfake-metoder som FaceSwap og DeepFaceLab/Live har i øjeblikket ingen kapacitet til at skabe sådanne granulerede biometriske approksimationer, men afhænger på bedste tid af talentfulde impersonators på hvem den falske identitet påføres, og endnu mere almindeligt på passende i-tilfælde-optagelser af ‘lignende’ personer. Ej heller gør strukturen af den centrale 2017-kode, der har lidt modulær og som stadig er den oprindelige kilde for DFL og FaceSwap, det muligt at tilføje denne type funktionalitet.

Disse to dominerende deepfake-pakker er baseret på autoencoders. Alternative menneskesynthesemetoder kan bruge en Generative Adversarial Network (GAN) eller Neural Radiance Field (NeRF)-tilgang til genskabelse af menneskelig identitet; men begge disse forskningslinjer har år af arbejde foran sig, selv for at producere fuldt fotorealistiske menneskevideo.

Med undtagelse af audio (falske stemmer), er biometrisk simulation meget langt nede på listen over udfordringer, der står over for menneskesynthesen. I alle tilfælde reproducerer genskabelse af timbre og andre kvaliteter af den menneskelige stemme ikke dens særheder og ‘tells’, eller måden, hvorpå den rigtige person bruger semantisk konstruktion på. Derfor løser selv perfektion af AI-genereret stemmesimulation ikke det potentielle brandskærm af biometrisk autenticitet.

Ved Arxiv alene udgives flere deepfake-detektionsstrategier og innovationer hver uge. Seneste tilgange har hvilet på Stemme-Ansigt-Homogenitet, Lokal Binary Pattern Histogram (FF-LBPH), menneskelig perception af audio-deepfakes, analyse af ansigtets grænser, beskæftigelse med video-degradering og ‘Forensisk Ballistik’ – blandt mange andre.

Segmenteret histogram-analyse er blandt de seneste teknikker, der tilbydes for at forbedre deepfake-detektion. Kilde: https://arxiv.org/pdf/2203.09928.pdf

Segmenteret histogram-analyse er blandt de seneste teknikker, der tilbydes for at forbedre deepfake-detektion. Kilde: https://arxiv.org/pdf/2203.09928.pdf

Tilgang, Data og Arkitektur

POI-Forensics tager en multi-modal tilgang til identitetsverificering, udnyttende bløde biometriske funktioner baseret på visuelle og audio-signaler. Rammen har separate audio- og video-netværk, der ultimativt afleder karakteristiske vektor-data, der kan sammenlignes med de samme udtrækne funktioner i en potentiel deepfake-video under undersøgelse.

Arkitekturen af POI-Forensics.

Den konceptuelle arkitektur af POI-Forensics.

Både separate (audio eller video) og fusionsanalyse kan udføres på mål-klip, ankommer til sidst til en POI-lighed-indeks. Den kontrastive tab-funktion, der anvendes, er baseret på en 2021 akademisk samarbejde mellem Google Research, Boston University, Snap Inc. og MIT.

Den grundlæggende dataset blev inddelt på en per-identitets-basis. 4608 identiteter blev brugt til træning, med 512 tilbage til validering. De 500 identiteter, der blev brugt i FakeAVCelebV2 (en testkandidat, se nedenfor), blev ekskluderet for at opnå ikke-polariserede resultater.

De to netværk blev trænet i 12 epocher med en usædvanligt stor batch-størrelse på 2304 batches per epoch, med hver batch bestående af 8×8 video-segmenter – 8 segmenter for 8 forskellige identiteter. Adam-optimizeren blev brugt med decoupled weight decay med en læringsrate på 10−4 og en vægt-forfald på 0,01.

Test og Resultater

Deepfake-datasets, der blev testet for projektet, var preview DeepFake Detection Challenge-dataset, der indeholder ansigtsskift over 68 emner, hvoraf 44 identiteter blev valgt, der har mere end ni relaterede videoer, i alt 920 rigtige videoer og 2925 falske videoer; DeepFake-TIMIT, en GAN-baseret dataset, der indeholder 320 videoer af 32 emner, i alt 290 rigtige videoer og 580 falske videoer med en varighed på mindst fire sekunder; FakeAVCelebV2, der består af 500 rigtige videoer fra Voxceleb2 og ca. 20.000 falske videoer fra forskellige datasets, til hvilke falske klonede audio blev tilføjet med SV2TTS for kompatibilitet; og KoDF, en koreansk deepfake-dataset med 403 identiteter, der blev deepfaked gennem FaceSwap, DeepFaceLab og FSGAN, samt tre First Order Motion Models (FOMM).

Denne indeholder også audio-drevet ansigtssyntese ATFHP og output fra Wav2Lip, hvor forfatterne brugte en afledt dataset, der indeholder 276 rigtige videoer og 544 falske videoer.

Metrikker, der blev brugt, inkluderede areal under modtagerens operativ karakteristika (AUC) og en approximeret 10% ‘falsk alarm-rate’, der ville være problematisk i rammer, der inkorporerer og træner på falsk data, men som bekymring er elimineret af det faktum, at POI-Forensics kun tager ægte video-optagelser som input.

Metoderne blev testet mod Seferbekov-deepfake-detektoren, der opnåede førstepladsen i Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), et samarbejde mellem Kinas Xiamen Universitet og Microsoft Research Asia; LipForensics, et fælles arbejde fra 2021 mellem Imperial College London og Facebook; og ID-Reveal, et tidligere projekt af flere af de nye artiklens forskere, der udelader en audio-aspekt og bruger 3D-morfable-modeller i kombination med en adversarial-spil-scenario til at detektere falsk output.

I resultater (se tidligere tabel ovenfor), overgik POI-Forensics reference-lederen Seferbekov med 2,5% i AUC og 1,5% i nøjagtighed. Præstationen var mere konkurrencedygtig over andre datasets på høj kvalitet.

Men den nye tilgang demonstrerede en bemærkelsesværdig føring over alle konkurrerende reference-metoder for lavkvalitetsvideoer, der forbliver den sandsynligste scenario, i hvilket deepfakes er tilbøjelige til at narre tilfældige seere, baseret på ‘virkelige verden’-kontekster.

Forfatterne påstår:

‘Sandt at sige, i denne udfordrende situation, er det kun identitets-baserede tilgange, der stadig giver en god præstation, da de afhænger af højniveaufunktioner, der er ret robuste over for billed-forringelse.’

Da POI-Forensics kun bruger ægte video som kilde-materiale, er præstationen sandsynligvis forstørret, og antyder, at brug af de native biometriske træk af potentielle deepfake-ofre er en værdig vej fremad til at undgå ‘artefakt-koldkrig’ mellem deepfake-software og deepfake-detektionsløsninger.

I en sidste test tilføjede forskerne adversarial støj til input, en metode, der kan pålideligt narre klassificatorer. Den nu værdsatte hurtig gradient-tegn-metode viser sig at være særligt effektiv i denne henseende.

Adversarial angrebs-strategier reducerede succes-raten over alle metoder og datasets, med AUC, der falder i inkrementer mellem 10% til 38%. Men kun POI-Forensics og forfatternes tidligere metode ID-Reveal var i stand til at opretholde en rimelig præstation under denne angrebs-scenario, hvilket antyder, at de højniveaufunktioner, der er forbundet med bløde biometriske funktioner, er ekstraordinært robuste over for deepfake-detektions-undgåelse.

Forfatterne konkluderer:

‘Samlet set tror vi, at vores metode er et første skridt; i særdeleshed er brugen af højere-niveaufunktioner en lovende fremtidig vej for fremtidig forskning. Desuden kunne den multimodale analyse være yderligere beriget ved at inkludere mere information fra andre domæner, såsom tekstdata.’

 

Udgivet første gang den 8. april 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]