Andersons hoek
Deepfake-detectie op basis van originele menselijke biometrische kenmerken

Een nieuw artikel van onderzoekers in Italië en Duitsland stelt een methode voor om deepfake-videos te detecteren op basis van biometrisch gezichts- en stemgedrag, in plaats van artefacten die zijn gegenereerd door gezichtssynthesesystemen, dure watermerkoplossingen of andere meer omslachtige benaderingen.
Het kader vereist een invoer van 10 of meer gevarieerde, niet-neppe videos van het onderwerp. Echter, het hoeft niet specifiek getraind, opnieuw getraind of aangevuld te worden met per-geval-videos, aangezien het geïntegreerde model al de waarschijnlijke vectorafstanden tussen echte en neppe videos in een breed toepasbare manier heeft geabstraheerd.

Contrastive learning ondersteunt de aanpak van POI-Forensics. Vectors afgeleid van bronmateriaal op een per-geval-basis worden vergeleken met dezelfde vectors in een potentieel valse video, met facetten en kenmerken afgeleid van zowel video- als audio-onderdelen van de potentieel vervalste beelden. Bron: https://arxiv.org/pdf/2204.03083.pdf
Genoemd POI-Forensics, de aanpak is gebaseerd op bewegings- en audio-signalen die uniek zijn voor het echte individu dat wordt diepgemaakt.
Hoewel een dergelijk systeem volledig geautomatiseerde, ‘pre-rendered’ authenticatiekaders kan bieden voor beroemdheden, politici, YouTube-influencers en andere mensen voor wie veel videomateriaal beschikbaar is, kan het ook worden aangepast tot een kader waarin gewone slachtoffers van deepfake-technologieën mogelijk een platform kunnen hebben om de onauthenticiteit van aanvallen tegen hen aan te tonen.

Visualisaties van geëxtraheerde kenmerken van echte en vervalste videos over vier onderwerpen in POI-Forensics, via het t-SNE-kader.
De auteurs beweren dat POI-Forensics een nieuwe standaard bereikt in deepfake-detectie. Over een verscheidenheid aan veelvoorkomende datasets in dit veld, wordt het kader gemeld om een verbetering te bereiken in AUC-scores van 3%, 10% en 7% voor hoge kwaliteit, lage kwaliteit en ‘aangevallen’ videos, respectievelijk. De onderzoekers beloven de code binnenkort vrij te geven.

POI-Forensics’ prestaties tegenover rivaliserende SOTA-kaders pDFDC, DeepFakeTIMIT, FakeAVCelebV2 en KoDF. Training in elk geval werd uitgevoerd op FaceForensics++ en de methode van de auteurs ID-Reveal op VoxCeleb2. Resultaten omvatten hoge en lage kwaliteit videos.
De auteurs verklaren:
‘Training wordt uitgevoerd op echte praat-gezichtsvideos, dus de detector is niet afhankelijk van een specifieke manipulatiemethode en levert de hoogste generalisatievermogen. Bovendien kan onze methode zowel single-modality (alleen audio, alleen video) als multi-modality (audio-video) aanvallen detecteren en is robuust tegen lage kwaliteit of beschadigde videos door alleen te bouwen op hoge-niveau semantische kenmerken.’
Het nieuwe artikel, dat elementen bevat van enkele van de auteurs’ visie-gebaseerde ID-Reveal project van 2021, heeft als titel Audio-Visuele Persoon-van-Interesse DeepFake Detectie en is een gezamenlijke inspanning tussen de Universiteit van Federico II in Napels en de Technische Universiteit van München.
De Deepfake Wapenwedloop
Om een dergelijk detectiesysteem te verslaan, zouden deepfake- en mensensynthesesystemen de mogelijkheid moeten hebben om ten minste visuele en audio biometrische signalen van het beoogde doelwit van de synthese te simuleren – technologie die vele jaren weg is en waarschijnlijk zal blijven in het domein van dure en propriëtaire gesloten systemen die zijn ontwikkeld door VFX-bedrijven, die het voordeel zullen hebben van de medewerking en deelname van de beoogde doelwitten (of hun estates, in het geval van simulatie van overleden personen).

De vorige aanpak van de auteurs, ID-Reveal, concentreerde zich geheel op visuele informatie. Bron: https://arxiv.org/pdf/2012.02512.pdf
Succesvolle en populaire deepfake-methoden zoals FaceSwap en DeepFaceLab/Live hebben momenteel geen capaciteit om dergelijke granulaire biometrische benaderingen te creëren, en vertrouwen op getalenteerde impersonators op wie de vervalste identiteit wordt opgelegd, en veel vaker op passende in-the-wild-beelden van ‘soortgelijke’ mensen. Noch maakt de structuur van de core 2017-code, die weinig modulariteit heeft en die nog steeds de upstream-bron is voor DFL en FaceSwap, het toevoegen van deze functionaliteit haalbaar.
Deze twee dominante deepfake-pakketten zijn gebaseerd op autoencoders. Alternatieve mensensynthesemethoden kunnen een Generatief Adversarial Network (GAN) of Neural Radiance Field (NeRF) benadering gebruiken om menselijke identiteit te recreëren; maar beide onderzoekslijnen hebben jaren van werk voor de boeg om zelfs maar volledig fotorealistische menselijke video te produceren.
Met uitzondering van audio (gefabriceerde stemmen), is biometrische simulatie ver weg in de lijst van uitdagingen die menselijke beeldsynthese tegenkomt. In elk geval reproduceert het perfectioneren van AI-gegenereerde stemsimulatie niet de eigenaardigheden en ‘tells’ van de menselijke stem, of de manier waarop het echte onderwerp semantische constructie gebruikt. Daarom lost zelfs het perfectioneren van AI-gegenereerde stemsimulatie het potentieel vuurwapen van biometrische authenticiteit niet op.
Alleen op Arxiv worden elk week verschillende deepfake-detectiestrategieën en innovaties vrijgegeven. Recent benaderingen hebben gehangen van Voice-Face Homogeniteit, Lokale Binaire Patroon Histogram (FF-LBPH), menselijke perceptie van audio deepfakes, analyseren van gezichtsgrenzen, rekening houden met videodegradatie, en ‘Forensische Balistiek’ – onder vele anderen.

Gehistograme-analyse is een van de nieuwste technieken die worden aangeboden om deepfake-detectie te verbeteren. Bron: https://arxiv.org/pdf/2203.09928.pdf
Aanpak, Gegevens en Architectuur
POI-Forensics neemt een multimodale aanpak voor identiteitsverificatie, waarbij gebruik wordt gemaakt van zachte biometrie op basis van visuele en audio-signalen. Het kader heeft afzonderlijke audio- en videonetwerken, die uiteindelijk karakteristieke vectorgegevens opleveren die kunnen worden vergeleken met dezelfde geëxtraheerde kenmerken in een potentieel deepfake-video die wordt onderzocht.

De conceptuele architectuur van POI-Forensics.
Beide afzonderlijke (audio of video) en fusie-analyse kunnen worden uitgevoerd op doelclips, wat uiteindelijk leidt tot een POI-overeenkomstindex. De contrastieve verliesfunctie die wordt gebruikt, is gebaseerd op een academische samenwerking tussen Google Research, Boston University, Snap Inc. (SNAP ) en MIT.
De basisdataset werd opgesplitst op een per-identiteitsbasis. 4608 identiteiten werden gebruikt voor training, met 512 over voor validatie. De 500 identiteiten die werden gebruikt in FakeAVCelebV2 (een testkandidaat, zie hieronder) werden uitgesloten om niet-gepolariseerde resultaten te verkrijgen.
De twee netwerken werden getraind voor 12 epochs met een ongebruikelijk grote batchgrootte van 2304 batches per epoch, met elk batch bestaande uit 8×8 videosegmenten – 8 segmenten voor 8 verschillende identiteiten. De Adam-optimizer werd gebruikt met gedecoupeerd gewichtsverval bij een leeraanpak van 10−4, en een gewichtsverval van 0,01.
Testen en Resultaten
De deepfake-datasets die voor het project werden getest, waren de preview DeepFake Detection Challenge dataset, die gezichtswisselingen over 68 onderwerpen bevat, waarvan 44 identiteiten werden geselecteerd die meer dan negen gerelateerde videos hebben, in totaal 920 echte videos en 2925 valse videos; DeepFake-TIMIT, een GAN-gebaseerde dataset met 320 videos van 32 onderwerpen, in totaal 290 echte videos en 580 valse videos van ten minste vier seconden duur; FakeAVCelebV2, bestaande uit 500 echte videos van Voxceleb2, en ongeveer 20.000 valse videos van verschillende datasets, waaraan valse gekloonde audio werd toegevoegd met SV2TTS voor compatibiliteit; en KoDF, een Koreaanse deepfake-dataset met 403 identiteiten die zijn vervalst met FaceSwap, DeepFaceLab en FSGAN, evenals drie First Order Motion Models (FOMM).
De laatste bevat ook audio-gestuurde gezichtssynthese ATFHP, en output van Wav2Lip, waarbij de auteurs een afgeleide dataset gebruiken met 276 echte videos en 544 valse videos.
De gebruikte metrics omvatten het gebied onder de ontvanger-operatiekarakteristieke curve (AUC), en een geschatte 10% ‘vals alarmpercentage’, wat problematisch zou zijn in kaders die neppe gegevens incorporeren en trainen, maar waarvan de zorg wordt weggenomen door het feit dat POI-Forensics alleen echte videobeelden als invoer gebruikt.
De methoden werden getest tegen de Seferbekov deepfake-detector, die de eerste plaats behaalde in de Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), een samenwerking tussen China’s Xiamen University en Microsoft (MSFT ) Research Asia; LipForensics, een gezamenlijk werk van 2021 tussen Imperial College London en Facebook; en ID-Reveal, een eerder project van enkele van de onderzoekers van het nieuwe artikel, dat een audio-aspect weglaat en 3D Morphable Models in combinatie met een adversariaal spelscenario gebruikt om neppe output te detecteren.
In resultaten (zie eerder tabel hierboven), overtrof POI-Forensics de referentieleider Seferbekov met 2,5% in AUC, en 1,5% in termen van nauwkeurigheid. De prestaties waren concurrerender over andere datasets op HQ.
Echter, de nieuwe aanpak toonde een opvallende voorsprong over alle concurrerende referentiemethoden voor lage kwaliteit videos, die nog steeds de waarschijnlijkste scenario zijn waarin deepfakes geneigd zijn om onoplettende kijkers te misleiden, op basis van ‘real-world’ contexten.
De auteurs beweren:
‘In feite, in dit uitdagende scenario, bieden alleen identiteit-gebaseerde benaderingen nog steeds een goede prestatie, omdat ze afhankelijk zijn van hoge-niveau semantische kenmerken, die robuust zijn tegen beeldvervuiling.’
Aangezien POI-Forensics alleen echte video als bronmateriaal gebruikt, is de prestatie mogelijk nog groter, en suggereert dat het gebruik van de native biometrische kenmerken van potentiële deepfake-slachtoffers een waardevolle weg vooruit is om de ‘artefact-cold war’ tussen deepfake-software en deepfake-detectieoplossingen te ontvluchten.
In een laatste test, voegden de onderzoekers adversarial ruis toe aan de invoer, een methode die classificatoren betrouwbaar kan misleiden. De inmiddels verouderde fast gradient sign methode blijkt nog steeds bijzonder effectief in dit opzicht.
Adversarial aanvalstrategieën lieten de succesrate over alle methoden en datasets dalen, met AUC dalend in stappen van 10% tot 38%. Echter, alleen POI-Forensics en de eerdere methode van de auteurs, ID-Reveal, konden redelijke prestaties behouden onder deze aanvalsscenario, wat suggereert dat de hoge-niveau kenmerken geassocieerd met zachte biometrie buitengewoon resistent zijn tegen deepfake-detectie-ontwijking.
De auteurs concluderen:
‘Over het algemeen geloven we dat onze methode een eerste stap is; in het bijzonder, het gebruik van hogere-niveau semantische kenmerken is een veelbelovende toekomstige richting voor toekomstig onderzoek. Bovendien kan de multimodale analyse verder worden verrijkt door meer informatie op te nemen uit andere domeinen, zoals tekstuele gegevens.’
Eerst gepubliceerd op 8 april 2022.












