Andersons vinkel

Deepfake-detektion baserad på ursprungliga mänskliga biometriska egenskaper

mm
Lägg till Unite.AI bland dina föredragna källor på Google
Images produced by deepfakers at the DeepFaceLab Discord Channel

En ny rapport från forskare i Italien och Tyskland föreslår en metod för att upptäcka deepfake-videor baserat på biometrisk ansikts- och röstbeteende, snarare än artefakter skapade av ansiktssyntesystem, dyra vattenstämpel-lösningar eller andra mer otympliga tillvägagångssätt.

Ramverket kräver en inmatning av 10 eller fler varierade, icke-falska videor av ämnet. Det kräver dock inte att det ska vara specifikt tränat, omtränat eller förstärkt på per-fall-videor, eftersom den inkorporerade modellen redan har abstraherat de troliga vektordistanserna mellan riktiga och falska videor på ett brett tillämpligt sätt.

Kontrastiv inlärning utgör grunden för POI-Forensics tillvägagångssätt. Vektorer som härrör från källmaterialet på ett per-fall-basis jämförs med samma vektorer i en potentiell falsk video, med aspekter och egenskaper som härrör från både video- och ljudkomponenter i den potentiellt förfalskade filmen. Källa: https://arxiv.org/pdf/2204.03083.pdf

Kontrastiv inlärning utgör grunden för POI-Forensics tillvägagångssätt. Vektorer som härrör från källmaterialet på ett per-fall-basis jämförs med samma vektorer i en potentiell falsk video, med aspekter och egenskaper som härrör från både video- och ljudkomponenter i den potentiellt förfalskade filmen. Källa: https://arxiv.org/pdf/2204.03083.pdf

Med titeln POI-Forensics bygger tillvägagångssättet på rörelse- och ljudsignaler som är unika för den riktiga individen som deepfakes.

Även om ett sådant system skulle kunna tillåta helt automatiserade, “för-renderade” autentiseringsramverk för kändisar, politiker, YouTube-influencers och andra personer för vilka en stor mängd videomaterial är lätt tillgängligt, kunde det också anpassas till ett ramverk där vanliga offer för deepfake-teknologier potentiellt kunde ha en plattform för att bevisa den oäkthet av attacker mot dem.

Visualiseringar av extraherade funktioner från äkta och förfalskade videor över fyra ämnen i POI-Forensics, via t-SNE-ramverket.

Visualiseringar av extraherade funktioner från äkta och förfalskade videor över fyra ämnen i POI-Forensics, via t-SNE-ramverket.

Författarna hävdar att POI-Forensics uppnår en ny state-of-the-art i deepfake-detektion. Över en mängd olika dataset i detta område rapporteras ramverket uppnå en förbättring av AUC-poäng på 3%, 10% och 7% för högkvalitativa, lågkvalitativa och “attackerade” videor, respectively. Forskarna lovar att släppa koden kort.

POI-Forensics prestanda mot rivaliserande SOTA-ramverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 och KoDF. Träning i varje fall utfördes på FaceForensics++, ID-Reveal och författarnas metod på VoxCeleb2. Resultaten inkluderar hög- och lågkvalitativa videor.

POI-Forensics prestanda mot rivaliserande SOTA-ramverk pDFDC, DeepFakeTIMIT, FakeAVCelebV2 och KoDF. Träning i varje fall utfördes på FaceForensics++ och författarnas egen ID-Reveal på VoxCeleb2. Resultaten inkluderar hög- och lågkvalitativa videor.

Författarna påstår:

‘Träning utförs uteslutande på riktiga talande-ansikts-videor, så detektorn är inte beroende av någon specifik manipuleringsmetod och ger den högsta generaliseringsförmågan. Dessutom kan vår metod upptäcka både enkel-modal (endast ljud, endast video) och multi-modal (ljud-video) attacker, och är robust mot lågkvalitativa eller skadade videor genom att bygga endast på högnivå-semantiska funktioner.’

Den nya rapporten, som inkorporerar element från några av författarnas vision-baserade ID-Reveal-projekt från 2021, har titeln Audio-Visual Person-of-Interest DeepFake Detection, och är ett samarbete mellan Universitetet i Neapel och Tekniska universitetet i München.

Deepfake-armsracet

För att besegra ett detektionssystem av detta slag skulle deepfake- och människosyntes-system kräva förmågan att åtminstone simulera visuella och audio-biometriska signaler från den avsedda måltavlan för syntesen – teknik som ligger många år bort och som sannolikt kommer att förbli inom området för dyra och proprietära slutna system som utvecklats av VFX-företag, som kommer att ha fördelen av samarbetet och deltagandet av de avsedda måltavlor (eller deras estates, i fallet med simulering av avlidna personer).

Författarnas tidigare tillvägagångssätt, ID-Reveal, koncentrerade sig uteslutande på visuell information. Källa: https://arxiv.org/pdf/2012.02512.pdf

Författarnas tidigare tillvägagångssätt, ID-Reveal, koncentrerade sig uteslutande på visuell information. Källa: https://arxiv.org/pdf/2012.02512.pdf

Lyckade och populära deepfake-metoder som FaceSwap och DeepFaceLab/Live har för närvarande noll kapacitet att skapa sådana granulära biometriska approximationer, och förlitar sig i stället på begåvade impersonatorer på vilka den förfalskade identiteten påförs, och ännu mer vanligt på lämpliga in-the-wild-footage av “liknande” personer. Inte heller gör den ursprungliga 2017-koden, som har liten moduläritet och som fortfarande är den uppströms-källan för DFL och FaceSwap, det möjligt att lägga till denna typ av funktionalitet.

De två dominerande deepfake-paketen bygger på autoencoders. Alternativa människosyntes-metoder kan använda en Generative Adversarial Network (GAN) eller Neural Radiance Field (NeRF)-tillvägagångssätt för att återskapa mänsklig identitet; men båda dessa forskningslinjer har år av arbete framför sig, även för att producera fullständigt fotorealistiska mänskliga videor.

Med undantag för ljud (förfalskade röster) är biometrisk simulering mycket långt ner på listan över utmaningar som möter mänsklig bildsyntes. I vilket fall som helst, att reproducera timbre och andra kvaliteter på den mänskliga rösten, reproducerar inte dess egenheter och “tells”, eller sättet som den riktiga ämnet använder semantisk konstruktion. Därför, även perfektionen av AI-genererad röstsimulering, löser inte den potentiella brandväggen av biometrisk autenticitet.

På Arxiv ensam släpps flera deepfake-detektionsstrategier och innovationer varje vecka. Nya tillvägagångssätt har hängt på Voice-Face Homogeneity, Local Binary Pattern Histogram (FF-LBPH), mänsklig perception av ljud-deepfakes, analys av ansiktsgränser, hänsyn till videodegradering och ‘Forensic Ballistics’ – bland många andra.

Segmenterad histogramanalys är en av de senaste teknikerna som erbjuds för att förbättra deepfake-detektion. Källa: https://arxiv.org/pdf/2203.09928.pdf

Segmenterad histogramanalys är en av de senaste teknikerna som erbjuds för att förbättra deepfake-detektion. Källa: https://arxiv.org/pdf/2203.09928.pdf

Tillvägagångssätt, data och arkitektur

POI-Forensics tar ett multi-modalt tillvägagångssätt för identitetsverifiering, som utnyttjar mjuka biometriska funktioner baserade på visuella och ljudsignaleringar. Ramverket har separata ljud- och videonätverk, som slutligen härleder karakteristiska vektordata som kan jämföras med samma extraherade funktioner i en potentiell deepfake-video som undersöks.

Arkitekturen för POI-Forensics.

Konceptuell arkitektur för POI-Forensics.

Både separata (ljud eller video) och fusionsanalys kan utföras på målklipp, och slutligen resultera i en POI-likhetsindex. Den kontrastiva förlustfunktion som används bygger på ett 2021 akademiskt samarbete mellan Google Research, Boston University, Snap Inc. och MIT.

Bas-datasetet delades upp på ett per-identitets-basis. 4608 identiteter användes för träning, med 512 kvar för validering. De 500 identiteter som användes i FakeAVCelebV2 (en testkandidat, se nedan) uteslöts för att få icke-polariserade resultat.

De två nätverken tränades i 12 epocher med en ovanligt stor batch-storlek på 2304 batcher per epoch, med varje batch bestående av 8×8-videosegment – 8 segment för 8 olika identiteter. Adam-optimisatorn användes med avkopplad viktminskning med en inlärningshastighet på 10−4, och en viktminskning på 0,01.

Testning och resultat

De deepfake-dataset som testades för projektet var förhandsvisningen av DeepFake Detection Challenge-datasetet, som innehåller ansiktsbyten över 68 ämnen, varav 44 identiteter valdes som har mer än nio relaterade videor, totalt 920 riktiga videor och 2925 falska videor; DeepFake-TIMIT, ett GAN-baserat dataset som innehåller 320 videor av 32 ämnen, totalt 290 riktiga videor och 580 falska videor med en varaktighet på minst fyra sekunder; FakeAVCelebV2, som består av 500 riktiga videor från Voxceleb2, och ungefär 20 000 falska videor från olika dataset, till vilka falska klonade ljud lades till med SV2TTS för kompatibilitet; och KoDF, ett koreanskt deepfake-dataset med 403 identiteter som förfalskats med FaceSwap, DeepFaceLab och FSGAN, samt tre First Order Motion Models (FOMM).

Det senare innehåller också ljud-styrd ansiktssyntes ATFHP, och utdata från Wav2Lip, med författarna som använder ett härlett dataset som innehåller 276 riktiga videor och 544 falska videor.

Mätvärden som användes inkluderade area under mottagarens operativa karaktäristik-kurva (AUC) och en approximerad 10% “falsk larmfrekvens”, som skulle vara problematisk i ramverk som inkorporerar och tränar på falskt data, men som bekymmer undanröjs av det faktum att POI-Forensics endast tar äkta videomaterial som indata.

Metoderna testades mot Seferbekov-deepfake-detektorn, som uppnådde första plats i Kaggle Deepfake Detection Challenge; FTCN (Fully Temporal Convolution Network), ett samarbete mellan Kinas Xiamen University och Microsoft Research Asia; LipForensics, ett gemensamt arbete 2021 mellan Imperial College London och Facebook; och ID-Reveal, ett tidigare projekt av flera av de nya rapportens forskare, som utelämnar en ljudaspekt och som använder 3D-morfbara modeller i kombination med en adversarial-spelscenario för att upptäcka falskt utdata.

I resultaten (se tidigare tabell ovan) överträffade POI-Forensics referensledaren Seferbekov med 2,5% i AUC och 1,5% i termer av noggrannhet. Prestandan var mer konkurrenskraftig över andra dataset på HQ.

Men det nya tillvägagångssättet visade en betydande ledning över alla konkurrerande referensmetoder för lågkvalitativa videor, som förblir det troligaste scenariot där deepfakes är benägna att lura ovanliga tittare, baserat på “verklighetsbaserade” sammanhang.

Författarna hävdar:

‘Verkligen, i denna utmanande scenario, är det endast identitetsbaserade tillvägagångssätt som fortfarande ger en bra prestanda, eftersom de förlitar sig på högnivå-semantiska funktioner, som är ganska robusta mot bildförstöringar.’

Med tanke på att POI-Forensics endast använder riktigt videomaterial som källmaterial, är prestationen på något sätt förstärkt, och tyder på att användningen av de ursprungliga biometriska egenskaperna hos potentiella deepfake-offer är en värdig väg framåt för att undkomma “artefakt-kalla kriget” mellan deepfake-programvara och deepfake-detektionslösningar.

I en sista test, lade forskarna till adversarial brus till inmatningen, en metod som kan tillförlitligt lura klassificerare. Den nu väletablerade snabba gradienttecknet visar sig fortfarande vara särskilt effektiv i detta avseende.

Adversarial attack-strategier minskade framgångsgraden över alla metoder och dataset, med AUC som minskade i steg mellan 10% till 38%. Men endast POI-Forensics och författarnas tidigare metod ID-Reveal kunde upprätthålla rimlig prestanda under denna attack-scenario, vilket tyder på att de högnivå-funktioner som är associerade med mjuka biometriska funktioner är ovanligt resistenta mot deepfake-detektionsundvikande.

Författarna avslutar:

‘Sammanfattningsvis tror vi att vår metod är ett första steg; i synnerhet är användningen av högnivå-semantiska funktioner en lovande framtida väg för framtida forskning. Dessutom kan den multimodala analysen berikas ytterligare genom att inkludera mer information från andra domäner, såsom textdata.’

Publicerad första gången den 8 april 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai