Andersons hoek

Een Nieuwe en Simpelere Deepfake-Methode die Beter Presteert dan Eerdere Benaderingen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een samenwerking tussen een Chinees AI-onderzoekscentrum en Amerikaanse onderzoekers heeft mogelijk de eerste echte innovatie in deepfake-technologie sinds het fenomeen vier jaar geleden ontstond, ontwikkeld.

De nieuwe methode kan faceswaps uitvoeren die alle bestaande kaders op standaard perceptuele tests overtreffen, zonder dat er grote toegewijde datasets nodig zijn die uitgebreid moeten worden verzameld en gecurateerd, en getraind moeten worden voor maximaal een week voor slechts één identiteit. Voor de voorbeelden die in het nieuwe artikel worden gepresenteerd, werden modellen getraind op de gehele twee populaire celebrity-datasets, op één NVIDIA Tesla P40 GPU gedurende ongeveer drie dagen.

Volledige video is ingesloten aan het einde van dit artikel. In dit voorbeeld uit een video in aanvullende materialen voor het nieuwe artikel, wordt het gezicht van Scarlett Johansson overgebracht op de bronvideo. CihaNet verwijdert het probleem van edge-masking bij het uitvoeren van een swap, door diepere relaties te vormen en uit te voeren tussen de bron- en doelidentiteiten, wat betekent dat er een einde komt aan 'obvious borders' en andere superimpositieglitches die optreden in traditionele deepfake-benaderingen. Bron: https://mitchellx.github.io/#video

Volledige video beschikbaar aan het einde van dit artikel. In dit voorbeeld uit een video in aanvullende materialen die zijn verstrekt door een van de auteurs van het nieuwe artikel, wordt het gezicht van Scarlett Johansson overgebracht op de bronvideo. CihaNet verwijdert het probleem van edge-masking bij het uitvoeren van een swap, door diepere relaties te vormen en uit te voeren tussen de bron- en doelidentiteiten, wat betekent dat er een einde komt aan ‘obvious borders’ en andere superimpositieglitches die optreden in traditionele deepfake-benaderingen. Bron: Bron: https://mitchellx.github.io/#video

De nieuwe benadering verwijdert de noodzaak om de getransplanteerde identiteit grof in de doelvideo te plakken, wat vaak leidt tot verklapbare artefacten die verschijnen waar het valse gezicht eindigt en het echte, onderliggende gezicht begint. In plaats daarvan worden ‘hallucination maps’ gebruikt om een diepere vermenging van visuele facetten uit te voeren, omdat het systeem identiteit van context veel effectiever scheidt dan huidige methoden, en dus de doelidentiteit op een dieper niveau kan mengen.

Uit het artikel. CihaNet-transformaties worden gefaciliteerd door hallucination maps (onderste rij). Het systeem gebruikt contextinformatie (d.w.z. gezichtsrichting, haar, bril en andere obstakels, enz.) geheel uit het beeld waarin de nieuwe identiteit zal worden overgebracht, en gezichtsidentiteitsinformatie geheel uit de persoon die in het beeld zal worden ingevoegd. Deze mogelijkheid om gezicht van context te scheiden is cruciaal voor het succes van het systeem. Bron: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Uit het artikel. CihaNet-transformaties worden gefaciliteerd door hallucination maps (onderste rij). Het systeem gebruikt contextinformatie (d.w.z. gezichtsrichting, haar, bril en andere obstakels, enz.) geheel uit het beeld waarin de nieuwe identiteit zal worden overgebracht, en gezichtsidentiteitsinformatie geheel uit de persoon die in het beeld zal worden ingevoegd. Deze mogelijkheid om gezicht van context te scheiden is cruciaal voor het succes van het systeem. Bron: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Effectief biedt de nieuwe hallucination map een meer complete context voor de swap, in tegenstelling tot de harde masks die vaak uitgebreide curatie (en in het geval van DeepFaceLab, separate training) vereisen, terwijl ze beperkte flexibiliteit bieden in termen van echte incorporatie van de twee identiteiten.

Uit voorbeelden die zijn verstrekt in de aanvullende materialen, met behulp van zowel de FFHQ- als de Celeb-A HQ-datasets, over VGGFace en Forensics++. De eerste twee kolommen tonen de willekeurig geselecteerde (echte) beelden die moeten worden omgewisseld. De volgende vier kolommen tonen de resultaten van de swap met behulp van de vier meest effectieve methoden die momenteel beschikbaar zijn, terwijl de laatste kolom het resultaat van CihaNet toont. Het FaceSwap-repository is gebruikt, in plaats van het meer populaire DeepFaceLab, aangezien beide projecten forks zijn van de originele 2017 Deepfakes-code op GitHub. Hoewel elk project sindsdien modellen, technieken, diverse UI’s en aanvullende tools heeft toegevoegd, is de onderliggende code die deepfakes mogelijk maakt nooit veranderd en blijft deze gemeenschappelijk voor beide. Bron: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Het artikel, getiteld One-stage Context and Identity Hallucination Network, is geschreven door onderzoekers die zijn aangesloten bij JD AI Research en de University of Massachusetts Amherst, en werd ondersteund door het Nationale Key R&D-programma van China onder Grant No. 2020AAA0103800. Het werd gepresenteerd op de 29e ACM International Conference on Multimedia, op 20-24 oktober, in Chengdu, China.

Geen Noodzaak voor ‘Face-On’ Pariteit

Zowel de meest populaire huidige deepfake-software, DeepFaceLab, als de concurrerende fork FaceSwap, voeren een moeilijke en vaak handmatig gecurateerde workflow uit om te bepalen welke kant een gezicht is gericht, welke obstakels er in de weg zitten die moeten worden meegenomen (opnieuw, handmatig), en moeten omgaan met veel andere irritante beperkingen (inclusief verlichting) die hun gebruik verre van de ‘point-and-click’-ervaring maken die onjuist wordt weergegeven in de media sinds het ontstaan van deepfakes.

Daarentegen heeft CihaNet geen behoefte aan twee beelden die rechtstreeks naar de camera zijn gericht om nuttige identiteitsinformatie uit één beeld te extraheren en te exploiteren.

In deze voorbeelden worden een reeks deepfake-softwareconcurrenten uitgedaagd om gezichten te wisselen die niet alleen in identiteit verschillen, maar die ook niet dezelfde kant op staan. Software die is afgeleid van het originele deepfakes-repository (zoals de enorm populaire DeepFaceLab en FaceSwap, afgebeeld hierboven) kan de dispariteit in hoeken tussen de twee beelden die moeten worden omgewisseld niet aan (zie derde kolom). Ondertussen kan CihaNet de identiteit correct afleiden, omdat de 'pose' van het gezicht geen intrinsiek deel is van de identiteitsinformatie.

In deze voorbeelden worden een reeks deepfake-softwareconcurrenten uitgedaagd om gezichten te wisselen die niet alleen in identiteit verschillen, maar die ook niet dezelfde kant op staan. Software die is afgeleid van het originele deepfakes-repository (zoals de enorm populaire DeepFaceLab en FaceSwap, afgebeeld hierboven) kan de dispariteit in hoeken tussen de twee beelden die moeten worden omgewisseld niet aan (zie derde kolom). Ondertussen kan CihaNet de identiteit correct afleiden, omdat de ‘pose’ van het gezicht geen intrinsiek deel is van de identiteitsinformatie.

Architectuur

Het CihaNet-project, volgens de auteurs, werd geïnspireerd door de samenwerking tussen Microsoft Research en Peking University in 2019, genaamd FaceShifter, hoewel het enkele opvallende en kritieke veranderingen aanbrengt in de kernarchitectuur van de oude methode.

FaceShifter gebruikt twee Adaptive Instance Normalization (AdaIN)-netwerken om identiteitsinformatie te verwerken, die vervolgens via een masker in het doelbeeld worden overgebracht, op een manier die vergelijkbaar is met de huidige populaire deepfake-software (en met alle daaraan verbonden beperkingen), met behulp van een extra HEAR-Net (die een afzonderlijk getraind sub-net bevat dat is getraind op occlusie-obstakels – een extra laag complexiteit).

In plaats daarvan gebruikt de nieuwe architectuur deze ‘contextuele’ informatie rechtstreeks voor het transformatieproces zelf, via een tweestaps enkele Cascading Adaptive Instance Normalization (C-AdaIN)-bewerking, die consistentie van context (d.w.z. gezichtshuid en occlusies) van ID-relevante gebieden biedt.

Het tweede sub-net dat cruciaal is voor het systeem heet Swapping Block (SwapBlk), dat een geïntegreerd kenmerk genereert uit de context van het referentiebeeld en de ingebedde ‘identiteits’-informatie van het bronbeeld, waardoor de multiple stages die nodig zijn om dit te bereiken met conventionele middelen worden omzeild.

Om identiteit en context te onderscheiden, wordt voor elk niveau een hallucination map gegenereerd, die fungeert als een zachte segmentatiemasker en werkt op een bredere reeks kenmerken voor dit kritieke deel van het deepfake-proces.

Naarmate de waarde van de hallucination map (afgebeeld rechts) toeneemt, ontstaat een duidelijker pad tussen identiteiten.

Naarmate de waarde van de hallucination map (afgebeeld rechts) toeneemt, ontstaat een duidelijker pad tussen identiteiten.

Op deze manier wordt het hele wisselproces in één stadium en zonder nabewerking uitgevoerd.

Gegevens en Testen

Om het systeem te testen, trainden de onderzoekers vier modellen op twee zeer populaire en gevarieerde open beeldatasets – CelebA-HQ en NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), elk met 30.000 en 70.000 beelden respectievelijk.

Er werd geen pruning of filtering uitgevoerd op deze basisdatasets. In elk geval trainden de onderzoekers de gehele dataset op de enkele Tesla GPU gedurende drie dagen, met een leersnelheid van 0,0002 op Adam-optimalisatie.

Ze renderden vervolgens een reeks willekeurige swaps onder de duizenden persoonlijkheden die in de datasets worden gepresenteerd, zonder rekening te houden met of de gezichten al dan niet op elkaar leken of zelfs geslachtsgelijk waren, en vergeleken de resultaten van CihaNet met de uitvoer van vier toonaangevende deepfake-kaders: FaceSwap (die fungeert als de meer populaire DeepFaceLab, aangezien het een gemeenschappelijke root codebase deelt in het originele 2017-repository dat deepfakes ter wereld bracht); de eerder genoemde FaceShifter; FSGAN; en SimSwap.

Bij het vergelijken van de resultaten via VGG-Face, FFHQ, CelebA-HQ en FaceForensics++, vonden de auteurs dat hun nieuwe model alle eerdere modellen overtrof, zoals aangegeven in de onderstaande tabel.

De drie metrics die werden gebruikt om de resultaten te evalueren waren Structurele Overeenkomst (SSIM), pose-schattingfout en ID-opname nauwkeurigheid, die wordt berekend op basis van het percentage succesvol opgehaalde paren.

De onderzoekers beweren dat CihaNet een superieure benadering vertegenwoordigt in termen van kwalitatieve resultaten, en een opvallende vooruitgang op de huidige stand van de techniek in deepfake-technologie, door de last van uitgebreide en arbeidsintensieve maskerarchitecturen en -methoden te verwijderen, en een meer bruikbare en actiegerichte scheiding van identiteit en context te bereiken.

Kijk hieronder voor meer videovoorbeelden van de nieuwe techniek. U kunt de volledige video hier vinden.

Uit aanvullende materialen voor het nieuwe artikel, voert CihaNet faceswapping uit op verschillende identiteiten. Bron: https://mitchellx.github.io/#video

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai