Andersons vinkel

En Ny og Simpler Deepfake Metode, der Overgår Tidligere Tilgange

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et samarbejde mellem en kinesisk AI-forskningsgruppe og amerikanske forskere har udviklet, hvad der kan være den første rigtige innovation i deepfake-teknologi siden fænomenet opstod for fire år siden.

Den nye metode kan udføre faceswaps, der overgår alle andre eksisterende rammer på standard perceptuelle tests, uden at skulle samle og kuraterer store dedikerede datasæt og træne dem i op til en uge for kun en enkelt identitet. For de eksempler, der præsenteres i den nye artikel, blev modellerne trænet på hele to populære celebrity-datasæt, på en enkelt NVIDIA Tesla P40 GPU i omkring tre dage.

Hele videoen er indlejret i slutningen af denne artikel. I dette eksempel fra en video i supplerende materiale til den nye artikel, er Scarlett Johanssons ansigt overført til kildevideoen. CihaNet fjerner problemet med edge-masking, når der udføres en swap, ved at danne og udføre dybere relationer mellem kilde- og mål-identiteter, hvilket betyder en ende på 'åbenlyse grænser' og andre superimposition-fejl, der opstår i traditionelle deepfake-tilgange. Kilde: https://mitchellx.github.io/#video

Hele videoen er tilgængelig i slutningen af denne artikel. I dette eksempel fra en video i supplerende materiale leveret af en af forfatterne af den nye artikel, er Scarlett Johanssons ansigt overført til kildevideoen. CihaNet fjerner problemet med edge-masking, når der udføres en swap, ved at danne og udføre dybere relationer mellem kilde- og mål-identiteter, hvilket betyder en ende på ‘åbenlyse grænser’ og andre superimposition-fejl, der opstår i traditionelle deepfake-tilgange. Kilde: https://mitchellx.github.io/#video

Den nye tilgang fjerner behovet for at ‘klæbe’ den transplanterede identitet groft ind i målvideoen, hvilket ofte fører til afslørende artefakter, der opstår, hvor det falske ansigt slutter, og det virkelige, underliggende ansigt begynder. I stedet bruges ‘hallucinationskort’ til at udføre en dybere blandning af visuelle aspekter, fordi systemet adskiller identitet fra kontekst langt mere effektivt end nuværende metoder, og derfor kan blande mål-identiteten på et mere grundlæggende niveau.

Fra artiklen. CihaNet-transformationer faciliteres gennem hallucinationskort (nederste række). Systemet bruger kontekstinformation (dvs. ansigtsretning, hår, briller og andre forhindringer osv.) fuldstændigt fra billedet, som den nye identitet skal overføres til, og ansigtsidentitetsinformation fuldstændigt fra personen, der skal indsættes i billedet. Denne evne til at adskille ansigt fra kontekst er afgørende for systemets succes. Kilde: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Fra artiklen. CihaNet-transformationer faciliteres gennem hallucinationskort (nederste række). Systemet bruger kontekstinformation (dvs. ansigtsretning, hår, briller og andre forhindringer osv.) fuldstændigt fra billedet, som den nye identitet skal overføres til, og ansigtsidentitetsinformation fuldstændigt fra personen, der skal indsættes i billedet. Denne evne til at adskille ansigt fra kontekst er afgørende for systemets succes. Kilde: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257

Effektivt set tilbyder det nye hallucinationskort en mere komplet kontekst for swap, i modsætning til de hårde masker, der ofte kræver omfattende kuratering (og i tilfældet DeepFaceLab, separat træning) samtidig med, at de tilbyder begrænset fleksibilitet i forhold til reel inkorporering af de to identiteter.

Fra eksempler i supplerende materiale, der bruger både FFHQ- og Celeb-A HQ-datasættene, på tværs af VGGFace og Forensics++. De første to kolonner viser de tilfældigt valgte (reelle) billeder, der skal swappes. De følgende fire kolonner viser resultaterne af swap, ved hjælp af de fire mest effektive metoder, der i øjeblikket er tilgængelige, mens den sidste kolonne viser resultatet fra CihaNet. FaceSwap-repositoriet er blevet brugt i stedet for den mere populære DeepFaceLab, da begge projekter er forks af den originale 2017 Deepfakes-kode på GitHub. Selvom hvert projekt har tilføjet modeller, teknikker, diverse UI’er og supplerende værktøjer, har den underliggende kode, der gør deepfakes mulige, aldrig ændret sig og er fælles for begge. Kilde: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip

Den artikel, med titlen One-stage Context and Identity Hallucination Network, er skrevet af forskere tilknyttet JD AI Research og University of Massachusetts Amherst, og blev støttet af National Key R&D Program of China under Grant No. 2020AAA0103800. Den blev præsenteret på 29th ACM International Conference on Multimedia, den 20.-24. oktober, i Chengdu, Kina.

Ingen Behov for ‘Face-On’ Paritet

Både den mest populære nuværende deepfake-software, DeepFaceLab, og den konkurrerende fork FaceSwap, udfører komplicerede og ofte håndkuraterede workflows for at identificere, hvilken vej et ansigt er vendt, hvilke forhindringer der er i vejen, der skal tages i betragtning (igen, manuelt), og måtte klare mange andre irriterende forhindringer (herunder belysning), der gør deres brug langt fra den ‘point-and-click’-oplevelse, der forkert er blevet portrætteret i medierne, siden deepfakes opstod.

I modsætning hertil kræver CihaNet ikke, at to billeder skal være vendt direkte mod kameraet for at udtrække og udnytte nyttig identitetsinformation fra et enkelt billede.

I disse eksempler er en række deepfake-software-konkurrenter udfordret med opgaven at swappe ansigter, der ikke kun er forskellige i identitet, men også ikke er vendt den samme vej. Software, der er afledt af den originale deepfakes-repositorium (såsom den meget populære DeepFaceLab og FaceSwap, vist ovenfor), kan ikke håndtere forskellen i vinkler mellem de to billeder, der skal swappes (se tredje kolonne). Imens kan CihaNet abstrahere identiteten korrekt, da 'posen' af ansigtet ikke er en integreret del af identitetsinformationen.

I disse eksempler er en række deepfake-software-konkurrenter udfordret med opgaven at swappe ansigter, der ikke kun er forskellige i identitet, men også ikke er vendt den samme vej. Software, der er afledt af den originale deepfakes-repositorium (såsom den meget populære DeepFaceLab og FaceSwap, vist ovenfor), kan ikke håndtere forskellen i vinkler mellem de to billeder, der skal swappes (se tredje kolonne). Imens kan CihaNet abstrahere identiteten korrekt, da ‘posen’ af ansigtet ikke er en integreret del af identitetsinformationen.

Arkitektur

CihaNet-projektet, ifølge forfatterne, blev inspireret af samarbejdet mellem Microsoft Research og Peking University i 2019, kaldet FaceShifter, selvom det har gjort nogle bemærkelsesværdige og kritiske ændringer i den underliggende arkitektur af den ældre metode.

FaceShifter bruger to Adaptive Instance Normalization (AdaIN)-netværk til at håndtere identitetsinformation, som derefter overføres til målbilledet via en maske, på en måde, der ligner nuværende populære deepfake-software (og med alle dens relaterede begrænsninger), ved hjælp af et ekstra HEAR-Net (der inkluderer et separat trænet sub-net, der er trænet på forhindringer – en ekstra lag af kompleksitet).

I stedet bruger den nye arkitektur direkte denne ‘kontekstuelle’ information til den transformative proces selv, via en to-trins single Cascading Adaptive Instance Normalization (C-AdaIN)-operation, der giver konsistens af kontekst (dvs. ansigts hud og forhindringer) af ID-relevante områder.

Det andet sub-net, der er afgørende for systemet, kaldes Swapping Block (SwapBlk), som genererer en integreret funktion fra konteksten af referencebilledet og den indlejrede ‘identitets’-information fra kildebilledet, og omgår de multiple stadier, der er nødvendige for at opnå dette ved konventionelle nuværende midler.

For at hjælpe med at adskille kontekst og identitet genereres et hallucinationskort for hvert niveau, der fungerer som en soft-segmenteringsmaske, og virker på en bredere række af funktioner for denne kritiske del af deepfake-processen.

Da værdien af hallucinationskortet (billedet til højre) øges, opstår der en klarere vej mellem identiteter.

Da værdien af hallucinationskortet (billedet til højre) øges, opstår der en klarere vej mellem identiteter.

På denne måde opnås hele swap-processen i ét enkelt trin og uden efterbehandling.

Data og Test

For at afprøve systemet trænede forskerne fire modeller på to meget populære og varierede åbne billed-datasæt – CelebA-HQ og NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), hver indeholdende 30.000 og 70.000 billeder henholdsvis.

Ingen beskæring eller filtrering blev udført på disse grundlæggende datasæt. I hvert tilfælde trænede forskerne hele datasættet på den enkelte Tesla GPU over tre dage, med en læringsrate på 0,0002 på Adam-optimering.

Derefter renderede de en række tilfældige swaps mellem de tusinder af personligheder, der er repræsenteret i datasættene, uden hensyn til, om ansigterne var lignende eller endda kønsmatchede, og sammenlignede CihaNets resultater med outputtet fra fire førende deepfake-rammer: FaceSwap (der står i stedet for den mere populære DeepFaceLab, da den deler en rod-kodebase i den originale 2017-repositorium, der bragte deepfakes til verden); den nævnte FaceShifter; FSGAN; og SimSwap.

Ved at sammenligne resultaterne via VGG-Face, FFHQ, CelebA-HQ og FaceForensics++, fandt forfatterne, at deres nye model overgik alle tidligere modeller, som vist i tabellen nedenfor.

De tre metrikker, der blev brugt til at evaluere resultaterne, var Structural Similarity (SSIM), pose estimation error og ID retrieval accuracy, der beregnes på basis af procentdelen af succesfuldt hentede par.

Forskerne hævder, at CihaNet repræsenterer en overlegen tilgang i forhold til kvalitative resultater og en bemærkelsesværdig fremgang på den nuværende tilstand af deepfake-teknologier, ved at fjerne byrden af omfattende og arbejdskrævende masker-arkitekturer og -metoder, og opnå en mere nyttig og anvendelig adskillelse af identitet fra kontekst.

Se nedenfor for at se flere videoeksempler på den nye teknik. Du kan finde den fuldlængde-video her.

Fra supplerende materiale til den nye artikel udfører CihaNet faceswapping på forskellige identiteter. Kilde: https://mitchellx.github.io/#video

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai