Andersons vinkel
En ny og enklere deepfake-metode som overgår tidligere tilnærminger

Et samarbeid mellom en kinesisk AI-forskningsgruppe og amerikanske forskere har utviklet hva som kan være den første virkelige innovasjonen i deepfake-teknologi siden fenomenet oppstod for fire år siden.
Den nye metoden kan utføre faceswaps som overgår alle eksisterende rammer på standard perceptuelle tester, uten å måtte samle inn og kuratere store dedikerte datasett og trene dem i opp til en uke for bare en enkelt identitet. For eksemplene presentert i den nye artikkelen, ble modellene trent på hele to populære celebrity-datasett, på en NVIDIA Tesla P40 GPU i omtrent tre dager.

Fullt video tilgjengelig i slutten av denne artikkelen. I dette eksemplet fra en video i supplerende materiale levert av en av forfatterne av den nye artikkelen, blir Scarlett Johanssons ansikt overført til kildevideoen. CihaNet fjerner problemet med edge-masking når det gjelder å bytte, ved å danne og iverksette dypere relasjoner mellom kilde- og mål-identiteter, noe som betyr en slutt på ‘åpenbare grenser’ og andre overlagringsfeil som oppstår i tradisjonelle deepfake-tilnærminger. Kilde: https://mitchellx.github.io/#video
Den nye tilnærmingen fjerner behovet for å ‘lime’ den transplanterte identiteten grovt inn i målvideoen, noe som ofte fører til avslørende artefakter som viser seg der det falske ansiktet slutter og det virkelige, underliggende ansiktet begynner. I stedet brukes ‘hallusinasjonskart’ til å utføre en dypere blandning av visuelle aspekter, fordi systemet skiller identitet fra kontekst mye bedre enn nåværende metoder, og derfor kan blande mål-identiteten på et mer grundig nivå.

Fra artikkelen. CihaNet-omforminger utføres gjennom hallusinasjonskart (nederste rad). Systemet bruker kontekstinformasjon (dvs. ansiktsretning, hår, briller og andre forhindringer osv.) helt fra bildet som den nye identiteten skal overføres til, og ansiktsidentitetsinformasjon helt fra personen som skal settes inn i bildet. Denne evnen til å skille ansikt fra kontekst er kritisk for systemets suksess. Kilde: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
Effektivt gir det nye hallusinasjonskartet en mer fullstendig kontekst for byttet, i motsetning til de harde maskene som ofte krever omfattende kurering (og i tilfelle DeepFaceLab, separat trening) samtidig som de tilbyr begrenset fleksibilitet i forhold til virkelig inkorporering av de to identitetene.

Fra eksempler i supplerende materiale, ved hjelp av både FFHQ- og Celeb-A HQ-datasett, over VGGFace og Forensics++. De to første kolonnene viser de tilfeldig valgte (virkelige) bildene som skal byttes. De fire påfølgende kolonnene viser resultater fra bytte med de fire mest effektive metodene som for tiden er tilgjengelige, mens den siste kolonnen viser resultatet fra CihaNet. FaceSwap-repositoriet har blitt brukt, i stedet for den mer populære DeepFaceLab, siden begge prosjektene er forgreninger av den originale 2017 Deepfakes-koden på GitHub. Selv om hver prosjekt har lagt til modeller, teknikker, mangfoldige UI-er og supplerende verktøy, har den underliggende koden som gjør deepfakes mulig, aldri endret seg, og er felles for begge. Kilde: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Den artikkelen, med tittelen One-stage Context and Identity Hallucination Network, er skrevet av forskere tilknyttet JD AI Research og University of Massachusetts Amherst, og ble støttet av National Key R&D Program of China under Grant No. 2020AAA0103800. Den ble introdusert på 29th ACM International Conference on Multimedia, 20.-24. oktober, i Chengdu, Kina.
Ingen behov for ‘ansikt-til-ansikt’-likhet
Både den mest populære nåværende deepfake-programvaren, DeepFaceLab, og konkurrerende forgrening FaceSwap, utfører torturøse og ofte håndkurerte arbeidsflyter for å identifisere hvilken vei et ansikt er vendt, hva hindringer som må være til stede som må tas med i betraktning (igjen, manuelt), og må takle mange andre irritasjonene (inkludert lys) som gjør deres bruk langt ifra ‘peke-og-klikk’-opplevelsen som uakkurat blir portrettert i media siden deepfakes oppstod.
I motsetning til dette, trenger CihaNet ikke at to bilder skal vende direkte mot kameraet for å trekke ut og utnytte nyttig identitetsinformasjon fra ett enkelt bilde.
<img class="size-full wp-image-178605" src="https://www.unite.ai/wp-content/uploads/2021/11/cihanet-angles.jpg" alt="I disse eksemplene, er en rekke deepfake-programvare-konkurrenter utfordret med oppgaven å bytte ansikter som ikke bare er ulike i identitet, men som heller ikke vender samme vei. Programvare avledet fra det originale deepfakes-repositoriet (slik som den meget populære DeepFaceLab og FaceSwap, avbildet ovenfor) kan ikke håndtere forskjellen i vinkler mellom de to bildene som skal byttes (se tredje kolonne). Mens CihaNet kan abstrahere identiteten riktig, siden 'posen' til ansiktet ikke er en del av identitetsinformasjonen.Arkitektur
CihaNet-prosjektet, ifølge forfatterne, ble inspirert av det 2019-samarbeidet mellom Microsoft Research og Peking University, kalt FaceShifter, selv om det gjør noen bemerkelsesverdige og kritiske endringer i den underliggende arkitekturen til den eldre metoden.
FaceShifter bruker to Adaptive Instance Normalization (AdaIN)-nettverk til å håndtere identitetsinformasjon, som data deretter overføres til målbildet via en maske, på en måte lignende nåværende populære deepfake-programvare (og med alle dens relaterte begrensninger), ved hjelp av et ekstra HEAR-Net (som inkluderer et separat trent sub-nett trent på hindringshindringer – et ekstra lag av kompleksitet).
I stedet bruker den nye arkitekturen direkte denne ‘kontekstuelle’ informasjonen for den transformative prosessen selv, via en to-trinns enkelt Cascading Adaptive Instance Normalization (C-AdaIN)-operasjon, som gir konsistens av kontekst (dvs. ansiktshud og hindringer) av ID-relevante områder.
Det andre sub-nettet som er kritisk for systemet, kalles Swapping Block (SwapBlk), som genererer en integrert funksjon fra konteksten av referansebildet og den innebygde ‘identitets’-informasjonen fra kildebildet, og omgår de multiple stadiene nødvendige for å oppnå dette ved konvensjonelle nåværende midler.
For å hjelpe med å skille mellom kontekst og identitet, genereres en hallusinasjonskart for hvert nivå, som erstatter en myk-segmenteringsmaske, og virker på et bredere spekter av funksjoner for denne kritiske delen av deepfake-prosessen.

Ettersom verdien av hallusinasjonskartet (avbildet nedenfor til høyre) øker, oppstår en tydeligere vei mellom identiteter.
På denne måten blir hele bytteprosessen utført i ett enkelt stadium og uten etterbehandling.
Data og testing
For å prøve ut systemet, trente forskerne fire modeller på to svært populære og varierte åpne bilde-datasett – CelebA-HQ og NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), hver inneholdende 30 000 og 70 000 bilder henholdsvis.
Ingen beskjæring eller filtrering ble utført på disse basis-datasettene. I hver tilfelle trente forskerne hele datasettet på en enkelt Tesla GPU over tre dager, med en læringshastighet på 0,0002 på Adam-optimisering.
De renderte deretter ut en rekke tilfeldige bytt mellom de tusenvis av personligheter som er presentert i datasettene, uten å ta hensyn til om ansiktene var like eller til og med kjønns-matched, og sammenlignet CihaNets resultater med utgangen fra fire ledende deepfake-rammer: FaceSwap (som står for den mer populære DeepFaceLab, siden de deler en felles kodebase i det originale 2017-repositoriet som brakte deepfakes til verden); den ovennevnte FaceShifter; FSGAN; og SimSwap.
I sammenligning av resultater via VGG-Face, FFHQ, CelebA-HQ og FaceForensics++, fant forfatterne at deres nye modell overgikk alle tidligere modeller, som vist i tabellen nedenfor.

De tre målene som ble brukt til å evaluere resultater var Structural Similarity (SSIM), pose-estimeringsfeil og ID-gjenkjenningssnøhet, som beregnes basert på prosentandelen av vellykkede gjenkjenninger.
Forskerne hevder at CihaNet representerer en overlegen tilnærming i forhold til kvalitative resultater, og en merkbart fremgang på nåværende tilstand av kunsten i deepfake-teknologier, ved å fjerne byrden av omfattende og arbeidskrevende masker-arkitekturer og -metodologier, og oppnå en mer nyttig og håndterbar skille mellom identitet og kontekst.
Se nedenfor for å se flere videoeksempler på den nye teknikken. Du kan finne den fullstendige videoen her.
Fra supplerende materiale for den nye artikkelen, utfører CihaNet faceswapping på ulike identiteter. Kilde: https://mitchellx.github.io/#video














