Andersons vinkel
Ny metode til dybfake billeder løser ‘ansigtshost’-problemet

Trods flere års mediehyppe omkring mulighederne for, at dybfake-billeder kan undergrave vores langvarige tillid til autenticiteten af videooptagelser, afhænger alle nuværende populære metoder af at finde ‘ansigtshoste’, der er bredt lignende i form til målansigtet.
Hvor den originale optagelse viser et bredt ansigt, men målpersonen har et smalt ansigt, har resultaterne altid været problematiske, fordi en sådan overførsel indebærer at skære en del af det originale ansigt væk og genopbygge den nu eksponerede baggrund. Nuværende pakker som DeepFaceLab og FaceSwap kan producere begrænsede resultater, når konfigurationen er omvendt (smal > bred), men har ingen funktion til at tackle denne situation på en overbevisende måde.
En samarbejdsprojekt mellem Tencent og Kinas Xiamen Universitet har udviklet en ny tilgang, kaldet HifiFace, designet til at rette op på denne mangel.

To HifiFace-dybfake-billeder, det første af Anne Hathaway, hvor en god lighed opnås trods ukompatible ansigtshost-form. HifiFace fungerer også godt på mål med briller, traditionelt en hindring i dybfake-billeder. Kilde: https://arxiv.org/pdf/2106.09965.pdf
Ombygning af et dybfake-ansigt
Tidligere tilgange, såsom 2019’s Emne-agnostisk ansigtsskift og genskabelse (FSGAN), har afhængt af 3DMM-tilpasning (3D-formbare modeller) eller andre metoder baseret på ansigtslandemærker eller transformation, hvor ansigtets linjeføring på det ansigt, der skal “overskrives”, næsten diktérer grænserne for skiftet:

3DMM-ansigtslandemærke-detektion. Kilde: https://github.com/Yinghao-Li/3DMM-fitting
Selvom konkurrerende metoder har draget på funktioner afledt fra ansigtsgenkendelsesnetværk, er disse primært rettet mod at genskabe tekstur snarere end struktur, og producerer lignende en “maskelignende” effekt i tilfælde, hvor ansigtshosten ikke er fuldstændigt kompatibel (dvs. grænserne og formen på hårlinje, kæbe og kindben).
For at løse disse problemer udviklede de kinesiske forskere, baseret i Media Analytics and Computing Lab på universitetets afdeling for kunstig intelligens, et end-to-end-netværk, der regresser koefficienterne for mål- og kildeansigtet ved hjælp af en 3D-rekonstruktionsmodel, som herefter kombineres som forminformation og konkateneres med identitetsvektorinformation fra et ansigtsgenkendelsesnetværk.
Dette geometriske data indføres herefter i en encoder-decoder-model som strukturrelateret information, der kombineres med målansigtets udtryk og disposition, som udnyttes som hjælpemidler til præcis overførsel.
Semantisk ansigtssammensmeltning
HifiFace inkluderer desuden en komponent til semantisk ansigtssammensmeltning (SFF), som anvender en lavniveaufunktion i encoderen til at bevare rum- og teksturinformation uden at ofre målbilledeidentiteten. Funktioner fra encoderen og decoderen integreres i en lært adaptiv maske, og baggrundsinformationen blandes ind i outputtet via den lært ansigtsmaske.

HifiFace i aktion. Kilde: https://johann.wang/HifiFace/
På denne måde afviger HifiFace fra brugen af originale ansigtsgrenser som en fast grænse ved at anvende dilateret ansigtssammensmeltning, hvor modellen kan udføre bedre adaptiv sammensmeltning på ansigtets kantgrænser.

To tidligere tilgange (øverst og nederst til venstre) og den nye HifiFace-arkitektur, som består af en encoder, decoder, 3D-formbevidst identitetsudtrækker og SFF-modul.
I en sammenligning med tidligere metoder FSGAN, SimSwap og FaceShifter, demonstrerer HifiFace en overlegen rekonstruktion af ansigtets form, da den ikke approksimerer “spøgelses”-elementer, hvor ansigtets grænser forvirrer identitets-til-identitets-mappingen, men definitivt rekonstruerer dem.
Test
Forskerne implementerede systemet ved hjælp af VGGFace2 og DeepGlint Asian-Celeb-datasættene. Ansigterne blev justeret via 5 udadgående landemærker og genskåret til 256×256 pixels. Et portrætfornyelsesnetværk blev også anvendt til at generere en 512×512-pixels-version, for en ekstra højopløsningsmodel. Modellen blev trænet under Adam.
Selvom FaceShifter bevare identiteten godt, kan den ikke tackle problemer som udtryk, farve og tilsløring så effektivt som HifiFace, og har en mere kompleks netværksstruktur. FSGAN har problemer med at overføre lysningen fra kilde til mål.
Forskerne anvender FaceForensics++ til kvantitative sammenligninger, ved at tage prøver af ti billeder hver i en batch af konverterede videoer over de konkurrerende metoder, og finder, at HifiFace opnåede en overlegen ID-hentningsscore. Ved at teste en række andre faktorer, såsom billedkvalitet, fandt forskerne også, at deres metode overgik de rivaliserende metoder.
Arbejdet repræsenterer et skridt mod at abstrahere kildematerialet, så det kun er en omtrentlig skabelon, hvori præcise identiteter kan overføres. Nogle af de nuværende FOSS-pakker, herunder DeepFaceLab, har begyndt at udvikle funktioner til fuld-hoved-erstatning, men som HifiFace, tager disse ikke hensyn til hår, og de er mere effektive til at “bygge ud” et ansigt end til at skære det væk for at matche en ønsket målkilde.

















