Andersons vinkel

Ny metode for deepfakes løser ‘face host’-problemet

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Tross flere års mediehyppe om potensialet for deepfake-bilder til å undergrave vår langvarige tro på autentisiteten av videoopptak, avhenger alle nåværende metoder av å finne ‘face hosts’ som er bredt liknende i form til målsansiktet.

Hvor originalopptakene viser et bredt ansikt, men målsobjektet har et smalt ansikt, har resultater alltid vært problematiske, fordi en slik overføring innebærer å kutte bort en del av det originale ansiktet og gjenskape den nå avdekkede bakgrunnen. Nåværende pakker som DeepFaceLab og FaceSwap kan produsere begrensede resultater når konfigurasjonen er omvendt (smal > bred), men har ingen funksjon for å overbevisende takle denne scenariot.

Nå har et samarbeid mellom Tencent og Kinas Xiamen University utviklet en ny tilnærming, tittelen HifiFace, designet for å rette opp denne mangelen.

To HifiFace-deepfakes, den første av Anne Hathaway, hvor en god likhet oppnås til tross for ubeslektet vertsansiktform. HifiFace fungerer også godt på mål med briller, tradisjonelt en hindring i deepfakes. Kilde: https://arxiv.org/pdf/2106.09965.pdf

To HifiFace-deepfakes, den første av Anne Hathaway, hvor en god likhet oppnås til tross for ubeslektet vertsansiktform. HifiFace fungerer også godt på mål med briller, tradisjonelt en hindring i deepfakes. Kilde: https://arxiv.org/pdf/2106.09965.pdf

Ombygging av et deepfake-ansikt

Tidligere metoder, som 2019s Subject Agnostic Face Swapping and Reenactment (FSGAN), har avhengt av 3DMM-fitting (3D Morphable Models) eller andre metodologier basert på ansiktslandemerker eller transformasjon, hvor ansiktslinjene til ansiktet som skal “overskrives” nesten diktater grensene for byttet.

Kilde: https://github.com/Yinghao-Li/3DMM-fitting

3DMM-ansiktslandemerker. Kilde: https://github.com/Yinghao-Li/3DMM-fitting

Selv om konkurransemetodene har trukket på funksjoner avledet fra ansiktsgjenkjenningnettverk, er disse hovedsakelig rettet mot å gjenopprette tekstur fremfor struktur, og produserer en “mask-lignende” effekt i tilfeller hvor vertsansiktet ikke er fullstendig kompatibelt (dvs. grensene og formen på hårlinje, kjeve og kinnbein).

For å løse disse problemene utviklet de kinesiske forskerne, basert i Media Analytics and Computing Lab ved universitetets Department of Artificial Intelligence, et end-to-end-nettverk som regredierer koeffisientene til mål- og kildeansiktet ved hjelp av en 3D-rekonstruksjonsmodell, som deretter kombineres som forminformasjon, og konkateneres med identitetsvektorinformasjon fra et ansiktsgjenkjenningnettverk.

Dette geometriske dataene føres deretter inn i en encoder-decoder-modell som strukturinformasjon, blandes med målansiktets uttrykk og holdning, som utnyttes som hjelpekilder for nøyaktig overføring.

Semantisk ansiktsfusjon

I tillegg inkluderer HifiFace en Semantisk Ansiktsfusjon (SFF)-komponent, som bruker en lav-nivå-funksjon i encoderen for å bevare rom- og teksturinformasjon, uten å ofre målbildets identitet. Funksjoner fra encoderen og decoderen integreres i en lært adaptiv maske, og bakgrunnsinformasjonen blandes inn i utgangen ved hjelp av den lætte ansiktsmasken.

HifiFace i aksjon. Kilde: https://johann.wang/HifiFace/

HifiFace i aksjon. Kilde: https://johann.wang/HifiFace/

På denne måten avviker HifiFace fra å bruke originale ansiktsgrenser som en hard grense, ved å bruke utvidet ansiktssemantisk segmentering, hvor modellen kan utføre bedre adaptiv fusjon på ansiktets kantgrenser.

To tidligere tilnærminger (øverst og nederst til venstre), og den nye HifiFace-arkitekturen, som består av en encoder, decoder, 3D-form-bevisst identitetseksponent og SFF-modul.

To tidligere tilnærminger (øverst og nederst til venstre), og den nye HifiFace-arkitekturen, som består av en encoder, decoder, 3D-form-bevisst identitetseksponent og SFF-modul.

I en sammenligning med tidligere metoder FSGAN, SimSwap og FaceShifter, demonstrerer HifiFace en overlegen rekonstruksjon av ansiktsform, siden det ikke approksimerer “spøkelses”-elementer hvor ansiktsavgrensningene forvirrer identitet > identitet-mapping, men rekonstruerer dem definitivt.

Testing

Forskerne implementerte systemet ved hjelp av VGGFace2 og DeepGlint Asian-Celeb-datasettene. Ansikter ble justert via 5 ytre landemerker og omklipt til 256×256 piksler. Et portrettforbedringsnettverk ble også brukt til å generere en 512×512 piksler versjon, for en ekstra høyoppløst modell. Modellen ble trent under Adam.

Tross at FaceShifter bevare identiteten godt, kan det ikke håndtere problemer som uttrykk, farge og okklusjon like effektivt som HifiFace, og har en mer kompleks nettverksstruktur. FSGAN har problemer med å overføre lys fra kilde til mål.

Forskerne bruker FaceForensics++ for kvantitative sammenligninger, sampling ti rammeverk hver i en batch av konverterte videoer over konkurransemetodene, og fant at HifiFace oppnådde en overlegen ID-innhentingsscore. Ved å teste en rekke andre faktorer, som bildekvalitet, fant forskerne også at deres metode overgikk rivaliserende metodologier.

Benedict Cumberbatchs ansiktslinjer gjengis trofast.

Benedict Cumberbatchs ansiktslinjer gjengis trofast.

Arbeidet representerer et videre skritt mot å abstrahere kildematerialet så at det bare er en grov mal som kan overføres med nøyaktige identiteter. Noen av de nåværende FOSS-pakkene, inkludert DeepFaceLab, har begynt å utvikle funksjoner for full-hode-erstatning, men, som HifiFace, tar de ikke hensyn til hår, og er mer effektive til å “bygge ut” et ansikt enn å meisle det bort for å matche et ønsket mål.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai