Andersons vinkel
En ny och enklare deepfake-metod som överträffar tidigare tillvägagångssätt

En samarbetsinsats mellan en kinesisk AI-forskningsgrupp och amerikanska forskare har utvecklat vad som kan vara den första riktiga innovationen inom deepfake-teknologi sedan fenomenet uppkom för fyra år sedan.
Den nya metoden kan utföra ansiktsbyten som överträffar alla andra existerande ramverk på standardperceptuella tester, utan att behöva samla in och kuratera stora dedikerade datamängder och träna dem i upp till en vecka för endast en identitet. För de exempel som presenteras i den nya artikeln, tränades modellerna på hela två populära celebrity-datamängder, på en NVIDIA Tesla P40 GPU under cirka tre dagar.

Hela videon finns tillgänglig i slutet av den här artikeln. I det här exemplet från en video i supplementär material som tillhandahållits av en av författarna till den nya artikeln, överförs Scarlett Johanssons ansikte till källvideon. CihaNet tar bort problemet med edge-masking när en utbyte görs, genom att bilda och utföra djupare relationer mellan käll- och målidentiteter, vilket innebär ett slut på ‘uppenbara gränser’ och andra superimpositionsfel som förekommer i traditionella deepfake-tillvägagångssätt. Källa: https://mitchellx.github.io/#video
Den nya tillvägagångssättet tar bort behovet av att ‘klistra’ in den transplanterade identiteten på ett grovt sätt i målvideon, vilket ofta leder till avslöjande artefakter som visas där den fejkade ansiktet slutar och det riktiga, underliggande ansiktet börjar. Istället används ‘hallucinationskartor’ för att utföra en djupare blandning av visuella aspekter, eftersom systemet separerar identitet från sammanhang mycket mer effektivt än nuvarande metoder, och därför kan blanda målidentiteten på ett mer grundläggande sätt.

Från artikeln. CihaNet-omvandlingar underlättas genom hallucinationskartor (nedersta raden). Systemet använder kontextinformation (dvs. ansiktsriktning, hår, glasögon och andra hinder etc.) helt från bilden som den nya identiteten ska superponeras på, och ansiktsidentitetsinformation helt från personen som ska infogas i bilden. Denna förmåga att separera ansikte från sammanhang är avgörande för systemets framgång. Källa: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
Effektivt sett tillhandahåller den nya hallucinationskartan en mer komplett kontext för utbytet, till skillnad från de hårda maskerna som ofta kräver omfattande kurering (och i fallet med DeepFaceLab, separat utbildning) medan de tillhandahåller begränsad flexibilitet i termer av verklig inkorporering av de två identiteterna.

Från prover som tillhandahållits i supplementär material, med användning av både FFHQ- och Celeb-A HQ-datamängderna, över VGGFace och Forensics++. De två första kolumnerna visar de slumpmässigt valda (verkliga) bilderna som ska bytas ut. De följande fyra kolumnerna visar resultaten av utbytet med de fyra mest effektiva metoderna som för närvarande är tillgängliga, medan den sista kolumnen visar resultatet från CihaNet. FaceSwap-repositoriet har använts, snarare än den mer populära DeepFaceLab, eftersom båda projekten är grenar av den ursprungliga 2017 Deepfakes-koden på GitHub. Även om varje projekt sedan dess har lagt till modeller, tekniker, olika användargränssnitt och supplementär verktyg, har den underliggande koden som gör deepfakes möjliga aldrig ändrats och förblir gemensam för båda. Källa: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Den artikeln, med titeln One-stage Context and Identity Hallucination Network, är skriven av forskare knutna till JD AI Research och University of Massachusetts Amherst, och stöddes av den nationella nyckelutvecklingsprogrammet i Kina under bidragsnummer 2020AAA0103800. Den presenterades vid den 29:e ACM International Conference on Multimedia, den 20-24 oktober, i Chengdu, Kina.
Inget behov av ‘ansikte-mot-ansikte’-jämvikt
Både den mest populära nuvarande deepfake-mjukvaran, DeepFaceLab, och den konkurrerande grenen FaceSwap, utför mödosamma och ofta manuellt kuraterade arbetsflöden för att identifiera vilket sätt ett ansikte är lutat, vilka hinder som finns i vägen som måste beaktas (igen, manuellt), och måste hantera många andra irriterande hinder (inklusive belysning) som gör deras användning långt ifrån den ‘pek-och-klick’-upplevelse som felaktigt beskrivits i media sedan deepfakes uppkomst.
Till skillnad från detta kräver CihaNet inte att två bilder ska vara vända direkt mot kameran för att extrahera och utnyttja användbar identitetsinformation från en enda bild.

I dessa exempel utmanas en uppsättning deepfake-mjukvarukonkurrenter med uppgiften att byta ut ansikten som inte bara är olika till identitet, utan som inte heller är vända åt samma håll. Mjukvara som härstammar från det ursprungliga deepfakes-repositoriet (såsom den mycket populära DeepFaceLab och FaceSwap, avbildad ovan) kan inte hantera olikheten i vinklar mellan de två bilderna som ska bytas ut (se tredje kolumnen). Samtidigt kan CihaNet abstrahera identiteten korrekt, eftersom ‘pose’ för ansiktet inte är en intrinsisk del av identitetsinformationen.
Arkitektur
CihaNet-projektet, enligt författarna, inspirerades av 2019 års samarbete mellan Microsoft Research och Peking University, kallat FaceShifter, men gör några noterbara och kritiska ändringar i den äldre metodens kärnarkitektur.
FaceShifter använder två Adaptive Instance Normalization (AdaIN)-nätverk för att hantera identitetsinformation, som sedan överförs till målbilden via en mask, på ett sätt som liknar nuvarande populära deepfake-mjukvara (och med alla dess relaterade begränsningar), med hjälp av ett tillägg HEAR-Net (som innehåller ett separat tränat sub-nät tränat på hinder – ett extra lager av komplexitet).
Istället använder den nya arkitekturen direkt denna ‘kontextuella’ information för den transformerande processen själv, via en tvåstegs enkel Cascading Adaptive Instance Normalization (C-AdaIN)-operation, som tillhandahåller konsekvens i kontext (dvs. ansikts hud och hinder) av ID-relevanta områden.
Det andra sub-nätet som är avgörande för systemet kallas Swapping Block (SwapBlk), som genererar en integrerad funktion från kontexten av referensbilden och den inbäddade ‘identitets’-informationen från källbilden, och kringgår de flera steg som är nödvändiga för att uppnå detta med konventionella nuvarande medel.
För att hjälpa till att skilja mellan kontext och identitet genereras en hallucinationskarta för varje nivå, som står för en mjuk-segmenteringsmask, och verkar på ett bredare utbud av funktioner för denna kritiska delen av deepfake-processen.

När hallucinationskartans värde växer, uppstår en tydligare väg mellan identiteter.
På detta sätt utförs hela utbytesprocessen i ett enda steg och utan efterbearbetning.
Data och testning
För att prova systemet tränade forskarna fyra modeller på två mycket populära och varierade öppna bild-datamängder – CelebA-HQ och NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), som vardera innehåller 30 000 och 70 000 bilder.
Inga beskärningar eller filter tillämpades på dessa bas-datamängder. I varje fall tränade forskarna hela varje datamängd på den enskilda Tesla GPU:n under tre dagar, med en inlärningshastighet på 0,0002 på Adam-optimering.
Sedan renderade de ut en serie slumpmässiga utbyten bland de tusentals personligheter som presenteras i datamängderna, utan hänsyn till om ansiktena var lika eller ens könsmatchade, och jämförde CihaNets resultat med utdata från fyra ledande deepfake-ramverk: FaceSwap (som står för den mer populära DeepFaceLab, eftersom den delar en rotkodbas i det ursprungliga 2017-repositoriet som förde deepfakes till världen); den ovannämnda FaceShifter; FSGAN; och SimSwap.
När de jämförde resultaten via VGG-Face, FFHQ, CelebA-HQ och FaceForensics++, fann författarna att deras nya modell överträffade alla tidigare modeller, som visas i tabellen nedan.

De tre mått som användes för att utvärdera resultaten var Strukturell likhet (SSIM), pose-estimeringsfel och ID-återställningsnoggrannhet, som beräknas baserat på procentandelen framgångsrikt återställda par.
Forskarna hävdar att CihaNet representerar en överlägsen tillvägagångssätt i termer av kvalitativa resultat, och en anmärkningsvärd framsteg i förhållande till den nuvarande tillståndet inom deepfake-teknologier, genom att ta bort bördan av omfattande och arbetsintensiva maskarkitekturer och metoder, och uppnå en mer användbar och genomförbar separation av identitet från sammanhang.
Titta på videon nedan för att se fler exempel på den nya tekniken. Du kan hitta den fullständiga videon här.
Från supplementär material för den nya artikeln, utför CihaNet ansiktsbyten på olika identiteter. Källa: https://mitchellx.github.io/#video














