Andersons vinkel

Identifikation af celebrity deepfakes fra ydre ansigtsomrÃĨder

mm
FÃļj Unite.AI til dine foretrukne kilder pÃĨ Google

Et nyt samarbejde mellem Microsoft og et kinesisk universitet har foreslÃĨet en ny mÃĨde at identificere celebrity deepfakes pÃĨ, ved at udnytte svaghederne i nuvÃĶrende deepfake-teknikker til at genkende identiteter, der er “projiceret” pÃĨ andre mennesker.

Tilgangen kaldes Identity Consistency Transformer (ICT), og fungerer ved at sammenligne de ydre dele af ansigtet (kÃĶbe, kindben, hÃĨrlinje og andre ydre marginal linjement) med ansigtets indre dele. Systemet udnytter offentligt tilgÃĶngelige billeddata af berÃļmte personer, hvilket begrÃĶnser dets effektivitet til populÃĶre celebriteter, hvis billeder er tilgÃĶngelige i store mÃĶngder i computer vision-datasets og pÃĨ internettet.

The forgery coverage of faked faces across seven techniques: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; and DF-VAE. Source: https://arxiv.org/pdf/2203.01318.pdf

The forgery coverage of faked faces across seven techniques: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; and DF-VAE. Popular packages such as DeepFaceLab and FaceSwap provide similarly constrained coverage. Source: https://arxiv.org/pdf/2203.01318.pdf

Som billedet ovenfor viser, er nuvÃĶrende metoder for deepfaking ret ressource-krÃĶvende og afhÃĶnger af “kompatible” vÃĶrt-ansigter/kroppe for at minimere beviser for ansigtsudskiftning.

Selv om forskellige metoder kan omfatte hele panden og en stor del af hagen og kindbenets omrÃĨder, er de alle mere eller mindre begrÃĶnsede inden for rammen af vÃĶrt-ansigtet.

A saliency map that emphasizes the 'inner' and 'outer' identities calculated by ICT. Where an inner facial match is established but an outer identity does not correspond, ICT evaluates the image as false.

A saliency map that emphasizes the ‘inner’ and ‘outer’ identities calculated by ICT. Where an inner facial match is established but an outer identity does not correspond, ICT evaluates the image as false.

I tests viste ICT sig i stand til at detektere deepfake-indhold i fake-venlige omgivelser sÃĨsom lav oplÃļsning video, hvor indholdet af hele videoen er degraderet af kompressionsarter, hvilket hjÃĶlper med at skjule rester af beviser for deepfake-processen – en omstÃĶndighed, der forvirrer mange konkurrerende deepfake-detektionsmetoder.

ICT outperforms contenders in recognizing deepfake content. See video embedded at end of article for more examples and better resolution. Source: https://www.youtube.com/watch?v=zgF50dcymj8

ICT outperforms contenders in recognizing deepfake content. See video embedded at end of article for more examples and better resolution. See embedded source video at end of article for further examples. Source: https://www.youtube.com/watch?v=zgF50dcymj8

Den artikel er titlen Protecting Celebrities with Identity Consistency Transformer, og kommer fra ni forskere, der er tilknyttet University of Science and Technology of China, Microsoft Research Asia og Microsoft Cloud + AI.

TrosvigtighedsGapet

Der er mindst to grunde til, hvorfor populÃĶre ansigtsudskiftningsalgoritmer sÃĨsom DeepFaceLab og FaceSwap negligerer de ydre omrÃĨder af de udskiftede ansigtsidentiteter.

FÃļrst og fremmest er trÃĶning af deepfake-modeller tidskrÃĶvende og ressource-kritisk, og brugen af “kompatible” vÃĶrt-ansigter/kroppe frigÃļr GPU-cykler og epoker til at koncentrere sig om de relativt uforanderlige indre omrÃĨder af ansigtet, som vi bruger til at skelne identitet (siden variabler sÃĨsom vÃĶgtfluktuation og aldring er mindst sandsynlige for at ÃĶndre disse kerneansigtskarakteristika pÃĨ kort sigt).

For det andet har de fleste deepfake-tilgange (og dette er bestemt tilfÃĶldet med DeepFaceLab, softwaren brugt af de mest populÃĶre eller berygtede praktikere) en begrÃĶnsning i deres evne til at replikere “end of face”-grÃĶnser sÃĨsom kind og kÃĶbeomrÃĨder og er begrÃĶnsede af, at deres upstream (2017) kode ikke omfattede denne problemstilling.

I tilfÃĶlde, hvor identiteterne ikke matcher godt, mÃĨ deepfake-algoritmen “inpaint” baggrundsomrÃĨder omkring ansigtet, hvilket den gÃļr klodset pÃĨ bedste, selv i hÃĶnderne pÃĨ de bedste deepfakere, sÃĨsom Ctrl Shift Face, hvis output blev brugt i artiklens studier.

The best of the best: stills from a deepfake video from acclaimed deepfaker Ctrl-Shift-Face, swapping Jim Carrey over Gary Oldman. This work arguably represents some of the best output currently available via DeepFaceLab and post-processing techniques. Nonetheless, the swaps remains limited to the relatively scant attention that DFL gives to the outer face, requiring a Herculean effort of data curation and training to address the outermost lineaments. Source: https://www.youtube.com/watch?v=x8igrh1eyLk

The best of the best: stills from a deepfake video from acclaimed deepfaker Ctrl-Shift-Face, swapping Jim Carrey over Gary Oldman. This work arguably represents some of the best output currently available via DeepFaceLab and post-processing techniques. Nonetheless, the swaps remain limited to the relatively scant attention that DFL gives to the outer face, requiring a Herculean effort of data curation and training to address the outermost lineaments. Source: https://www.youtube.com/watch?v=x8igrh1eyLk

Dette “sleight of hand”, eller afledning af opmÃĶrksomhed, undgÃĨr i stor udstrÃĶkning offentlighedens opmÃĶrksomhed i den nuvÃĶrende bekymring over deepfakes’ voksende realisme, fordi vores kritiske evner omkring deepfakes stadig er under udvikling forbi “shock and awe”-stadiet.

Split Identities

Den nye artikel bemÃĶrker, at de fleste tidligere metoder for deepfake-detektion afhÃĶnger af artefakter, der forrÃĨder udskiftningsprocessen, sÃĨsom inconsistente hovedposer og blinkning, blandt mange andre teknikker. Kun denne uge har en ny deepfake-detektionsartikel forslagt at bruge “signatur” af de forskellige modeltyper i FaceSwap-rammen til at hjÃĶlpe med at identificere forfalsket video skabt med det (se billedet nedenfor).

Identifying deepfakes by characterizing the signatures of different model types in the FaceSwap framework. Source: https://arxiv.org/pdf/2202.12951.pdf

Identifying deepfakes by characterizing the signatures of different model types in the FaceSwap framework. Source: https://arxiv.org/pdf/2202.12951.pdf

I modsÃĶtning hertil skaber ICT’s arkitektur to separate, indbyrdes identiteter for en person, som hver isÃĶr skal verificeres, fÃļr hele identiteten kan konkluderes som “sandt” billede eller video.

Architecture for the training and testing phases of ICT.

Architecture for the training and testing phases of ICT.

Splitningen af identiteter faciliteres af en vision Transformer, som udfÃļrer ansigtsidentifikation, fÃļr det opdeler de undersÃļgte omrÃĨder i tokens, der tilhÃļrer de indre eller ydre identiteter.

Distributing patches among the two parallel identity signifiers.

Distributing patches among the two parallel identity signifiers.

Artiklen fastslÃĨr:

‘DesvÃĶrre tenderer eksisterende ansigtsverifikationsmetoder til at karakterisere den mest diskriminerende region, dvs. det indre ansigt til verifikation og mislykkes med at fange identitetsinformationen i det ydre ansigt. Med Identity Consistency Transformer trÃĶner vi en model til at lÃĶre en par identitetsvektorer, en for det indre ansigt og en for det ydre ansigt, ved at designe en Transformer, sÃĨledes at de indre og ydre identiteter kan lÃĶres samtidigt i en sammenhÃĶngende model.’

Da der ikke findes en eksisterende model for denne identifikationsprotokol, har forfatterne udviklet en ny type konsistens-tab, der kan fungere som en mÃĨlestok for ÃĶgthed. De “indre token” og “ydre token”, der resulterer fra identitetsudtrÃĶkningsmodellen, tilfÃļjes de mere konventionelle patch-embeddings, der produceres af ansigtsidentifikationsrammer.

Data og TrÃĶning

ICT-netvÃĶrket blev trÃĶnet pÃĨ Microsoft Research’s MS-Celeb-1M dataset, som indeholder 10 millioner celebrity-ansigtsbilleder, der dÃĶkker 1 million identiteter, herunder skuespillere, politikere og mange andre typer fremtrÃĶdende personer. IfÃļlge proceduren for tidligere metode Face X-ray (en anden Microsoft Research-initiativ), genererer ICT’s egen fake-genereringsrutine indre og ydre omrÃĨder af ansigter fra dette dataset for at skabe materiale, som kan testes pÃĨ algoritmen.

Til at udfÃļre disse interne udskiftninger, identificerer ICT to billeder i datasettet, der viser lignende hovedposer og ansigtslandemÃĶrker, genererer en maskeringsregion af de centrale trÃĶk (hvor en udskiftning kan udfÃļres) og udfÃļrer en deepfake-udskiftning med RGB-farvekorrektion.

Grunden til, at ICT er begrÃĶnset til celebrity-identifikation, er, at det afhÃĶnger (i dets mest effektive variation) af en ny reference-sÃĶt, der inkorporerer afledte ansigtsvektorer fra en central korpus (i dette tilfÃĶlde MS-Celeb-1M, selv om referencen kunne udvides til netvÃĶrks-tilgÃĶngelige billeder, som sandsynligvis kun ville eksistere i tilstrÃĶkkelig kvalitet og kvantitet for velkendte offentlige figurer).

Disse afledte vektor-sÃĶt-par tilfÃļjer autentificerings-token til at verificere de indre og ydre ansigtsomrÃĨder i tandem.

Forfatterne bemÃĶrker, at tokenene, der erhverves fra disse metoder, reprÃĶsenterer “hÃļj-niveau”-funktioner, der resulterer i en deepfake-detektionsproces, der er mere sandsynlig at overleve udfordrende miljÃļer sÃĨsom lav oplÃļsning eller anden degraderet video.

Vigtigt er, at ICT ikke sÃļger efter artefakt-baseret bevis, men er fokuseret pÃĨ identitetsverifikationsmetoder mere i overensstemmelse med ansigtsgenkendelsesteknikker – en tilgang, der er svÃĶr med lav-volumen data, som er tilfÃĶldet med undersÃļgelsen af tilfÃĶlde af deepfake-revenge-porn mod ikke-berÃļmte mÃĨl.

Tests

TrÃĶnet pÃĨ MS-Celeb-1M, blev ICT derefter opdelt i reference-assisterede og “blinde” versioner af algoritmen og testet mod en rÃĶkke konkurrerende datasets og metoder. Disse inkluderer FaceForensics++ (FF++), et dataset af 1000 autentiske og deepfake-videoer skabt over fire metoder, herunder Face2Face og FaceSwap; Google’s Deepfake Detection (DFD), som ogsÃĨ bestÃĨr af tusinder af Google-genererede deepfake-videoer; Celeb-DeepFake v1 (CD1), som indeholder 408 virkelige og 795 syntetiserede, lav-artefakt-videoer; Celeb-DeepFake v2, en udvidelse af V1, der indeholder 590 virkelige og 5.639 fake-videoer; og Kinas 2020 Deeper-Forensics (Deeper).

Det er datasets; detektionsmetoderne i test-udfordringerne var Multi-task, MesoInc4, Capsule, Xception-c0, c2 (en metode anvendt i FF++), FWA/DSP-FW fra University at Albany, Two-Branch, PCL+I2G og Yuval Nirkins kontekst-discrÃĐpancy-metode.

De nÃĶvnte detektionsmetoder er rettet mod at detektere bestemte typer ansigtsmanipulation. Ud over disse, testede artiklens forfattere ogsÃĨ mere generelle deepfake-detektionsmuligheder Face X-ray, Michigan State University’s FFD, CNNDetection og Patch-Forensics fra MIT CSAIL.

Det mest tydelige resultat fra testen er, at de konkurrerende metoder dramatisk falder i effektivitet, nÃĨr videooplÃļsning og kvalitet sÃĶnkes. Da nogle af de mest alvorlige muligheder for deepfake-gennembrud af vores diskriminerende krÃĶfter ligger (ikke mindst pÃĨ nuvÃĶrende tidspunkt) i non-HD eller anden kvalitets-kompromitteret video, synes dette at vÃĶre et betydeligt resultat.

I resultattabellen ovenfor ses effekten af de forskellige deepfake-detektionsmetoder pÃĨ de usete datasets. GrÃĨ og stjernemÃĶrkede resultater indikerer sammenligning fra oprindeligt publicerede resultater i lukkede projekter, som ikke kan verificeres eksternt. Over nÃĶsten alle sammenlignelige rammer udfÃļrer ICT bedre end de konkurrerende deepfake-detektionsmetoder (vist i fed skrift) over de testede datasets.

Som et tillÃĶg test, kÃļrte forfatterne indhold fra YouTube-kanalen af den anerkendte deepfaker Ctrl Shift Face og fandt, at konkurrerende metoder opnÃĨede betydeligt lavere identifikationsscores:

BemÃĶrkelsesvÃĶrdigt her er, at FF++-metoder (Xception-c23) og FFD, som opnÃĨr nogle af de hÃļjeste scores over nogle af testdataserne i den nye artikels generelle tests, her opnÃĨr en langt lavere score end ICT i en “virkelig verden”-kontekst af hÃļjeffort deepfake-indhold.

Forfatterne konkluderer artiklen med hÃĨbet om, at dens resultater vil styre deepfake-detektionsfÃĶllesskabet mod lignende initiativer, der koncentrerer sig om mere let generaliserbare hÃļj-niveau-funktioner og vÃĶk fra “den kolde krig” af artefakt-detektion, hvor de seneste metoder rutinemÃĶssigt omgÃĨs af udviklinger i deepfake-rammer eller af andre faktorer, der gÃļr sÃĨdanne metoder mindre robuste.

Se det tilhÃļrende supplementÃĶre video nedenfor for flere eksempler pÃĨ ICT, der identificerer deepfake-indhold, der ofte outfoxer alternative metoder.

 

 

Offentliggjort fÃļrste gang den 4. marts 2022.

Forfatter til maskinlÃĶringsartikler, domÃĶneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold pÃĨ Metaphysic.ai, indtil oplÃļsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]