Andersons vinkel

Identifikation af celebrity deepfakes fra ydre ansigtsområder

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et nyt samarbejde mellem Microsoft (MSFT ) og et kinesisk universitet har foreslået en ny måde at identificere celebrity deepfakes på, ved at udnytte svaghederne i nuværende deepfake-teknikker til at genkende identiteter, der er “projiceret” på andre mennesker.

Tilgangen kaldes Identity Consistency Transformer (ICT), og fungerer ved at sammenligne de ydre dele af ansigtet (kæbe, kindben, hårlinje og andre ydre marginal linjement) med ansigtets indre dele. Systemet udnytter offentligt tilgængelige billeddata af berømte personer, hvilket begrænser dets effektivitet til populære celebriteter, hvis billeder er tilgængelige i store mængder i computer vision-datasets og på internettet.

The forgery coverage of faked faces across seven techniques: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; and DF-VAE. Source: https://arxiv.org/pdf/2203.01318.pdf

The forgery coverage of faked faces across seven techniques: DeepFake in FF+; DeepFake in Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; and DF-VAE. Popular packages such as DeepFaceLab and FaceSwap provide similarly constrained coverage. Source: https://arxiv.org/pdf/2203.01318.pdf

Som billedet ovenfor viser, er nuværende metoder for deepfaking ret ressource-krævende og afhænger af “kompatible” vært-ansigter/kroppe for at minimere beviser for ansigtsudskiftning.

Selv om forskellige metoder kan omfatte hele panden og en stor del af hagen og kindbenets områder, er de alle mere eller mindre begrænsede inden for rammen af vært-ansigtet.

A saliency map that emphasizes the 'inner' and 'outer' identities calculated by ICT. Where an inner facial match is established but an outer identity does not correspond, ICT evaluates the image as false.

A saliency map that emphasizes the ‘inner’ and ‘outer’ identities calculated by ICT. Where an inner facial match is established but an outer identity does not correspond, ICT evaluates the image as false.

I tests viste ICT sig i stand til at detektere deepfake-indhold i fake-venlige omgivelser såsom lav opløsning video, hvor indholdet af hele videoen er degraderet af kompressionsarter, hvilket hjælper med at skjule rester af beviser for deepfake-processen – en omstændighed, der forvirrer mange konkurrerende deepfake-detektionsmetoder.

ICT outperforms contenders in recognizing deepfake content. See video embedded at end of article for more examples and better resolution. Source: https://www.youtube.com/watch?v=zgF50dcymj8

ICT outperforms contenders in recognizing deepfake content. See video embedded at end of article for more examples and better resolution. See embedded source video at end of article for further examples. Source: https://www.youtube.com/watch?v=zgF50dcymj8

Den artikel er titlen Protecting Celebrities with Identity Consistency Transformer, og kommer fra ni forskere, der er tilknyttet University of Science and Technology of China, Microsoft Research Asia og Microsoft Cloud + AI.

TrosvigtighedsGapet

Der er mindst to grunde til, hvorfor populære ansigtsudskiftningsalgoritmer såsom DeepFaceLab og FaceSwap negligerer de ydre områder af de udskiftede ansigtsidentiteter.

Først og fremmest er træning af deepfake-modeller tidskrævende og ressource-kritisk, og brugen af “kompatible” vært-ansigter/kroppe frigør GPU-cykler og epoker til at koncentrere sig om de relativt uforanderlige indre områder af ansigtet, som vi bruger til at skelne identitet (siden variabler såsom vægtfluktuation og aldring er mindst sandsynlige for at ændre disse kerneansigtskarakteristika på kort sigt).

For det andet har de fleste deepfake-tilgange (og dette er bestemt tilfældet med DeepFaceLab, softwaren brugt af de mest populære eller berygtede praktikere) en begrænsning i deres evne til at replikere “end of face”-grænser såsom kind og kæbeområder og er begrænsede af, at deres upstream (2017) kode ikke omfattede denne problemstilling.

I tilfælde, hvor identiteterne ikke matcher godt, må deepfake-algoritmen “inpaint” baggrundsområder omkring ansigtet, hvilket den gør klodset på bedste, selv i hænderne på de bedste deepfakere, såsom Ctrl Shift Face, hvis output blev brugt i artiklens studier.

The best of the best: stills from a deepfake video from acclaimed deepfaker Ctrl-Shift-Face, swapping Jim Carrey over Gary Oldman. This work arguably represents some of the best output currently available via DeepFaceLab and post-processing techniques. Nonetheless, the swaps remains limited to the relatively scant attention that DFL gives to the outer face, requiring a Herculean effort of data curation and training to address the outermost lineaments. Source: https://www.youtube.com/watch?v=x8igrh1eyLk

The best of the best: stills from a deepfake video from acclaimed deepfaker Ctrl-Shift-Face, swapping Jim Carrey over Gary Oldman. This work arguably represents some of the best output currently available via DeepFaceLab and post-processing techniques. Nonetheless, the swaps remain limited to the relatively scant attention that DFL gives to the outer face, requiring a Herculean effort of data curation and training to address the outermost lineaments. Source: https://www.youtube.com/watch?v=x8igrh1eyLk

Dette “sleight of hand”, eller afledning af opmærksomhed, undgår i stor udstrækning offentlighedens opmærksomhed i den nuværende bekymring over deepfakes’ voksende realisme, fordi vores kritiske evner omkring deepfakes stadig er under udvikling forbi “shock and awe”-stadiet.

Split Identities

Den nye artikel bemærker, at de fleste tidligere metoder for deepfake-detektion afhænger af artefakter, der forråder udskiftningsprocessen, såsom inconsistente hovedposer og blinkning, blandt mange andre teknikker. Kun denne uge har en ny deepfake-detektionsartikel forslagt at bruge “signatur” af de forskellige modeltyper i FaceSwap-rammen til at hjælpe med at identificere forfalsket video skabt med det (se billedet nedenfor).

Identifying deepfakes by characterizing the signatures of different model types in the FaceSwap framework. Source: https://arxiv.org/pdf/2202.12951.pdf

Identifying deepfakes by characterizing the signatures of different model types in the FaceSwap framework. Source: https://arxiv.org/pdf/2202.12951.pdf

I modsætning hertil skaber ICT’s arkitektur to separate, indbyrdes identiteter for en person, som hver især skal verificeres, før hele identiteten kan konkluderes som “sandt” billede eller video.

Architecture for the training and testing phases of ICT.

Architecture for the training and testing phases of ICT.

Splitningen af identiteter faciliteres af en vision Transformer, som udfører ansigtsidentifikation, før det opdeler de undersøgte områder i tokens, der tilhører de indre eller ydre identiteter.

Distributing patches among the two parallel identity signifiers.

Distributing patches among the two parallel identity signifiers.

Artiklen fastslår:

‘Desværre tenderer eksisterende ansigtsverifikationsmetoder til at karakterisere den mest diskriminerende region, dvs. det indre ansigt til verifikation og mislykkes med at fange identitetsinformationen i det ydre ansigt. Med Identity Consistency Transformer træner vi en model til at lære en par identitetsvektorer, en for det indre ansigt og en for det ydre ansigt, ved at designe en Transformer, således at de indre og ydre identiteter kan læres samtidigt i en sammenhængende model.’

Da der ikke findes en eksisterende model for denne identifikationsprotokol, har forfatterne udviklet en ny type konsistens-tab, der kan fungere som en målestok for ægthed. De “indre token” og “ydre token”, der resulterer fra identitetsudtrækningsmodellen, tilføjes de mere konventionelle patch-embeddings, der produceres af ansigtsidentifikationsrammer.

Data og Træning

ICT-netværket blev trænet på Microsoft Research’s MS-Celeb-1M dataset, som indeholder 10 millioner celebrity-ansigtsbilleder, der dækker 1 million identiteter, herunder skuespillere, politikere og mange andre typer fremtrædende personer. Ifølge proceduren for tidligere metode Face X-ray (en anden Microsoft Research-initiativ), genererer ICT’s egen fake-genereringsrutine indre og ydre områder af ansigter fra dette dataset for at skabe materiale, som kan testes på algoritmen.

Til at udføre disse interne udskiftninger, identificerer ICT to billeder i datasettet, der viser lignende hovedposer og ansigtslandemærker, genererer en maskeringsregion af de centrale træk (hvor en udskiftning kan udføres) og udfører en deepfake-udskiftning med RGB-farvekorrektion.

Grunden til, at ICT er begrænset til celebrity-identifikation, er, at det afhænger (i dets mest effektive variation) af en ny reference-sæt, der inkorporerer afledte ansigtsvektorer fra en central korpus (i dette tilfælde MS-Celeb-1M, selv om referencen kunne udvides til netværks-tilgængelige billeder, som sandsynligvis kun ville eksistere i tilstrækkelig kvalitet og kvantitet for velkendte offentlige figurer).

Disse afledte vektor-sæt-par tilføjer autentificerings-token til at verificere de indre og ydre ansigtsområder i tandem.

Forfatterne bemærker, at tokenene, der erhverves fra disse metoder, repræsenterer “høj-niveau”-funktioner, der resulterer i en deepfake-detektionsproces, der er mere sandsynlig at overleve udfordrende miljøer såsom lav opløsning eller anden degraderet video.

Vigtigt er, at ICT ikke søger efter artefakt-baseret bevis, men er fokuseret på identitetsverifikationsmetoder mere i overensstemmelse med ansigtsgenkendelsesteknikker – en tilgang, der er svær med lav-volumen data, som er tilfældet med undersøgelsen af tilfælde af deepfake-revenge-porn mod ikke-berømte mål.

Tests

Trænet på MS-Celeb-1M, blev ICT derefter opdelt i reference-assisterede og “blinde” versioner af algoritmen og testet mod en række konkurrerende datasets og metoder. Disse inkluderer FaceForensics++ (FF++), et dataset af 1000 autentiske og deepfake-videoer skabt over fire metoder, herunder Face2Face og FaceSwap; Google’s Deepfake Detection (DFD), som også består af tusinder af Google-genererede deepfake-videoer; Celeb-DeepFake v1 (CD1), som indeholder 408 virkelige og 795 syntetiserede, lav-artefakt-videoer; Celeb-DeepFake v2, en udvidelse af V1, der indeholder 590 virkelige og 5.639 fake-videoer; og Kinas 2020 Deeper-Forensics (Deeper).

Det er datasets; detektionsmetoderne i test-udfordringerne var Multi-task, MesoInc4, Capsule, Xception-c0, c2 (en metode anvendt i FF++), FWA/DSP-FW fra University at Albany, Two-Branch, PCL+I2G og Yuval Nirkins kontekst-discrépancy-metode.

De nævnte detektionsmetoder er rettet mod at detektere bestemte typer ansigtsmanipulation. Ud over disse, testede artiklens forfattere også mere generelle deepfake-detektionsmuligheder Face X-ray, Michigan State University’s FFD, CNNDetection og Patch-Forensics fra MIT CSAIL.

Det mest tydelige resultat fra testen er, at de konkurrerende metoder dramatisk falder i effektivitet, når videoopløsning og kvalitet sænkes. Da nogle af de mest alvorlige muligheder for deepfake-gennembrud af vores diskriminerende kræfter ligger (ikke mindst på nuværende tidspunkt) i non-HD eller anden kvalitets-kompromitteret video, synes dette at være et betydeligt resultat.

I resultattabellen ovenfor ses effekten af de forskellige deepfake-detektionsmetoder på de usete datasets. Grå og stjernemærkede resultater indikerer sammenligning fra oprindeligt publicerede resultater i lukkede projekter, som ikke kan verificeres eksternt. Over næsten alle sammenlignelige rammer udfører ICT bedre end de konkurrerende deepfake-detektionsmetoder (vist i fed skrift) over de testede datasets.

Som et tillæg test, kørte forfatterne indhold fra YouTube-kanalen af den anerkendte deepfaker Ctrl Shift Face og fandt, at konkurrerende metoder opnåede betydeligt lavere identifikationsscores:

Bemærkelsesværdigt her er, at FF++-metoder (Xception-c23) og FFD, som opnår nogle af de højeste scores over nogle af testdataserne i den nye artikels generelle tests, her opnår en langt lavere score end ICT i en “virkelig verden”-kontekst af højeffort deepfake-indhold.

Forfatterne konkluderer artiklen med håbet om, at dens resultater vil styre deepfake-detektionsfællesskabet mod lignende initiativer, der koncentrerer sig om mere let generaliserbare høj-niveau-funktioner og væk fra “den kolde krig” af artefakt-detektion, hvor de seneste metoder rutinemæssigt omgås af udviklinger i deepfake-rammer eller af andre faktorer, der gør sådanne metoder mindre robuste.

Se det tilhørende supplementære video nedenfor for flere eksempler på ICT, der identificerer deepfake-indhold, der ofte outfoxer alternative metoder.

 

 

Offentliggjort første gang den 4. marts 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai