Andersonův úhel
Identifikace deepfakeů slavných osob z vnějších oblastí obličeje

Nová spolupráce mezi Microsoftem a čínskou univerzitou navrhla nový způsob identifikace deepfakeů slavných osob, využívající nedostatků současných technik deepfake k rozpoznání identit, které byly „projektovány“ na jiné lidi.
Přístup se nazývá Identity Consistency Transformer (ICT), a funguje tak, že porovnává vnější části obličeje (čelist, lícní kosti, vlasová linie a další vnější linie) s vnitřní částí obličeje. Systém využívá běžně dostupná veřejná obrazová data slavných osob, což omezuje jeho účinnost na populární celebrity, jejichž obrázky jsou dostupné ve velkém počtu ve veřejně dostupných datech počítačového vidění a na internetu.

Padělaná oblast obličeje u sedmi technik: DeepFake v FF+; DeepFake v Google DeepFake Detection; DeepFaceLab; Face2Face; FSGAN; a DF-VAE. Populární balíčky, jako je DeepFaceLab a FaceSwap, poskytují podobně omezenou pokrytí. Source: https://arxiv.org/pdf/2203.01318.pdf
Jako ilustruje výše uvedený obrázek, současné populární metody pro deepfaking jsou bastante omezené a spoléhají na host-obličeje/těla, aby minimalizovaly důkazy o výměně obličeje.
Přestože různé metody mohou zahrnovat celou čelo a velkou část brady a lícních kostí, jsou všechny více nebo méně omezené uvnitř rámu host-obličeje.

Mapa saliency, která zdůrazňuje „vnitřní“ a „vnější“ identity vypočítané ICT. Kde je vnitřní obličejová shoda zavedena, ale vnější identita neodpovídá, ICT hodnotí obraz jako falešný.
V testech ICT prokázal schopnost detekovat deepfake obsah v low-resolution videu, kde je celý video degradován kompresními artefakty, což pomáhá skrýt zbytkové důkazy deepfake procesu – okolnost, která znepokojuje mnoho konkurenčních metod detekce deepfake.

ICT překonává konkurenty v rozpoznávání deepfake obsahu. Viz video na konci článku pro více příkladů a lepší rozlišení. Viz video na konci článku pro další příklady. Source: https://www.youtube.com/watch?v=zgF50dcymj8
Článek článku se nazývá Protecting Celebrities with Identity Consistency Transformer, a pochází od devíti výzkumníků z University of Science and Technology of China, Microsoft Research Asia, a Microsoft Cloud + AI.
Mezera důvěryhodnosti
Existují alespoň dva důvody, proč populární algoritmy pro výměnu obličeje, jako je DeepFaceLab a FaceSwap, zanedbávají vnější oblasti obličejové identity.
Prvním důvodem je, že trénování modelů deepfake je časově náročné a kritické pro zdroje, a adopce „kompatibilních“ host-obličejů/těl uvolňuje GPU cykly a epochy pro soustředění na relativně neměnné vnitřní oblasti obličeje, které používáme k rozlišení identity (protože proměnné, jako je kolísání hmotnosti a stárnutí, jsou nejméně pravděpodobné, že změní tyto základní rysy obličeje v krátkém období).
Druhým důvodem je, že většina přístupů deepfake (a to je určitě případ DeepFaceLab, software používaný nejznámějšími nebo nejznámějšími praktiky) má omezenou schopnost replikovat „koncové“ okraje obličeje, jako je oblast tváří a čelisti, a jsou omezeny skutečností, že jejich upstream (2017) kód nezabýval se touto otázkou.
V případech, kdy identity neodpovídají dobře, musí algoritmus deepfake „doplnit“ pozadí kolem obličeje, což dělá nešikovně, i v rukou nejlepších deepfakers, jako je Ctrl Shift Face, jehož výstup byl použit v studiích článku.

Nejlepší z nejlepších: snímky z deepfake videa od uznávaného deepfakera Ctrl-Shift-Face, vyměňujícího Jima Carreye za Garyho Oldmana. Tato práce pravděpodobně představuje některé z nejlepších výstupů目前 dostupných prostřednictvím DeepFaceLab a technik post-processing. Přestože výměny zůstávají omezeny na relativně skrovnou pozornost, kterou DFL věnuje vnějšímu obličeji, vyžadující titánské úsilí datové kurace a tréninku, aby se zabývaly vnějšími lineamenty. Source: https://www.youtube.com/watch?v=x8igrh1eyLk
Tento „kouzelný trik“, nebo odvrácení pozornosti, většinou uniká veřejnému povědomí v současném znepokojení nad rostoucí realističností deepfake, protože naše kritické schopnosti kolem deepfake jsou stále ve fázi „šoku a úžasu“.
Rozdělené identity
Nový článek uvádí, že většina předchozích metod detekce deepfake se spoléhá na artefakty, které zradí proces výměny, jako je nesouhlasné polohy hlavy a mrknutí, mezi mnoha dalšími technikami. Pouze tento týden, další nový článek o detekci deepfake navrhl použití „signatury“ různých modelových typů v rámci FaceSwap, aby pomohl identifikovat padělaná videa vytvořená s ním (viz obrázek níže).

Identifikace deepfake pomocí charakterizace signatur různých modelových typů v rámci FaceSwap. Source: https://arxiv.org/pdf/2202.12951.pdf
Naproti tomu architektura ICT vytváří dvě samostatné vnořené identity pro osobu, z nichž každá musí být ověřena, než je celá identita uzavřena jako „pravdivá“ nebo „falešná“.

Architektura pro fázi tréninku a testování ICT.
Rozdělení identit je usnadněno vizuální Transformerem, který provádí identifikaci obličeje před rozdělením prozkoumaných oblastí do tokenů patřících k vnitřním nebo vnějším identitám.

Rozdělení patchů mezi dvě paralelní identifikační znaky.
Článek uvádí:
‘Bohužel, stávající metody ověřování obličeje tendují k charakterizaci nejvíce diskriminativních oblastí, tj. vnitřní obličeje pro ověření a selhávají při zachycení informací o identitě ve vnější oblasti obličeje. S Identity Consistency Transformer, trénujeme model, aby naučil pár identifikačních vektorů, jeden pro vnitřní obličej a druhý pro vnější obličej, navrhnout Transformer, aby vnitřní a vnější identity mohly být naučeny současně v bezproblémovém sjednoceném modelu.’
Jelikož neexistuje žádný existující model pro tento identifikační protokol, autoři vytvořili nový typ konzistence ztráty, který může sloužit jako metrika pro autenticitu. „Vnitřní token“ a „vnější token“, které vyplývají z modelu extrakce identity, jsou přidány k běžným patchovým vložením, které jsou produkovány rámci identifikace obličeje.
Data a trénink
Síť ICT byla trénována na datasetu Microsoft Research MS-Celeb-1M, který obsahuje 10 milionů obrázků slavných osob, pokrývajících jeden milion identit, včetně herců, politiků a mnoha dalších typů prominentních osob. Podle postupu předchozích metod Face X-ray (další iniciativa Microsoft Research), vlastní rutina generování falešných dat ICT vyměňuje vnitřní a vnější oblasti obličeje z tohoto datasetu, aby vytvořila materiál, na kterém lze testovat algoritmus.
Pro provedení těchto vnitřních výměn ICT identifikuje dvě obrázky v datasetu, které vykazují podobné polohy hlavy a obličejové landmaríky, generuje maskovací oblast centrálních rysů (do které lze provést výměnu), a provede deepfake výměnu s RGB barevnou korekcí.
Důvod, proč je ICT omezen na identifikaci slavných osob, je ten, že závisí (v jeho nejúčinnější variaci) na novém referenčním souboru, který zahrnuje odvozené vektory obličeje z centrálního korpusu (v tomto případě MS-Celeb-1M, i když referencia mohla být rozšířena na síťově dostupné obrázky, které by pravděpodobně existovaly pouze v dostatečné kvalitě a množství pro dobře známé veřejné osobnosti).
Tito odvození vektoroví dvojice slouží jako autentizační tokeny pro ověření vnitřních a vnějších oblastí obličeje současně.
Autoři uvádějí, že tokeny získané z těchto metod představují „high-level“ rysy, vedoucí k procesu detekce deepfake, který je více pravděpodobný, že přežije náročné prostředí, jako je low-resolution nebo jinak degradované video.
Klíčovým faktem je, že ICT ne hledá důkazy založené na artefaktech, ale spíše se zaměřuje na metody ověření identity, které jsou více v souladu s technikami rozpoznávání obličeje – přístup, který je obtížný s nízkým objemem dat, jako je tomu u vyšetřování incidentů deepfake pomsty proti nefamous cílům.
Testy
Trénovaná na MS-Celeb-1M, ICT byla poté rozdělena do referenčních a „slepých“ verzí algoritmu a testována proti řadě konkurenčních datasetů a metod. Tyto zahrnovaly FaceForensics++ (FF++), dataset 1000 autentických a deepfake videí vytvořených pomocí čtyř metod, včetně Face2Face a FaceSwap; Googleho Deepfake Detection (DFD), který se skládá z tisíců Google-generovaných deepfake videí; Celeb-DeepFake v1 (CD1), který obsahuje 408 skutečných a 795 syntetizovaných, low-artifact videí; Celeb-DeepFake v2, rozšíření V1, které obsahuje 590 skutečných a 5 639 falešných videí; a Číny 2020 Deeper-Forensics (Deeper).
Tyto jsou datové sady; metody detekce v testovacích výzvách byly Multi-task, MesoInc4, Capsule, Xception-c0, c2 (metoda použita v FF++), FWA/DSP-FW z University at Albany, Two-Branch, PCL+I2G, a Yuval Nirkinova kontext-discrepancy metoda.
Uvedené detekční metody jsou zaměřeny na detekci určitých typů manipulace s obličejem. Kromě těchto, autoři nového článku testovali obecnější nabídky detekce deepfake Face X-ray, Michigan State University FFD, CNNDetection, a Patch-Forensics z MIT CSAIL.
Nejběžnější výsledky z testu jsou, že konkurenční metody dramaticky klesají v účinnosti, jakmile se snižuje rozlišení a kvalita videa. Jelikož některé z nejzávažnějších potenciálů pro deepfake pronikání našich diskriminačních sil leží (nejen v současné době) v non-HD nebo jinak kvalitativně kompromitovaných videích, zdá se, že by to mělo být významný výsledek.

V grafu výsledků výše, modrá a červená linie označují odolnost metod ICT vůči degradaci obrazu ve všech oblastech kromě Gaussian šumu (který není pravděpodobný v případě videa Zoom a webové kamery), zatímco konkurenční metody klesají v spolehlivosti.
V tabulce výsledků níže vidíme účinnost různých metod detekce deepfake na neviditelných datech. Šedé a označené výsledky označují srovnání z původně publikovaných výsledků v uzavřených projektech, které nelze externě ověřit. Napříč téměř všemi srovnatelnými rámci ICT překonává konkurenční přístupy detekce deepfake (zobrazené tučně) na testovaných datech.

Jako další test, autoři spustili obsah z YouTube kanálu uznávaného deepfakera Ctrl Shift Face, a zjistili, že konkurenční metody dosáhly zřetelně horších identifikačních skórů:

Je pozoruhodné, že metody FF++ (Xception-c23) a FFD, které dosáhly některých z nejvyšších skórů v testovacích datech v novém článku, zde dosáhly mnohem nižšího skóre než ICT v „reálném“ kontextu high-effort deepfake obsahu.
Autoři článku uzavírají, že doufají, že výsledky článku povedou komunitu detekce deepfake k podobným iniciativám, které se soustředí na více obecné high-level rysy, a odvrátí se od „studené války“ detekce artefaktů, ve které jsou nejnovější metody rutinně obviňovány z vývoje deepfake rámců, nebo jinými faktory, které činí tyto metody méně odolnými.
Vyzkoušejte doprovodné video níže pro více příkladů ICT, které identifikují deepfake obsah, který často obchází alternativní metody.
Poprvé publikováno 4. března 2022.












