Andersonův úhel
Detektory deepfake se vydávají na nové území: Latentní difuzní modely a GANy

Výhled
V poslední době, komunita výzkumu detekce deepfake, která se od konce roku 2017 téměř výhradně zabývala rámcem založeným na autoencoderu, který debutoval v té době s velkým veřejným ohlasem (a zklamáním), začala projevovat forenzní zájem o méně stagnující architektury, včetně latentních difuzních modelů, jako je DALL-E 2 a Stable Diffusion, a také výstupem Generativních Adversativních Sítí (GAN). Například v červnu, UC Berkeley publikoval výsledky svého výzkumu do vývoje detektoru pro výstup DALL-E 2.
Co zdá se být hnací silou tohoto rostoucího zájmu, je náhlý evoluční skok v schopnostech a dostupnosti latentních difuzních modelů v roce 2022, s uzavřenou a omezenou verzí DALL-E 2 na jaře, následované v pozdním létě senzacionálním otevřením Stable Diffusion stability.ai.
GANy byly také dlouhodobě studovány v tomto kontextu, i když méně intenzivně, protože je velmi obtížné je použít pro přesvědčivé a komplexní video-rekreační lidi; alespoň ve srovnání s již zavedenými balíčky autoencoderu, jako je FaceSwap a DeepFaceLab – a jeho live-streaming bratranec, DeepFaceLive.
V každém případě, galvanizující faktor se zdá být perspektiva následného vývojového sprintu pro video syntézu. Začátek října – a hlavní konferenční sezóna 2022 – byl charakterizován náhlým a neočekávaným řešením různých dlouhodobých problémů video syntézy: sotva Facebook publikoval ukázky své vlastní text-to-video platformy, než Google Research rychle utopil počáteční oslavu oznámením své nové architektury Imagen-to-Video T2V, schopné výstupu vysokého rozlišení (i když pouze prostřednictvím 7-vrstvé sítě upscalerů).
Jestliže věříte, že tento druh věcí přichází ve trojicích, zvažte také stability.ai slib, že “video je na cestě” do Stable Diffusion, zřejmě později v tomto roce, zatímco Stable Diffusion spoluvývojář Runway učinil podobný slib, i když není jasné, zda se týká stejného systému. Discord zpráva ze Stability CEO Emad Mostaque také slibovala ‘audio, video [a] 3d’.
Co se týče nového nabídky několika audio generativních rámců (některé založené na latentní difuzi), a nového difuzního modelu, který může generovat autentické charakterové pohyby, myšlenka, že “statické” rámce, jako jsou GANy a difuzory, budou konečně zaujímat své místo jako podpůrné příslušenství k externím animačním rámcům, začíná získávat reálnou trakci.
Stručně řečeno, zdá se, že svět autoencoderů založených na video deepfake, který může pouze účinně nahradit střední část obličeje, by mohl být do tohoto času v příštím roce zatměn novou generací difuzních založených deepfake schopných technologií – populární, otevřené přístupy s potenciálem fotorealisticky padělat nejen celé tělo, ale celé scény.
Proto, snad, komunita anti-deepfake výzkumu začíná brát image syntézu vážně a uvědomovat si, že může sloužit více účelům než jen generovat falešné LinkedIn profilové fotografie; a že pokud všechny jejich neřešitelné latentní prostory mohou dosáhnout v oblasti temporálního pohybu, je to skutečně velké renderovací příslušenství, že by to mohlo být více než dost.
Pohyblivé obrazy
V každém případě, galvanizující faktor se zdá být perspektiva následného vývojového sprintu pro video syntézu. Začátek října – a hlavní konferenční sezóna 2022 – byl charakterizován náhlým a neočekávaným řešením různých dlouhodobých problémů video syntézy: sotva Facebook publikoval ukázky své vlastní text-to-video platformy, než Google Research rychle utopil počáteční oslavu oznámením své nové architektury Imagen-to-Video T2V, schopné výstupu vysokého rozlišení (i když pouze prostřednictvím 7-vrstvé sítě upscalerů).
Jestliže věříte, že tento druh věcí přichází ve trojicích, zvažte také stability.ai slib, že “video je na cestě” do Stable Diffusion, zřejmě později v tomto roce, zatímco Stable Diffusion spoluvývojář Runway učinil podobný slib, i když není jasné, zda se týká stejného systému. Discord zpráva ze Stability CEO Emad Mostaque také slibovala ‘audio, video [a] 3d’.
Co se týče nového nabídky několika audio generativních rámců (některé založené na latentní difuzi), a nového difuzního modelu, který může generovat autentické charakterové pohyby, myšlenka, že “statické” rámce, jako jsou GANy a difuzory, budou konečně zaujímat své místo jako podpůrné příslušenství k externím animačním rámcům, začíná získávat reálnou trakci.
Stručně řečeno, zdá se, že svět autoencoderů založených na video deepfake, který může pouze účinně nahradit střední část obličeje, by mohl být do tohoto času v příštím roce zatměn novou generací difuzních založených deepfake schopných technologií – populární, otevřené přístupy s potenciálem fotorealisticky padělat nejen celé tělo, ale celé scény.
Blade Runner
Poslední dvě práce, které se zabývají latentní difuzí a GAN-založenou detekcí deepfake, jsou, resp., DE-FAKE: Detekce a atribuce falešných obrazů generovaných text-to-image difuzními modely, spolupráce mezi CISPA Helmholtz Center for Information Security a Salesforce; a BLADERUNNER: Rychlá protiváha pro syntetické (AI-generované) StyleGAN obličeje, od Adama Doriana Wonga z MIT Lincoln Laboratory.
Než vysvětluje novou metodu, druhá práce se zabývá předchozími přístupy k určení, zda je obraz generován GANem (práce se zabývá konkrétně NVIDIA StyleGAN rodinou).
“Brady Bunch” metoda – možná neznamená nic pro kohokoliv, kdo neviděl TV v 70. letech nebo kdo zmeškal filmové adaptace 90. let – identifikuje GAN-falešný obsah na základě fixních pozic, kteréertain části GAN obličeje jsou určeny k obsazení, kvůli rote a šablonové povaze “výrobního procesu”.

The ‘Brady Bunch’ metoda propojená s webcastem z SANS institutu v roce 2022: GAN-založený generátor obličeje bude provádět nepravděpodobně uniformní umístění určitých obličejových rysů, prozrazující původ fotografie, v určitých případech. Zdroj: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf
Jiným užitečným známým indikátorem je StyleGANova častá neschopnost vykreslit více obličejů (první obrázek níže), pokud je to nutné, stejně jako jeho nedostatek talentu v koordinaci doplňků (střední obrázek níže), a tendence použít vlasovou linii jako začátek improvizovaného klobouku (třetí obrázek níže).

Třetí metoda, kterou výzkumník upozorňuje, je foto překrytí (příklad lze vidět v naší srpnu článku o AI-pomocném diagnostikování duševních poruch), který používá kompoziční “obrazové překrytí” software, jako je série CombineZ, pro spojení více obrázků do jednoho obrázku, často odhalující podkladové společné rysy – potenciální indikaci syntézy.

Architektura navrhovaná v nové práci je nazvaná (možná proti všem SEO radám) Blade Runner, odkazující na Voight-Kampff test, který určuje, zda jsou antagonisté ve sci-fi franšíze “falešní” nebo ne.
Roura se skládá ze dvou fází, první z nich je PapersPlease analyzer, který může vyhodnotit data získaná z známých GAN-obličejových webových stránek, jako je thispersondoesnotexist.com nebo generated.photos.

Though a cut-down verze kódu může být prohlédnuta na GitHub (viz níže), málo detailů je poskytováno o tomto modulu, kromě toho, že OpenCV a DLIB jsou použity pro obkreslení a detekci obličejů v získaném materiálu.
Druhý modul je AmongUs detektor. Systém je navržen pro vyhledávání koordinovaného umístění očí ve fotografiích, trvalým rysem StyleGANova výstupu obličeje, typickým v “Brady Bunch” scénáři popsaném výše. AmongUs je poháněn standardním 68-landmark detektorem.

Obličejové body anotace prostřednictvím Intelligent Behaviour Understanding Group (IBUG), jehož kód pro obličejové body je použit v Blade Runner balíčku.
AmongUs závisí na předem naučených landmarkech založených na známých “Brady Bunch” souřadnicích z PapersPlease a je určen pro použití proti živým, web-orientovaným vzorkům StyleGAN-založených obličejových obrazů.
Blade Runner, autor navrhuje, je plug-and-play řešení určené pro společnosti nebo organizace, které postrádají zdroje pro vývoj vlastních řešení pro detekci deepfake; a “základní opatření, aby se získalo čas pro trvalá protiváha”.
Skutečně, v tomto sektoru, který je tak volatilní a rychle se vyvíjí, nejsou mnoho speciálních nebo cloudových řešení, na která by se mohla společnost spolehnout.
Though Blade Runner vykonává špatně proti brýlovým StyleGAN-falešným lidem, je to relativně běžný problém napříč podobnými systémy, které očekávají, že budou moci vyhodnotit oči jako základní body – které jsou v takových případech zakryty.
Zkrácená verze Blade Runner byla publikována jako otevřený zdroj na GitHub. Více funkcionalit proprietární verze existuje, která může zpracovat více fotografií, než je jeden snímek na operaci otevřeného repozitáře. Autor má v úmyslu, říká, aktualizovat verzi GitHubu na stejnou úroveň, jakmile to čas dovolí. Také připouští, že StyleGAN se pravděpodobně vyvine za hranice svých známých nebo současných slabostí, a software bude muset také vyvíjet se.
DE-FAKE
DE-FAKE architektura má za cíl nejen dosáhnout “univerzální detekci” pro obrazy generované text-to-image difuzními modely, ale také poskytnout metodu pro určení, který latentní difuzní model vygeneroval obraz.

Univerzální detekční rámec v DE-FAKE se zabývá místními obrázky, hybridním rámcem (zelený) a otevřeným světem obrázků (modrý). Zdroj: http://export.arxiv.org/pdf/2210.06998
Upřímně, v tuto chvíli, je to poměrně jednoduchý úkol, protože všechny populární latentní difuzní modely – uzavřené nebo otevřené – mají pozorovatelné rozlišovací rysy.
<p Navíc, většina z nich sdílí některé společné slabosti, jako je tendence odříznout hlavy, protože náhodným způsobem, jakým jsou nekvadrátové webové snímky vstřebávány do masivních datových sad, které pohání systémy, jako je DALL-E 2, Stable Diffusion a MidJourney:

Latentní difuzní modely, stejně jako všechny počítačové vize modely, vyžadují čtvercový formát vstupu; ale agregovaná webová snímání, která pohání LAION5B dataset, nabízí žádné ‘luxusní doplňky’, jako je schopnost rozpoznat a zaměřit se na obličeje (nebo cokoliv jiného), a místo toho je ořezává quite brutálně. Jakmile jsou tyto ‘ořezané’ části vycvičeny, stanou se normalizovanými a velmi často se objevují ve výstupu latentních difuzních systémů, jako je Stable Diffusion. Zdroje: https://blog.novelai.net/novelai-improvements-on-stable-diffusion-e10d38db82ac a Stable Diffusion.
DE-FAKE je navržen tak, aby byl algoritmem-agnostic, dlouho žádaným cílem autoencoder anti-deepfake výzkumníků, a v současné době je to poměrně dosažitelný cíl ve vztahu k latentním difuzním systémům.
Architektura používá OpenAI’s Contrastive Language-Image Pretraining (CLIP) multimodální knihovnu – základní prvek ve Stable Diffusion a rychle se stává srdcem nové vlny image/video syntézích – jako způsob, jak extrahovat vložené objekty z “falšovaných” latentních difuzních obrazů a trénovat klasifikátor na pozorovaných vzorcích a třídách.
V více “černé skříňce” scénáři, kde PNG chunky, které drží informace o generativním procesu, byly již dlouho odstraněny uploadovacími procesy a z jiných důvodů, výzkumníci používají Salesforce BLIP framework (také součást alespoň jedné distribuce Stable Diffusion) pro “slepé” dotazování obrazů na pravděpodobnou semantickou strukturu promptů, které je vytvořily.

Výzkumníci použili Stable Diffusion, Latent Diffusion (samostatný produkt), GLIDE a DALL-E 2 k vytvoření trénovací a testovací datové sady pomocí MSCOCO a Flickr30k.
Normálně bychom se podívali na výsledky výzkumníků poměrně extenzivně pro novou architekturu; ale ve skutečnosti, výsledky DE-FAKE se zdají být více užitečné jako budoucí benchmark pro pozdější iterace a podobné projekty, než jako smysluplná metrika úspěchu projektu, vzhledem k tomu, že prostředí, ve kterém operuje, je tak volatilní a rychle se vyvíjí, a že systém, proti kterému je testován v článku, je téměř tři roky starý – z doby, kdy byla image syntéza skutečně v plenkách.
Tým dosáhl převážně pozitivních výsledků ze dvou důvodů: je málo předchozích prací, proti kterým by se dalo srovnávat (a žádné, které by nabízely spravedlivé srovnání, tj. které by pokrývaly pouhých dvanáct týdnů od okamžiku, kdy byl Stable Diffusion uvolněn jako otevřený zdroj).
Druhým důvodem je, že latentní difuzní image syntéza se vyvíjí exponenciálně rychle, ale výstupní obsah současných nabídek se prakticky “vlastnoručně” označuje svými vlastními strukturálními (a velmi předvídatelnými) slabostями a excentricitami – mnohé z nich budou pravděpodobně odstraněny, alespoň v případě Stable Diffusion, vydáním lepšího 1,5 kontrolního bodu (tj. 4GB trénovaného modelu, který pohání systém).
Navíc, Stability již naznačil, že má jasnou mapu pro verzi 2 a 3 systému. Vzhledem k senzačním událostem posledních tří měsíců, je pravděpodobné, že jakákoli firemní letargie na straně OpenAI a dalších soutěžících hráčů v image syntéze prostoru byla již odstraněna, což znamená, že můžeme očekávat podobně rychlý tempo pokroku také v uzavřené image syntéze prostoru. První publikováno 14. října 2022.












