Andersonův úhel
Nová a jednodušší metoda Deepfake, která předčí předchozí přístupy

Spojení čínské skupiny pro výzkum umělé inteligence a výzkumníků z USA vyvinulo to, co může být první skutečnou inovací v technologii deepfakes od doby, kdy se tento jev objevil před čtyřmi lety.
Nová metoda může provádět výměny obličejů, které předčí všechny ostatní existující rámce na standardních percepčních testech, bez nutnosti vyčerpávajícího shromažďování a kurátorství velkých vyhrazených datových sad a jejich trénování po dobu až týdne pro jednu identitu. Pro příklady uvedené v novém článku byly modely trénovány na celé dvou populárních datových sadách celebrit, na jedné NVIDIA Tesla P40 GPU po dobu asi tří dnů.

Celé video je k dispozici na konci tohoto článku. V tomto vzorku z videa v doplňkových materiálech poskytnutých jedním z autorů nového článku je obličej Scarlett Johanssonové přenesen na zdroj videa. CihaNet odstraňuje problém edge-masking při provádění výměny, vytvářením a prováděním hlubších vztahů mezi zdrojovou a cílovou identitou, což znamená konec „zřetelných hranic“ a dalších superimpozičních chyb, které se vyskytují v tradičních přístupech deepfakes. Source: Source: https://mitchellx.github.io/#video
Nový přístup odstraňuje potřebu „vlepit“ transplantovanou identitu hrubě do cílového videa, což často vede k zřetelným artefaktům, které se objevují tam, kde končí falešná tvář a začíná skutečná, podkladová tvář. Místo toho se používají „hallucinační mapy“ k provedení hlubšího míchání vizuálních aspektů, protože systém odděluje identitu od kontextu mnohem účinněji než současné metody, a proto může sloučit cílovou identitu na hlubší úrovni.

Z článku. Transformace CihaNet jsou usnadněny hallucinačními mapami (spodní řádek). Systém používá kontextové informace (tj. směr obličeje, vlasy, brýle a další překážky atd.) zcela z obrazu, do kterého bude nová identita vložena, a informace o identitě obličeje zcela z osoby, která bude vložena do obrazu. Tato schopnost oddělit obličej od kontextu je kritická pro úspěch systému. Source: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
Účinně nová hallucinační mapa poskytuje úplnější kontext pro výměnu, na rozdíl od tvrdých masek, které často vyžadují rozsáhlou kurátorství (a v případě DeepFaceLab, samostatné trénování) a poskytují omezenou flexibilitu v oblasti skutečného začlenění obou identit.

Z vzorků poskytnutých v doplňkových materiálech, pomocí obou datových sad FFHQ a Celeb-A HQ, napříč VGGFace a Forensics++. První dvě sloupce ukazují náhodně vybrané (skutečné) obrázky, které mají být vyměněny. Následující čtyři sloupce ukazují výsledky výměny pomocí čtyř nejúčinnějších metod目前 dostupných, zatímco poslední sloupec ukazuje výsledek z CihaNet. Repozitář FaceSwap byl použit místo populárnějšího DeepFaceLab, protože oba projekty jsou forkem originálního kódu deepfakes z roku 2017 na GitHubu. Ačkoli každý projekt od té doby přidává modely, techniky, rozmanité uživatelské rozhraní a doplňkové nástroje, základní kód, který umožňuje deepfakes, se nikdy nezměnil a zůstává společný pro oba. Source: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Článek článku, nazvaný One-stage Context and Identity Hallucination Network, je autorem výzkumníků spojených s JD AI Research a University of Massachusetts Amherst, a byl podporován Národním klíčovým programem výzkumu a vývoje Číny pod číslem grantu 2020AAA0103800. Byl uveden na 29. mezinárodní konferenci ACM o multimédiích, 20.-24. října, v Chengdu, Čína.
Žádná potřeba „face-on“ parity
Oba nejoblíbenější současné software pro deepfakes, DeepFaceLab, a konkurenční fork FaceSwap, provádějí únavné a často ručně kurátorované pracovní postupy, aby identifikovaly, kterým směrem je obličej nakloněn, jaké překážky jsou na cestě, které je třeba zohlednit (opět ručně), a musí se vypořádat s mnoha dalšími frustrujícími překážkami (včetně osvětlení), které činí jejich použití daleko od „point-and-click“ zkušenosti, která je nepřesně popisována v médiích od doby, kdy se deepfakes objevily.
Naproti tomu CihaNet nevyžaduje, aby dvě obrázky byly čelem k fotoaparátu, aby extrahoval a využil užitečné informace o identitě z jednoho obrázku.

V těchto příkladech je sada softwaru pro deepfakes vyzvána k úkolu výměny obličejů, které nejsou pouze odlišné v identitě, ale které nejsou čelem k témuž směru. Software odvozený z originálního repozitáře deepfakes (jako velmi populární DeepFaceLab a FaceSwap, zobrazený výše) nemůže zvládnout rozdíly v úhlech mezi dvěma obrázky, které mají být vyměněny (viz třetí sloupec). Mezitím CihaNet může správně abstrahovat identitu, protože „pose“ obličeje není intrinsicky součástí informací o identitě.
Architektura
Projekt CihaNet, podle autorů, byl inspirován spoluprací mezi Microsoft Research a Peking University z roku 2019, nazvanou FaceShifter, i když provedl einige pozoruhodné a kritické změny v základní architektuře starší metody.
FaceShifter používá dvě sítě Adaptive Instance Normalization (AdaIN) pro zpracování informací o identitě, které jsou poté transponovány do cílového obrázku prostřednictvím masky, způsobem podobným současnému populárnímu softwaru pro deepfakes (a s všemi souvisejícími omezeními), pomocí další HEAR-Net (který zahrnuje samostatně trénovanou podsíť trénovanou na překážky překrytí – další vrstvu složitosti).
Místo toho nová architektura přímo používá tyto „kontextové“ informace pro transformační proces, prostřednictvím dvoukrokového jednoduchého operace Cascading Adaptive Instance Normalization (C-AdaIN), který poskytuje konzistenci kontextu (tj. kůže obličeje a překrytí) oblastí relevantních pro identitu.
Druhá podsíť, která je kritická pro systém, se nazývá Swapping Block (SwapBlk), která generuje integrovanou funkci z kontextu referenčního obrázku a vložených „informací o identitě“ ze zdrojového obrázku, obcházející多stage nutná k dosažení tohoto pomocí konvenčních současných prostředků.
Chcete-li pomoci rozlišit mezi kontextem a identitou, je pro každou úroveň generována hallucinační mapa, která nahrazuje měkkou segmentační masku a působí na širší rozsah funkcí pro tuto kritickou část procesu deepfakes.

Jak se hodnota hallucinační mapy (zobrazená níže vpravo) zvyšuje, objevuje se jasnější cesta mezi identitami.
Tímto způsobem je celý proces výměny proveden v jednom kroku a bez následného zpracování.
Data a testování
Chcete-li otestovat systém, výzkumníci trénovali čtyři modely na dvou velmi populárních a různorodých otevřených datových sadách obrázků – CelebA-HQ a NVIDIA’s Flickr-Faces-HQ Dataset (FFHQ), každá obsahující 30 000 a 70 000 obrázků, resp.
Žádné prořezávání nebo filtrování nebylo provedeno na těchto základních datových sadách. V každém případě výzkumníci trénovali celou datovou sadu na jediné Tesla GPU po dobu tří dnů, s rychlostí učení 0,0002 na Adam optimalizaci.
Pak vyrenderovali řadu náhodných výměn mezi tisíci osobnostmi zobrazenými v datových sadách, bez ohledu na to, zda byly tváře podobné nebo dokonce shodné pohlaví, a porovnali výsledky CihaNet s výstupem ze čtyř předních rámců deepfakes: FaceSwap (který zastupuje více populární DeepFaceLab, protože sdílí kořenový kód v originálním repozitáři z roku 2017, který přinesl deepfakes do světa); výše zmíněný FaceShifter; FSGAN; a SimSwap.
Při porovnávání výsledků prostřednictvím VGG-Face, FFHQ, CelebA-HQ a FaceForensics++, autoři zjistili, že jejich nový model předčí všechny předchozí modely, jak je uvedeno v tabulce níže.

Tři metriky použité pro hodnocení výsledků byly Strukturální podobnost (SSIM), chyba odhadu polohy a přesnost vyhledání identity, která se počítá na základě procenta úspěšně vyhledaných párů.
Výzkumníci tvrdí, že CihaNet představuje lepší přístup z hlediska kvalitativních výsledků a významný pokrok ve stavu současného umění v technologii deepfakes, odstraňující břemeno rozsáhlých a namáhavých architektur a metodologií a dosahující užitečnějšího a akčnějšího oddělení identity od kontextu.
Vyzkoušejte si níže další video příklady nové techniky. Celé video můžete najít zde.
Z doplňkových materiálů pro nový článek, CihaNet provádí výměnu obličejů na různých identitách. Source: https://mitchellx.github.io/#video














