Andersonův úhel
Adobe Research Rozšiřuje Disentangled GAN Face Editing

Není těžké pochopit, proč je entanglement problémem v obrazové syntéze, protože je to často problém v jiných oblastech života; například je mnohem těžší odstranit kurkumu z kari než odstranit okurku z burgeru, a je prakticky nemožné zbavit se sladkosti z šálku kávy. Některé věci prostě přicházejí v balíku.
Podobně je entanglement překážkou pro architektury obrazové syntézy, které by ideálně rády oddělily různé funkce a koncepty při použití strojového učení pro vytváření nebo editaci obličejů (nebo psů, lodí nebo jakýchkoli jiných domén).
Pokud byste mohli oddělit vlákna, jako je věk, pohlaví, barva vlasů, barva kůže, emocionální stav a tak dále, měli byste začátek skutečné instrumentality a flexibility v rámci, který by mohl vytvářet a editovat obličejové obrázky na skutečně granulární úrovni, bez tažení nežádoucích “cestujících” do těchto konverzí.
Při maximálním entanglementu (nahoře vlevo) můžete pouze změnit obraz naučené GAN sítě na obraz jiné osoby.
To je efektivní použití nejnovější AI počítačové vize k dosažení něčeho, co bylo vyřešeno jinými prostředky před více než třiceti lety.
S určitým stupněm oddělení (‘Střední oddělení’ v předchozím obrázku výše) je možné provést stylem založené změny, jako je barva vlasů, výraz, kosmetické aplikace a omezená rotace hlavy, mezi jinými.

Source: FEAT: Face Editing with Attention, únor 2022, https://arxiv.org/pdf/2202.02713.pdf
Byla provedena řada pokusů v posledních dvou letech o vytvoření interaktivních prostředí pro editaci obličejů, která by umožňovala uživateli měnit obličejové rysy pomocí posuvníků a dalších tradičních interakcí s uživatelským rozhraním, zatímco zachovávaly základní rysy cílové osoby neporušené při přidávání nebo měnění. Nicméně to se ukázalo jako výzva kvůli základní funkci/style entanglementu v latentním prostoru GAN.
Například brýle jsou často spojeny s věkem, což znamená, že přidání brýlí může také “zestárnout” obličej, zatímco stárnutí obličeje může přidat brýle, v závislosti na stupni aplikovaného oddělení vysokých funkcí (viz “Testování” níže pro příklady).
Většinou se ukázalo, že je téměř nemožné změnit barvu vlasů a další vlásové aspekty bez přepočítání vlasových vláken a jejich rozložení, což dává “šumivý”, přechodný efekt.

Source: InterFaceGAN Demo (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w
Latent-to-Latent GAN Traversal
Nová Adobe -led paper vstoupila do WACV 2022 nabízí novou cestu k těmto základním problémům v paperu nazvaném Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images.

Supplemental material from the paper Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images. Here we see that base characteristics in the learned face are not dragged into unrelated changes. See full video embed at end of article for better detail and resolution. Source: https://www.youtube.com/watch?v=rf_61llRH0Q
Paper je veden Adobe Applied Scientist Siavash Khodadadeh, spolu s dalšími čtyřmi Adobe výzkumníky a výzkumníkem z Department of Computer Science na University of Central Florida.
Článek je zajímavý částečně proto, že Adobe působí v tomto prostoru již nějakou dobu, a je lákavé si představit, že tato funkčnost vstoupí do Creative Suite projektu v příštích několika letech; ale hlavně proto, že architektura vytvořená pro projekt bere jiný přístup k zachování vizuální integrity v GAN face editoru, zatímco se aplikují změny.
Autoři prohlašují:
‘[My] trénujeme neuronovou síť, aby provedla latent-to-latent transformaci, která najde latentní kódování odpovídající obrazu s změněným atributem. Jako technika je one-shot, nezávisí na lineární nebo nelineární trajektorii postupné změny atributů.
‘Tréninkem sítě end-to-end přes celou generační pipeline, systém může přizpůsobit latentnímu prostoru off-the-shelf generátorových architektur. Zachování vlastností, jako je zachování identity osoby, lze zakódovat ve formě tréninkových ztrát.
‘Jakmile byla latent-to-latent síť trénována, může být znovu použita pro libovolné obrázky bez dalšího tréninku.’
Tato poslední část znamená, že navrhovaná architektura přichází s koncovým uživatelem v dokončeném stavu. Stále potřebuje spustit neuronovou síť na místních zdrojích, ale nové obrázky lze “přidat” a být připraveny k úpravám téměř okamžitě, protože rámec je dostatečně odpojen, aby nemusel vyžadovat další image-specifický trénink.

Pohlaví a vousy změněny jako posuvníky vykreslují náhodné a libovolné cesty skrze latentní prostor, ne jen ‘škrábání mezi koncovými body’. See video embedded at end of article for more transformations at better resolution.
Mezi hlavní úspěchy v práci je síť schopnost “zmrazit” identity v latentním prostoru změnou pouze atributu v cílovém vektoru a poskytování “korekčních termínů”, které zachovávají identity, které se transformují.
V podstatě je navrhovaná síť vložena do širší architektury, která orchestruje všechny zpracované prvky, které procházejí předtrénovanými komponentami s zamrzlými váhami, které nebudou produkovat nežádoucí laterální účinky na transformace.
Jelikož tréninkový proces závisí na tripletech, které lze vygenerovat buď z počátečního obrázku (pod GAN inverzí) nebo existujícího počátečního latentního kódování, celý tréninkový proces je nesupervizovaný, s tacitními akcemi obvyklého rozsahu označování a kurátorských systémů v takových systémech efektivními do architektury. Skutečně, nový systém používá off-the-shelf atributové regresory:
‘[Počet] atributů, které naše síť může nezávisle ovládat, je omezen pouze schopnostmi rozpoznávače(s) – pokud máte rozpoznávač pro atribut, můžete ho přidat k libovolným obličejům. V našich experimentech jsme trénovali latent-to-latent síť, aby umožnila úpravu 35 různých obličejových atributů, více než jakékoli předchozí přístupy.’
Systém zahrnuje další bezpečnostní opatření proti nežádoucím “vedlejších” transformacím: v nepřítomnosti požadavku na změnu atributu bude latent-to-latent síť mapovat latentní vektor na sebe sama, dále zvyšující stabilní persistenci cílové identity.
Rozpoznávání Obličejů
Jednou z opakujících se otázek s GAN a encoder/decoder-založenými editory obličejů v posledních několika letech byla tendence aplikovaných transformací degradovat podobnost. Aby se tomu zabránilo, Adobe projekt používá zabudovaný rozpoznávací síť obličejů nazvaný FaceNet jako diskriminátor.

Projektová architektura, vidět níže uprostřed vlevo pro zařazení FaceNet. Source: Latent to Latent: A Learned Mapper for Identity Preserving Editing of Multiple Face Attributes in StyleGAN-generated Images, OpenAccess.
(Na osobní poznámku, toto zdá se být povzbudivým krokem směrem k integraci standardních systémů rozpoznávání obličejů a dokonce i rozpoznávání výrazů do generativních sítí, pravděpodobně nejlepší způsob, jak překonat slepé pixel-pixel mapování, které dominuje současné deepfake architektury na úkor expresivní věrnosti a dalších důležitých domén v generování obličejů.)
Přístup ke Všem Oblastem v Latentním Prostoru
Další působivou funkcí rámce je jeho schopnost cestovat libovolně mezi potenciálními transformacemi v latentním prostoru, na uživatelské přání. Několik předchozích systémů, které poskytly průzkumné rozhraní, často nechaly uživatele基本ně “škrábat” mezi pevnými transformačními časovými osami – působivé, ale často khá lineární nebo proscriptivní zkušenosti.

From Improving GAN Equilibrium by Raising Spatial Awareness: here the user scrubs through a range of potential transition points between two latent space locations, but within the confines of pre-trained locations in the latent space. To apply other kinds of transformation based on the same material, reconfiguration and/or retraining is necessary. Source: https://genforce.github.io/eqgan/
Data
Atributová regresní síť byla trénována na třech sítích: FFHQ, CelebAMask-HQ, a místní, GAN-generovaná síť získaná vzorkováním 400 000 vektorů z prostoru Z StyleGAN-V2.
Mimo-distribuční (OOD) obrázky byly filtrovány pryč, a atributy byly extrahovány pomocí Microsoft Azure Face API, s výsledným image-set rozděleným 90/10, což zanechalo 721 218 tréninkových obrázků a 72 172 testovacích obrázků pro srovnání.
Testování
Ačkoli experimentální síť byla inicializována pro akomodaci 35 potenciálních transformací, tyto byly zredukovány na osm, aby se provedlo analogické testování proti srovnatelným rámcům InterFaceGAN, GANSpace, a StyleFlow.
Osm vybraných atributů byly Věk, Holohlavost, Vousy, Výraz, Pohlaví, Brýle, Pitch, a Yaw. Bylo nutné přepracovat soutěžící rámce pro některé z osmi atributů, které nebyly zprovisionovány v původní distribuci, jako je přidání holohlavosti a vousů do InterFaceGAN.
Jako očekávané, vyšší stupeň entanglementu nastal v rivalizujících architekturách. Například, v jednom testu, InterFaceGAN a StyleFlow obě změnily pohlaví subjektu, když se požádaly o aplikaci věku:

Dva ze soutěžících rámců zahrnuli změnu pohlaví do ‘věkové’ transformace, také měnící barvu vlasů bez přímého pokynu uživatele.
Dále, dva ze soupeřů našli, že brýle a věk jsou neseparovatelné aspekty:
Je to neuniformní vítězství pro výzkum: jak je vidět v doprovodném videu vloženém na konci článku, rámec je nejméně účinný, když se snaží extrapolovat různé úhly (yaw), zatímco GANSpace má lepší obecný výsledek pro věk a aplikaci brýlí. Latent-to-latent rámec se vázal s GANSpace a StyleFlow ohledně přidání pitch (úhlu hlavy).

Výsledky vypočteny na základě kalibrace MTCNN obličejového detektoru. Nižší výsledky jsou lepší.
Pro další podrobnosti a lepší rozlišení příkladů, podívejte se na doprovodné video níže.
První zveřejnění 16. února 2022.














