Andersonův úhel

Editace latentního prostoru GAN pomocí ‘blobů’

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z UC Berkeley a Adobe (ADBE ) nabízí způsob, jak přímo editovat hyperrealistické obsahy, které lze vytvořit pomocí Generative Adversarial Network (GAN), ale které se obvykle nedají ovládat, animovat nebo volně manipulovat způsobem, který je známý uživatelům Photoshopu a CGI praktikům.

Nazvaný BlobGAN, metoda spočívá ve vytvoření mřížky ‘blobů’ – matematických konstrukcí, které mapují přímo na obsah v latentním prostoru GAN.

Pohybem blobů můžete pohybovat ‘objekty’ v reprezentaci scény, intuitivním způsobem, který je bližší CGI a CAD metodám než mnoho současných pokusů mapovat a ovládat latentní prostor GAN:

Manipulace scény s BlobGAN: pohybem 'blobů' se mění dispozice latentních objektů a stylů v GAN. Více příkladů naleznete v doprovodném videu na konci tohoto článku nebo na https://www.youtube.com/watch?v=KpUv82VsU5k

Manipulace scény s BlobGAN: pohybem ‘blobů’ se mění dispozice latentních objektů a stylů v GAN. Více příkladů naleznete v doprovodném videu na konci tohoto článku nebo na https://www.youtube.com/watch?v=KpUv82VsU5k

Jelikož bloby odpovídají ‘objektům’ v scéně mapované v latentním prostoru GAN, jsou všechny objekty disentangled a priori, což umožňuje jejich individuální změnu:

Objekty lze měnit, zmenšovat, klonovat a odstraňovat, mezi jinými operacemi.

Objekty lze měnit, zmenšovat, klonovat a odstraňovat, mezi jinými operacemi.

Jako u libovolného objektu v softwaru pro editaci fotografií (nebo dokonce textového editoru), lze blob zdvojovat a následně manipulovat:

Bloby lze zdvojovat v rozhraní a jejich odpovídající latentní reprezentace budou také 'zkopírovány a vloženy'. Zdroj: https://dave.ml/blobgan/#results

Bloby lze zdvojovat v rozhraní a jejich odpovídající latentní reprezentace budou také ‘zkopírovány a vloženy’. Zdroj: https://dave.ml/blobgan/#results

BlobGAN může také analyzovat nové, uživatelsky vybrané obrázky v jeho latentním prostoru:

S BlobGAN nemusíte začleňovat obrázky, které chcete manipulovat, přímo do trénovacích dat a poté hledat jejich latentní kódy, ale můžete vstupovat vybrané obrázky libovolně a manipulovat jimi. Tyto fotografie jsou po-facto uživatelský vstup. Zdroj: https://dave.ml/blobgan/#results

S BlobGAN nemusíte začleňovat obrázky, které chcete manipulovat, přímo do trénovacích dat a poté hledat jejich latentní kódy, ale můžete vstupovat vybrané obrázky libovolně a manipulovat jimi. Zdroj: https://dave.ml/blobgan/#results

Více výsledků naleznete zde a v doprovodném YouTube videu (vloženém na konci tohoto článku). Existuje také interaktivní Colab demo*, a GitHub repo**.

Tento druh instrumentality a rozsahu může vypadat naivně v post-Photoshop éře, a parametrické softwarové balíčky, jako je Cinema4D a Blender, umožňují uživatelům vytvářet a přizpůsobovat 3D světy po desetiletí; ale představuje slibný přístup k uklidnění excentricit a arcana latentního prostoru v Generative Adversarial Network, pomocí proxy entit, které jsou mapovány na latentní kódy.

Autoři tvrdí:

‘Na náročném multi-kategorickém datasetu vnitřních scén, BlobGAN překonává Style-GAN2 v kvalitě obrazu, měřené pomocí FID.’

Článek je nazvaný BlobGAN: Prostorově disentangled scénové reprezentace a je napsán dvěma výzkumníky z UC Berkeley, spolu s třemi z Adobe Research.

Prostředník

BlobGAN přináší nový paradigm do GAN obrazové syntézy. Předchozí přístupy k řešení diskrétních entit v latentním prostoru, nový článek poukazuje, byly buď ‘shora-dolů’ nebo ‘zdola-nahoru’.

Shora-dolů metoda v GAN nebo obrazovém klasifikátoru zachází s obrázky scén jako třídy, jako ‘ložnice’, ‘kostel’, ‘obličej’, atd. Tento druh text-obrázek párování pohání novou generaci multimodálních obrazových syntetických rámců, jako je nedávný DALL-E 2 od OpenAI.

Zdola-nahoru přístupy místo toho mapují každý pixel v obraze do třídy, štítku nebo kategorie. Tyto přístupy používají různé techniky, ačkoli semantická segmentace je populární současný výzkumný směr.

Autoři komentují:

‘Oba přístupy se zdají neuspokojivé, protože ani jeden nemůže poskytnout snadný způsob, jak uvažovat o částech scény jako entitách. Části scény jsou buď pevně zakódovány do jediného propojeného latentního vektoru (shora-dolů), nebo je třeba je seskupit z jednotlivých pixelových štítků (zdola-nahoru).’

Místo toho, BlobGAN nabízí nadřízenou mid-level reprezentaci, nebo proxy rámec pro generativní modely.

Layout síť mapuje lokální (a ovladatelné) 'blob' entity na latentní kódy. Barevné kruhy ve středu tvoří 'blob mapu'. Zdroj: https://arxiv.org/pdf/2205.02837.pdf

Layout síť mapuje lokální (a ovladatelné) ‘blob’ entity na latentní kódy. Zdroj: https://arxiv.org/pdf/2205.02837.pdf

Gaussovské (tj. založené na šumu) bloby jsou řazeny podle hloubky a reprezentují úzké místo v architektuře, které přiřazuje mapování každé entity, řeší největší překážku, která existuje pro manipulaci s obsahem GAN: disentanglement (také problém pro autoencoder-založené architektury). Výsledná ‘blob mapa’ se používá k manipulaci dekodérem BlobGAN.

Autoři poznamenávají s jistým překvapením, že systém se učí rozkládat scény do layoutů a entit prostřednictvím off-the-shelf diskriminátora, který nepoužívá explicitní štítky.

Architektura a data

Entity v blob mapě jsou převáděny na obrázky pomocí revidovaného StyleGAN2-derived síťě, v přístupu, který čerpá inspiraci z předchozího výzkumu NVIDIA (NVDA ).

Revidovaná StyleGAN 2 odvozená od NVIDIA Research. Některé principy z této práce byly přijaty nebo adaptovány pro BlobGAN. Zdroj: https://arxiv.org/pdf/1912.04958.pdf

Revidovaná StyleGAN 2 odvozená od NVIDIA Research. Zdroj: https://arxiv.org/pdf/1912.04958.pdf

StyleGAN 2 je modifikován v BlobGAN, aby přijímal vstup z blob mapy místo jediného globálního vektoru, jak je obvykle případ.

Řada manipulací ermögněných BlobGAN, včetně 'autodoplnění' prázdné scény ložnice a změna velikosti a přesunutí prvků v místnosti. V řádku níže vidíme uživatelsky přístupnou instrumentaci, která umožňuje toto – blob mapu.

Řada manipulací ermögněných BlobGAN, včetně ‘autodoplnění’ prázdné scény ložnice a změna velikosti a přesunutí prvků v místnosti.

Podobně, místo toho, aby se vytvořila obrovská a komplexní budova (latentní prostor) najednou, a poté musel prozkoumat její nekonečné cesty, BlobGAN pošle na začátku komponentní bloky a vždy ví, kde jsou. Tato disentanglement obsahu a umístění je hlavní inovací této práce.

 

* Nefunkční v době psaní
** Kód nebyl zveřejněn v době psaní

 

Poprvé zveřejněno 8. května 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai