Andersonův úhel

Vytvoření vlastního generativního adversariálního sítě s náčrtky

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z Carnegie Mellon a MIT vyvinuli novou metodologii, která umožňuje uživateli vytvořit vlastní Generative Adversarial Network (GAN) systémy pro generování obrazů pouze tím, že nakreslí naznačující náčrtky.

Systém tohoto typu by mohl umožnit koncovému uživateli vytvořit systémy generování obrazů, které jsou schopny generovat velmi specifické obrazy, jako jsou například konkrétní zvířata, typy budov – a dokonce i jednotlivé osoby. V současné době většina systémů GAN generuje široké a poměrně náhodné výstupy, s omezenou možností specifikovat konkrétní charakteristiky, jako je plemeno zvířat, typy vlasů u lidí, styly architektury nebo skutečné obličeje.

Přístup, popsán v článku Nakresli si svou vlastní GAN, využívá novou rozhraní pro kreslení jako efektivní “vyhledávací” funkci pro nalezení funkcí a tříd v jinak přeplněných databázích obrazů, které mohou obsahovat tisíce typů objektů, včetně mnoha podtříd, které nejsou relevantní pro záměr uživatele. GAN je poté trénován na tomto filtrovaném podmnožině obrazů.

Pokud uživatel chce vytvořit rámec, který generuje konkrétní typ kočky (a ne pouze jakoukoli kočku, jako je tomu u This Cat Does Not Exist), jeho vstupní náčrtky slouží jako filtr, který vylučuje nerelevantní třídy koček.

 

Zdroj: https://peterwang512.github.io/GANSketching/

Zdroj: https://peterwang512.github.io/GANSketching/

Výzkum je veden Sheng Yu-Wangem z Carnegie Mellon University, spolu s kolegou Jun-Yan Zhu a Davidem Bauem z Computer Science & Artificial Intelligence Laboratory MIT.

Metoda sama je nazvána “GAN kreslení” a používá vstupní náčrtky k přímé změně váh GAN modelu, aby specificky cítil na identifikovanou doménu nebo subdoménu prostřednictvím cross-domain adversarial loss.

Byly prozkoumány různé metody regularizace, aby se zajistilo, že výstup modelu je různorodý, zatímco se udržuje vysoká kvalita obrazu. Výzkumníci vytvořili ukázkové aplikace, které jsou schopny interpolovat latentní prostor a provádět procedury editace obrazu.

Tato [$class] neexistuje

Systémy GAN pro generování obrazů se staly módou, pokud ne memem, za posledních několik let, s množstvím projektů, které jsou schopny generovat obrázky neexistujících věcí, včetně lidí, pronájmu bytů, snídaňových jídel, nohou, koní, politiků a hmyzu, mezi mnoha dalšími.

Systémy GAN pro syntézu obrazů jsou vytvořeny kompilací nebo kurací rozsáhlých databází obsahujících obrázky z cílové domény, jako jsou tváře nebo koně; trénováním modelů, které generalizují řadu funkcí napříč obrázky v databázi; a implementací generátorových modulů, které mohou vyprodukovat náhodné příklady na základě naučených funkcí.

Výstup z náčrtků v DeepFacePencil, který umožňuje uživatelům vytvářet fotorealistické tváře z náčrtků. Mnoho podobných projektů pro kreslení obrazů existuje. Zdroj: https://arxiv.org/pdf/2008.13343.pdf

Výstup z náčrtků v DeepFacePencil, který umožňuje uživatelům vytvářet fotorealistické tváře z náčrtků. Mnoho podobných projektů pro kreslení obrazů existuje. Zdroj: https://arxiv.org/pdf/2008.13343.pdf

Vysokodimenzionální funkce jsou mezi prvními, které jsou konkretizovány během procesu trénování, a jsou ekvivalentní k malířovým prvním širokým tahům barvy na plátně. Tyto vysokodimenzionální charakteristiky nakonec korelují s mnohem podrobnějšími funkcemi (tj. světlem oka a ostrými vousy kočky, místo pouze generické béžové koule reprezentující hlavu).

Vím, co myslíte…

Mapováním vztahu mezi těmito ranými semennými tvary a konečnými podrobnými interpretacemi, které jsou získány mnohem později v procesu trénování, je možné odvodit vztahy mezi “nejasnými” a “konkrétními” obrázky, což umožňuje uživatelům vytvářet komplexní a fotorealistické obrazy z hrubých náčrtků.

Nedávno NVIDIA vydala desktopovou verzi své dlouhodobé výzkumné iniciativy GauGAN pro generování krajiny založené na GAN, která snadno demonstruje tento princip:

Přibližné náčrtky jsou přeloženy do bohatých scénických obrazů prostřednictvím NVIDIA GauGAN a nyní aplikace NVIDIA Canvas. Zdroj: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Přibližné náčrtky jsou přeloženy do bohatých scénických obrazů prostřednictvím NVIDIA GauGAN a nyní aplikace NVIDIA Canvas. Zdroj: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/

Podobně mnoho systémů, jako je DeepFacePencil, použilo stejný princip k vytvoření generátorů obrazů indukovaných náčrtky pro různé domény.

Architektura DeepFacePencil.

Architektura DeepFacePencil.

Zjednodušení kreslení-obraz

Nový článek GAN Sketching se snaží odstranit únavnou zátěž shromažďování a kurace dat, která je typicky zapojena do vývoje rámců GAN pro generování obrazů, pomocí uživatelského vstupu pro definici, která podmnožina obrazů by měla tvořit trénovací data.

Systém byl navržen tak, aby vyžadoval pouze malý počet vstupních náčrtků pro kalibraci rámců. Systém efektivní reverzuje funkčnost PhotoSketch, společného výzkumného projektu z roku 2019 výzkumníků z Carnegie Mellon, Adobe, Uber ATG a Argo AI, který je začleněn do nové práce. PhotoSketch byl navržen pro vytváření uměleckých náčrtků z obrazů a již obsahuje efektivní mapování vztahů mezi nejasnými a specifickými tvary.

Pro generování části procesu nový metod používá pouze modifikaci váh StyleGAN2. Protože obrazová data, která jsou používána, jsou pouze podmnožinou celkových dostupných dat, stačí pouze modifikovat mapovací síť pro dosažení žádoucích výsledků.

Metoda byla vyhodnocena na několika populárních subdoménách, včetně jezdeckých, kostelů a koček.

Dataset LSUN z Princeton University z roku 2016 byl použit jako základní materiál pro odvození cílových subdomén. Pro vytvoření systému mapování náčrtků, který je robustní vůči excentricitám reálného uživatelského vstupu, je systém trénován na obrazech z QuickDraw dataset vyvinutého Microsoftem mezi lety 2021-2016.

Ačkoli jsou mapování náčrtků mezi PhotoSketch a QuickDraw poměrně odlišné, výzkumníci zjistili, že jejich rámec dobře funguje na relativně jednoduchých pózách, zatímco složitější pózy (jako kočky ležící) představují větší výzvu, zatímco velmi abstraktní uživatelský vstup (tj. příliš hrubé kresby) také zhoršuje kvalitu výsledků.

Latentní prostor a editace obrazu

Výzkumníci vyvinuli dvě aplikace na základě základní práce: editaci latentního prostoru a editaci obrazu. Editace latentního prostoru nabízí uživatelsky ovladatelné prvky, které jsou facilitovány během trénování, a umožňují širokou míru variace, zatímco zůstávají věrné cílové doméně a příjemně konzistentní napříč variacemi.

Plynulá interpolace latentního prostoru s vlastními modely GAN Sketching.

Plynulá interpolace latentního prostoru s vlastními modely GAN Sketching.

Komponent editace latentního prostoru byl poháněn projektem GANSpace z roku 2020, společným projektem Aalto University, Adobe a NVIDIA.

Jeden obraz může být také zaveden do přizpůsobeného modelu, což usnadňuje editaci obrazu. V této aplikaci je jeden obraz projektován do přizpůsobeného GAN, nejenže umožňuje přímou editaci, ale také zachovává vyšší úroveň editace latentního prostoru, pokud je tato také použita.

Zde byl použit reálný obraz jako vstup do GAN (model kočky), který edituje vstupní obraz tak, aby odpovídal předloženým náčrtkům. To umožňuje editaci obrazu pomocí kreslení.

Zde byl použit reálný obraz jako vstup do GAN (model kočky), který edituje vstupní obraz tak, aby odpovídal předloženým náčrtkům. To umožňuje editaci obrazu pomocí kreslení.

Ačkoli je konfigurovatelný, systém není navržen pro práci v reálném čase, alespoň pokud jde o trénování a kalibraci. V současné době GAN Sketching vyžaduje 30 000 trénovacích iterací. Systém také vyžaduje přístup k původním trénovacím datům pro původní model.

V případech, kdy je dataset otevřený a má licenci, která umožňuje lokální kopírování, mohlo by to být zajištěno zahrnutím zdrojových dat do místně nainstalovaného balíčku, i když by to zabralo značné místo na disku; nebo přístupem nebo zpracováním dat na dálku prostřednictvím cloudového přístupu, který zavádí síťové přetížení a (v případě, že zpracování skutečně probíhá v cloudu) možná výpočetní náklady.

Transformace z přizpůsobených modelů FFHQ trénovaných pouze na 4 lidsky generované náčrtky.

Transformace z přizpůsobených FFHQ modelů trénovaných pouze na lidsky generované náčrtky.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai