Andersons vinkel

Redigering af en GAN’s latente rum med ‘blobs’

mm
Føj Unite.AI til dine foretrukne kilder på Google

Nyt forskning fra UC Berkeley og Adobe (ADBE ) tilbyder en måde at redigere det hyperrealistiske indhold, der kan oprettes af en Generative Adversarial Network (GAN), men som normalt ikke kan kontrolleres, animeres eller manipuleres frit på en måde, der er velkendt for Photoshop-brugere og CGI-praktikere.

Metoden, der hedder BlobGAN, indebærer at oprette et grid af ‘blobs’ – matematiske konstruktioner, der direkte kan kobles til indhold i GAN’s latente rum.

Ved at flytte blobs kan man flytte ‘objekter’ i en scenerepræsentation på en intuitiv måde, der er nærmere CGI- og CAD-metoder end mange af de nuværende forsøg på at kortlægge og kontrollere GAN’s latente rum:

Scenemanipulation med BlobGAN: når 'blobs' flyttes af brugeren, ændres dispositionen af latente objekter og stilarter i GAN entsprechende. For flere eksempler, se papirens tilhørende video, indlejret i slutningen af denne artikel, eller på https://www.youtube.com/watch?v=KpUv82VsU5k

Scenemanipulation med BlobGAN: når ‘blobs’ flyttes af brugeren, ændres dispositionen af latente objekter og stilarter i GAN entsprechende. For flere eksempler, se papirens tilhørende video, indlejret i slutningen af denne artikel, eller på https://www.youtube.com/watch?v=KpUv82VsU5k

Siden blobs svarer til ‘objekter’ i scenen, der er kortlagt i GAN’s latente rum, er alle objekterne frakoblet a priori, hvilket gør det muligt at ændre dem enkeltvis:

Objekter kan ændres i størrelse, formindskes, kloneres og fjernes, blandt andet.

Objekter kan ændres i størrelse, formindskes, kloneres og fjernes, blandt andet.

Som med ethvert objekt i billedredigeringssoftware (eller selv tekstredigeringssoftware) kan en blob duplikeres og herefter manipuleres:

Blobs kan duplikeres i grænsefladen, og deres tilhørende latente repræsentationer vil også blive 'kopieret og indsættet'. Kilde: https://dave.ml/blobgan/#results

Blobs kan duplikeres i grænsefladen, og deres tilhørende latente repræsentationer vil også blive ‘kopieret og indsættet’. Kilde: https://dave.ml/blobgan/#results

BlobGAN kan også parse nye, bruger-valgte billeder ind i dets latente rum:

Med BlobGAN behøver du ikke at indarbejde billeder, du ønsker at manipulere, direkte i træningsdata og herefter lede efter deres latente koder, men kan indsætte valgte billeder efter behov og manipulere dem. Billederne, der ændres her, er efterfølgende brugerinput. Kilde: https://dave.ml/blobgan/#results

Med BlobGAN behøver du ikke at indarbejde billeder, du ønsker at manipulere, direkte i træningsdata og herefter lede efter deres latente koder, men kan indsætte valgte billeder efter behov og manipulere dem. Billederne, der ændres her, er efterfølgende brugerinput. Kilde: https://dave.ml/blobgan/#results

Flere resultater kan ses her, og i den tilhørende YouTube-video (indlejret i slutningen af denne artikel). Der er også en interaktiv Colab demo*, og en GitHub repo**.

Dette niveau af instrumentering og omfang kan synes naivt i efter-Photoshop-alderen, og parametrisk softwarepakker som Cinema4D og Blender har i årtier tilladt brugerne at oprette og tilpasse 3D-verden; men det repræsenterer en lovende tilgang til at temme de excentriske og arcane naturen af det latente rum i en Generative Adversarial Network, ved brug af proxy-enheder, der er koblet til latente koder.

Forfatterne hævder:

‘På en udfordrende multi-kategori-datasæt af indendørs scener, overgår BlobGAN Style-GAN2 i billedkvalitet, målt efter FID.’

Papiret er titlen BlobGAN: Spatially Disentangled Scene Representations, og er skrevet af to forskere fra UC Berkeley, sammen med tre fra Adobe Research.

Middle-man

BlobGAN bringer en ny paradigm til GAN-billedsynthese. Tidligere tilgange til at adressere diskrete enheder i det latente rum, påpeger den nye artikel, har enten været ‘top-down’ eller ‘bottom up’.

En top-down-metode i en GAN eller billedklassifikator behandler billeder af scener som klasser, såsom ‘soveværelse’, ‘kirke’, ‘ansigt’ osv. Denne type tekst/billede-parering giver kraft til en ny generation af multimodale billedsyntheserammer, såsom den seneste DALL-E 2 fra OpenAI.

Bund-bottom-tilgange, til gengæld, kortlægger hvert pixel i et billede til en klasse, mærke eller kategori. Sådanne tilgange bruger diverse teknikker, selvom semantisk segmentering er en populær nuværende forskningsstrang.

Forfatterne kommenterer:

‘Begge veje synes utilfredsstillende, fordi ingen af dem kan give lette måder at resonere om dele af scenen som enheder. Scenens dele er enten bagt ind i en enkelt sammenflettet latent vektor (top-down), eller skal grupperes sammen fra enkelt pixel-mærker (bottom-up).’

I stedet tilbyder BlobGAN en usupervised mid-level-repræsentation, eller proxy-ramme for generative modeller.

Layout-netværket kortlægger lokale (og kontrollerbare) 'blob'-enheder til latente koder. De farvede cirkler i midten udgør en 'blob-kort'.

Layout-netværket kortlægger lokale (og kontrollerbare) ‘blob’-enheder til latente koder. De farvede cirkler i midten udgør en ‘blob-kort’. Kilde: https://arxiv.org/pdf/2205.02837.pdf

De gaussiske (dvs. støj-baserede) blobs er dybde-ordnet, og repræsenterer en flaskehals i arkitekturen, der tildeles en mapping til hver enhed, og løser det største hinder, der er til GAN-indhold-manipulation: frakobling (også et problem for autoencoder-baserede arkitekturer). Den resulterende ‘blob-kort’ bruges til at manipulere BlobGAN’s decoder.

Forfatterne bemærker med en vis overraskelse, at systemet lærer at dekomponere scener i layouts og enheder gennem en off-the-shelf-diskriminator, der ikke bruger eksplisitte mærker.

Arkitektur og Data

Enhederne i blob-kortet konverteres til billeder via en revideret StyleGAN2-afledt netværk, i en tilgang, der tager inspiration fra tidligere NVIDIA (NVDA ) -forskning.

En revideret StyleGAN 2-afledt fra NVIDIA Research. Nogle af principperne i dette arbejde blev antaget eller tilpasset til BlobGAN.

En revideret StyleGAN 2-afledt fra NVIDIA Research. Nogle af principperne i dette arbejde blev antaget eller tilpasset til BlobGAN. Kilde: https://arxiv.org/pdf/1912.04958.pdf

StyleGAN 2 er modificeret i BlobGAN til at acceptere input fra blob-kortet i stedet for en enkelt global vektor, som er normalt tilfældet.

En række manipulationer, der er mulige med BlobGAN, herunder 'autocompletion' af et soveværelse, og ændring af størrelse og placering af elementerne i rummet. I rækken nedenfor ser vi den bruger-tilgængelige instrumentering, der muliggør dette - blob-kortet.

En række manipulationer, der er mulige med BlobGAN, herunder ‘autocompletion’ af et tomt soveværelse, og ændring af størrelse og placering af elementerne i rummet. I rækken nedenfor ser vi den bruger-tilgængelige instrumentering, der muliggør dette – blob-kortet.

Ved analogi, i stedet for at bringe et enormt og komplekst bygning (det latente rum) til eksistens på én gang, og herefter have at udforske dets endeløse byveje, sender BlobGAN ind i de komponent-blokke fra starten, og ved altid, hvor de er. Denne frakobling af indhold og placering er den største innovation i arbejdet.

 

* Ikke funktionsdygtig på tidspunktet for skrivning
** Kode ikke endnu offentliggjort på tidspunktet for skrivning

 

Først offentliggjort den 8. maj 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai