Andersonin kulma
GAN:n latentin muokkaus ‘palloilla’

Uusi tutkimus UC Berkeleystä ja Adobesta tarjoaa tavan muokata suoraan hyperreaalia sisältöä, jota voidaan luoda Generative Adversarial Network (GAN) -menetelmällä, mutta jota ei yleensä voida ohjata, animoida tai muokata vapaasti tavalla, joka on pitkään ollut tuttu Photoshop-käyttäjille ja CGI-harjoittajille.
(ADBE )Tutkimuksen nimi on BlobGAN, ja se perustuu siihen, että luodaan ruudukko “pallorakenteista” – matemaattisista konstruktioista, jotka liittyvät suoraan sisältöön GAN:n latenttiavaruudessa.
Liikuttamalla palloja voidaan liikuttaa “objekteja” kohtauksen edustajassa intuitiivisella tavalla, joka on lähempänä CGI- ja CAD-menetelmiä kuin monet nykyiset yritykset kartoittaa ja ohjata GAN:n latenttiavaruutta:

Kohtauksen muokkaus BlobGAN:lla: kun “pallot” liikkuva käyttäjän toiminnan mukaan, latenttiobjektien ja -tyylien järjestely GAN:ssa muuttuu vastaavasti. Lisätietoja löytyy tutkimuksen liitteenä olevasta videosta, joka on liitetty tämän artikkelin loppuun, tai osoitteesta https://www.youtube.com/watch?v=KpUv82VsU5k
Koska pallot liittyvät “objekteihin” kohtauksessa, joka on kartoitettu GAN:n latenttiavaruudessa, kaikki objektit ovat eriytettyjä a priori, mikä mahdollistaa niiden yksittäisen muokkaamisen:

Objekteja voidaan muuttaa kokoa, kutistaa, kloonata ja poistaa, muun muassa.
Kuten kuvankäsittelyohjelmistossa (tai jopa tekstinkäsittelyohjelmistossa), pallo voidaan monistaa ja sen jälkeen muokata:

Pallot voidaan monistaa käyttöliittymässä, ja niiden latenttiesitykset voidaan “kopioida ja liittää”. Lähde: https://dave.ml/blobgan/#results
BlobGAN voi myös tulkita uusia, käyttäjän valitsemia kuvia latenttiavaruuteensa:

BlobGAN:lla ei tarvitse sisällyttää kuvia, joita halutaan muokata, suoraan koulutusdataan ja etsiä niiden latenttikoodit, vaan voidaan syöttää valitut kuvat vapaasti ja muokata niitä. Kuvat, joita muokataan, ovat jälkikäteen käyttäjän syöttämiä. Lähde: https://dave.ml/blobgan/#results
Lisää tuloksia voidaan nähdä täällä, ja liitteenä olevassa YouTube-videossa (joka on liitetty tämän artikkelin loppuun). On myös interaktiivinen Colab demo*, ja GitHub repo**.
Tämänkaltaisen instrumentaation ja laajuuden voi nähdä naivina post-Photoshop-aikakaudella, ja parametrinen ohjelmistopaketti kuten Cinema4D ja Blender on sallinut käyttäjien luoda ja mukauttaa 3D-maailmoja vuosikymmenien ajan; mutta se edustaa lupaavaa lähestymistapaa GAN-sisällön hallitsemiseen latenttiavaruuden epävakauden ja arkaaisen luonteen kanssa, käyttäen välittäjiä, jotka liittyvät latenttikoodiin.
Tutkijat toteavat:
‘Haastavalla monikategorisen sisätilojen aineistolla BlobGAN ylittää Style-GAN2:n kuvanlaadussa, mitattuna FID:llä.’
Tutkimus paperi on nimeltään BlobGAN: Spatially Disentangled Scene Representations, ja sen ovat kirjoittaneet kaksi tutkijaa UC Berkeleystä yhdessä kolmen Adoben tutkijan kanssa.
Välittäjä
BlobGAN tuo uuden paradigman GAN-kuvansynteesiin. Aikaisemmat lähestymistavat diskreettisten entiteettien käsittelyyn latenttiavaruudessa, tutkimus toteaa, ovat olleet joko “ylhäältä alas” tai “alhaalta ylös”.
Ylhäältä-alas-lähestymistapa GAN:ssa tai kuvaluokittelijassa käsittää kuvia kohtauksina luokkina, kuten “makuuhuone”, “kirkko”, “kasvo”, jne. Tämänkaltaiset teksti/kuvaparit mahdollistavat uuden sukupolven multimodaalisen kuvansynteesirunkojen.
Alhaalta-ylos-lähestymistavat karttoittavat jokaisen kuvapikselin luokkaan, merkintään tai kategoriaan. Nämä lähestymistavat käyttävät erilaisia tekniikoita, vaikka semanttinen segmentointi on suosittu tutkimussuunta.
Tutkijat toteavat:
‘Molemmat polut tuntuvat tyydyttämättömiltä, koska kumpikaan ei tarjoa helppoa tapaa puhua kohtauksen osista entiteetteinä. Kohtauksen osat ovat joko yhdistetty yhteen sekaantuneeseen latenttivektooriin (ylhäältä alas), tai niitä on ryhmiteltävä yksittäisistä pikselimerkinnöistä (alhaalta ylös).’
Sen sijaan BlobGAN tarjoaa valvottoman keskitason edustamisen tai välittäjäkehyksen generatiivisille malleille.

Layout-verkko karttoittaa paikallisia (ja ohjattavissa olevia) “pallorakenteita” latenttikoodiin. Väritetyt ympyrät keskellä muodostavat “pallokartan”. Lähde: https://arxiv.org/pdf/2205.02837.pdf
Gaussin (eli melupohjaiset) pallot ovat syvyyssuunnassa järjestettyjä, ja ne edustavat pullonkaulaa arkkitehtuurissa, joka määrittää kunkin entiteetin koodauksen, ratkaisemalla suurimman esteen GAN-sisällön muokkaukselle: eriyttämisen (joka on myös ongelma autoencoder-pohjaisille arkkitehtuureille). Tuloksena oleva “pallokartta” käytetään BlobGAN:n dekooderin muokkaamiseen.
Tutkijat toteavat hämmästykseksi, että järjestelmä oppii hajottamaan kohtauksia layouteiksi ja entiteeteiksi valmiiden diskriminaattorien avulla, jotka eivät käytä eksplisiittisiä merkintöjä.
Arkkitehtuuri ja data
Entiteetit pallokartassa muunnetaan kuviksi muunnetun StyleGAN2-johtuvan verkon avulla, lähestymistavassa, joka ottaa vaikutteita aiemmasta NVIDIA (NVDA ) -tutkimuksesta.

Muunnettu StyleGAN 2 -johdannainen NVIDIA-tutkimuksesta. Lähde: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2 on muunnettu BlobGAN:iin siten, että se hyväksyy syötteen pallokartasta sen sijaan, että se ottaisi yksittäisen globaalivektorin, kuten yleensä tapahtuu.

Sarja muokkauksia, joita BlobGAN mahdollistaa, mukaan lukien “automaattinen täydentäminen” tyhjässä makuuhuonekohtauksessa, ja huoneen elementtien kokoa muuttava ja sijaintia muuttava toiminto. Seuraavassa rivissä nähdään käyttäjän käytettävissä oleva instrumentaatio, joka mahdollistaa tämän – pallokartta.
Verrattaessa, sen sijaan, että suuri ja monimutkainen rakennus (latenttiavaruus) tuotettaisiin olemassa yhdessä kertaa, ja sitten joutuisi tutkimaan sen loputtomat polut, BlobGAN lähettää komponenttiblokkeja alusta, ja aina tietää, missä ne ovat. Tämä eriyttäminen sisällöstä ja sijainnista on työn suurin innovaatio.
* Ei toiminut kirjoitushetkellä
** Koodi ei ollut julkaistu kirjoitushetkellä
Julkaistu ensimmäisen kerran 8. toukokuuta 2022.












