Andersonin kulma
GAN:n latentin avaruuden karttamisen ei-odotettu hyöty

Kun tutkijaryhmä Kiinasta ja Australiasta yritti parantaa tekoälyllä luotujen kuvien laatua ja uskottavuutta, he löysivät tahattomasti menetelmän, jolla voidaan ohjata Generative Adversarial Networkin (GAN) latenttia avaruutta. Tämä menetelmä mahdollistaa käyttäjän vuorovaikutteisen tutkimisen GAN:n latenttia avaruutta hiiren avulla, ikään kuin vierittäisiin videota tai selattaisiin kirjaa.
Tutkimuksen tulokset, jotka olivat projektin päämäärän sivutuote, mahdollistavat käyttäjän mielivaltaisen ja vuorovaikutteisen tutkimisen GAN:n latenttia avaruutta. Tämä löytö on tärkeä, sillä se avaa uusia mahdollisuuksia kuvansynteesille ja -muokkaukselle.

Tutkijoiden mukaan tuotetun videon otteita (katso alla oleva upotus). Huomaa, että käyttäjä muokkaa muodonmuutoksia ‘otin’ -kohdistimella (ylävasen). Source: https://www.youtube.com/watch?v=k7sG4XY5rIc
Menetelmä käyttää “lämpökarttoja” osoittamaan, mitkä kuvan osat parannettava, kun GAN suorittaa saman aineiston useita kertoja. Lämpökartat on tarkoitettu parantamaan kuvan laatua kertomalla GAN:lle, missä menee väärin, jotta seuraava yritys olisi parempi. Samalla se tarjoaa “kartan” koko latentista avaruudesta, jota voidaan selata siirtämällä hiirtä.

Paikallinen visuaalinen tarkkaavaisuus korostettu GradCAM:lla, joka osoittaa huomion tarpeen asettamalla kirkkaita värejä. Source: https://arxiv.org/pdf/2112.00718.pdf
Tutkimusartikkeli on nimeltään Parantamalla GAN:n tasapainoa lisäämällä paikallista tietoisuutta, ja se on peräisin Kiinan Hongkongin yliopistosta ja Australian kansallisyliopistosta. Lisäksi artikkelin lisäksi video ja muu materiaali on saatavilla projektisivulla.
Työ on vasta alkuvaiheessa, ja se rajoittuu tällä hetkellä matalaresoluutioisiin kuvien (256×256) käsittelyyn, mutta se on osoitus siitä, että GAN:n latentin avaruuden “musta laatikko” voidaan avata, ja se tulee aikana, jolloin useat tutkimushankkeet pyrkivät saavuttamaan suuremman hallinnan kuvansynteesiin.
Vaikka nämä kuvat ovat mielenkiintoisia (ja voit nähdä enemmän niistä paremmassa resoluutiossa alla olevassa videossa), olennaisempaa on, että tutkimus on löytänyt tavan parantaa kuvan laatua ja mahdollisesti tehdä se nopeammin, kertomalla GAN:lle tarkalleen, missä menee väärin koulutuksen aikana.
Mutta, kuten Adversarial osoittaa, GAN ei ole yksittäinen kokonaisuus, vaan epätasainen konflikti valta- ja työnteon välillä. Ymmärtääksemme, mitä parannuksia tutkijat ovat tehneet tässä suhteessa, tarkastelemme, miten tämä sota on luonnehdittu tähän asti.
Generaattorin surkeat olot
Jos olet koskaan ollut vaivautunut ajattelemaan, että joku uusi vaate, jonka olet ostanut, on valmistettu jonkin maiden sorrettujen maiden työläisten toimesta, tai olet ollut esimiehen tai asiakkaan alaisena, joka kertoo sinulle “tee se uudelleen” ilman kertomatta, mikä on vikana edellisessä yrityksessä, sääli Generaattoria, GAN:n osaa.

Generaattori on työntekijä, joka on ilahduttanut sinua viimeisen viiden vuoden ajan auttamalla GAN:ia luomaan fotorealistisia ihmisiä, jotka eivät ole olemassa, nostamaan vanhoja videopelien resoluutiota 4k-resoluutioon ja muuttamaan sadan vuoden vanhan kuvamateriaalin täysivärikuvaksi 60 fps:llä, muun muassa muita upeita tekoälyuutuuksia.

Luomalla fotorealistisia kasvoja olemattomista ihmisistä vanhojen videopelien ja arkistovideoiden palauttamiseen, GAN on ollut kiireinen viime vuosina.
Generaattori suorittaa koulutusaineiston uudelleen ja uudelleen (kuten kasvojen kuvia, jotta GAN voisi luoda valokuvamaisia kuvia satunnaisista, olemattomista ihmisistä), yhden valokuvan kerrallaan, useita päiviä tai jopa viikkoja, kunnes se pystyy luomaan kuvia, jotka ovat yhtä vakuuttavia kuin aineistossa olevat aidoit valokuvat.
Miten Generaattori tietää, että se tekee edistystä kussakin yrityksessä?
Generaattorilla on helvettiinmoinen esimies.

Erottelijan armoton epäselvyys
Erottelijan tehtävä on kertoa Generaattorille, ettei se onnistunut luomaan aidoita kuvia, ja käskeä sitä “tee se uudelleen”. Erottelija ei kerro Generaattorille, mitä oli vikana edellisessä yrityksessä; se tarkastelee vain yksityisesti ja vertaa luotua kuvaa alkuperäisiin kuviin (jälleen yksityisesti) ja antaa sille pisteytys.
Pistemäärä on aina riittämätön. Erottelija ei lopeta sanomasta “tee se uudelleen”, kunnes tutkijat sammuttavat sen (kun he katsovat, että lisäkoulutus ei paranna tulosta enää).
Tässä tapauksessa, ilman rakentavaa kritiikkiä ja aseistettuna vain salaperäisellä pisteytyksellä, Generaattorin on arvioitava satunnaisesti, mitkä kuvan osat tai näkökohdat aiheuttivat korkeamman pisteytyksen kuin aiemmin. Tämä johtaa useisiin epäonnistuneisiin reitteihin ennen kuin se muuttaa jotain myönteisesti tarpeeksi saadakseen korkeamman pisteytyksen.
Erottija opettajana ja mentorina
Uuden tutkimuksen innovaatio on perustuu siihen, että Erottija osoittaa nyt Generaattorille, mitkä kuvan osat olivat tyydyttämättömiä, jotta Generaattori voisi keskittyä niihin alueisiin seuraavassa iteroinnissa eikä heittäisi pois osia, jotka saivat korkeamman pisteytyksen. Suhteen luonne on muuttunut taistelusta yhteistyöhön.

Parantamaan epätasapuolisuutta Erottelijan ja Generaattorin välillä tutkijat käyttivät GradCAM:ia mekanismina, joka voi muuttaa Erottelijan havainnot visuaaliseksi palautteeksi Generaattorin seuraavaa yritystä varten.
Uusi “tasapaino” -koulutusmenetelmä on nimeltään EqGAN. Maksimaalisen toistettavuuden vuoksi tutkijat ottivat käyttöön olemassa olevia tekniikoita ja menetelmiä oletusarvoisilla asetuksilla, mukaan lukien StyleGan2 -arkkitehtuuri.

EqGAN:n arkkitehtuuri. Generaattorin paikallinen koodaus on kytketty Erottelijan paikalliseen tietoisuuteen, ja satunnaiset näytteet paikallisia lämpökarttoja (katso edellinen kuva) on koodattu takaisin Generaattoriin paikallisen koodauskerroksen (SEL) kautta. GradCAM on mekanismi, jolla Erottelijan huomion kartat ovat saatavilla Generaattorille.
GradCAM tuottaa lämpökarttoja (katso yllä olevat kuvat), jotka heijastavat Erottelijan kritiikkiä viimeisimmästä iteroinnista, ja tekee sen saataville Generaattorille.
Kun malli on koulutettu, kartta säilyy tämän yhteistyön prosessin jäänteenä, mutta sitä voidaan myös käyttää lopullisen latentin koodin vuorovaikutteiseen tutkimiseen tutkijoiden projektivideon (katso alla) osoittamalla tavalla.
EqGAN
Projekti käytti useita suosittuja aineistoja, mukaan lukien LSUN Cat ja Churches -aineistot, sekä FFHQ -aineiston. Alla oleva video esittää myös esimerkkejä kasvojen ja kissan muokkauksesta EqGAN:lla.
Kaikki kuvat on muunnettu 256×256 resoluutioon ennen EqGAN:n koulutusta StyleGAN2:n virallisen toteutuksen avulla. Malli on koulutettu eräkoolle 64 yli 8 GPU:lla, kunnes Erottelija on nähnyt yli 25 miljoonaa kuvaa.
Tulosten testaamiseksi valituissa näytteissä Frechet Inception Distance (FID) -mittauksella, tutkijat määrittivät mittarin, jota kutsutaan Epätasapainon osoittimaksi (DI) – Erottelijan tietämysetua Generaattoria kohtaan, tavoitteena kaventaa tätä kuilua.
Kolmessa koulutetussa aineistossa uusi mittari osoitti hyödyllisen laskun paikallisen tietoisuuden koodaamisen jälkeen Generaattoriin, ja parannettu tasapaino todettiin sekä FID:llä että DI:llä.

Tutkijat johtopäätöksenä:
‘Toivomme, että tämä työ voi inspiroida enemmän tutkimuksia GAN:n tasapainon uudelleenarvioimiseksi ja kehittää uusia menetelmiä kuvansynteesin laadun parantamiseksi GAN:n tasapainon hallitsemisen kautta. Tulevassa työssä tulemme suorittamaan enemmän teoreettista tutkimusta tästä aiheesta.’
Ja jatkavat:
‘Laadulliset tulokset osoittavat, että menetelmämme onnistuu pakottamaan Generaattorin keskittymään tiettyihin alueisiin. Kokeet eri aineistoilla vahvistavat, että menetelmämme lievittää epätasapainoa GAN:n koulutuksessa ja parantaa merkittävästi kuvansynteesin laatua. Tuloksena oleva malli, jossa on paikallinen tietoisuus, mahdollistaa myös interaktiivisen muokkauksen lopullista kuvaa.’
Katsokaa alla olevaa videota lisätietoja projektista ja lisää esimerkkejä dynaamisesta ja interaktiivisesta latentin avaruuden tutkimisesta GAN:lla.
11:12 4. joulukuuta 2021 – Korjattu GradCAM:n URL ja siivottu ympäröivä viittaus.












