Andersonin kulma
Luomalla mukautettu generatiivinen vastakkainen verkko piirroksilla

Tutkijat Carnegie Mellonista ja MIT:stä ovat kehittäneet uuden menetelmän, joka mahdollistaa käyttäjän luomisen mukautettuja generatiivisia vastakkaisia verkkoja (GAN) kuvanluontijärjestelmiä yksinkertaisesti piirtämällä osoittavia viivapiirroksia.
Tällainen järjestelmä voisi sallia loppukäyttäjän luomisen kuvienluontijärjestelmiä, jotka pystyvät luomaan erittäin tarkkoja kuvia, kuten tiettyjä eläimiä, rakennusten tyyppejä ja jopa yksittäisiä henkilöitä. Tällä hetkellä useimmat GAN-kuvienluontijärjestelmät tuottavat laajoja ja melko satunnaisia tuloksia, joissa on rajoitettu mahdollisuus määritellä tiettyjä ominaisuuksia, kuten eläinten rotu, hiusten tyypit ihmisillä, arkkitehtuurin tyylit tai todelliset kasvonpiirteet.
Lähestymistapa, josta kerrotaan artikkelissa Piirrä oma GAN, käyttää uudenlaista piirroksien käyttöliittymää tehokkaana “hakutoiminnona” etsimään ominaisuuksia ja luokkia muuten ylikuormitettujen kuvatietokantojen, jotka voivat sisältää tuhansia erilaisia objekteja, mukaan lukien monia alaluokkia, jotka eivät ole merkityksellisiä käyttäjän aikomukselle. GAN koulutetaan tämän suodatetun alijoukon kuvista.
Kun käyttäjä piirtää tarkan objektityypin, jonka kanssa hän haluaa kalibroida GANin, kehyksen generoivat ominaisuudet erikoistuvat tähän luokkaan. Esimerkiksi, jos käyttäjä haluaa luoda kehys, joka luo tietyn kissatyypin (eikä vain mitä tahansa kissaa, kuten saadaan This Cat Does Not Exist), hänen piirroksensa toimivat suodattimena, joka poistaa epäolennaiset kissaluokat.

Lähde: https://peterwang512.github.io/GANSketching/
Tutkimuksen johtaa Sheng Yu-Wang Carnegie Mellon -yliopistosta yhdessä kollegansa Jun-Yan Zhun ja David Baun kanssa MIT:n tietojenkäsittelytieteen ja tekoälylaboratoriosta.
Menetelmä on kutsuttu “GAN-piirroksiksi”, ja se käyttää syötteenä annettuja piirroksia muuttaakseen suoraan “malli”-GAN-mallin painoja kohdistamaan tunnistettuun alueeseen tai alalueeseen erilaisten vastakkaiden tappioiden kautta.
Eri sääntöistämismenetelmiä tutkittiin varmistamaan, että mallin tuloste on monipuolinen ja säilyttää korkean kuvanlaadun. Tutkijat loivat näyteohjelmia, jotka pystyvät interpoloimaan latenttiluvun ja suorittamaan kuvankäsittelytoimia.
Tämä [$class] ei ole olemassa
GAN-pohjaiset kuvienluontijärjestelmät ovat muodostuneet muodikkaiksi, ellei jopa meemeiksi, viime vuosien aikana, ja niiden mukana on tullut projektien lisääntyminen, jotka pystyvät luomaan kuvia olemattomista asioista, mukaan lukien ihmiset, vuokra-asunnot, välipaloja, jalkoja, hevosiä, poliitikkoja ja hyönteisiä, muun muassa.
GAN-pohjaiset kuvienluontijärjestelmät luodaan kokoamalla tai kuratoidessa laajoja tietokantoja, jotka sisältävät kuvia kohdealueesta, kuten kasvoista tai hevosoista; kouluttamalla malleja, jotka yleistävät joukon ominaisuuksia kuvissa tietokannassa; ja toteuttamalla generoivat moduulit, jotka voivat tuottaa satunnaisia esimerkkejä opittujen ominaisuuksien perusteella.

DeepFacePencilin piirrosten tuloste, joka mahdollistaa käyttäjien luomisen fotorealistisia kasvoja piirroksista. Monia samanlaisia piirros-kuvaprojekteja on olemassa.
Korkean dimensionaaliset ominaisuudet ovat ensimmäisiä, jotka konkretisoidaan koulutusprosessin aikana, ja ne ovat vastaavia kuin maalarin ensimmäiset laajat värialueet kanvaksella. Nämä korkean dimensionaaliset ominaisuudet korreloivat lopulta paljon yksityiskohtaisempiin ominaisuuksiin (esim. kissan silmänkiilto ja terävät viikset, eikä vain geneerinen beigen värinen pöllö, joka edustaa päätä).
Minä tiedän, mitä tarkoitat…
Karttamalla suhdetta näiden varhaisempien perusmuotojen ja lopulta yksityiskohtaisempien tulkintojen välillä, jotka saadaan paljon myöhemmin koulutusprosessissa, on mahdollista päätellä suhteita “epämääräisten” ja “tarkkojen” kuvien välillä, mikä mahdollistaa käyttäjien luomisen monipuolisia ja fotorealistisia kuvia karkeista viivapiirroksista.
Viime aikoina NVIDIA julkaisi pöytäversion pitkäaikaisesta GauGAN-tutkimuksestaan GAN-pohjaisen maisemanluontiin, joka osoittaa helposti tämän periaatteen:

Lähestyskuvat muunnetaan rikkaiksi maisemakuviksi NVIDIA:n GauGANin ja nyt NVIDIA Canvas -sovelluksen kautta. Lähde: https://rossdawson.com/futurist/implications-of-ai/future-of-ai-image-synthesis/
Samalla tavoin useat järjestelmät, kuten DeepFacePencil, ovat käyttäneet samaa periaatetta luomaan piirroskäyttöisiä fotorealistisia kuvienluontijärjestelmiä eri aloille.
Yksinkertaistamalla piirros-kuvaa
Uuden artikkelin GAN-piirrosten lähestymistapa pyrkii poistamaan vaativan datan keräämisen ja kuratoinnin, joka on tyypillisesti osa GAN-kuvienluontikehyksen kehittämistä, käyttämällä käyttäjän syötettä määrittämään, mikä alijoukko kuvista tulisi muodostaa koulutusaineiston.
Järjestelmä on suunniteltu vaatimaan vain pienen määrän syötteenä annettuja piirroksia kalibroimaan kehyksen. Järjestelmä kääntää tehokkaasti PhotoSketch-järjestelmän toiminnallisuuden, joka on yhteistyöhön perustuva tutkimushanke vuodelta 2019, johon osallistuivat tutkijat Carnegie Mellonista, Adobesta, Uber ATG:stä ja Argo AI:sta, ja se on sisällytetty uuteen työhön. PhotoSketch oli suunniteltu luomaan taiteellisia piirroksia kuvista, ja se sisältää jo tehokkaan kartan epämääräisten ja tarkkojen kuvienluontisuhteiden välillä.
Generoivassa prosessissa uusi menetelmä muuttaa vain StyleGAN2:n painoja. Koska kuvadata on vain osa koko saatavilla olevasta datasta, muokkaamalla vain karttaverkkoa saadaan toivottuja tuloksia.
Menetelmää arvioitiin useilla suosituilla alalueilla, mukaan lukien hevonen, kirkot ja kissat.
Princetonin yliopiston vuoden 2016 LSUN-tietokanta käytettiin keskeisenä aineistona, josta johdettiin kohdealueita. Järjestelmän piirrosten karttaamiseksi, joka on robusti maailmanlaajuisten käyttäjien syötteiden erityispiirteille, järjestelmä koulutettiin Microsoftin QuickDraw-tietokannasta kehitetyillä kuvilla vuosina 2021-2016.
Vaikka PhotoSketchin ja QuickDraw’n piirrosten karttaus eroaa melkoisesti, tutkijat totesivat, että heidän kehyksensä onnistuu hyvin ylittämään ne melko helposti yksinkertaisilla asennoilla, vaikka monimutkaisemmat asennot (kuten kissat makaamassa) osoittautuvat haasteellisemmiksi, ja hyvin abstraktit käyttäjän syötteet (esim. liian karkeat piirrokset) heikentävät tulosten laatua.

Latenttiluvu ja luonnollinen kuvankäsittely
Tutkijat kehittivät kaksi sovellusta perustyön perusteella: latenttiluvun muokkaus ja kuvankäsittely. Latenttiluvun muokkaus tarjoaa käyttäjälle tulkiteltavat ohjaimet, jotka on tehostettu koulutusajassa, ja ne mahdollistavat laajan vaihtelun, säilyttäen uskollisuuden kohdealueeseen ja miellyttävän johdonmukaisuuden vaihteluiden välillä.
Latenttiluvun muokkauskomponentti perustui GANSpace-projektiin vuodelta 2020, joka on yhteistyöhön perustuva hanke Aalto-yliopiston, Adoben ja NVIDIA:n välillä.
Yksittäinen kuva voidaan myös syöttää mukautettuun malliin, jolloin voidaan tehostaa luonnollinen kuvankäsittely. Tässä sovelluksessa yksittäinen kuva projetoidaan mukautettuun GAN:iin, mikä mahdollistaa suoran kuvankäsittelyn ja säilyttää latenttiluvun muokkaamisen, jos sitä on myös käytetty.

Tässä on käytetty aitoa kuvaa syötteenä GAN:iin (kissamalli), joka muokkaa syötteen vastaamaan esitettyjä piirroksia. Tämä mahdollistaa kuvankäsittelyn piirrosten avulla.
Vaikka järjestelmä on konfiguroitavissa, se ei ole suunniteltu toimimaan reaaliajassa, ainakin koulutuksen ja kalibroinnin osalta. Tällä hetkellä GAN-piirros vaatii 30 000 koulutusiteraatiota. Järjestelmä vaatii myös pääsyn alkuperäiseen koulutusdataan alkuperäisestä mallista.
Tapauksissa, joissa tietokanta on avoimen lähdekoodin ja lisenssi, joka sallii paikallisen kopioinnin, tämä voidaan toteuttaa sisällyttämällä lähdeaineisto paikallisesti asennettuun pakettiin, vaikka se vaatisi merkittävän levytilan; tai käsittelemällä dataa etäältä pilvipohjaisen lähestymistavan kautta, mikä saattaa aiheuttaa verkkoliikenteen viiveitä ja (tapauksissa, joissa prosessi tapahtuu pilvessä) mahdollisesti laskennan kustannusvaikutuksia.

Muunnelmat mukautetuista FFHQ-malleista, jotka on koulutettu vain neljällä ihmisten luomalla piirroksella.















