AI-mallit ja alustat
Korkean tarkkuuden semanttinen kuvanmuokkaus EditGAN:llä
Generatiiviset vastakkainoppijaverkkot (GAN) ovat olleet mukana uusissa sovelluksissa kuvanmuokkausalaan. Viime kuukausien ajan EditGAN on saavuttanut suosiota tekoäly- ja koneoppimisalalla, koska se on uudenlainen menetelmä korkean tarkkuuden ja laadukkaan semanttisen kuvanmuokkauksen toteuttamiseksi.
Tarkastelemme EditGAN-mallia yksityiskohtaisesti ja kerromme, miksi se voi olla merkittävä askel semanttisessa kuvanmuokkausalaan.
Aloita. Ennen kuin tutustumme EditGAN:iin, on tärkeää ymmärtää, mikä on EditGAN:n merkitys ja miksi se on tärkeä askel eteenpäin.
Miksi EditGAN?
Vaikka perinteiset GAN-rakenteet ovat edistäneet tekoälypohjaista kuvanmuokkausta merkittävästi, on niissä joitakin suuria haasteita, kun rakennetaan GAN-rakennetta alusta alkaen.
- Koulutusvaiheessa GAN-rakenteen tarvitaan suuri määrä merkittyjä tietoja, joissa on semanttisia segmentointimerkintöjä.
- Ne tarjoavat vain korkean tason valvontaa.
- Ja usein ne vain interpoloivat edestakaisin kuvien välillä.
Voidaan havaita, että vaikka perinteiset GAN-rakenteet saavuttavat työn, ne eivät ole tehokkaita laajamittaisessa käytössä. Perinteisten GAN-rakenteiden alhainen tehokkuus on syy, miksi EditGAN esiteltiin NVIDIA (NVDA ):lla vuonna 2022.
EditGAN on ehdotettu tehokkaaksi menetelmäksi korkean tarkkuuden ja laadukkaan semanttisen kuvanmuokkauksen toteuttamiseksi, joka mahdollistaa käyttäjilleen muokata kuvia muuttamalla niiden yksityiskohtaisia segmentointimaskuja. Yksi syy, miksi EditGAN on skaalautuva menetelmä kuvanmuokkaustehtävissä, on sen arkkitehtuuri.
EditGAN-malli on rakennettu GAN-pohjalle, joka mallintaa kuvia ja niiden semanttisia segmentointeja yhdessä ja vaatii vain muutaman merkityn tai annotoidun koulutusdatan. EditGAN:n kehittäjät ovat yrittäneet upottaa kuvan GAN:n latenttiavaruuteen muokatakseen kuvaa tehokkaasti ehdollisen latenttikoodin optimoinnin mukaisesti segmentoinnin muokkauksen mukaan. Lisäksi, optimoinnin amortisointiin, malli yrittää löytää “muokkausvektorit” latenttiavaruudessa, jotka toteuttavat muokkaukset.
EditGAN-kehyksen arkkitehtuuri mahdollistaa mallille oppia mielivaltaisen määrän muokkausvektoreita, jotka voidaan soveltaa suoraan muihin kuviin nopeasti ja tehokkaasti. Lisäksi, kokeelliset tulokset osoittavat, että EditGAN voi muokata kuvia ennen näkemättömällä yksityiskohtaisuudella säilyttäen kuvan laadun maksimissaan.
Yhteenvetona siitä, miksi tarvitsemme EditGAN:ia, se on ensimmäinen GAN-pohjainen kuvanmuokkauskehyks, joka tarjoaa
- Erittäin korkean tarkkuuden muokkauksen.
- Toimii vain muutaman merkityn datan kanssa.
- Voidaan käyttää tehokkaasti reaaliaikaisissa tilanteissa.
- Mahdollistaa monien muokkausten yhdistämisen samanaikaisesti.
- Toimii GAN:lla generoiduilla, reaaliupotetuilla ja jopa ulkopuolisilla kuville.
Korkean tarkkuuden semanttinen kuvanmuokkaus EditGAN:llä
StyleGAN2, joka on valmis GAN-kehyksistä kuvasynteesiin, on EditGAN:n ensisijainen kuvagenerointikomponentti. StyleGAN2-kehyks upottaa latenttikoodit, jotka poimitaan monivaiheisen normaalijakauman joukosta, ja upottaa ne realistisiin kuviiin.
StyleGAN2 on syvä generatiivinen malli, joka on koulutettu synteesoi kuvia korkeimman mahdollisen laadun mukaisesti ja hankkii samalla semanttisen ymmärryksen kuvista, joita malli mallintaa.
Segmentointikoulutus ja päätöksenteko
EditGAN-malli upottaa kuvan GAN:n latenttiavaruuteen optimoinnin ja koodarin avulla, ja suorittaa segmentoinnin uudelle kuvalla ja kouluttaa segmentoinnin haaran. EditGAN-kehyks jatkaa aiempien töiden rakentamista ja kouluttaa koodarin upottamaan kuvat latenttiavaruuteen. Ensimmäinen tavoite on kouluttaa koodari, joka koostuu standardista pikselikohtaisesta L2- ja LPIPS-rakenteen tappioista, käyttäen GAN:n näytteitä ja todellisia koulutusdataa. Lisäksi malli säätää koodaria eksplisiittisesti käyttäen latenttikoodia, kun työskentelee GAN:n näytteiden kanssa.
Tuloksena malli upottaa merkityt kuvat tietokannasta, jotka on merkitty semanttisilla segmentoinneilla, latenttiavaruuteen ja käyttää ristientropiatappiota kouluttaa segmentoinnin haaraa generoijassa.
Käyttäminen segmentointimuokkausta latenttiavaruuden semantiikan löytämiseen
EditGAN:n ensisijainen tarkoitus on hyödyntää kuvien ja niiden semanttisten segmentointien yhteistä jakaumaa korkean tarkkuuden kuvanmuokkaukseen. Oletetaan, että meillä on kuva x, jota on muokattava, joten malli upottaa kuvan EditGAN:n latenttiavaruuteen tai käyttää mallin näytteitä itse. Segmentoinnin haara generoi y tai vastaavan segmentoinnin, koska sekä RGB-kuvat että segmentoinnit jakavat samat latenttikoodit w. Kehittäjät voivat sitten käyttää mitä tahansa merkintä- tai digitaalimaalaustyökaluja muokata segmentointia ja muokata niitä manuaalisesti tarpeiden mukaan.

Erilaiset muokkaustavat päätöksenteon aikana
Latenttiavaruuden muokkausvektorit, jotka saadaan optimoinnin avulla, voidaan kuvailla semanttisesti merkityksellisiksi ja usein eriytettyinä eri attribuutteja. Siksi, kun muokataan uutta kuvaa, malli voi upottaa kuvan suoraan latenttiavaruuteen ja suorittaa samat muokkaustoimenpiteet, jotka malli on oppinut aiemmin, ilman optimoinnin uudelleen suorittamista alusta alkaen. Voidaan sanoa, että muokkausvektorit, jotka malli oppii, amortisoi optimoinnin, joka oli välttämätöntä muokata kuvaa alun perin.
On huomattava, että kehittäjät eivät ole vielä täydellisesti saavuttaneet eriyttämistä, ja muokkausvektorit eivät aina palauta parhaita tuloksia, kun ne käytetään muihin kuviin. Kuitenkin ongelma voidaan voittaa poistamalla muokkausartefakteja muista osista kuvasta suorittamalla muutamia lisäoptimointivaiheita testiaikana.
Perustuen nykyisiin tietämiimme, EditGAN-kehyks voidaan käyttää kuvien muokkaamiseen kolmella eri tavalla.
- Reaaliaikainen muokkaus muokkausvektoreilla
Paikallistetuille ja eriytetyille kuville malli muokkaa kuvia soveltamalla aiemmin opittuja muokkausvektoreita eri skaaloilla ja manipuloi kuvia interaktiivisilla nopeuksilla.
- Itseohjautuva tarkennus vektorigraafisella muokkauksella
Paikallistetuille kuville, jotka eivät ole täysin eriytettyjä muiden osien kanssa, malli aloittaa kuvan muokkaamisen käyttäen aiemmin opittuja muokkausvektoreita ja poistaa muokkausartefakteja suorittamalla muutamia lisäoptimointivaiheita testiaikana.
- Optimointipohjainen muokkaus
Suorittaakseen laajamittaista ja kuvakohtaisia muokkauksia, malli suorittaa optimoinnin alusta alkaen, koska muokkausvektorit eivät voi suorittaa näitä siirtoja muihin kuviin.
Toteutus
EditGAN-kehyks arvioidaan kuvilla, jotka ovat jaettu neljään eri kategoriaan: Autot, Linnut, Kissat ja Kasvot. Segmentoinnin haara mallissa koulutetaan käyttäen 16, 30, 30, 16 kuvamaskipareja merkittyinä koulutusdatoina Autot, Linnut, Kissat ja Kasvot vastaavasti. Kun kuva on muokattava pelkästään optimoinnin avulla tai kun malli yrittää oppia muokkausvektoreita, malli suorittaa 100 optimointivaihetta Adam-optimoinnin avulla.
Kissojen, autojen ja kasvojen tietokannassa malli käyttää todellisia kuvia DatasetGAN:n testijoukosta, joita ei käytetty GAN-kehyksen koulutukseen suorittaakseen muokkaustoimintoja. Nämä kuvat upotetaan suoraan EditGAN:n latenttiavaruuteen optimoinnin ja koodauksen avulla. Lintujen kategoriassa muokkaus näytetään GAN:lla generoiduilla kuvilla.
Tulokset
Laadulliset tulokset
Sisäinen tulokset

Yllä oleva kuva osoittaa EditGAN-kehyksen suorituskyvyn, kun se soveltaa aiemmin opittuja muokkausvektoreita uusiin kuviihin ja tarkentaa kuvia 30 optimointivaiheen avulla. Nämä EditGAN-kehyksen suorittamat muokkaustoimenpiteet ovat eriytettyjä kaikille luokille ja ne säilyttävät kuvan laadun. Vertaamalla EditGAN:n tuloksia muihin menetelmiin, voidaan havaita, että EditGAN-kehyks suoriutuu paremmin kuin muut menetelmät suorittaessaan korkean tarkkuuden ja monimutkaisia muokkauksia säilyttäen samalla aiheen identiteetin ja kuvan laadun.
Mitä hämmästyttävää on, että EditGAN-kehyks voidaan käyttää muokkaamaan kuvia erittäin korkealla tarkkuudella, kuten laajentamalla pupilleja tai muokkaamalla auton pyörien napeja. Lisäksi EditGAN voidaan käyttää muokkaamaan semanttisia osia objekteista, joissa on vain muutamia pikseleitä, tai suorittamaan laajamittaista muokkauksia kuvassa. On huomattava, että useat EditGAN-kehyksen muokkaustoimenpiteet voivat generoida manipuloituja kuvia, jotka eivät ole GAN:n koulutusdatassa.
Ulkoiset tulokset
Arvioidakseen EditGAN:n ulkoisen suorituskyvyn, kehyks on testattu MetFaces-tietokannassa. EditGAN-malli käyttää sisäisiä todellisia kasvoja luomaan muokkausvektoreita. Malli upottaa MetFaces-portraitit, jotka ovat ulkoisia, 100-vaiheisen optimointiprosessin avulla ja soveltaa muokkausvektoreita 30-vaiheisen itseohjautuvan tarkennusprosessin avulla. Tulokset voidaan nähdä seuraavassa kuvassa.

Määrälliset tulokset
Mittaakseen EditGAN:n kuvanmuokkauskykyä määrällisesti, malli käyttää hymy-muokkausvertailua, joka esiteltiin alun perin MaskGAN:lla. Kasvot, jotka sisältävät neutraalin ilmeen, korvataan hymyilevillä kasvoilla, ja suorituskyky mitataan kolmen parametrin mukaan.
- Semanttinen oikeellisuus
Malli käyttää esikoulutettua hymy-attribuuttien luokittelijaa mittaakseen, näyttävätkö kasvot kuvissa hymyileviltä muokkauksen jälkeen.
- Jakautumisen taso kuvan laatu
Kernel Inception Distance (KID) ja Frechet Inception Distance (FID) lasketaan CelebA-testidatasa ja 400 muokatun testikuvan välillä.
- Identiteetin säilyttäminen
Mallin kyky säilyttää aiheen identiteettiä muokattaessa kuvaa mitataan esikoulutetun ArcFace-ominaisuusjärjestelmän avulla.

Yllä oleva taulukko vertaa EditGAN-kehyksen suorituskykyä muihin vertailumalliin smile-muokkausvertailussa. Menetelmä, jota EditGAN-kehyks seuraa, saavuttaa korkeat tulokset, ja se verrataan kolmeen eri vertailumalliin:
- MaskGAN
MaskGAN ottaa ei-hymyilevät kuvat ja niiden segmentointimaskit sekä kohdehymyilevän segmentointimaskin syötteenä. On huomattava, että verrattuna EditGAN:iin, MaskGAN-kehyks vaatii suuren määrän annotoituja tietoja.
- Paikallinen muokkaus
EditGAN vertaa myös suorituskykyään paikalliseen muokkaukseen, joka on menetelmä, jota käytetään GAN-ominaisuuksien ryhmittelyyn paikallisen muokkauksen toteuttamiseen, ja se riippuu viitekuvista.
- InterFaceGAN
Kuten EditGAN, InterFaceGAN yrittää löytää muokkausvektoreita mallin latenttiavaruudessa. Kuitenkin toisin kuin EditGAN, InterFaceGAN-malli käyttää suurta määrää annotoituja tietoja, apuattribuuttiluokittelijoita ja ei ole yhtä tarkkaa muokkausta.
- StyleGAN2-tislaus
Tämä menetelmä luo vaihtoehtoisen lähestymistavan, joka ei välttämättä vaadi todellisten kuvien upottamista, vaan sen sijaan se käyttää muokkausvektori-mallia koulutusdatan luomiseen.

Rajoitukset
Koska EditGAN perustuu GAN-kehykseen, se kärsii samasta rajoituksesta kuin muut GAN-mallit: se toimii vain kuvilla, jotka voidaan mallintaa GAN:lla. EditGAN:n rajoitus toimia GAN-mallin kuville on suurin syy, miksi on vaikea toteuttaa EditGAN:ia eri tilanteissa. On kuitenkin huomattava, että EditGAN:n korkean tarkkuuden muokkaukset voidaan siirtää helposti muihin kuviin käyttäen muokkausvektoreita.
Johtopäätös
Yksi tärkeimmistä syistä, miksi GAN ei ole teollisuusstandardi kuvanmuokkausalaan, on sen rajoitettu käytännöllisyys. GAN-kehykset vaativat yleensä suuren määrän annotoituja koulutusdataa, ja ne eivät usein palauta korkeaa tehokkuutta ja tarkkuutta.
EditGAN pyrkii ratkaisemaan ongelmat, jotka perinteiset GAN-kehykset aiheuttavat, ja se yrittää olla tehokas menetelmä korkealaatuisen ja korkean tarkkuuden semanttisen kuvanmuokkauksen toteuttamiseksi. Tulokset ovat osoittaneet, että EditGAN tarjoaa, mitä se lupaa, ja se suoriutuu jo paremmin kuin jotkut nykyiset teollisuusstandardit ja -mallit.












