AI-mallit ja alustat

Plastinen kirurgia GAN: n luomaisten kasvojen parantamiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Improvements in synthetically generated (GAN) images

Uusi tutkimus Etelä-Koreasta lupailee parantaa GAN: n (Generative Adversarial Networks) luomien syntetisten kasvokuvien laatua.

Järjestelmä pystyy tunnistamaan GAN-prosesseissa syntyneitä kuvavirheitä ja korjaamaan niitä, jopa korvaamalla hupun peittämän hiuksen, korvaamalla kasvojen osia, jotka puuttuvat alkuperäisestä kuvasta, ja poistamalla esteitä, kuten käsien ja aurinkolasien, ja se toimii myös hyvin maisema- ja arkkitehtuuriin liittyvissä tuloksissa.

GAN-korjaus

Vasemmalla jokaisessa sarakkeessa alkuperäinen GAN-tulos virheineen, seuraavaksi kaksi muuta lähestymistapaa virheisiin, ja lopuksi Etelä-Korean tutkijoiden käyttämä menetelmä. Lähde: https://arxiv.org/pdf/2104.06118.pdf

Useimmat viimeaikaiset lähestymistavat GAN-kuvien laadun parantamiseksi ovat katsoneet, että virheet ovat prosessin ammattitauti, ja metodologiaa pidetään “luonnonvoimana”, ja siihen liittyvät enemmän psykedeeleiset tai poikkeavat tulokset ovat välttämättömiä sivutuotteita.

Sen sijaan Etelä-Korean tutkimus ehdottaa, että virheisiin vaikuttavat tekijät tunnistetaan ja niiden vaikutus vähennetään tai poistetaan GAN-verkosta puolivalvottavalla tasolla, joka ylittää ja laajentaa GAN-rakenteen omat itsesäätelevät mekanismit.

Hankkeen toteuttamiseksi oli luotava laajasti sovellettava käsinkirjoitettu tietokanta kuvista, jotka olivat voimakkaasti vaikuttaneet GAN-virheisiin. Aluksi tutkijat käyttivät Frechet Inception Distance (FID), mittaria, joka arvioi GAN-tulosten laatua vertaamalla kuvien piirteitä, kelpoisuusyksikkönä. 10 000 kuvaa, joilla oli korkein FID-piste 200 000 kuvan joukosta, käytettiin erillisinä “virhe-yksikköinä”. Tutkijat merkitsivät käsin 2 000 luotua kuvaa, luokitellen ne joko “normaaleiksi” tai FID-virheisiin vaikuttaviksi. Sitten luotiin malli, joka luokitteli tietokannan virheisiin, normaaleihin ja satunnaisiin maailmanlaajuisiin näytteisiin.

Tämän jälkeen Gradient-weighted Class Activation Mapping (Grad-CAM) käytettiin virheisiin vaikuttavien alueiden maskien luomiseen, mikä teki virheiden merkinnän automaattiseksi.

Grad-CAM-maskit

Yllä olevassa kuvassa Grad-CAM-maskit on sovellettu LSUN-Church outdoor -tietokannan ja CelebA-HQ -tietokannan tuloksiin.

20 000 kuvan joukosta 20 eniten vaikuttaneen tuloksen analyysin perusteella luotiin segmentointimaskit, joihin edustavat tulokset voitiin korvata vähentämällä virheisiin vaikuttavien yksiköiden aktivaatiota seuraavissa sukupolvisissa.

Ihmisten arvio virheiden korjaamisesta osoitti, että 53 % “korjatuista” kuvista luokiteltiin “normaaleiksi”, kun taas 97 % alkuperäisistä kuvista edustaa edelleen merkittäviä parannuksia alkuperäisiin.

Tutkijat väittävät, että tämä menetelmä voidaan soveltaa NVIDIA: n StyleGAN2: een vain vähäisin muutoksin.

GAN-lasien poisto

Syntetisen datan hyödyt

Ennen kaikkea kasvodataa koskien, todellisten maailmanlaajuisten tietokantojen niukkuus tietokoneen näön tutkimuksessa on este monille tärkeille tutkimusalueille, kuten kasvon tunnistamiselle, tunnekuvaustutkimukselle, lääketieteelliselle tutkimukselle ja kasvojen topologian hienojakoisemmalle segmentoinnille, muun muassa.

Nykyinen reaktio vapaan verkkotietojen käytön ja ad hoc -keräyksen vastaan todellisten kasvokuvien kasvojen tietokantojen luomiseksi on lisäksi este tutkimukselle, ja useat valtiot ja kansalliset viranomaiset rajoittavat verkkokuvien keräämistä ja sosiaalisen median kuvien käyttöä tähän tarkoitukseen.

Viimeisen kymmenen vuoden aikana on olemassa vain muutamia rajoitettuja kasvotietokantoja, jotka tarjoavat turvapaikan tämänkaltaiselle epävarmuudelle, ja useita julkisia tutkimushaasteita, jotka on keskitetty niihin. On kuitenkin väitetty, että tämä on johtanut siihen, että tutkimushankkeet ovat suuntautuneet menetelmiinsä nimenomaan näihin tietokantoihin, ja saavutettu vuosi vuodelta samankaltaisia tuloksia, mutta kustannuksella, joka on puutteellinen monipuolisuus alkuperäisessä aineistossa – tilanne, joka pahenee joka vuosi, kun uusi tutkimus rajoittuu näihin rajoituksiin.

Lisäksi jotkut näistä “perinteisistä” tietokannoista ovat joutuneet kritiikin kohteeksi rodullisen monipuolisuuden puutteen vuoksi, mikä viittaa siihen, että nämä vakiintuneet vertailukohteet eivät välttämättä ole sopivia resursseja lähitulevaisuudessa.

Tämä osoittaa tarpeen laadukkaiden kasvokuvien tarpeen, jotka ovat realistisia, mutta joissa “todellisen maailman” kuvat on muunnettu tunnistamattomiin. Vaikka tämä käyttö “todellisten” kasvokuvien “yhdellä etäisyydellä” voi itsessään lopulta laukaista ongelmia provenienssin suhteen, se on este, joka ei todennäköisesti tule esiin, kunnes oikeudelliset ja tekniset mekanismit tällaisen tietojen keräämisen osalta ovat vakiintuneet; ja koskien mahdollisia muutoksia oikeudellisiin kehyksiin tämän asian ympärillä, se on edelleen vähäisempi vaara kuin todellisten ihmisten kuvien käyttäminen.

Lisää lukemista:

Syntetisten kuvien realismin parantaminen
Generatiivisten neuroverkkojen sisäisten yksiköiden automaattinen korjaus

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai