Andersonin kulma

Haastavat “huonot hiukset” -päivät ihmisen kuvan synteesissä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Ihmisen hiusten kuvaaminen on ollut haasteellista jo roomalaisen patsaskauden aikana. Keskimääräinen ihmispää sisältää 100 000 hiussuorta, ja niiden refraktiivinen indeksi vaihtelee hiusten värin mukaan. Pitkien hiusten liike voidaan simuloida vain kompleksisten fysiikkamallien avulla, jotka ovat toistaiseksi soveltuneet vain perinteisiin CGI-menetelmiin.

Disney:n 2017 tutkimuksesta, fysiikkapohjainen malli yrittää soveltaa realistista liikettä fluidiin hiustyyliin CGI-työvirrassa. Lähde: https://www.youtube.com/watch?v=-6iF3mufDW0

Disney:n 2017 tutkimuksesta, fysiikkapohjainen malli yrittää soveltaa realistista liikettä fluidiin hiustyyliin CGI-työvirrassa. Lähde: https://www.youtube.com/watch?v=-6iF3mufDW0

Modernit deepfake-menetelmät eivät ole onnistuneet ratkaisemaan tätä ongelmaa. DeepFaceLab on ollut jo useita vuosia johtava paketti, jolla on “full head” -malli, joka pystyy vain kaappaamaan jähmeitä, lyhyitä (yleensä miehen) hiustyylejä. Myös FaceSwap on tarjonnut BiseNet-semantic segmentation -mallin, joka sallii käyttäjän sisällyttää korvat ja hiukset deepfake-virtaukseen.

Hiusten kuvaaminen on edelleen haasteellista, jopa lyhyiden hiustyylejen kohdalla. Tulokset ovat usein heikkolaatuisia, ja pää näyttää liimatuksi kuvan päälle, eikä se ole integroitu kuvan osaksi.

GAN-hiukset

Ihmisen simulaation kaksi kilpailevaa lähestymistapaa ovat Neural Radiance Fields (NeRF) ja Generative Adversarial Networks (GAN). NeRF pystyy kaappaamaan kohtauksen useista näkökulmista ja sisällyttämään 3D-representaation näistä näkökulmista tutkittavaan neuroverkkoon. GAN on edistyneempi ihmisen kuvan synteesissä, koska NeRF on vasta vuonna 2020 kehitetty.

NeRF:n 3D-geometrian ymmärtäminen mahdollistaa kohtauksen toistamisen suurella uskollisuudella ja johdonmukaisuudella, vaikka se ei tällä hetkellä tarjoa mahdollisuuksia fysiikkamallien soveltamiseen tai muille muunnoksille kuin kamerakulman muutoksille. NeRF:llä on myös hyvin rajalliset mahdollisuudet hiusten liikkeen toistamiseen.

GAN-pohjaiset vastaavat NeRF:lle ovat aloittaneet lähes mahdottoman esteen, koska GAN:n latenttiavaruus ei sisällä 3D-tietoa. 3D-tietoinen GAN-kasvokuvien synteesi on ollut kuuma aihe kuvan luomisessa viime vuosina, ja vuoden 2019 InterFaceGAN on yksi johtavista läpimurroista.

InterFaceGAN:n esitetyt ja valitut tulokset osoittavat kuitenkin, että neurohiusten johdonmukaisuus on edelleen haasteellinen ongelma aikajohdonmukaisuuden suhteen, mahdollisissa VFX-työvirroissa:

InterFaceGAN:n posemuodonmuutos, jossa hiukset

InterFaceGAN:n posemuodonmuutos, jossa hiukset “sirisevät”. Lähde: https://www.youtube.com/watch?v=uoftpl3Bj6w

Yhä useammat tutkimukset sisällyttävät CGI-pohjaisia 3D-tietoja GAN-työvirraan stabiloivana ja normaalistavana rajoituksena.

CGI-elementti voidaan edustaa väliaikaisilla 3D-primitiiveillä, kuten SMPL-mallilla, tai omaksamalla 3D-johtamistekniikoita NeRF:n tavoin, jossa geometria arvioidaan lähdekuvin tai videon perusteella.

Yksi uusi tutkimus, joka julkaistiin tällä viikolla, on MVCGAN, joka on yhteistyö ReLER:n, AAII:n, University of Technology Sydneyn, DAMO Academy at Alibaba Groupin ja Zhejiang Universityn välillä.

Uskottavat ja vankat uudet kasvokuvat, jotka MVCGAN on luonut CELEBA-HQ-aineistosta. Lähde: https://arxiv.org/pdf/2204.06307.pdf

Uskottavat ja vankat uudet kasvokuvat, jotka MVCGAN on luonut CELEBA-HQ-aineistosta. Lähde: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN sisältää generatiivisen radiance field -verkon, joka pystyy tarjoamaan geometrisia rajoituksia GAN-verkossa, ja se saavuttaa yhden autenttisimman poseerauskyvyn GAN-pohjaisessa lähestymistavassa.

Vertailu MVCGAN:n ja aiempien menetelmien GRAF, GIRAFFE ja pi-GAN välillä.

Vertailu MVCGAN:n ja aiempien menetelmien GRAF, GIRAFFE ja pi-GAN välillä.

MVCGAN:n lisäaineistossa paljastuu, että hiusten tilavuuden, asennon, sijainnin ja käyttäytymisen johdonmukaisuus on edelleen haasteellinen ongelma, jota ei voida helposti ratkaista ulkoisesti määrättyjen 3D-geometrian rajoitusten avulla.

MVCGAN:n kasvokuvien synteesi edustaa merkittävää edistystä, mutta aikajohdonmukainen hiusten liike on edelleen haasteellinen ongelma.

MVCGAN:n kasvokuvien synteesi edustaa merkittävää edistystä, mutta aikajohdonmukainen hiusten liike on edelleen haasteellinen ongelma.

Koska “suorat” CGI-työvirrat edelleen kohtaavat haasteita hiusten liikkeen toistamisessa, ei ole syytä olettaa, että perinteiset geometriaan perustuvat lähestymistavat tulevat ratkaisemaan hiusten synteesin latenttiavaruudessa lähitulevaisuudessa.

Hiusten stabiloiminen konvoluutio-neuroverkoilla

Tuleva tutkimus kolmelta Chalmersin teknillisen korkeakoulun tutkijalta Ruotsista saattaa tarjota edistystä neurohiusten simulaatiossa.

Vasemmalla CNN-stabiloitu hiusten esitys, oikealla alkuperäinen kuva. Katso video artikkelin lopusta paremman resoluution ja lisäesimerkkien vuoksi. Lähde: https://www.youtube.com/watch?v=AvnJkwCmsT4

Vasemmalla CNN-stabiloitu hiusten esitys, oikealla alkuperäinen kuva. Katso video artikkelin lopusta paremman resoluution ja lisäesimerkkien vuoksi. Lähde: https://www.youtube.com/watch?v=AvnJkwCmsT4

Tutkimuksen otsikko on Real-Time Hair Filtering with Convolutional Neural Networks, ja se julkaistaan i3D-symposiumissa toukokuun alussa.

Järjestelmä koostuu autoencoder-pohjaisesta verkosta, joka pystyy arvioimaan hiusten resoluutiota, mukaan lukien itsevarjostus ja hiusten paksuuden huomioon ottaminen, reaaliajassa, perustuen rajoitettuun määrään stokastisiin näytteisiin, jotka on sirottu OpenGL-geometrialla.

Lähestymistapa renderöi rajoitetun määrän näytteitä stokastisella läpinäkyvyydellä ja kouluttaa sitten U-netin rekonstruoimaan alkuperäisen kuvan.

MVCGAN:ssa CNN-suodatin suodattaa stokastisiin värikohtaisiin tekijöihin, korostuksiin, tangenteihin, syvyyksiin ja alfa-kanaviin, ja kokoaa syntetisoidut tulokset yhdistetyksi kuvaksi.

MVCGAN:ssa CNN-suodatin suodattaa stokastisiin värikohtaisiin tekijöihin, korostuksiin, tangenteihin, syvyyksiin ja alfa-kanaviin, ja kokoaa syntetisoidut tulokset yhdistetyksi kuvaksi.

Verkko koulutetaan PyTorchilla, ja se suppenee kuuden ja kahdentoista tunnin kuluessa, riippuen verkkoarkkitehtuurista ja syöteominaisuuksien määrästä. Koulutetut parametriarvot (painot) käytetään sitten reaaliaikaisessa järjestelmän toteutuksessa.

Koulutusdataa generoidaan renderöimällä useita satoja kuvia suorille ja aaltoileville hiustyyleille, käyttäen satunnaisia etäisyyksiä ja asentoja, sekä moninaisia valaistusolosuhteita.

Erikoisia esimerkkejä koulutusdatasta.

Erikoisia esimerkkejä koulutusdatasta.

Hiusten läpinäkyvyys keskiarvoistetaan kuvista, jotka on renderöity stokastisella läpinäkyvyydellä supersampled-resoluutiolla. Alkuperäinen korkearesoluutioinen dataa pienennetään verkko- ja laitteistorajoitusten vuoksi, ja myöhemmin suurennetaan takaisin tyypillisessä autoencoder-työvirrassa.

Reaaliaikainen inference-sovellus (eli “live”-ohjelma, joka hyödyntää koulutetun mallin johdannaista) käyttää NVIDIA CUDAa cuDNN:n ja OpenGL:n kanssa. Alkuperäiset syöteominaisuudet dumppaavat OpenGL-moninäytteisiin värikokoelmiin, ja tulokset siirretään cuDNN-tensooreihin ennen prosessointia CNN:ssa. Nämä tensorit siirretään sitten takaisin “live”-OpenGL-tekstuuriin lopullisen kuvan asettamiseksi.

Reaaliaikainen järjestelmä toimii NVIDIA RTX 2080:lla, ja se tuottaa 1024×1024 pikselin resoluution.

Koska hiusten väriarvot ovat täysin eriytettyjä lopullisissa arvoissa, joita verkko saa, hiusten värin muuttaminen on yksinkertainen tehtävä, vaikka vaikutukset kuten gradientit ja raidat ovat edelleen tulevaisuuden haaste.

Tutkijat ovat julkaisseet koodin, jota he käyttivät tutkimuksensa arvioissa, GitLabissa. Katso lisäksi liitetty video MVCGAN:sta alla.

Johtopäätös

Navigointi latenttiavaruudessa on edelleen enemmän kuin tarkka ohjaus. Vasta viime aikoina olemme nähneet uskottavia tuloksia kasvojen poseerauksista yksinkertaisemmassa geometriassa, kuten NeRF:ssa, GAN:ssa ja ei-deepfake (2017) autoencoder-kehyksissä.

Ihmisen hiusten merkittävä arkkitehtoninen monimutkaisuus, yhdistettynä tarpeeseen sisällyttää fysiikkamalleja ja muita ominaisuuksia, joita nykyiset kuvansynteesimenetelmät eivät tarjoa, osoittaa, että hiusten synteesi ei todennäköisesti jää yleisen kasvojen synteesin integroiduksi osaksi, vaan se vaatii omat, erilliset verkot, jotka ovat jonkinlaisia monimutkaisuuden tasolla – vaikka ne voivat lopulta tulla osaksi laajempia ja monimutkaisempia kasvojen synteesikehyksiä.

 

Julkaistu ensimmäisen kerran 15. huhtikuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai