Andersonin kulma

Ihmisen kehon muokkaus tekoälyllä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinalaisen tutkimusyhteistyön uusi menetelmä muokkaa ihmisen kehoa kuvissa koordinoituja kaksoisneuraaliverkkoja ja parametrinen malli, joka mahdollistaa loppukäyttäjän muokata painoa, pituutta ja kehon mittasuhteita interaktiivisessa käyttöliittymässä.

Parametrisoitu kehonmuoto, jossa liukusäätimet muuttavat kolmea saatavilla olevaa ominaisuutta. Lähde: https://arxiv.org/pdf/2203.10496.pdf

Parametrisoitu kehonmuoto, jossa liukusäätimet muuttavat kolmea saatavilla olevaa ominaisuutta. Lähde: https://arxiv.org/pdf/2203.10496.pdf

Työ tarjoaa useita parannuksia viimeaikaiseen vastaavaan projektiin Alibabasta, sillä se voi vakuuttavasti muuttaa pituutta ja kehon mittasuhteita sekä painoa, ja sillä on omistettu neuraaliverkko “täyttämään” (ei-olemassaolevan) taustan, joka voidaan paljastaa “ohuemmilla” kehonkuvilla. Se myös parantaa tunnnettua aiempaa parametrinen menetelmää kehonmuokkaukseen poistamalla tarpeen laajalle inhimilliselle väliintulolle muodonmuutoksen muodostusprosessissa.

Nimeämätön NeuralReshaper, uusi arkkitehtuuri sovittaa parametrinen 3D-ihmismalli lähdekuvaan, ja sitten käyttää muodonmuutoksia mallissa sovittamaan alkuperäistä kuvaa uusiin parametreihin.

Järjestelmä pystyy käsittelemään kehonmuodonmuutoksia sekä pukeutuneilla että puolipukeutuneilla (esim. uimahuoneessa) hahmoilla.

Tällaiset muodonmuutokset ovat tällä hetkellä kiinnostavia muotitekoälytutkimukselle, joka on tuottanut useita StyleGAN/CycleGAN-pohjaisia ja yleisiä neuraaliverkkopohjaisia alustoja virtuaalikokeiluille, jotka voivat sovittaa saatavilla olevia vaatekappaleita kehonmuotoon ja kehotyyppiin käyttäjän lähettämässä kuvassa tai muutoin auttaa visuaalisessa yhdenmukaisuudessa.

Artikkeli on nimeltään Single-image Human-body Reshaping with Deep Neural Networks, ja se on peräisin Zhejiangin yliopistosta Hangzhousta ja City University of Hong Kongin luovasta mediakoulusta.

SMPL Sovittaminen

NeuralReshaper käyttää Skinned Multi-Person Linear Model (SMPL) kehittämää Max Planck -instituutista älykkäistä järjestelmistä ja tunnetusta VFX-talosta Industrial Light and Magic vuonna 2015.

SMPL Parametrinen ihminen vuoden 2015 Planck/ILM-yhteistyöstä. Lähde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametrinen ihminen vuoden 2015 Planck/ILM-yhteistyöstä. Lähde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Prosessin ensimmäisessä vaiheessa luodaan SMPL-malli lähdekuvaan, johon kehonmuodonmuutoksia halutaan tehdä. SMPL-mallin sovittaminen kuvaan noudattaa menetelmää Ihmisen verkon palautusmenetelmä, jonka yliopistot Saksassa ja Yhdysvalloissa esittivät vuonna 2018.

Kolme muodonmuutosparametria (paino, pituus, kehon mittasuhteet) lasketaan tässä vaiheessa yhdessä kameraparametrien, kuten polttovälin, kanssa. 2D avainpisteet ja luodun silhuettien kohdistus tarjoavat kehysmuodonmuutokselle 2D-silhuettina, joka on lisäksi optimointitoimi, joka lisää reunan tarkkuutta ja mahdollistaa aidon taustan täyttämisen myöhemmin prosessissa.

SMPL sovittamisen vaiheet: vasemmalla, lähdekuva; toisella vasemmalla, optimointitulos, joka saavutettiin menetelmällä, josta vuoden 2016 tutkimuksessa, jota johti Max Planck -instituutti älykkäistä järjestelmistä; kolmannella vasemmalla, suora johtopäätös esikoulutetusta mallista loppuun asti ihmisruumiin ja asennon palauttamiseksi; toisella oikealla, tulokset, jotka saavutettiin 2D-avainpistekohtaisen optimoinnin jälkeen; ja lopuksi oikealla, valmis sovitus silhuettioptimoinnin jälkeen (ks. yllä).

SMPL sovittamisen vaiheet: vasemmalla, lähdekuva; toisella vasemmalla, optimointitulos, joka saavutettiin menetelmällä, josta vuoden 2016 tutkimuksessa, jota johti Max Planck -instituutti älykkäistä järjestelmistä; kolmannella vasemmalla, suora johtopäätös esikoulutetusta mallista loppuun asti ihmisruumiin ja asennon palauttamiseksi; neljännellä, tulokset, jotka saavutettiin 2D-avainpistekohtaisen optimoinnin jälkeen; ja lopuksi viidennellä, valmis sovitus silhuettioptimoinnin jälkeen (ks. yllä).

3D-muodonmuutos projisoidaan sitten arkkitehtuurin kuvatilaan, jotta voidaan luoda tiheä muodonmuutoskenttä, joka määrittää muodonmuutoksen. Tämä prosessi kestää noin 30 sekuntia kuvaa kohden.

NeuralReshaper Arkkitehtuuri

NeuralReshaper suorittaa kaksi neuraaliverkkoa yhtä aikaa: etumaisen koodarin, joka luo muokatun kehonmuodon, ja taustan koodarin, joka keskittyy täyttämään “paljastettuja” taustan osia (esim. kun kehoa “ohennetaan” – ks. alla oleva kuva).

U-net-tyyppinen kehys yhdistää kummankin koodarin ominaisuuksien tulokset ennen kuin se siirtää tuloksen yhdistettyyn koodariin, joka lopulta tuottaa uuden kuvan kahdesta syötteestä. Arkkitehtuuri sisältää uuden warp-ohjatun mekanismin, joka mahdollistaa integraation.

Koulutus ja Kokeet

NeuralReshaper on toteutettu PyTorchissa yhdellä NVIDIA (NVDA ) 1080ti GPU:lla, jossa on 11 Gt VRAM. Verkko koulutettiin 100 episodin ajan Adam-optimoinnin alla, jossa generoija asetettiin kohdelukuihin 0,0001 ja diskriminoija kohdelukuihin 0,0004. Koulutus tapahtui erityisessä ulkoilmadatassa (joka on peräisin COCO, MPII ja LSP), ja 2 koulutuksessa DeepFashion-datassa.

Vasemmalla alkuperäiskuvat, oikealla NeuralReshaperin uudelleenmuokatun tulosteen.

Vasemmalla alkuperäiskuvat, oikealla NeuralReshaperin uudelleenmuokatun tulosteen.

Alempana on joitakin esimerkkejä ainoastaan DeepFashion-datassa, jota NeuralReshaper on koulutettu, alkuperäiskuvat aina vasemmalla.

Kolme säädettävissä olevaa ominaisuutta voidaan erottaa toisistaan, ja niitä voidaan soveltaa erikseen.

Ulkoilmadatassa tehtyjen muodonmuutosten on havaittu olevan haasteellisempia, koska ne usein vaativat monimutkaisten taustojen täyttämistä ja selkeää ja vakuuttavaa kehonmuodonmuutosten erottelua:

Parametrinen Välttämättömyys

Kuten artikkeli huomauttaa, saman kuvan muodonmuutokset edustavat huonosti määriteltyä ongelmaa kuvansynteesissä. Monet muodonmuuttavat GAN- ja koodarikehykset voivat hyödyntää pareittaisia kuvia (kuten monia projekteja, jotka on suunniteltu luonnos>valokuva ja valokuva>luonnos muodonmuutoksia).

Kuitenkin tämän tapauksessa se vaatisi kuvapareja, joissa samat ihmiset eri fyysisissä konfiguraatioissa, kuten “ennen ja jälkeen” -kuvat dieetti- tai plastiikkakirurgia-mainonnassa – dataa, jota on vaikea hankkia tai luoda.

Toisaalta muodonmuuttavat GAN-verkot voivat koulutusdataa, ja tehdä muodonmuutoksia etsimällä latentin suunnan lähde- (alkuperäisen kuvan latentin koodi) ja haluttu luokka (tässä tapauksessa “lihava”, “ohut”, “pitkä” jne.) välillä. Tämä lähestymistapa on kuitenkin tällä hetkellä liian rajoitettu kehonmuodon hienostuneelle muokkaukselle.

Neuraaliradianssikentät (NeRF) -lähestymistavat ovat paljon edistyneempiä täyskehon simulaatiossa kuin useimmat GAN-pohjaiset järjestelmät, mutta ne ovat edelleen kohtauskohtaisia ja resursseja vaativia, ja niillä on tällä hetkellä hyvin rajoitettu kyky muokata kehonmuotoja yksityiskohtaisella tavalla, jota NeuralReshaper ja aiemmat projektit yrittävät ratkaista (pl. koko kehon mittakaavan laskemista suhteessa ympäristöön).

GAN:n latentiavaruus on vaikea hallita; VAE:t eivät vielä ratkaise täyskehon reproduktion monimutkaisuuksia; ja NeRF:n kyky johdonmukaisesti ja realistisesti uudelleenmuokata ihmiskehoja on edelleen vasta alkuvaiheessa. Siksi perinteisten CGI-menetelmien, kuten SMPL:n, käytön sisällyttäminen ihmisen kuvansynteesitutkimukseen näyttää jatkuvan, koska se on tapa koota ja konsolidoida ominaisuuksia, luokkia ja latenteja koodauksia, joiden parametreja ja hyödyntämismahdollisuuksia ei vielä täysin ymmärretä näissä kehittyvissä teknologioissa.

 

Julkaistu ensimmäisen kerran 31. maaliskuuta 2022.

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai