Andersons vinkel

Omformning av mÃĪnskliga kroppstyper med AI

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

En ny forskningssamarbete frÃĨn Kina erbjuder en ny metod fÃķr omformning av mÃĪnskliga kroppar i bilder, med hjÃĪlp av ett koordinerat tvillingneuralt nÃĪtverk, styrt av en parametrisk modell, som tillÃĨter en slutanvÃĪndare att modulera vikt, hÃķjd och kroppproportioner i en interaktiv GUI.

Parametrisk modulering av kroppens form, med reglage som ÃĪndrar de tre tillgÃĪngliga funktionerna. KÃĪlla: https://arxiv.org/pdf/2203.10496.pdf

Parametrisk modulering av kroppens form, med reglage som ÃĪndrar de tre tillgÃĪngliga funktionerna. KÃĪlla: https://arxiv.org/pdf/2203.10496.pdf

Arbetet erbjuder flera fÃķrbÃĪttringar jÃĪmfÃķrt med ett liknande projekt frÃĨn Alibaba, eftersom det kan Ãķvertygande ÃĪndra hÃķjd och kroppproportioner samt vikt, och har ett dedikerat neuralt nÃĪtverk fÃķr “inpainting” av bakgrunden som kan avslÃķjas av “smalare” kroppsbilder. Det fÃķrbÃĪttrar ocksÃĨ en tidigare parametrisk metod fÃķr kroppsomformning genom att ta bort behovet av omfattande mÃĪnsklig inblandning under formuleringen av transformationen.

Den nya arkitekturen, som kallas NeuralReshaper, passar en parametrisk 3D-mall av en mÃĪnniska till en kÃĪllbild, och anvÃĪnder sedan deformationer i mallen fÃķr att anpassa den ursprungliga bilden till de nya parametrarna.

Systemet kan hantera kroppstransformationer pÃĨ klÃĪdda samt halvklÃĪdda (t.ex. badklÃĪder) figurer.

Transformeringar av detta slag ÃĪr fÃķr nÃĪrvarande av stor intresse fÃķr mode AI-forskningssektorn, som har producerat ett antal StyleGAN/CycleGAN-baserade och allmÃĪnna neuronnÃĪtverksplattformar fÃķr virtuella provningar som kan anpassa tillgÃĪngliga klÃĪdesplagg till kroppens form och typ av en anvÃĪndarinskickad bild, eller pÃĨ annat sÃĪtt hjÃĪlpa till med visuell konformitet.

Den artikeln heter Single-image Human-body Reshaping with Deep Neural Networks och kommer frÃĨn forskare vid Zhejiang University i Hangzhou och School of Creative Media vid City University of Hong Kong.

SMPL Fitting

NeuralReshaper anvÃĪnder sig av Skinned Multi-Person Linear Model (SMPL) utvecklad av Max Planck Institute for Intelligent Systems och det vÃĪlkÃĪnda VFX-huset Industrial Light and Magic 2015.

SMPL Parametriska mÃĪnniskor frÃĨn 2015 ÃĨrs Planck/ILM-samarbete. KÃĪlla: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametriska mÃĪnniskor frÃĨn 2015 ÃĨrs Planck/ILM-samarbete. KÃĪlla: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

I den fÃķrsta fasen av processen genereras en SMPL-modell frÃĨn en kÃĪllbild som kroppstransformationer Ãķnskas gÃķras pÃĨ. Anpassningen av SMPL-modellen till bilden fÃķljer metodiken frÃĨn Human Mesh Recovery (HMR)-metoden som fÃķreslogs av universitet i Tyskland och USA 2018.

De tre parametrarna fÃķr deformation (vikt, hÃķjd, kroppproportion) berÃĪknas vid denna fas, tillsammans med en ÃķvervÃĪgning av kameraparametrar, sÃĨsom brÃĪnnvidd. 2D-nyckelpunkter och genererad silhuettjustering tillhandahÃĨller inkapslingen fÃķr deformationen i form av en 2D-silhuett, en ytterligare optimeringsÃĨtgÃĪrd som Ãķkar grÃĪnsens noggrannhet och tillÃĨter ÃĪkta bakgrunds “inpainting” lÃĪngre ner i pipelinen.

SMPL-anpassningsfaser: vÃĪnster, kÃĪllbilden; andra frÃĨn vÃĪnster, optimeringsresultatet erhÃĨllet frÃĨn metoden som beskrivs i 2016 ÃĨrs forskning ledd av Max Planck Institute for Intelligent Systems; tredje frÃĨn vÃĪnster, ett direkt inferensresultat frÃĨn den fÃķrtrÃĪnade modellen fÃķr End-to-end Recovery of Human Shape and Pose; andra frÃĨn hÃķger, resultaten erhÃĨllna efter optimering av 2D-nyckelpunkter; och slutligen, hÃķger, den fÃĪrdiga anpassningen efter silhuettjustering (se ovan).

SMPL-anpassningsfaser: vÃĪnster, kÃĪllbilden; andra, optimeringsresultatet erhÃĨllet frÃĨn metoden som beskrivs i 2016 ÃĨrs forskning ledd av Max Planck Institute for Intelligent Systems; tredje, ett direkt inferensresultat frÃĨn den fÃķrtrÃĪnade modellen fÃķr End-to-end Recovery of Human Shape and Pose; fjÃĪrde, resultaten erhÃĨllna efter optimering av 2D-nyckelpunkter; och slutligen, femte, den fÃĪrdiga anpassningen efter silhuettjustering (se ovan).

3D-deformationen projiceras sedan in i arkitekturens bildrum fÃķr att underlÃĪtta en tÃĪt warp-fÃĪlt som kommer att definiera deformationen. Denna process tar cirka 30 sekunder per bild.

NeuralReshaper Architecture

NeuralReshaper kÃķr tvÃĨ neuronnÃĪtverk i tandem: en foreground-encoder som genererar den transformerade kroppen, och en background-encoder som fokuserar pÃĨ att fylla i “de-occluded” bakgrundsomrÃĨden (i fallet, till exempel, att gÃķra en kropp “smalare” – se bild nedan).

U-net-liknande ramverket integrerar utdata frÃĨn de tvÃĨ encoderns funktioner innan den skickar resultatet till en enhetlig encoder som slutligen producerar en ny bild frÃĨn de tvÃĨ ingÃĨngarna. Arkitekturen har en ny warp-styrd mekanism fÃķr att mÃķjliggÃķra integration.

TrÃĪning och Experiment

NeuralReshaper implementeras i PyTorch pÃĨ en enda NVIDIA 1080ti GPU med 11 GB VRAM. NÃĪtverket trÃĪnades i 100 epoker under Adam-optimisatorn, med generatorn instÃĪlld pÃĨ ett mÃĨlfÃķrlust pÃĨ 0,0001 och diskriminatoren pÃĨ ett mÃĨlfÃķrlust pÃĨ 0,0004. TrÃĪningen skedde pÃĨ en batchstorlek pÃĨ 8 fÃķr en proprietÃĪr utomhusdataset (hÃĪmtad frÃĨn COCO, MPII och LSP), och 2 fÃķr trÃĪning pÃĨ DeepFashion-datasetet.

Till vÃĪnster, de ursprungliga bilderna, till hÃķger, den reproportionerade utdata av NeuralReshaper.

Till vÃĪnster, de ursprungliga bilderna, till hÃķger, den reproportionerade utdata av NeuralReshaper.

Nedan fÃķljer nÃĨgra exempel uteslutande frÃĨn DeepFashion-datasetet som trÃĪnats fÃķr NeuralReshaper, med de ursprungliga bilderna alltid till vÃĪnster.

De tre kontrollerbara attributen ÃĪr desintegrerade och kan tillÃĪmpas separat.

Transformeringar pÃĨ den hÃĪrledda utomhusdataseten ÃĪr mer utmanande, eftersom de ofta krÃĪver infyllning av komplexa bakgrunder och tydlig och Ãķvertygande avgrÃĪnsning av de transformerade kroppstyperna:

Parametrisk NÃķdvÃĪndighet

Som artikeln pÃĨpekar representerar samma-bildstransformationer av detta slag ett illa stÃĪllt problem i bildsyntes. MÃĨnga transformerande GAN- och encoder-ramverk kan anvÃĪnda parade bilder (sÃĨsom de mÃĨnga projekten som ÃĪr utformade fÃķr att effektera skiss>foto och foto>skiss-transformationer).

Men i fallet som beskrivs skulle detta krÃĪva bildpar som visar samma personer i olika fysiska konfigurationer, sÃĨsom “fÃķr och efter”-bilder i diet- eller plastikkirurgireklam – data som ÃĪr svÃĨra att erhÃĨlla eller generera.

Alternativt kan transformerande GAN-nÃĪtverk trÃĪna pÃĨ mycket mer varierad data och effektera transformationer genom att sÃķka efter latent riktning mellan kÃĪllan (ursprunglig bild latent kod) och den Ãķnskade klassen (i detta fall “fet”, “smal”, “lÃĨng”, etc.). Men denna metod ÃĪr fÃķr nÃĪrvarande fÃķr begrÃĪnsad fÃķr ÃĪndamÃĨlet med finjusterad kroppsomformning.

Neural Radiance Fields (NeRF)-tillvÃĪgagÃĨngssÃĪtt ÃĪr mycket mer avancerade i fullstÃĪndig kroppsimitation ÃĪn de flesta GAN-baserade system, men fÃķrblir scenspecifika och resurskrÃĪvande, med fÃķr nÃĪrvarande mycket begrÃĪnsad fÃķrmÃĨga att redigera kroppstyper pÃĨ det granulÃĪra sÃĪtt som NeuralReshaper och tidigare projekt fÃķrsÃķker lÃķsa (fÃķrutom att skalera hela kroppen ner i fÃķrhÃĨllande till dess miljÃķ).

GAN:s latenta utrymme ÃĪr svÃĨrt att styra; VAE:er ensam tillfredsstÃĪller inte ÃĪnnu komplexiteten i fullstÃĪndig kroppsreproduktion; och NeRF:s fÃķrmÃĨga att konsekvent och realistiskt omforma mÃĪnskliga kroppar ÃĪr fortfarande i sin linda. DÃĪrfÃķr verkar det som att infÃķrandet av “traditionella” CGI-metodologier som SMPL kommer att fortsÃĪtta i den mÃĪnskliga bildsyntesforskningssektorn, som en metod fÃķr att samla in och konsolidera funktioner, klasser och latenta koder vars parametrar och exploaterbarhet ÃĪnnu inte ÃĪr fullstÃĪndigt fÃķrstÃĨdda i dessa nya teknologier.

 

Publicerad fÃķrsta gÃĨngen den 31 mars 2022.

FÃķrfattare pÃĨ maskinlÃĪrning, domÃĪnspecialist inom mÃĪnsklig bildsyntes. Fd chef fÃķr forskningsinnehÃĨll pÃĨ Metaphysic.ai, till dess upplÃķsning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]