Andersons vinkel
Omformning av mÃĪnskliga kroppstyper med AI

En ny forskningssamarbete frÃĨn Kina erbjuder en ny metod fÃķr omformning av mÃĪnskliga kroppar i bilder, med hjÃĪlp av ett koordinerat tvillingneuralt nÃĪtverk, styrt av en parametrisk modell, som tillÃĨter en slutanvÃĪndare att modulera vikt, hÃķjd och kroppproportioner i en interaktiv GUI.

Parametrisk modulering av kroppens form, med reglage som ÃĪndrar de tre tillgÃĪngliga funktionerna. KÃĪlla: https://arxiv.org/pdf/2203.10496.pdf
Arbetet erbjuder flera fÃķrbÃĪttringar jÃĪmfÃķrt med ett liknande projekt frÃĨn Alibaba, eftersom det kan Ãķvertygande ÃĪndra hÃķjd och kroppproportioner samt vikt, och har ett dedikerat neuralt nÃĪtverk fÃķr âinpaintingâ av bakgrunden som kan avslÃķjas av âsmalareâ kroppsbilder. Det fÃķrbÃĪttrar ocksÃĨ en tidigare parametrisk metod fÃķr kroppsomformning genom att ta bort behovet av omfattande mÃĪnsklig inblandning under formuleringen av transformationen.
Den nya arkitekturen, som kallas NeuralReshaper, passar en parametrisk 3D-mall av en mÃĪnniska till en kÃĪllbild, och anvÃĪnder sedan deformationer i mallen fÃķr att anpassa den ursprungliga bilden till de nya parametrarna.
Systemet kan hantera kroppstransformationer pÃĨ klÃĪdda samt halvklÃĪdda (t.ex. badklÃĪder) figurer.
Transformeringar av detta slag ÃĪr fÃķr nÃĪrvarande av stor intresse fÃķr mode AI-forskningssektorn, som har producerat ett antal StyleGAN/CycleGAN-baserade och allmÃĪnna neuronnÃĪtverksplattformar fÃķr virtuella provningar som kan anpassa tillgÃĪngliga klÃĪdesplagg till kroppens form och typ av en anvÃĪndarinskickad bild, eller pÃĨ annat sÃĪtt hjÃĪlpa till med visuell konformitet.
Den artikeln heter Single-image Human-body Reshaping with Deep Neural Networks och kommer frÃĨn forskare vid Zhejiang University i Hangzhou och School of Creative Media vid City University of Hong Kong.
SMPL Fitting
NeuralReshaper anvÃĪnder sig av Skinned Multi-Person Linear Model (SMPL) utvecklad av Max Planck Institute for Intelligent Systems och det vÃĪlkÃĪnda VFX-huset Industrial Light and Magic 2015.

SMPL Parametriska mÃĪnniskor frÃĨn 2015 ÃĨrs Planck/ILM-samarbete. KÃĪlla: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
I den fÃķrsta fasen av processen genereras en SMPL-modell frÃĨn en kÃĪllbild som kroppstransformationer Ãķnskas gÃķras pÃĨ. Anpassningen av SMPL-modellen till bilden fÃķljer metodiken frÃĨn Human Mesh Recovery (HMR)-metoden som fÃķreslogs av universitet i Tyskland och USA 2018.
De tre parametrarna fÃķr deformation (vikt, hÃķjd, kroppproportion) berÃĪknas vid denna fas, tillsammans med en ÃķvervÃĪgning av kameraparametrar, sÃĨsom brÃĪnnvidd. 2D-nyckelpunkter och genererad silhuettjustering tillhandahÃĨller inkapslingen fÃķr deformationen i form av en 2D-silhuett, en ytterligare optimeringsÃĨtgÃĪrd som Ãķkar grÃĪnsens noggrannhet och tillÃĨter ÃĪkta bakgrunds âinpaintingâ lÃĪngre ner i pipelinen.

SMPL-anpassningsfaser: vÃĪnster, kÃĪllbilden; andra, optimeringsresultatet erhÃĨllet frÃĨn metoden som beskrivs i 2016 ÃĨrs forskning ledd av Max Planck Institute for Intelligent Systems; tredje, ett direkt inferensresultat frÃĨn den fÃķrtrÃĪnade modellen fÃķr End-to-end Recovery of Human Shape and Pose; fjÃĪrde, resultaten erhÃĨllna efter optimering av 2D-nyckelpunkter; och slutligen, femte, den fÃĪrdiga anpassningen efter silhuettjustering (se ovan).
3D-deformationen projiceras sedan in i arkitekturens bildrum fÃķr att underlÃĪtta en tÃĪt warp-fÃĪlt som kommer att definiera deformationen. Denna process tar cirka 30 sekunder per bild.
NeuralReshaper Architecture
NeuralReshaper kÃķr tvÃĨ neuronnÃĪtverk i tandem: en foreground-encoder som genererar den transformerade kroppen, och en background-encoder som fokuserar pÃĨ att fylla i âde-occludedâ bakgrundsomrÃĨden (i fallet, till exempel, att gÃķra en kropp âsmalareâ â se bild nedan).
U-net-liknande ramverket integrerar utdata frÃĨn de tvÃĨ encoderns funktioner innan den skickar resultatet till en enhetlig encoder som slutligen producerar en ny bild frÃĨn de tvÃĨ ingÃĨngarna. Arkitekturen har en ny warp-styrd mekanism fÃķr att mÃķjliggÃķra integration.
TrÃĪning och Experiment
NeuralReshaper implementeras i PyTorch pÃĨ en enda NVIDIA 1080ti GPU med 11 GB VRAM. NÃĪtverket trÃĪnades i 100 epoker under Adam-optimisatorn, med generatorn instÃĪlld pÃĨ ett mÃĨlfÃķrlust pÃĨ 0,0001 och diskriminatoren pÃĨ ett mÃĨlfÃķrlust pÃĨ 0,0004. TrÃĪningen skedde pÃĨ en batchstorlek pÃĨ 8 fÃķr en proprietÃĪr utomhusdataset (hÃĪmtad frÃĨn COCO, MPII och LSP), och 2 fÃķr trÃĪning pÃĨ DeepFashion-datasetet.

Till vÃĪnster, de ursprungliga bilderna, till hÃķger, den reproportionerade utdata av NeuralReshaper.
Nedan fÃķljer nÃĨgra exempel uteslutande frÃĨn DeepFashion-datasetet som trÃĪnats fÃķr NeuralReshaper, med de ursprungliga bilderna alltid till vÃĪnster.
De tre kontrollerbara attributen ÃĪr desintegrerade och kan tillÃĪmpas separat.
Transformeringar pÃĨ den hÃĪrledda utomhusdataseten ÃĪr mer utmanande, eftersom de ofta krÃĪver infyllning av komplexa bakgrunder och tydlig och Ãķvertygande avgrÃĪnsning av de transformerade kroppstyperna:
Parametrisk NÃķdvÃĪndighet
Som artikeln pÃĨpekar representerar samma-bildstransformationer av detta slag ett illa stÃĪllt problem i bildsyntes. MÃĨnga transformerande GAN- och encoder-ramverk kan anvÃĪnda parade bilder (sÃĨsom de mÃĨnga projekten som ÃĪr utformade fÃķr att effektera skiss>foto och foto>skiss-transformationer).
Men i fallet som beskrivs skulle detta krÃĪva bildpar som visar samma personer i olika fysiska konfigurationer, sÃĨsom âfÃķr och efterâ-bilder i diet- eller plastikkirurgireklam â data som ÃĪr svÃĨra att erhÃĨlla eller generera.
Alternativt kan transformerande GAN-nÃĪtverk trÃĪna pÃĨ mycket mer varierad data och effektera transformationer genom att sÃķka efter latent riktning mellan kÃĪllan (ursprunglig bild latent kod) och den Ãķnskade klassen (i detta fall âfetâ, âsmalâ, âlÃĨngâ, etc.). Men denna metod ÃĪr fÃķr nÃĪrvarande fÃķr begrÃĪnsad fÃķr ÃĪndamÃĨlet med finjusterad kroppsomformning.
Neural Radiance Fields (NeRF)-tillvÃĪgagÃĨngssÃĪtt ÃĪr mycket mer avancerade i fullstÃĪndig kroppsimitation ÃĪn de flesta GAN-baserade system, men fÃķrblir scenspecifika och resurskrÃĪvande, med fÃķr nÃĪrvarande mycket begrÃĪnsad fÃķrmÃĨga att redigera kroppstyper pÃĨ det granulÃĪra sÃĪtt som NeuralReshaper och tidigare projekt fÃķrsÃķker lÃķsa (fÃķrutom att skalera hela kroppen ner i fÃķrhÃĨllande till dess miljÃķ).
GAN:s latenta utrymme ÃĪr svÃĨrt att styra; VAE:er ensam tillfredsstÃĪller inte ÃĪnnu komplexiteten i fullstÃĪndig kroppsreproduktion; och NeRF:s fÃķrmÃĨga att konsekvent och realistiskt omforma mÃĪnskliga kroppar ÃĪr fortfarande i sin linda. DÃĪrfÃķr verkar det som att infÃķrandet av âtraditionellaâ CGI-metodologier som SMPL kommer att fortsÃĪtta i den mÃĪnskliga bildsyntesforskningssektorn, som en metod fÃķr att samla in och konsolidera funktioner, klasser och latenta koder vars parametrar och exploaterbarhet ÃĪnnu inte ÃĪr fullstÃĪndigt fÃķrstÃĨdda i dessa nya teknologier.
Â
Publicerad fÃķrsta gÃĨngen den 31 mars 2022.



















