Andersons vinkel
Omformning av mänskliga kroppstyper med AI

En ny forskningssamarbete från Kina erbjuder en ny metod för omformning av mänskliga kroppar i bilder, med hjälp av ett koordinerat tvillingneuralt nätverk, styrt av en parametrisk modell, som tillåter en slutanvändare att modulera vikt, höjd och kroppproportioner i en interaktiv GUI.

Parametrisk modulering av kroppens form, med reglage som ändrar de tre tillgängliga funktionerna. Källa: https://arxiv.org/pdf/2203.10496.pdf
Arbetet erbjuder flera förbättringar jämfört med ett liknande projekt från Alibaba, eftersom det kan övertygande ändra höjd och kroppproportioner samt vikt, och har ett dedikerat neuralt nätverk för “inpainting” av bakgrunden som kan avslöjas av “smalare” kroppsbilder. Det förbättrar också en tidigare parametrisk metod för kroppsomformning genom att ta bort behovet av omfattande mänsklig inblandning under formuleringen av transformationen.
Den nya arkitekturen, som kallas NeuralReshaper, passar en parametrisk 3D-mall av en människa till en källbild, och använder sedan deformationer i mallen för att anpassa den ursprungliga bilden till de nya parametrarna.
Systemet kan hantera kroppstransformationer på klädda samt halvklädda (t.ex. badkläder) figurer.
Transformeringar av detta slag är för närvarande av stor intresse för mode AI-forskningssektorn, som har producerat ett antal StyleGAN/CycleGAN-baserade och allmänna neuronnätverksplattformar för virtuella provningar som kan anpassa tillgängliga klädesplagg till kroppens form och typ av en användarinskickad bild, eller på annat sätt hjälpa till med visuell konformitet.
Den artikeln heter Single-image Human-body Reshaping with Deep Neural Networks och kommer från forskare vid Zhejiang University i Hangzhou och School of Creative Media vid City University of Hong Kong.
SMPL Fitting
NeuralReshaper använder sig av Skinned Multi-Person Linear Model (SMPL) utvecklad av Max Planck Institute for Intelligent Systems och det välkända VFX-huset Industrial Light and Magic 2015.

SMPL Parametriska människor från 2015 års Planck/ILM-samarbete. Källa: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
I den första fasen av processen genereras en SMPL-modell från en källbild som kroppstransformationer önskas göras på. Anpassningen av SMPL-modellen till bilden följer metodiken från Human Mesh Recovery (HMR)-metoden som föreslogs av universitet i Tyskland och USA 2018.
De tre parametrarna för deformation (vikt, höjd, kroppproportion) beräknas vid denna fas, tillsammans med en övervägning av kameraparametrar, såsom brännvidd. 2D-nyckelpunkter och genererad silhuettjustering tillhandahåller inkapslingen för deformationen i form av en 2D-silhuett, en ytterligare optimeringsåtgärd som ökar gränsens noggrannhet och tillåter äkta bakgrunds “inpainting” längre ner i pipelinen.

SMPL-anpassningsfaser: vänster, källbilden; andra, optimeringsresultatet erhållet från metoden som beskrivs i 2016 års forskning ledd av Max Planck Institute for Intelligent Systems; tredje, ett direkt inferensresultat från den förtränade modellen för End-to-end Recovery of Human Shape and Pose; fjärde, resultaten erhållna efter optimering av 2D-nyckelpunkter; och slutligen, femte, den färdiga anpassningen efter silhuettjustering (se ovan).
3D-deformationen projiceras sedan in i arkitekturens bildrum för att underlätta en tät warp-fält som kommer att definiera deformationen. Denna process tar cirka 30 sekunder per bild.
NeuralReshaper Architecture
NeuralReshaper kör två neuronnätverk i tandem: en foreground-encoder som genererar den transformerade kroppen, och en background-encoder som fokuserar på att fylla i “de-occluded” bakgrundsområden (i fallet, till exempel, att göra en kropp “smalare” – se bild nedan).
U-net-liknande ramverket integrerar utdata från de två encoderns funktioner innan den skickar resultatet till en enhetlig encoder som slutligen producerar en ny bild från de två ingångarna. Arkitekturen har en ny warp-styrd mekanism för att möjliggöra integration.
Träning och Experiment
NeuralReshaper implementeras i PyTorch på en enda NVIDIA (NVDA ) 1080ti GPU med 11 GB VRAM. Nätverket tränades i 100 epoker under Adam-optimisatorn, med generatorn inställd på ett målförlust på 0,0001 och diskriminatoren på ett målförlust på 0,0004. Träningen skedde på en batchstorlek på 8 för en proprietär utomhusdataset (hämtad från COCO, MPII och LSP), och 2 för träning på DeepFashion-datasetet.
Nedan följer några exempel uteslutande från DeepFashion-datasetet som tränats för NeuralReshaper, med de ursprungliga bilderna alltid till vänster.
De tre kontrollerbara attributen är desintegrerade och kan tillämpas separat.
Transformeringar på den härledda utomhusdataseten är mer utmanande, eftersom de ofta kräver infyllning av komplexa bakgrunder och tydlig och övertygande avgränsning av de transformerade kroppstyperna:
Parametrisk Nödvändighet
Som artikeln påpekar representerar samma-bildstransformationer av detta slag ett illa ställt problem i bildsyntes. Många transformerande GAN- och encoder-ramverk kan använda parade bilder (såsom de många projekten som är utformade för att effektera skiss>foto och foto>skiss-transformationer).
Men i fallet som beskrivs skulle detta kräva bildpar som visar samma personer i olika fysiska konfigurationer, såsom “för och efter”-bilder i diet- eller plastikkirurgireklam – data som är svåra att erhålla eller generera.
Alternativt kan transformerande GAN-nätverk träna på mycket mer varierad data och effektera transformationer genom att söka efter latent riktning mellan källan (ursprunglig bild latent kod) och den önskade klassen (i detta fall “fet”, “smal”, “lång”, etc.). Men denna metod är för närvarande för begränsad för ändamålet med finjusterad kroppsomformning.
Neural Radiance Fields (NeRF)-tillvägagångssätt är mycket mer avancerade i fullständig kroppsimitation än de flesta GAN-baserade system, men förblir scenspecifika och resurskrävande, med för närvarande mycket begränsad förmåga att redigera kroppstyper på det granulära sätt som NeuralReshaper och tidigare projekt försöker lösa (förutom att skalera hela kroppen ner i förhållande till dess miljö).
GAN:s latenta utrymme är svårt att styra; VAE:er ensam tillfredsställer inte ännu komplexiteten i fullständig kroppsreproduktion; och NeRF:s förmåga att konsekvent och realistiskt omforma mänskliga kroppar är fortfarande i sin linda. Därför verkar det som att införandet av “traditionella” CGI-metodologier som SMPL kommer att fortsätta i den mänskliga bildsyntesforskningssektorn, som en metod för att samla in och konsolidera funktioner, klasser och latenta koder vars parametrar och exploaterbarhet ännu inte är fullständigt förstådda i dessa nya teknologier.
Publicerad första gången den 31 mars 2022.




















