Andersons vinkel

Omformning af menneskekroppsformer med AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

Et nyt forskningssamarbejde fra Kina tilbyder en ny metode til omformning af menneskekroppen i billeder ved hjælp af et koordineret tvilling neuralt encoder-netværk, styret af en parametrisk model, der giver en slutbruger mulighed for at modulere vægt, højde og kropsproportioner i en interaktiv brugergrænseflade.

Parametrisk modulation af kropsform, med skydere der ændrer de tre tilgængelige funktioner. Kilde: https://arxiv.org/pdf/2203.10496.pdf

Parametrisk modulation af kropsform, med skydere der ændrer de tre tilgængelige funktioner. Kilde: https://arxiv.org/pdf/2203.10496.pdf

Arbejdet tilbyder flere forbedringer over et lignende projekt fra Alibaba, da det kan overbevisende ændre højde og kropsproportioner samt vægt, og har et dedikeret neuralt netværk til ‘inpainting’ af (ikke-eksisterende) baggrund, der kan afsløres af ‘slankere’ kropsbilleder. Det forbedrer også en tidligere parametrisk metode for kropsomformning ved at fjerne behovet for omfattende menneskelig indgriben under formuleringen af transformationen.

Med titlen NeuralReshaper passerer den nye arkitektur en parametrisk 3D-menneske-model til et kildebillede, og bruger derefter forvrængninger i modellen til at tilpasse det originale billede til de nye parametre.

Systemet kan håndtere krops-transformationer på både klædt og semi-klædt (dvs. badetøj) figurer.

Transformationer af denne type er i øjeblikket af intens interesse for mode AI-forskningssektoren, som har produceret en række StyleGAN/CycleGAN-baserede og generelle neurale netværksplatforme til virtuelle prøvninger, som kan tilpasse tilgængelige beklædningsgenstande til kropsformen og typen af et brugerindsendt billede, eller hjælpe med visuel overensstemmelse.

Den artikel har titlen Single-image Human-body Reshaping with Deep Neural Networks og kommer fra forskere ved Zhejiang University i Hangzhou og School of Creative Media ved City University of Hong Kong.

SMPL Tilpasning

NeuralReshaper benytter sig af Skinned Multi-Person Linear Model (SMPL) udviklet af Max Planck Institute for Intelligent Systems og det kendte VFX-hus Industrial Light and Magic i 2015.

SMPL Parametrisk mennesker fra 2015 Planck/ILM-samarbejdet. Kilde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametrisk mennesker fra 2015 Planck/ILM-samarbejdet. Kilde: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

I den første fase af processen genereres en SMPL-model fra et kildebillede, hvortil krops-transformationer ønskes at blive udført. Tilpasningen af SMPL-modellen til billedet følger metodologien for Human Mesh Recovery (HMR)-metoden foreslået af universiteter i Tyskland og USA i 2018.

De tre parametre for deformation (vægt, højde, kropsproportion) beregnes på dette stadium, sammen med en overvejelse af kamera-parametrene, såsom brændvidde. 2D-nøglepunkter og genereret silhuet-tilpasning giver indhegningen for deformationen i form af en 2D-silhuet, en yderligere optimeringsmåde, der øger grænse-nøjagtigheden og tillader ægte baggrund-inpainting længere nede i pipeline’en.

SMPL-tilpasningsfaser: venstre, kildebilledet; anden fra venstre, optimeringsresultatet erhvervet fra metoden beskrevet i 2016-forskning ledet af Max Planck Institute for Intelligent Systems; tredje fra venstre, en direkte slutning fra det forudtrænede model for End-to-end Recovery of Human Shape and Pose; fjerde fra højre, resultaterne erhvervet efter optimering af 2D-nøglepunkter; og til sidst, højre, den færdige tilpasning efter silhuet-optimering (se ovenfor).

SMPL-tilpasningsfaser: venstre, kildebilledet; anden, optimeringsresultatet erhvervet fra metoden beskrevet i 2016 forskning ledet af Max Planck Institute for Intelligent Systems; tredje, en direkte slutning fra det forudtrænede model for End-to-end Recovery of Human Shape and Pose; fjerde, resultaterne erhvervet efter optimering af 2D-nøglepunkter; og til sidst, femte, den færdige tilpasning efter silhuet-optimering (se ovenfor).

3D-deformationen projiceres derefter ind i arkitekturens billedrum for at facilite en tæt forvrængningsfelt, der vil definere deformationen. Denne proces tager omkring 30 sekunder pr. billede.

NeuralReshaper Arkitektur

NeuralReshaper kører to neurale netværk i tandem: en forgrunds-encoder, der genererer den transformeret kropsform, og en baggrunds-encoder, der fokuserer på at udfylde ‘de-occludede’ baggrundsområder (i tilfælde, for eksempel, af at gøre en krop ‘slankere’ – se billedet nedenfor).

U-net-lignende rammeværk integrerer outputtet fra de to encoders’ funktioner, før det passerer resultatet til en samlet encoder, der ultimativt producerer et nyt billede fra de to input. Arkitekturen har en ny warp-guidet mekanisme til at muliggøre integration.

Træning og Eksperimenter

NeuralReshaper er implementeret i PyTorch på en enkelt NVIDIA 1080ti GPU med 11gb VRAM. Netværket blev trænet i 100 epocher under Adam-optimizeren, med generator sat til et mål-tab af 0,0001 og diskriminator til et mål-tab af 0,0004. Træningen fandt sted på en batch-størrelse på 8 for et proprietært udendørs-dataset (trukket fra COCO, MPII og LSP), og 2 for træning på DeepFashion-datasettet.

Til venstre, de originale billeder, til højre, de reproportionerede output af NeuralReshaper.

Til venstre, de originale billeder, til højre, de reproportionerede output af NeuralReshaper.

Nedenfor er nogle eksempler eksklusivt fra DeepFashion-datasettet, som er trænet for NeuralReshaper, med de originale billeder altid til venstre.

De tre kontrollerbare attributter er adskilt, og kan anvendes separat.

Transformationer på det afledte udendørs-dataset er mere udfordrende, da de ofte kræver infilling af komplekse baggrunde og klar og overbevisende afgrænsning af de transformeret kropsformer:

Parametrisk Nødvendighed

Som artiklen bemærker, repræsenterer samme-billede-transformationer af denne type et dårligt stillet problem i billed-syntese. Mange transformative GAN- og encoder-rammeværker kan anvende parrede billeder (såsom de forskellige projekter designet til at effektuere skitse>foto og foto>skitse-transformationer).

Men i dette tilfælde ville dette kræve billedpar med samme personer i forskellige fysiske konfigurationer, såsom ‘før og efter’-billederne i diæt- eller plastikoperation-reklamer – data, der er svær at opnå eller generere.

Alternativt kan transformative GAN-netværk træne på langt mere divers data og effektuere transformationer ved at søge efter latent retning mellem kilde-(original billede latent kode) og ønsket klasse (i dette tilfælde ‘fed’, ‘tynd’, ‘høj’, osv.). Men denne tilgang er i øjeblikket for begrænset til formålet med finjustering af kropsomformning.

Neural Radiance Fields (NeRF)-tilgange er langt mere avancerede i fuld-krops-simulation end de fleste GAN-baserede systemer, men forbliver scene-specifikke og ressource-krævende, med i øjeblikket meget begrænset evne til at redigere kropsformer på en granulær måde, som NeuralReshaper og tidligere projekter forsøger at adressere (bortset fra at skala hele kroppen ned i forhold til dens omgivelser).

GAN’ens latente rum er svært at styre; VAE’er alene løser ikke endnu kompleksiteterne af fuld-krops-reproduktion; og NeRF’s kapacitet til konsekvent og realistisk at omforme menneskekroppe er stadig i sin vorden. Derfor synes det, at inkorporeringen af ‘traditionelle’ CGI-metodologier såsom SMPL vil fortsætte i menneske-billede-syntese-forskningssektoren, som en metode til at samle og konsolidere funktioner, klasser og latente koder, hvis parametre og udnyttelighed endnu ikke er fuldt forstået i disse opdyrkende teknologier.

 

Offentliggjort første gang 31. marts 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskeskabt billedsynthese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]