Andersons hoek

Het herschapen van menselijke lichaamstypen met AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Een nieuwe onderzoeks samenwerking uit China biedt een novate methode om het menselijk lichaam in beelden te herschapen, door het gebruik van een gecoÃķrdineerd tweeling neurale encoder netwerk, geleid door een parametriseerd model, dat een eindgebruiker in staat stelt om gewicht, lengte en lichaamsproporties te moduleren in een interactieve GUI.

Parametrized modulation of body shape, with sliders altering the three available features. Source: https://arxiv.org/pdf/2203.10496.pdf

Parametrized modulation of body shape, with sliders altering the three available features. Source: https://arxiv.org/pdf/2203.10496.pdf

Het werk biedt verschillende verbeteringen ten opzichte van een recent soortgelijk project van Alibaba, omdat het overtuigend lengte en lichaamsproporties kan veranderen, evenals gewicht, en een speciaal neurale netwerk heeft voor ‘inpainting’ van de (niet-bestaande) achtergrond die kan worden onthuld door ‘dunnere’ lichaamsbeelden. Het verbetert ook een opvallende eerdere parametriseerde methode voor lichaamsherschapen door de noodzaak voor uitgebreide menselijke interventie tijdens de formulering van de transformatie te verwijderen.

Genoemd NeuralReshaper, past de nieuwe architectuur een parametriseerd 3D-menselijk sjabloon aan een bronafbeelding aan, en gebruikt vervormingen in het sjabloon om de oorspronkelijke afbeelding aan te passen aan de nieuwe parameters.

Het systeem kan lichaamstransformaties verwerken op geklede en semi-geklede (d.w.z. strandkleding) figuren.

Transformaties van dit type zijn momenteel van groot belang voor de fashion AI-onderzoekssector, die een aantal StyleGAN/CycleGAN-gebaseerde en algemene neurale netwerkplatforms heeft geproduceerd voor virtuele pasbeurten die beschikbare kledingartikelen kunnen aanpassen aan de lichaamsvorm en -type van een door de gebruiker ingediende afbeelding, of anderszins helpen bij visuele conformiteit.

Het artikel heet Single-image Human-body Reshaping with Deep Neural Networks en komt van onderzoekers aan de Zhejiang Universiteit in Hangzhou en de School of Creative Media aan de City University of Hong Kong.

SMPL Fitting

NeuralReshaper maakt gebruik van de Skinned Multi-Person Linear Model (SMPL) ontwikkeld door het Max Planck Instituut voor Intelligent Systems en de bekende VFX-huis Industrial Light and Magic in 2015.

SMPL Parametric humans from the 2015 Planck/ILM collaboration. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL Parametric humans from the 2015 Planck/ILM collaboration. Source: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

In de eerste fase van het proces wordt een SMPL-model gegenereerd uit een bronafbeelding waarop lichaamstransformaties gewenst zijn. De aanpassing van het SMPL-model aan de afbeelding volgt de methodologie van de Human Mesh Recovery (HMR)-methode die in 2018 door universiteiten in Duitsland en de VS is voorgesteld.

De drie parameters voor vervorming (gewicht, lengte, lichaamsproporties) worden op dit stadium berekend, samen met een overweging van de cameraparameters, zoals brandpuntsafstand. 2D-sleutelpunten en gegenereerde silhouetuitlijning bieden de omsluiting voor de vervorming in de vorm van een 2D-silhouet, een extra optimalisatiemaatregel die de grensprecisie verhoogt en authentieke achtergrondinpainting verderop in de pijplijn mogelijk maakt.

SMPL fitting stages: left, the source image; second from left, the optimization result obtained from the method outlined in 2016 research led by the Max Planck Institute for Intelligent Systems; third from left, a direct inference result from the pre-trained model for End-to-end Recovery of Human Shape and Pose; second from right, the results obtained after optimization of the 2D keypoints; and finally, right, the completed fit after silhouette optimization (see above).

SMPL fitting stages: left, the source image; second, the optimization result obtained from the method outlined in 2016 research led by the Max Planck Institute for Intelligent Systems; third, a direct inference result from the pre-trained model for End-to-end Recovery of Human Shape and Pose; fourth, the results obtained after optimization of the 2D keypoints; and finally, fifth, the completed fit after silhouette optimization (see above).

De 3D-vervorming wordt vervolgens geprojecteerd in de beeldruimte van de architectuur om een dichte warping-veld te definiÃŦren dat de vervorming zal definiÃŦren. Dit proces duurt ongeveer 30 seconden per afbeelding.

NeuralReshaper Architecture

NeuralReshaper draait twee neurale netwerken in tandem: een voorgrondencoder die de getransformeerde lichaamsvorm genereert, en een achtergrondencoder die zich richt op het invullen van ‘de-occluded’ achtergrondgebieden (in het geval, bijvoorbeeld, van het afslanken van een lichaam – zie onderstaande afbeelding).

Het U-net-achtige kader integreert de uitvoer van de twee encoders’ functies voordat het resultaat wordt doorgegeven aan een unified encoder die uiteindelijk een nieuwe afbeelding produceert uit de twee invoer. De architectuur heeft een novate warp-geleide mechanisme om integratie mogelijk te maken.

Training and Experiments

NeuralReshaper is geÃŊmplementeerd in PyTorch op een enkele NVIDIA 1080ti GPU met 11gb VRAM. Het netwerk werd getraind voor 100 epochs onder de Adam-optimizer, met de generator ingesteld op een doelverlies van 0,0001 en de discriminator op een doelverlies van 0,0004. De training vond plaats op een batchgrootte van 8 voor een propriÃŦtaire buitendataset (getrokken uit COCO, MPII, en LSP), en 2 voor training op de DeepFashion-dataset.

On the left, the original images, on the right, the reproportioned output of NeuralReshaper.

On the left, the original images, on the right, the reproportioned output of NeuralReshaper.

Onderstaand zijn enkele voorbeelden die exclusief afkomstig zijn van de DeepFashion-dataset, getraind voor NeuralReshaper, met de oorspronkelijke afbeeldingen altijd links.

De drie controleerbare attributen zijn ontward, en kunnen afzonderlijk worden toegepast.

Transformaties op de afgeleide buitendataset zijn moeilijker, omdat ze vaak het invullen van complexe achtergronden en duidelijke en overtuigende afbakening van de getransformeerde lichaamstypen vereisen:

Parametric Necessity

Zoals het artikel opmerkt, vertegenwoordigen transformaties van dit type een onbepaald probleem in beeldsynthese. Veel transformatieve GAN- en encoderkaders kunnen gebruikmaken van gepaarde afbeeldingen (zoals de diverse projecten die zijn ontworpen om schets>foto en foto>schets transformaties te bewerkstelligen).

Echter, in het geval hier, zou dit het gebruik van afbeeldingsparen vereisen met dezelfde personen in verschillende fysieke configuraties, zoals de ‘voor en na’ afbeeldingen in dieet- of plastische chirurgie reclame – gegevens die moeilijk te verkrijgen of te genereren zijn.

Alternatief kunnen transformatieve GAN-netwerken trainen op veel meer diverse gegevens en transformaties effectueren door de latent richting tussen de bron (oorspronkelijke afbeelding latent code) en de gewenste klasse (in dit geval ‘dik’, ‘dun’, ‘lang’, etc.) te zoeken. Echter, deze benadering is momenteel te beperkt voor het doel van fijn afgestemde lichaamsherschapen.

Neural Radiance Fields (NeRF) benaderingen zijn veel verder ontwikkeld in full-body simulatie dan de meeste GAN-gebaseerde systemen, maar blijven scÃĻne-specifiek en resource-intensief, met momenteel zeer beperkte mogelijkheid om lichaamstypen te bewerken op de granulaire manier die NeuralReshaper en eerdere projecten proberen aan te pakken (kortom, het hele lichaam naar beneden schalen ten opzichte van de omgeving).

De latent ruimte van de GAN is moeilijk te reguleren; VAE’s alleen adresseren nog niet de complexiteiten van full-body reproductie; en NeRF’s capaciteit om consistent en realistisch menselijke lichamen te remodelen is nog in de kinderschoenen. Daarom lijkt de incorporatie van ‘traditionele’ CGI-methodologieÃŦn zoals SMPL te zullen voortduren in de menselijke beeldsyntheseonderzoekssector, als een methode om functies, klassen en latent codes te corralen en te consolideren waarvan de parameters en exploitatie nog niet volledig worden begrepen in deze opkomende technologieÃŦn.

 

First published 31st maart 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]