Andersons Blickwinkel

Umgestaltung von Körpertypen mit KI

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine neue Forschungskooperation aus China bietet eine neuartige Methode zur Umgestaltung des menschlichen Körpers in Bildern, indem ein koordiniertes Zwillings-Neuronen-Encoder-Netzwerk verwendet wird, das von einem parametrischen Modell geleitet wird, das es einem Endbenutzer ermöglicht, Gewicht, Größe und Körperproportionen in einer interaktiven Benutzeroberfläche zu modulieren.

Parametrisierte Modulation der Körperform, mit Schiebereglern, die die drei verfügbaren Funktionen ändern. Quelle: https://arxiv.org/pdf/2203.10496.pdf

Parametrisierte Modulation der Körperform, mit Schiebereglern, die die drei verfügbaren Funktionen ändern. Quelle: https://arxiv.org/pdf/2203.10496.pdf

Die Arbeit bietet mehrere Verbesserungen gegenüber einem ähnlichen Projekt von Alibaba, da es überzeugend Größe und Körperproportionen sowie Gewicht ändern kann und ein dediziertes Neuronales Netzwerk für das “Inpainting” des (nicht existierenden) Hintergrunds hat, das durch “slimmere” Körperbilder aufgedeckt werden kann. Es verbessert auch eine bemerkenswerte frühere parametrische Methode für Körperumgestaltung, indem es die Notwendigkeit umfangreicher menschlicher Intervention während der Formulierung der Transformation entfernt.

Der neue Architekturansatz, der NeuralReshaper genannt wird, passt ein parametrizes 3D-Menschen-Modell an ein Quellbild an und verwendet dann Verzerrungen im Modell, um das Originalbild an die neuen Parameter anzupassen.

Das System kann Körpertransformationen auf bekleidete sowie halb bekleidete (z. B. Badebekleidung) Figuren anwenden.

Transformationen dieser Art sind derzeit von großem Interesse für den Mode-KI-Forschungsbereich, der eine Reihe von StyleGAN/CycleGAN-basierten und allgemeinen neuronalen Netzwerk-Plattformen für virtuelle Anproben entwickelt hat, die verfügbare Kleidungsstücke an die Körperform und den Körpertyp eines Benutzerbildes anpassen können oder anderweitig bei der visuellen Konformität helfen.

Die Studie trägt den Titel Single-image Human-body Reshaping with Deep Neural Networks und stammt von Forschern der Zhejiang-Universität in Hangzhou und der School of Creative Media an der City University of Hong Kong.

SMPL-Anpassung

NeuralReshaper nutzt das Skinned Multi-Person Linear Model (SMPL) entwickelt vom Max-Planck-Institut für Intelligente Systeme und der renommierten VFX-Firma Industrial Light and Magic im Jahr 2015.

SMPL-Parametrische Menschen vom 2015er Planck/ILM-Kooperationsprojekt. Quelle: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

SMPL-Parametrische Menschen vom 2015er Planck/ILM-Kooperationsprojekt. Quelle: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Im ersten Schritt des Prozesses wird ein SMPL-Modell aus einem Quellbild generiert, an dem Körpertransformationen vorgenommen werden sollen. Die Anpassung des SMPL-Modells an das Bild folgt der Methodik der Human Mesh Recovery (HMR)-Methode, die 2018 von Universitäten in Deutschland und den USA vorgeschlagen wurde.

Die drei Parameter für die Deformation (Gewicht, Größe, Körperproportion) werden in diesem Stadium berechnet, zusammen mit einer Berücksichtigung der Kameraparameter, wie z. B. der Brennweite. 2D-Schlüsselpunkte und generierte Silhouette-Anpassung bieten die Umrandung für die Deformation in Form einer 2D-Silhouette, eine zusätzliche Optimierungsmaßnahme, die die Randgenauigkeit erhöht und authentisches Hintergrund-Inpainting weiter unten in der Pipeline ermöglicht.

SMPL-Anpassungsschritte: links, das Quellbild; zweites Bild von links, das Optimierungsergebnis, das mit der in der 2016er Studie des Max-Planck-Instituts für Intelligente Systeme beschriebenen Methode erhalten wurde; drittes Bild von links, ein direktes Inferenzergebnis aus dem vorab trainierten Modell für die Wiederherstellung von menschlicher Form und Pose; zweites Bild von rechts, die Ergebnisse nach Optimierung der 2D-Schlüsselpunkte; und schließlich rechts, die abgeschlossene Anpassung nach Silhouette-Optimierung (siehe oben).

SMPL-Anpassungsschritte: links, das Quellbild; zweites Bild von links, das Optimierungsergebnis, das mit der in der 2016er Studie des Max-Planck-Instituts für Intelligente Systeme beschriebenen Methode erhalten wurde; drittes Bild von links, ein direktes Inferenzergebnis aus dem vorab trainierten Modell für die Wiederherstellung von menschlicher Form und Pose; viertes Bild von links, die Ergebnisse nach Optimierung der 2D-Schlüsselpunkte; und schließlich rechts, die abgeschlossene Anpassung nach Silhouette-Optimierung (siehe oben).

Die 3D-Deformation wird dann in den Bildraum des Architekturmodells projiziert, um ein dichtes Verformungsfeld zu ermöglichen, das die Deformation definieren wird. Dieser Prozess dauert etwa 30 Sekunden pro Bild.

NeuralReshaper-Architektur

NeuralReshaper läuft zwei Neuronale Netze parallel: einen Vordergrund-Encoder, der die transformierte Körperform erzeugt, und einen Hintergrund-Encoder, der sich auf das Ausfüllen von “entdeckten” Hintergrundbereichen konzentriert (z. B. wenn ein Körper “abgemagert” wird – siehe Bild unten).

Das U-Net-ähnliche Framework integriert die Ausgabe der beiden Encoder-Features, bevor es das Ergebnis an einen einheitlichen Encoder weiterleitet, der letztendlich ein neues Bild aus den beiden Eingaben erzeugt. Die Architektur verfügt über einen neuartigen warp-gesteuerten Mechanismus, um die Integration zu ermöglichen.

Schulung und Experimente

NeuralReshaper wird in PyTorch auf einem einzelnen NVIDIA (NVDA ) 1080ti-GPU mit 11 GB VRAM implementiert. Das Netzwerk wurde für 100 Epochen unter dem Adam-Optimizer trainiert, wobei der Generator auf einen Zielverlust von 0,0001 und der Diskriminator auf einen Zielverlust von 0,0004 eingestellt wurde. Die Schulung erfolgte auf einem Batch-Größe von 8 für ein proprietäres Outdoor-Datensatz (aus COCO, MPII und LSP), und 2 für die Schulung auf dem DeepFashion-Datensatz.

Links, die Originalbilder, rechts, die reproportionierten Ausgaben von NeuralReshaper.

Links, die Originalbilder, rechts, die reproportionierten Ausgaben von NeuralReshaper.

Unten sind einige Beispiele ausschließlich aus dem DeepFashion-Datensatz, der für NeuralReshaper trainiert wurde, wobei die Originalbilder immer links sind.

Die drei steuerbaren Attribute sind entkoppelt und können separat angewendet werden.

Transformationen auf dem abgeleiteten Outdoor-Datensatz sind herausfordernder, da sie häufig das Ausfüllen komplexer Hintergründe und eine klare und überzeugende Abgrenzung der transformierten Körpertypen erfordern:

Parametrische Notwendigkeit

Wie die Studie feststellt, stellen Transformationen von Bildern desselben Typs ein schlecht gestelltes Problem in der Bildsynthese dar. Viele transformative GAN- und Encoder-Frameworks können Paarbilder (wie die vielfältigen Projekte, die zur Durchführung von Skizze>Foto– und Foto>Skizze-Transformationen entwickelt wurden) verwenden.

Im vorliegenden Fall würde dies jedoch Paarbilder erfordern, die dieselben Menschen in verschiedenen körperlichen Konfigurationen zeigen, wie z. B. die “Vorher- und Nachher”-Bilder in Diät- oder Schönheits-Operationen-Werbung – Daten, die schwer zu erhalten oder zu generieren sind.

Alternativ können transformative GAN-Netzwerke auf viel diverseren Daten trainiert werden und Transformationen durchsuchen, indem sie die latente Richtung zwischen dem Quellbild (Originalbild-Latentcode) und der gewünschten Klasse (in diesem Fall “fett”, “dünn”, “groß” usw.) suchen. Dieser Ansatz ist jedoch derzeit für die Feinabstimmung der Körperumgestaltung zu begrenzt.

Neuronale Radiance Fields (NeRF) sind viel weiter fortgeschritten in der Vollkörpersimulation als die meisten GAN-basierten Systeme, bleiben jedoch szene-spezifisch und ressourcen-intensiv, mit derzeit sehr begrenzter Fähigkeit, Körpertypen in der granularen Weise zu bearbeiten, die NeuralReshaper und vorherige Projekte zu lösen versuchen (abgesehen von der Skalierung des gesamten Körpers im Verhältnis zu seiner Umgebung).

Der latente Raum des GAN ist schwer zu regieren; VAEs allein lösen die Komplexitäten der vollständigen Körperreproduktion noch nicht; und NeRFs Fähigkeit, menschliche Körper konsistent und realistisch umzugestalten, ist noch im Entstehen. Daher scheint die Einbeziehung von “traditionellen” CGI-Methoden wie SMPL in der menschlichen Bildsynthese-Forschung fortzusetzen, als Methode, um Funktionen, Klassen und latente Codes zu kanalisieren und zu konsolidieren, deren Parameter und Ausbeutbarkeit in diesen aufstrebenden Technologien noch nicht vollständig verstanden sind.

 

Erstveröffentlichung am 31. März 2022.

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai