Andersons Blickwinkel
Künstliche ‘bessere’ Körper mit KI

Neue Forschung der Alibaba DAMO Academy bietet einen KI‑gesteuerten Workflow zur automatischen Umgestaltung von Körperbildern – ein seltenes Unterfangen im Bereich der Computer Vision, der derzeit von gesichtsbasierter Manipulationen wie Deepfakes und GAN‑basiertem Gesichtsbearbeitung dominiert wird.

Einfügung in den ‘result’-Spalten, die erzeugten Aufmerksamkeitskarten, die die zu korrigierenden Bereiche definieren. Quelle: https://arxiv.org/pdf/2203.04670.pdf
Die Architektur der Forschenden nutzt die Schätzung von Skelettposen, um die größere Komplexität zu bewältigen, der Bildsynthetisierungs‑ und Bearbeitungssysteme bei der Konzeptualisierung und Parametrisierung bestehender Körperbilder gegenüberstehen, zumindest auf einem Granularitätsniveau, das tatsächlich sinnvolle und selektive Bearbeitungen ermöglicht.

Geschätzte Skelettkarten helfen, einzelne Körperbereiche zu identifizieren und die Aufmerksamkeit auf Bereiche zu richten, die wahrscheinlich retuschiert werden, wie etwa den Oberarmbereich.
Das System ermöglicht es letztlich einem Nutzer, Parameter zu setzen, die das Erscheinungsbild von Gewicht, Muskelmasse oder Gewichtsverteilung in Ganzkörper‑ oder Halbkörperaufnahmen von Personen verändern können, und ist in der Lage, beliebige Transformationen an bekleideten oder unbedeckten Körperabschnitten zu erzeugen.

Links das Eingabebild; Mitte eine Heatmap der abgeleiteten Aufmerksamkeitsbereiche; rechts das transformierte Bild.
Die Motivation hinter der Arbeit ist die Entwicklung automatisierter Workflows, die die mühsamen digitalen Manipulationen, die von Fotografen und Grafikdesignern in verschiedenen Medienbereichen – von Mode über Zeitschriftenausgaben bis hin zu Werbematerial – durchgeführt werden, ersetzen könnten.
Im Allgemeinen geben die Autoren zu, dass diese Transformationen üblicherweise mit ‘Warp’-Techniken in Photoshop und anderen traditionellen Bitmap‑Editoren angewendet werden und fast ausschließlich bei Bildern von Frauen zum Einsatz kommen. Folglich besteht der eigens entwickelte Datensatz, der den neuen Prozess erleichtern soll, hauptsächlich aus Aufnahmen von weiblichen Probanden:
‘Da die Körperretusche hauptsächlich von Frauen gewünscht wird, besteht die Mehrheit unserer Sammlung aus Frauenfotos, wobei die Vielfalt an Alter, Rassen (Afrikanisch:Asiatisch:Caucasian = 0.33:0.35:0.32), Posen und Kleidungsstücken berücksichtigt wird.’
Das Paper trägt den Titel Structure-Aware Flow Generation for Human Body Reshaping und stammt von fünf Autor*innen, die mit der globalen DAMO Academy von Alibaba verbunden sind.
Datensatzentwicklung
Wie bei Bildsynthetisierungs‑ und Bearbeitungssystemen üblich, erforderte die Architektur des Projekts einen maßgeschneiderten Trainingsdatensatz. Die Autor*innen beauftragten drei Fotografen, Standard‑Photoshop‑Manipulationen geeigneter Bilder von der Stock‑Fotografie‑Seite Unsplash zu erstellen, was zu einem Datensatz – betitelt BR-5K* – von 5.000 hochwertigen Bildern in 2K‑Auflösung führte.
Die Forschenden betonen, dass das Ziel des Trainings mit diesem Datensatz nicht darin besteht, ‘idealisiert’‑ und verallgemeinerte Merkmale im Hinblick auf einen Attraktivitäts‑ oder Wunscherscheinungs‑Index zu erzeugen, sondern vielmehr die zentralen Merkmalszuordnungen zu extrahieren, die mit professionellen Manipulationen von Körperbildern verbunden sind.
Sie räumen jedoch ein, dass die Manipulationen letztlich transformative Prozesse widerspiegeln, die einen Übergang von ‘real’ zu einer vorgegebenen Vorstellung von ‘ideal’ abbilden:
‘Wir laden drei professionelle Künstler ein, Körper mit Photoshop eigenständig zu retuschieren, mit dem Ziel schlanke Figuren zu erreichen, die den gängigen ästhetischen Vorstellungen entsprechen, und wählen das beste Ergebnis als Ground‑Truth aus.’
Da das Framework überhaupt nicht mit Gesichtern arbeitet, wurden diese vor der Aufnahme in den Datensatz verwischt.
Architektur und Kernkonzepte
Der Workflow des Systems besteht darin, ein hochauflösendes Porträt einzuspeisen, es auf eine niedrigere Auflösung herunterzuskalieren, die in die verfügbaren Rechenressourcen passt, und eine geschätzte Skelett‑Map‑Pose (zweite Abbildung von links im Bild unten) sowie Part Affinity Fields (PAFs) zu extrahieren, die 2016 vom Robotics Institute der Carnegie Mellon University entwickelt wurden (siehe unten eingebettetes Video).
Part Affinity Fields helfen, die Orientierung von Gliedmaßen und deren allgemeine Zuordnung zum übergeordneten Skelettgerüst zu definieren und bieten dem neuen Projekt ein zusätzliches Aufmerksamkeits‑/Lokalisierungswerkzeug.

Aus dem 2016‑Paper zu Part Affinity Fields kodieren vorhergesagte PAFs die Gliedmaßenorientierung als Teil eines 2D‑Vektors, der auch die allgemeine Position des Gliedes enthält. Quelle: https://arxiv.org/pdf/1611.08050.pdf
Trotz ihrer scheinbaren Irrelevanz für das Erscheinungsbild des Gewichts sind Skelettkarten nützlich, um die abschließenden Transformationsprozesse auf die zu korrigierenden Körperbereiche zu lenken, etwa Oberarme, Gesäß und Oberschenkel.
Nach diesem Schritt werden die Ergebnisse an ein Structure Affinity Self‑Attention (SASA) im zentralen Engpass des Prozesses weitergeleitet (siehe Bild unten).

Das SASA reguliert die Konsistenz des Flow‑Generators, der den Prozess antreibt; die daraus resultierenden Bilder werden anschließend an das Warping‑Modul (zweites von rechts im obigen Bild) übergeben, das die aus dem Training mit den manuellen Revisionen im Datensatz erlernten Transformationen anwendet.

Das Structure Affinity Self‑Attention (SASA)‑Modul verteilt Aufmerksamkeit auf relevante Körperteile und hilft, überflüssige oder irrelevante Transformationen zu vermeiden.
Das Ausgabebild wird anschließend wieder auf die ursprüngliche 2K‑Auflösung hochskaliert, wobei Verfahren verwendet werden, die der Standard‑Deepfake‑Architektur von 2017, von der populäre Pakete wie DeepFaceLab abgeleitet wurden, nicht unähnlich sind; der Upsampling‑Prozess ist ebenfalls in GAN‑Bearbeitungs‑Frameworks üblich.
Das Aufmerksamkeitsnetzwerk für das Schema ist modelliert nach Compositional De-Attention Networks (CODA), einer 2019 in den USA/Singapur entstandenen akademischen Zusammenarbeit mit Amazon (AMZN ) AI und Microsoft.
Tests
Das flussbasierte Framework wurde gegen frühere flussbasierte Methoden FAL und Animating Through Warping (ATW) sowie Bild‑Übersetzungs‑Architekturen Pix2PixHD und GFLA getestet, wobei SSIM, PSNR und LPIPS als Evaluationsmetriken dienten.

Ergebnisse der ersten Tests (Pfeilrichtung in den Überschriften zeigt an, ob niedrigere oder höhere Werte besser sind).
Auf Basis dieser Metriken übertrifft das System der Autor*innen die vorherigen Architekturen.

Ausgewählte Ergebnisse. Bitte beziehen Sie sich auf das in diesem Artikel verlinkte Original‑PDF für hochauflösendere Vergleiche.
Zusätzlich zu den automatisierten Metriken führten die Forschenden eine Nutzerstudie (letzte Spalte der zuvor abgebildeten Ergebnistabelle) durch, bei der 40 Teilnehmende jeweils 30 zufällig aus einem Pool von 100 Fragen ausgewählte Fragen zu den mit den verschiedenen Methoden erzeugten Bildern gezeigt bekamen. 70 % der Befragten bevorzugten die neue Technik als visuell ansprechender.
Herausforderungen
Das neue Paper stellt einen seltenen Ausflug in die KI‑basierte Körpermanipulation dar. Der Bildsynthetisierungs‑Sektor ist derzeit deutlich stärker daran interessiert, editierbare Körper mittels Methoden wie Neural Radiance Fields (NeRF) zu erzeugen, oder er fokussiert sich auf die Erkundung des latenten Raums von GANs und das Potenzial von Autoencodern für Gesichtsmanipulationen.
Die Initiative der Autor*innen ist derzeit darauf beschränkt, Veränderungen im wahrgenommenen Gewicht zu erzeugen, und sie haben noch keine Inpainting‑Technik implementiert, die den Hintergrund wiederherstellen würde, der unvermeidlich sichtbar wird, wenn man ein Bild einer Person schlanker macht.
Sie schlagen jedoch vor, dass Portrait‑Matting und Hintergrund‑Blending mittels texturaler Inferenz das Problem, die im Bild zuvor durch menschliche ‘Unvollkommenheit’ verborgenen Bildteile wiederherzustellen, trivial lösen könnten.

Ein vorgeschlagener Lösungsansatz zur Wiederherstellung des Hintergrunds, der durch KI‑gesteuerte Fettreduktion sichtbar wird.
* Obwohl das Preprint auf ergänzendes Material verweist, das weitere Details zum Datensatz sowie weitere Beispiele aus dem Projekt liefert, ist der Standort dieses Materials im Paper nicht verfügbar, und der korrespondierende Autor hat bisher nicht auf unsere Anfrage nach Zugriff geantwortet.
Erstmals veröffentlicht am 10. März 2022.












