Andersons hoek
Lichamen ‘Beter’ Valsmaken met AI

Nieuw onderzoek van de Alibaba DAMO Academy biedt een AI‑gedreven workflow voor het automatiseren van het herschikken van lichaamsafbeeldingen – een zeldzame inspanning in een computer‑vision‑sector die momenteel bezig is met gezichtsgebaseerde manipulaties zoals deepfakes en GAN‑gebaseerde gezichtsbewerking.

In de ‘result’-kolommen, de gegenereerde attentiekaarten die de te wijzigen gebieden definiëren. Bron: https://arxiv.org/pdf/2203.04670.pdf
De architectuur van de onderzoekers maakt gebruik van skelet‑pose‑schatting om de grotere complexiteit aan te pakken waarmee beeld‑synthese‑ en bewerkingssystemen worstelen bij het conceptualiseren en parametriseren van bestaande lichaamsbeelden, althans tot een granulariteitsniveau dat daadwerkelijk betekenisvolle en selectieve bewerking mogelijk maakt.

Geschatte skelettkaarten helpen om individuele delen te identificeren en de aandacht te richten op lichaamsgebieden die waarschijnlijk worden nabewerkt, zoals het bovenarmgebied.
Het systeem stelt een gebruiker uiteindelijk in staat parameters in te stellen die het uiterlijk van gewicht, spiermassa of gewichtsverdeling kunnen veranderen in volledige of halflengtefoto’s van personen, en kan willekeurige transformaties genereren op geklede of ongeklede lichaamsdelen.

Links, de invoerafbeelding; midden, een heatmap van de afgeleide attentiegebieden; rechts, de getransformeerde afbeelding.
De motivatie voor dit werk is de ontwikkeling van geautomatiseerde workflows die de moeizame digitale manipulaties die fotografen en grafische productie‑kunstenaars in diverse mediavakken uitvoeren – van mode tot tijdschrift‑output en publiciteit‑materiaal – kunnen vervangen.
In het algemeen erkennen de auteurs dat deze transformaties meestal worden toegepast met ‘warp‑technieken’ in Photoshop en andere traditionele bitmap‑editors, en bijna uitsluitend op afbeeldingen van vrouwen worden gebruikt. Bijgevolg bestaat de op maat gemaakte dataset die is ontwikkeld om het nieuwe proces te faciliteren voornamelijk uit foto’s van vrouwelijke onderwerpen:
‘Aangezien lichaamsretouchering voornamelijk door vrouwen wordt gewenst, bestaat de meerderheid van onze collectie uit vrouwenfoto’s, rekening houdend met de diversiteit in leeftijden, rassen (African:Asian:Caucasian = 0.33:0.35:0.32), poses en kleding.’
Het paper draagt de titel Structure-Aware Flow Generation for Human Body Reshaping en komt van vijf auteurs die verbonden zijn aan Alibaba’s wereldwijde DAMO Academy.
Datasetontwikkeling
Zoals meestal het geval is bij beeld‑synthese‑ en bewerkingssystemen, vereiste de architectuur van het project een op maat gemaakte trainings‑dataset. De auteurs huurden drie fotografen in om standaard Photoshop‑manipulaties te produceren van geschikte beelden van de stock‑fotografie‑site Unsplash, wat resulteerde in een dataset – getiteld BR-5K* – van 5.000 hoogwaardige beelden met een resolutie van 2K.
De onderzoekers benadrukken dat het doel van trainen op deze dataset niet is om ‘geidealiseerde’ en algemene kenmerken te produceren die betrekking hebben op een index van aantrekkelijkheid of gewenst uiterlijk, maar eerder om de centrale kenmerk‑mappings te extraheren die verband houden met professionele manipulaties van lichaamsbeelden.
Ze geven echter toe dat de manipulaties uiteindelijk transformatieve processen weerspiegelen die een voortgang van ‘realistisch’ naar een vooraf ingestelde notie van ‘ideaal’ in kaart brengen:
‘We nodigen drie professionele kunstenaars uit om lichamen onafhankelijk met Photoshop te retoucheren, met als doel slanke figuren te bereiken die voldoen aan de populaire esthetiek, en selecteren de beste als ground‑truth.’
Aangezien het kader zich helemaal niet met gezichten bezighoudt, werden deze vervaagd voordat ze in de dataset werden opgenomen.
Architectuur en Kernconcepten
De workflow van het systeem omvat het invoeren van een hoog‑resolutie‑portret, het downsamplen naar een lagere resolutie die binnen de beschikbare rekenresources past, en het extraheren van een geschatte skelet‑map‑pose (tweede afbeelding van links hieronder), evenals Part Affinity Fields (PAFs), die in 2016 werden geïnnoveerd door The Robotics Institute van Carnegie Mellon University (zie video direct hieronder).
Part Affinity Fields helpen de oriëntatie van ledematen en de algemene associatie met het bredere skelet‑kader te definiëren, waardoor het nieuwe project een extra aandacht‑/lokalisatietool krijgt.

Uit het 2016‑paper over Part Affinity Fields coderen voorspelde PAFs de ledemaatoriëntatie als onderdeel van een 2D‑vector die ook de algemene positie van de ledemaat omvat. Bron: https://arxiv.org/pdf/1611.08050.pdf
Ondanks hun schijnbare irrelevantie voor het uiterlijk van gewicht, zijn skelet‑kaarten nuttig om de uiteindelijke transformatieve processen te richten op lichaamsdelen die moeten worden aangepast, zoals bovenarmen, billen en dijen.
Daarna worden de resultaten gevoed aan een Structure Affinity Self‑Attention (SASA) in de centrale bottleneck van het proces (zie afbeelding hieronder).

De SASA reguleert de consistentie van de flow‑generator die het proces aandrijft; de resultaten hiervan worden vervolgens doorgegeven aan de warping‑module (tweede van rechts in de bovenstaande afbeelding), die de transformaties toepast die geleerd zijn tijdens de training op de handmatige revisies die in de dataset zijn opgenomen.

De Structure Affinity Self‑Attention (SASA)‑module wijst aandacht toe aan relevante lichaamsdelen, waardoor onnodige of irrelevante transformaties worden vermeden.
De uitvoerafbeelding wordt vervolgens weer opgeschaald naar de oorspronkelijke 2K‑resolutie, met processen die niet wezenlijk verschillen van de standaard deepfake‑architectuur uit 2017 waar populaire pakketten zoals DeepFaceLab later op zijn gebaseerd; het opschaalproces komt ook veel voor in GAN‑bewerkings‑frameworks.
Het attentienetwerk voor het schema is gemodelleerd naar Compositional De‑Attention Networks (CODA), een academische samenwerking uit 2019 tussen de VS en Singapore met Amazon (AMZN ) AI en Microsoft.
Tests
Het flow‑gebaseerde framework werd getest tegen eerdere flow‑gebaseerde methoden FAL en Animating Through Warping (ATW), evenals beeld‑vertalingsarchitecturen Pix2PixHD en GFLA, met SSIM, PSNR en LPIPS als evaluatiemetrieken.

Resultaten van de eerste tests (pijlrichting in de koppen geeft aan of lagere of hogere cijfers beter zijn).
Op basis van deze aangenomen metrieken presteert het systeem van de auteurs beter dan de eerdere architecturen.

Geselecteerde resultaten. Raadpleeg de oorspronkelijke PDF die in dit artikel wordt gelinkt voor vergelijkingen met hogere resolutie.
Naast de geautomatiseerde metrieken voerden de onderzoekers een gebruikerstest uit (laatste kolom van de eerder getoonde resultaten‑tabel), waarbij 40 deelnemers elk 30 willekeurig gekozen vragen uit een pool van 100 vragen kregen over de beelden die met de verschillende methoden waren geproduceerd. 70 % van de respondenten gaf de voorkeur aan de nieuwe techniek omdat deze ‘visueel aantrekkelijker’ was.
Uitdagingen
Het nieuwe artikel vormt een zeldzame uitstap in AI‑gebaseerde lichaamsmanipulatie. De sector van beeld‑synthese is momenteel veel meer geïnteresseerd in het genereren van bewerkbare lichamen via methoden zoals Neural Radiance Fields (NeRF), of is gefixeerd op het verkennen van de latente ruimte van GAN’s en het potentieel van auto‑encoders voor gezichtsmanipulatie.
De initiatief van de auteurs is momenteel beperkt tot het produceren van veranderingen in waargenomen gewicht, en ze hebben nog geen inpainting‑techniek geïmplementeerd die de achtergrond zou herstellen die onvermijdelijk zichtbaar wordt wanneer je een foto van iemand slanker maakt.
Echter, ze stellen voor dat portret‑matting en achtergrond‑blending via textuur‑inference het probleem van het herstellen van de delen van de wereld die voorheen verborgen waren in de afbeelding door menselijke ‘onvolkomenheid’, triviaal zou kunnen oplossen.

Een voorgestelde oplossing om de achtergrond te herstellen die zichtbaar wordt door AI‑gedreven vetreductie.
* Hoewel de preprint verwijst naar aanvullend materiaal met meer details over de dataset, evenals verdere voorbeelden uit het project, is de locatie van dit materiaal niet beschikbaar in het artikel, en heeft de corresponderende auteur nog niet gereageerd op ons verzoek om toegang.
Eerste publicatie 10 maart 2022.












