Andersons hoek

Lichamen ‘Beter’ Valsmaken met AI

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Nieuw onderzoek van de Alibaba DAMO Academy biedt een AI‑gedreven workflow voor het automatiseren van het herschikken van lichaamsafbeeldingen – een zeldzame inspanning in een computer‑vision‑sector die momenteel bezig is met gezichtsgebaseerde manipulaties zoals deepfakes en GAN‑gebaseerde gezichtsbewerking.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

In de ‘result’-kolommen, de gegenereerde attentiekaarten die de te wijzigen gebieden definiëren. Bron: https://arxiv.org/pdf/2203.04670.pdf

De architectuur van de onderzoekers maakt gebruik van skelet‑pose‑schatting om de grotere complexiteit aan te pakken waarmee beeld‑synthese‑ en bewerkingssystemen worstelen bij het conceptualiseren en parametriseren van bestaande lichaamsbeelden, althans tot een granulariteitsniveau dat daadwerkelijk betekenisvolle en selectieve bewerking mogelijk maakt.

Geschatte skelettkaarten helpen om individuele delen te identificeren en de aandacht te richten op lichaamsgebieden die waarschijnlijk worden nabewerkt, zoals het bovenarmgebied.

Het systeem stelt een gebruiker uiteindelijk in staat parameters in te stellen die het uiterlijk van gewicht, spiermassa of gewichtsverdeling kunnen veranderen in volledige of halflengtefoto’s van personen, en kan willekeurige transformaties genereren op geklede of ongeklede lichaamsdelen.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Links, de invoerafbeelding; midden, een heatmap van de afgeleide attentiegebieden; rechts, de getransformeerde afbeelding.

De motivatie voor dit werk is de ontwikkeling van geautomatiseerde workflows die de moeizame digitale manipulaties die fotografen en grafische productie‑kunstenaars in diverse mediavakken uitvoeren – van mode tot tijdschrift‑output en publiciteit‑materiaal – kunnen vervangen.

In het algemeen erkennen de auteurs dat deze transformaties meestal worden toegepast met ‘warp‑technieken’ in Photoshop en andere traditionele bitmap‑editors, en bijna uitsluitend op afbeeldingen van vrouwen worden gebruikt. Bijgevolg bestaat de op maat gemaakte dataset die is ontwikkeld om het nieuwe proces te faciliteren voornamelijk uit foto’s van vrouwelijke onderwerpen:

‘Aangezien lichaamsretouchering voornamelijk door vrouwen wordt gewenst, bestaat de meerderheid van onze collectie uit vrouwenfoto’s, rekening houdend met de diversiteit in leeftijden, rassen (African:Asian:Caucasian = 0.33:0.35:0.32), poses en kleding.’

Het paper draagt de titel Structure-Aware Flow Generation for Human Body Reshaping en komt van vijf auteurs die verbonden zijn aan Alibaba’s wereldwijde DAMO Academy.

Datasetontwikkeling

Zoals meestal het geval is bij beeld‑synthese‑ en bewerkingssystemen, vereiste de architectuur van het project een op maat gemaakte trainings‑dataset. De auteurs huurden drie fotografen in om standaard Photoshop‑manipulaties te produceren van geschikte beelden van de stock‑fotografie‑site Unsplash, wat resulteerde in een dataset – getiteld BR-5K* – van 5.000 hoogwaardige beelden met een resolutie van 2K.

De onderzoekers benadrukken dat het doel van trainen op deze dataset niet is om ‘geidealiseerde’ en algemene kenmerken te produceren die betrekking hebben op een index van aantrekkelijkheid of gewenst uiterlijk, maar eerder om de centrale kenmerk‑mappings te extraheren die verband houden met professionele manipulaties van lichaamsbeelden.

Ze geven echter toe dat de manipulaties uiteindelijk transformatieve processen weerspiegelen die een voortgang van ‘realistisch’ naar een vooraf ingestelde notie van ‘ideaal’ in kaart brengen:

‘We nodigen drie professionele kunstenaars uit om lichamen onafhankelijk met Photoshop te retoucheren, met als doel slanke figuren te bereiken die voldoen aan de populaire esthetiek, en selecteren de beste als ground‑truth.’

Aangezien het kader zich helemaal niet met gezichten bezighoudt, werden deze vervaagd voordat ze in de dataset werden opgenomen.

Architectuur en Kernconcepten

De workflow van het systeem omvat het invoeren van een hoog‑resolutie‑portret, het downsamplen naar een lagere resolutie die binnen de beschikbare rekenresources past, en het extraheren van een geschatte skelet‑map‑pose (tweede afbeelding van links hieronder), evenals Part Affinity Fields (PAFs), die in 2016 werden geïnnoveerd door The Robotics Institute van Carnegie Mellon University (zie video direct hieronder).

Part Affinity Fields helpen de oriëntatie van ledematen en de algemene associatie met het bredere skelet‑kader te definiëren, waardoor het nieuwe project een extra aandacht‑/lokalisatietool krijgt.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Uit het 2016‑paper over Part Affinity Fields coderen voorspelde PAFs de ledemaatoriëntatie als onderdeel van een 2D‑vector die ook de algemene positie van de ledemaat omvat. Bron: https://arxiv.org/pdf/1611.08050.pdf

Ondanks hun schijnbare irrelevantie voor het uiterlijk van gewicht, zijn skelet‑kaarten nuttig om de uiteindelijke transformatieve processen te richten op lichaamsdelen die moeten worden aangepast, zoals bovenarmen, billen en dijen.

Daarna worden de resultaten gevoed aan een Structure Affinity Self‑Attention (SASA) in de centrale bottleneck van het proces (zie afbeelding hieronder).

De SASA reguleert de consistentie van de flow‑generator die het proces aandrijft; de resultaten hiervan worden vervolgens doorgegeven aan de warping‑module (tweede van rechts in de bovenstaande afbeelding), die de transformaties toepast die geleerd zijn tijdens de training op de handmatige revisies die in de dataset zijn opgenomen.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

De Structure Affinity Self‑Attention (SASA)‑module wijst aandacht toe aan relevante lichaamsdelen, waardoor onnodige of irrelevante transformaties worden vermeden.

De uitvoerafbeelding wordt vervolgens weer opgeschaald naar de oorspronkelijke 2K‑resolutie, met processen die niet wezenlijk verschillen van de standaard deepfake‑architectuur uit 2017 waar populaire pakketten zoals DeepFaceLab later op zijn gebaseerd; het opschaalproces komt ook veel voor in GAN‑bewerkings‑frameworks.

Het attentienetwerk voor het schema is gemodelleerd naar Compositional De‑Attention Networks (CODA), een academische samenwerking uit 2019 tussen de VS en Singapore met Amazon (AMZN ) AI en Microsoft.

Tests

Het flow‑gebaseerde framework werd getest tegen eerdere flow‑gebaseerde methoden FAL en Animating Through Warping (ATW), evenals beeld‑vertalingsarchitecturen Pix2PixHD en GFLA, met SSIM, PSNR en LPIPS als evaluatiemetrieken.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Resultaten van de eerste tests (pijlrichting in de koppen geeft aan of lagere of hogere cijfers beter zijn).

Op basis van deze aangenomen metrieken presteert het systeem van de auteurs beter dan de eerdere architecturen.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Geselecteerde resultaten. Raadpleeg de oorspronkelijke PDF die in dit artikel wordt gelinkt voor vergelijkingen met hogere resolutie.

Naast de geautomatiseerde metrieken voerden de onderzoekers een gebruikerstest uit (laatste kolom van de eerder getoonde resultaten‑tabel), waarbij 40 deelnemers elk 30 willekeurig gekozen vragen uit een pool van 100 vragen kregen over de beelden die met de verschillende methoden waren geproduceerd. 70 % van de respondenten gaf de voorkeur aan de nieuwe techniek omdat deze ‘visueel aantrekkelijker’ was.

Uitdagingen

Het nieuwe artikel vormt een zeldzame uitstap in AI‑gebaseerde lichaamsmanipulatie. De sector van beeld‑synthese is momenteel veel meer geïnteresseerd in het genereren van bewerkbare lichamen via methoden zoals Neural Radiance Fields (NeRF), of is gefixeerd op het verkennen van de latente ruimte van GAN’s en het potentieel van auto‑encoders voor gezichtsmanipulatie.

De initiatief van de auteurs is momenteel beperkt tot het produceren van veranderingen in waargenomen gewicht, en ze hebben nog geen inpainting‑techniek geïmplementeerd die de achtergrond zou herstellen die onvermijdelijk zichtbaar wordt wanneer je een foto van iemand slanker maakt.

Echter, ze stellen voor dat portret‑matting en achtergrond‑blending via textuur‑inference het probleem van het herstellen van de delen van de wereld die voorheen verborgen waren in de afbeelding door menselijke ‘onvolkomenheid’, triviaal zou kunnen oplossen.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Een voorgestelde oplossing om de achtergrond te herstellen die zichtbaar wordt door AI‑gedreven vetreductie.

 

* Hoewel de preprint verwijst naar aanvullend materiaal met meer details over de dataset, evenals verdere voorbeelden uit het project, is de locatie van dit materiaal niet beschikbaar in het artikel, en heeft de corresponderende auteur nog niet gereageerd op ons verzoek om toegang.

Eerste publicatie 10 maart 2022.

Schrijver over machine learning, domeinspecialist in menselijke beeldsynthetisatie. Voormalig hoofd van onderzoekscontent bij Metaphysic.ai, tot de ontbinding ervan in DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai