Andersons vinkel
Falsk ‘Bedre’ Kroppe Med AI

Nyt forskning fra Alibaba DAMO-akademiet tilbyder en AI-dreven arbejdsgang for automatisering af omformningen af billeder af kroppe – en sjælden indsats i en computer vision-sektor, der i øjeblikket er optaget af ansigtsbaserede manipulationer såsom deepfakes og GAN-baseret ansigtsredigering.

Indsæt i ‘resultat’ kolonner, de genererede opmærksomheds-kort, der definerer de områder, der skal ændres. Kilde: https://arxiv.org/pdf/2203.04670.pdf
Forskernes arkitektur anvender skelet-stillingsskønningsmetoder til at tackle den større kompleksitet, som billedsynthesis- og redigerings-systemer står overfor i forhold til at konceptualisere og parametrisere eksisterende kroppebilleder, i hvert fald på et niveau, der tillader meningsfuld og selektiv redigering.

Estimerede skelet-kort hjælper med at individuere og fokusere opmærksomhed på kroppens områder, der sandsynligvis vil blive retoucherede, såsom overarmen.
Systemet muliggør i sidste ende, at en bruger kan indstille parametre, der kan ændre udseendet af vægt, muskelmasse eller vægtfordeling i fuldlængde- eller midlængde-fotos af mennesker, og kan generere arbitrære transformationer på klædt eller uklede kropsdele.

Venstre, input-billedet; midten, en varme-kort over de afledte opmærksomheds-områder; højre, det transformede billede.
Motivationen for arbejdet er udviklingen af automatiserede arbejdsgange, der kan erstatte de omfattende digitale manipulationer, der udføres af fotografer og produktionsgrafikere i forskellige mediebrancher, fra mode til magasin-stil og publicitetsmateriale.
I almindelighed erkender forfatterne, at disse transformationer normalt anvendes med ‘warp’-teknikker i Photoshop og andre traditionelle bitmap-redigeringssystemer, og anvendes næsten udelukkende på billeder af kvinder. Følgelig består den tilpassede dataset, der er udviklet til at facilere den nye proces, hovedsagelig af billeder af kvindelige emner:
‘Da krop-retouchering hovedsagelig er ønsket af kvinder, udgør størstedelen af vores samling kvindelige fotos, med henblik på diversitet i alder, racer (afrikansk:asiatisk:caucasisk = 0,33:0,35:0,32), stillinger og beklædning.’
Den artikel har titlen Structure-Aware Flow Generation for Human Body Reshaping og kommer fra fem forfattere tilknyttet Alibabas globale DAMO-akademi.
Dataset-udvikling
Som regel kræver arkitekturen for projektet en tilpasset trænings-dataset. Forfatterne har bestilt tre fotografer til at producere standard-Photoshop-manipulationer af billeder fra stock-fotografi-sitet Unsplash, hvilket resulterer i en dataset – med titlen BR-5K* – på 5.000 høj-kvalitets-billeder i 2K-opløsning.
Forskere understreger, at formålet med træning på denne dataset ikke er at producere ‘idealiserede’ og generaliserede funktioner i forhold til en indeks for tiltrækning eller ønsket udseende, men snarere at udtrække de centrale funktioner, der er forbundet med professionelle manipulationer af kroppebilleder.
Men de indrømmer, at manipulationerne i sidste ende reflekterer transformative processer, der kortlægger en progression fra ‘reel’ til en forudbestemt forestilling om ‘ideal’:
‘Vi inviterer tre professionelle kunstnere til at retouchere kroppe ved hjælp af Photoshop uafhængigt, med målet at opnå slanke skikkelser, der opfylder den populære æstetik, og vælger den bedste som grund-sandhed.’
Da rammen ikke omhandler ansigter overhovedet, blev disse udslettet, før de blev inkluderet i datasettet.
Arkitektur og kernebegreber
Systemets arbejdsgang indebærer at indføre et højopløst portræt, nedsample det til en lavere opløsning, der kan rummes i de tilgængelige beregningsressourcer, og udtrække en estimeret skelet-kort-stilling (anden figur fra venstre i billedet nedenfor), samt Part Affinity Fields (PAF), der blev innoveret i 2016 af The Robotics Institute på Carnegie Mellon University (se video nedenfor).
Part Affinity Fields hjælper med at definere orienteringen af lemmer og den generelle association med den bredere skelet-ramme, hvilket giver det nye projekt en yderligere opmærksomheds-/lokaliseringsværktøj.

Fra 2016 Part Affinity Fields-artiklen, kodificerer PAF’er lem-orientering som en del af en 2D-vektor, der også inkluderer den generelle position af lemmen. Kilde: https://arxiv.org/pdf/1611.08050.pdf
Trods deres tilsyneladende irrelevans for vægtens udseende, er skelet-kort nyttige til at dirigere de endelige transformative processer til kroppens områder, der skal ændres, såsom overarme, bagdel og lår.
Efter dette bliver resultaterne ført til en Structure Affinity Self-Attention (SASA) i den centrale flaskehals af processen (se billedet nedenfor).

SASA regulerer konsistensen af flow-generatoren, der driver processen, og resultaterne bliver herefter ført til warp-modulen (anden fra højre i billedet ovenfor), der anvender transformationerne, der er lært fra træning på de manuelle revisioner, der er inkluderet i datasettet.

Structure Affinity Self-Attention (SASA)-modulen allokerer opmærksomhed til pertinente kropsdele, hvilket hjælper med at undgå unødvendige eller irrelevante transformationer.
Output-billedet bliver herefter opsamplet tilbage til den originale 2K-opløsning, ved hjælp af processer, der ikke er ulig standard, 2017-stil deepfake-arkitektur, fra hvilken populære pakker som DeepFaceLab er siden blevet afledt; opsample-processen er også almindelig i GAN-redigerings-rammer.
Opmærksomheds-netværket for skemaet er modelleret efter Compositional De-Attention Networks (CODA), en 2019 US/Singapore-akademisk samarbejdsprojekt med Amazon AI og Microsoft.
Tests
Den flow-baserede ramme blev testet mod tidligere flow-baserede metoder FAL og Animating Through Warping (ATW), samt billed-oversættelses-arkitekturer Pix2PixHD og GFLA, med SSIM, PSNR og LPIPS som evaluering-metrikker.

Resultater af de første tests (pil-retningen i overskrifterne angiver, om lavere eller højere tal er bedst).
Baseret på disse antagne metrikker, overgår forfatternes system de tidligere arkitekturer.

Valgte resultater. Se venligst den originale PDF, der er linket i denne artikel, for højere opløsningssammenligninger.
Ud over de automatiserede metrikker gennemførte forskerne en brugerundersøgelse (sidste kolonne af resultater-tabel billedet tidligere), hvor 40 deltagere hver blev vist 30 spørgsmål, der var tilfældigt valgt fra en 100-spørgsmål-pool, der relaterer til billederne, der blev produceret via de forskellige metoder. 70% af respondenternes foretruk den nye teknik som mere ‘visuelt tiltalende’.
Udfordringer
Den nye artikel repræsenterer en sjælden udflugt i AI-baseret krop-manipulation. Billed-synthese-sektoren er i øjeblikket langt mere interesseret i enten at generere redigerbare kroppe via metoder såsom Neural Radiance Fields (NeRF), eller også er fast besluttet på at udforske den latente rum af GAN’er og potentialet for autoencodere til ansigts-manipulation.
Forfatternes initiativ er i øjeblikket begrænset til at producere ændringer i opfattet vægt, og de har ikke implementeret nogen form for inpainting-teknik, der kan genskabe baggrunden, der afsløres, når man slanker et billede af en person.
Men de foreslår, at portræt-matting og baggrund-blanding gennem tekstur-inferens kunne let løse problemet med at genskabe de dele af verden, der tidligere var skjult i billedet af menneskelig ‘imperfektion’.

En foreslået løsning til at genskabe baggrunden, der afsløres af AI-dreven fedt-reduktion.
* Selvom preprinten henviser til supplerende materiale, der giver flere detaljer om datasettet samt yderligere eksempler fra projektet, er placeringen af dette materiale ikke tilgængelig i artiklen, og den korresponderende forfatter har endnu ikke svaret på vores anmodning om adgang.
Offentliggjort første gang den 10. marts 2022.












