Andersons vinkel
Falsk ‘Bedre’ Kropper med AI

Ny forskning fra Alibaba DAMO Academy tilbyr en AI‑drevet arbeidsflyt for automatisering av omforming av kroppsbilder – en sjelden innsats i en datavisjonssektor som for tiden er opptatt med ansiktsbaserte manipulasjoner som deepfakes og GAN‑basert ansiktsredigering.

Innsatt i «resultat»-kolonnene, de genererte oppmerksomhetskartene som definerer områdene som skal endres. Kilde: https://arxiv.org/pdf/2203.04670.pdf
Forskerne bruker en arkitektur basert på estimat av skelettposisjon for å takle den større kompleksiteten bildesyntese‑ og redigeringssystemer møter når de skal konseptualisere og parametrisere eksisterende kroppsbilder, i hvert fall på et detaljnivå som faktisk tillater meningsfull og selektiv redigering.

Estimerte skelettkart hjelper med å individuere og fokusere oppmerksomheten på kroppsområder som sannsynligvis skal retusjeres, for eksempel overarmsområdet.
Systemet gjør det mulig for en bruker å sette parametere som kan endre utseendet på vekt, muskelmasse eller vektfordeling i helkropps‑ eller halvkropps‑foto av personer, og kan generere vilkårlige transformasjoner på både påkledde og nakne kroppssegmenter.

Venstre: inngangsbildet; midt: et varmekart over de avledede oppmerksomhetsområdene; høyre: det transformerte bildet.
Motivasjonen bak arbeidet er utviklingen av automatiserte arbeidsflyter som kan erstatte de tidkrevende digitale manipuleringene fotografer og grafiske produksjonsartister utfører i ulike mediegrener, fra mote til magasin‑stil og promomateriale.
Generelt, erkjenner forfatterne, blir disse transformasjonene vanligvis utført med «warp»-teknikker i Photoshop og andre tradisjonelle bitmap‑redigerere, og brukes nesten utelukkende på bilder av kvinner. Derfor består det tilpassede datasettet som er utviklet for å lette den nye prosessen hovedsakelig av bilder av kvinnelige modeller:
«Ettersom kropp‑retusjering hovedsakelig etterspørres av kvinner, er flertallet av samlingen vår kvinnelige bilder, med variasjon i alder, rase (Afrikansk:Asiatisk:Kaukasisk = 0,33:0,35:0,32), positur og klær.»
Artikkelen paper har tittelen Structure-Aware Flow Generation for Human Body Reshaping og er skrevet av fem forfattere tilknyttet Alibabas globale DAMO Academy.
Datasettutvikling
Som vanlig for bildesyntese‑ og redigeringssystemer krevde prosjektets arkitektur et skreddersydd treningsdatasett. Forfatterne engasjerte tre fotografer til å lage standard Photoshop‑manipulasjoner av passende bilder fra bildedatabasen Unsplash, noe som resulterte i et datasett – kalt BR-5K* – bestående av 5 000 høy‑kvalitetsbilder i 2K‑oppløsning.
Forskerne understreker at målet med trening på dette datasettet ikke er å produsere «idealiserte» og generaliserte trekk knyttet til en indeks for attraktivitet eller ønsket utseende, men snarere å trekke ut de sentrale funksjonskartene som er assosiert med profesjonelle manipuleringer av kroppsbilder.
De innrømmer imidlertid at manipuleringene til slutt reflekterer transformerende prosesser som går fra «ekte» til en forhåndsdefinert idé om «ideell»:
«Vi inviterte tre profesjonelle kunstnere til å retusjere kropper i Photoshop uavhengig av hverandre, med mål om å oppnå slanke figurer som samsvarer med populær estetikk, og valgte den beste som sann‑grunnlag.»
Siden rammeverket ikke håndterer ansikter i det hele tatt, ble disse uskarpgjort før de ble inkludert i datasettet.
Arkitektur og kjernebegreper
Systemets arbeidsflyt innebærer å mate inn et høy‑oppløsningsportrett, nedskalere det til en lavere oppløsning som passer inn i de tilgjengelige beregningsressursene, og ekstrahere et estimert skelett‑pose‑kart (andre figur fra venstre i bildet under), samt Part Affinity Fields (PAF‑er), som ble innovert i 2016 av The Robotics Institute ved Carnegie Mellon University (se videoen nedenfor).
Part Affinity Fields hjelper med å definere orienteringen av lemmer og den generelle tilknytningen til det bredere skjelettet, og gir det nye prosjektet et ekstra oppmerksomhets‑/lokaliseringsverktøy.

Fra 2016‑papiret om Part Affinity Fields, kodede PAF‑er lem‑orientering som en del av en 2‑D‑vektor som også inkluderer lem‑posisjonen generelt. Kilde: https://arxiv.org/pdf/1611.08050.pdf
Selv om de ved første øyekast virker irrelevante for vekt‑utseende, er skelettkart nyttige for å styre de endelige transformeringsprosessene mot kroppsdeler som skal endres, for eksempel overarmer, bakdel og lår.
Etter dette mates resultatene inn i en Structure Affinity Self‑Attention (SASA) i prosessens sentrale flaskehals (se bildet under).

SASA regulerer konsistensen i flytgeneratoren som driver prosessen, og resultatene sendes deretter til warp‑modulen (andre fra høyre i bildet ovenfor), som anvender transformasjonene lært fra trening på de manuelle revisjonene inkludert i datasettet.

Structure Affinity Self‑Attention (SASA)‑modulen tildeler oppmerksomhet til relevante kroppsdeler, og bidrar til å unngå overflødige eller irrelevante transformasjoner.
Den resulterende bilden blir deretter opp‑skalert tilbake til den opprinnelige 2K‑oppløsningen, ved hjelp av prosesser som ligner på den standardiserte deepfake‑arkitekturen fra 2017 som populære pakker som DeepFaceLab er bygget på; opp‑skalering er også vanlig i GAN‑redigeringsrammeverk.
Oppmerksomhetsnettet for skjemaet er modellert etter Compositional De‑Attention Networks (CODA), et 2019‑årig akademisk samarbeid mellom USA/Singapore med Amazon (AMZN ) AI og Microsoft.
Tester
Det flyt‑baserte rammeverket ble testet mot tidligere flyt‑baserte metoder FAL og Animating Through Warping (ATW), samt bildetranslasjonsarkitekturer Pix2PixHD og GFLA, med SSIM, PSNR og LPIPS som evalueringsmål.

Resultater fra innledende tester (pilretning i overskriftene indikerer om lavere eller høyere tall er best).
Basert på de valgte måleparametrene overgår forfatternes system de tidligere arkitekturene.

Utvalgte resultater. Se den originale PDF‑en som er lenket i denne artikkelen for sammenligninger i høyere oppløsning.
I tillegg til de automatiserte målingene gjennomførte forskerne en brukerstudie (siste kolonne i resultat‑tabellen som ble vist tidligere), hvor 40 deltakere hver ble vist 30 tilfeldig valgte spørsmål fra en pool på 100 spørsmål knyttet til bildene produsert med de ulike metodene. 70 % av respondentene foretrakk den nye teknikken som mer «visuelt tiltalende».
Utfordringer
Den nye artikkelen representerer et sjeldent forsøk på AI‑basert kropp‑manipulering. Bildesyntesefeltet er for tiden langt mer opptatt av enten å generere redigerbare kropper via metoder som Neural Radiance Fields (NeRF), eller av å utforske latentrommet i GAN‑er og potensialet til autoenkodere for ansiktsmanipulering.
Forfatternes initiativ er foreløpig begrenset til å produsere endringer i oppfattet vekt, og de har ikke implementert noen form for in‑painting‑teknikk som kan gjenopprette bakgrunnen som uunngåelig blir synlig når man slanker et bilde av noen.
De foreslår imidlertid at portrett‑matting og bakgrunns‑blanding gjennom tekstur‑inferenz enkelt kan løse problemet med å gjenopprette de delene av verden som tidligere var skjult i bildet av menneskelig «imperfeksjon».

Et foreslått løsningsforslag for å gjenopprette bakgrunnen som blir synlig etter AI‑drevet fett‑reduksjon.
* Selv om preprinten refererer til tilleggsmateriale som gir flere detaljer om datasettet, samt flere eksempler fra prosjektet, er ikke dette materialet gjort tilgjengelig i artikkelen, og korresponderende forfatter har ennå ikke svart på vår forespørsel om tilgang.
Først publisert 10. mars 2022.












