Andersons vinkel
Förfalskning av “bättre” kroppar med AI

Ny forskning från Alibaba DAMO-akademin erbjuder en AI-driven arbetsflöde för automatisering av omformning av bilder av kroppar – ett sällsynt företag i en datorsektorn som för närvarande är upptagen med ansiktsbaserade manipulationer såsom deepfakes och GAN-baserad ansiktsredigering.

Infogat i ‘resultat’ kolumner, de genererade uppmärksamhetskartorna som definierar områdena som ska ändras. Källa: https://arxiv.org/pdf/2203.04670.pdf
Forskarnas arkitektur använder skelettposeskattning för att hantera den större komplexitet som bildsynthes- och redigeringsystem möter när de försöker konceptualisera och parametrera befintliga kroppsbilder, åtminstone till en nivå av granularitet som tillåter meningsfull och selektiv redigering.

Uppskattade skelett kartor hjälper till att individuera och fokusera uppmärksamhet på områden av kroppen som sannolikt kommer att retuscheras, såsom överarmen.
Systemet möjliggör slutligen för en användare att ange parametrar som kan ändra utseendet på vikt, muskelmassa eller viktfördelning i fullängds- eller midjelängdsfotografier av människor, och kan generera godtyckliga transformationer på klädda eller nakna kroppsdelar.

Till vänster, inmatningsbilden; i mitten, en värmebild av de härledda uppmärksamhetsområdena; till höger, den transformerade bilden.
Motivationen för arbetet är utvecklingen av automatiserade arbetsflöden som kan ersätta de mödosamma digitala manipulationer som utförs av fotografer och produktionsgrafiker inom olika medieområden, från mode till magasinsutgåvor och publicitetsmaterial.
I allmänhet erkänner författarna att dessa transformationer vanligtvis appliceras med ‘warp’-tekniker i Photoshop och andra traditionella bitmap-redigerare, och används nästan uteslutande på bilder av kvinnor. Följaktligen består den anpassade datamängd som utvecklats för att underlätta den nya processen främst av bilder av kvinnliga ämnen:
‘Eftersom kroppsretuschering främst önskas av kvinnor, utgörs majoriteten av vår samling av kvinnliga foton, med hänsyn till ålders-, ras- (afrikansk:asiatisk:caucasisk = 0,33:0,35:0,32), poser och kläder.’
Den artikeln heter Structure-Aware Flow Generation for Human Body Reshaping och kommer från fem författare som är associerade med Alibabas globala DAMO-akademi.
Datamängdsutveckling
Som vanligt med bildsynthes- och redigeringsystem krävde arkitekturen för projektet en anpassad träningsdatamängd. Författarna beställde tre fotografer för att producera standard-Photoshop-manipulationer av lämpliga bilder från stockfotografi-sajten Unsplash, vilket resulterade i en datamängd – med titeln BR-5K* – på 5 000 högkvalitativa bilder i 2K-upplösning.
Forskarna betonar att målet med att träna på denna datamängd inte är att producera ‘idealiserade’ och generaliserade funktioner relaterade till en index av attraktivitet eller önskvärd utseende, utan snarare att extrahera de centrala funktionella kartorna som är associerade med professionella manipulationer av kroppsbilder.
Men de medger att manipulationerna slutligen reflekterar transformeringsprocesser som kartlägger en progression från ‘verklig’ till en förinställd uppfattning om ‘ideal’:
‘Vi inbjuder tre professionella artister att retuschera kroppar med Photoshop oberoende, med målet att uppnå slanka figurer som möter den populära estetiken, och väljer den bästa som grundtruth.’
Eftersom ramverket inte hanterar ansikten alls, suddades de ut innan de lades till i datamängden.
Arkitektur och kärnkconcept
Systemets arbetsflöde innebär att mata in en högupplöst porträtt, nedsample det till en lägre upplösning som kan passa in i de tillgängliga beräkningsresurserna, och extrahera en uppskattad skelett-kartapos (andra figuren från vänster i bilden nedan), samt Part Affinity Fields (PAF), som introducerades 2016 av The Robotics Institute vid Carnegie Mellon University (se video som är inbäddad direkt nedan).
Part Affinity Fields hjälper till att definiera orienteringen av lemmar och den allmänna associationen med den bredare skelettstrukturen, vilket ger det nya projektet en ytterligare uppmärksamhets-/lokaliseringverktyg.

Från 2016 års Part Affinity Fields-artikel, förutsagda PAF kodar lemorientering som en del av en 2D-vektor som också innehåller den allmänna positionen för lemmen. Källa: https://arxiv.org/pdf/1611.08050.pdf
Trots deras uppenbara irrelevans för utseendet på vikt, är skelett kartor användbara för att rikta de slutliga transformeringsprocesserna till delar av kroppen som ska ändras, såsom överarmar, bak och lår.
Efter detta matas resultaten till en Structure Affinity Self-Attention (SASA) i den centrala flaskhalsen i processen (se bild nedan).

SASA reglerar konsistensen hos flödesgenereringen som driver processen, och resultaten av detta skickas sedan till warp-modulen (andra från höger i bilden ovan), som tillämpar transformationerna som lärts från träning på de manuella revisionerna som ingår i datamängden.

Structure Affinity Self-Attention (SASA)-modulen allokerar uppmärksamhet till relevanta kroppsdelar, vilket hjälper till att undvika onödiga eller irrelevanta transformationer.
Utmatningsbilden sampas sedan tillbaka till den ursprungliga 2K-upplösningen med hjälp av processer som inte skiljer sig mycket från standard-2017-arkitekturen för deepfakes, från vilken populära paket som DeepFaceLab har härletts; upsamplingsprocessen är också vanlig i GAN-redigeringsramverk.
Uppmärksamhetsnätverket för schemat är modellerat efter Compositional De-Attention Networks (CODA), ett 2019 års akademiskt samarbete mellan USA/Singapore med Amazon AI och Microsoft.
Tester
Det flödesbaserade ramverket testades mot tidigare flödesbaserade metoder FAL och Animating Through Warping (ATW), samt bildöversättningsarkitekturer Pix2PixHD och GFLA, med SSIM, PSNR och LPIPS som utvärderingsmetoder.

Resultat från initiala tester (pilriktningen i rubriker indikerar om lägre eller högre värden är bäst).
Baserat på dessa antagna mått, presterar författarnas system bättre än tidigare arkitekturer.

Valda resultat. Vänligen se den ursprungliga PDF som är länkad i den här artikeln för högupplösta jämförelser.
Utöver de automatiserade måtten genomförde forskarna en användarstudie (sista kolumnen i resultat-tabellen som visas tidigare), där 40 deltagare visades 30 slumpmässigt utvalda frågor från en pool på 100 frågor relaterade till de bilder som producerats via de olika metoderna. 70% av respondenterna föredrog den nya tekniken som mer ‘visuellt tilltalande’.
Utmaningar
Den nya artikeln representerar ett sällsynt äventyr inom AI-baserad kroppmanipulation. Bildsynthesektorn är för närvarande mycket mer intresserad av att antingen generera redigerbara kroppar via metoder som Neural Radiance Fields (NeRF) eller att utforska den latenta utrymmet för GAN och potentialen för autoencoders för ansiktsmanipulation.
Författarnas initiativ är för närvarande begränsat till att producera förändringar i upplevd vikt, och de har inte implementerat någon form av inpainting-teknik som skulle återställa bakgrunden som avslöjas när man slimmar ner en bild av någon.
Men de föreslår att porträttmatning och bakgrundsblending genom texturinferens kan lösa problemet med att återställa de delar av världen som tidigare var dolda i bilden av mänsklig ‘imperfection’.

Ett föreslaget lösning för att återställa bakgrund som avslöjas av AI-driven fettreducering.
* Även om förtrycket hänvisar till supplementär material som ger mer information om datamängden, samt ytterligare exempel från projektet, är platsen för detta material inte tillgänglig i artikeln, och den korresponderande författaren har ännu inte svarat på vår begäran om tillgång.
Publicerad första gången den 10 mars 2022.












