Andersons vinkel

Falsk ‘Bedre’ Kroppe med AI

mm
Føj Unite.AI til dine foretrukne kilder på Google

Ny forskning fra Alibaba DAMO-akademiet tilbyder en AI-drevet arbejdsgang til automatisering af omformning af kropsbilleder – en sjælden indsats i en computer‑visionssektor, der i øjeblikket er optaget af ansigtsbaserede manipulationer såsom deepfakes og GAN‑baseret ansigtsredigering.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Indsat i ‘resultat’-kolonnerne, de genererede opmærksomhedskort som definerer de områder, der skal ændres. Kilde: https://arxiv.org/pdf/2203.04670.pdf

Forskerne’s arkitektur bruger skeletpose‑estimering til at tackle den større kompleksitet, som billedsyntese‑ og redigeringssystemer står over for ved at konceptualisere og parametrere eksisterende kropsbilleder, i hvert fald på et granularitetsniveau, der faktisk muliggør meningsfuld og selektiv redigering.

Estimerede skeletkort hjælper med at individuere og fokusere opmærksomheden på kropsområder, der sandsynligvis skal efterbehandles, såsom overarmsområdet.

Systemet gør det i sidste ende muligt for en bruger at indstille parametre, der kan ændre udseendet af vægt, muskelmasse eller vægtfordeling i fuldlængde‑ eller mellemstore fotos af personer, og er i stand til at generere vilkårlige transformationer på påklædte eller afklædte kropsdele.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Venstre, inputbilledet; midten, et varmekort over de afledte opmærksomhedsområder; højre, det transformerede billede.

Motivationen bag arbejdet er udviklingen af automatiserede arbejdsgange, der kan erstatte de anstrengende digitale manipulationer udført af fotografer og produktionsgrafikere i forskellige mediegrene, fra mode til magasinlignende udgivelser og offentlighedsmateriale.

Generelt anerkender forfatterne, at disse transformationer typisk anvendes med ‘warp’-teknikker i Photoshop og andre traditionelle bitmap‑redigeringsprogrammer, og næsten udelukkende bruges på billeder af kvinder. Som følge heraf består det tilpassede datasæt, der er udviklet til at lette den nye proces, hovedsageligt af billeder af kvindelige forsøgspersoner:

‘Da kropsretouchering primært ønskes af kvinder, er størstedelen af vores samling kvindelige fotos, idet vi tager højde for alders‑, race‑ (African:Asian:Caucasian = 0.33:0.35:0.32), pose‑ og beklædningsdiversitet.’

Papiret paper har titlen Structure-Aware Flow Generation for Human Body Reshaping og er skrevet af fem forfattere tilknyttet Alibabas globale DAMO-akademi.

Datasætudvikling

Som det ofte er tilfældet med billedsyntese‑ og redigeringssystemer, krævede projektets arkitektur et tilpasset træningsdatasæt. Forfatterne bestilte tre fotografer til at producere standard Photoshop‑manipulationer af passende billeder fra stockfotowebstedet Unsplash, hvilket resulterede i et datasæt – med titlen BR-5K* – på 5.000 høj kvalitet billeder i 2K‑opløsning.

Forskerne understreger, at målet med træning på dette datasæt ikke er at producere ‘idealiserede’ og generelle funktioner relateret til en attraktivitet‑ eller ønsket udseende‑indeks, men snarere at udtrække de centrale funktionskortlægninger, der er forbundet med professionelle manipulationer af kropsbilleder.

De indrømmer dog, at manipulationerne i sidste ende afspejler transformerende processer, der kortlægger en overgang fra ‘virkeligt’ til en foruddefineret idé om ‘idealt’:

‘Vi inviterer tre professionelle kunstnere til uafhængigt at efterbehandle kroppe ved hjælp af Photoshop med målet om at opnå slanke figurer, der opfylder den populære æstetik, og udvælge den bedste som grundsandhed.’

Da rammeværket slet ikke beskæftiger sig med ansigter, blev disse sløret, før de blev inkluderet i datasættet.

Arkitektur og Grundlæggende Koncepter

Systemets arbejdsgang indebærer at indlæse et højopløsningsportræt, nedskalere det til en lavere opløsning, der kan passe ind i de tilgængelige computerressourcer, og udtrække en estimeret skeletpose (andet billede fra venstre i billedet nedenfor), samt Part Affinity Fields (PAFs), som blev innoveret i 2016 af The Robotics Institute på Carnegie Mellon University (se video indlejret direkte nedenfor).

Part Affinity Fields hjælper med at definere lemmenes orientering og den generelle tilknytning til den bredere skeletstruktur, hvilket giver det nye projekt et ekstra opmærksomheds-/lokaliseringsværktøj.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Fra 2016-part Affinity Fields-papiret, forudsagte PAF’er koder lemorientering som en del af en 2D‑vektor, der også inkluderer lemets generelle position. Kilde: https://arxiv.org/pdf/1611.08050.pdf

På trods af deres tilsyneladende irrelevans for vægtens udseende er skeletkort nyttige til at styre de endelige transformerende processer mod kropsdele, der skal ændres, såsom overarme, bagdel og lår.

Derefter føres resultaterne til en Structure Affinity Self-Attention (SASA) i den centrale flaskehals i processen (se billedet nedenfor).

SASA regulerer konsistensen af flowgeneratoren, der driver processen, hvorefter resultaterne overføres til warp‑modulet (andet fra højre i billedet ovenfor), som anvender de transformationer, der er lært fra træning på de manuelle revisioner inkluderet i datasættet.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Structure Affinity Self-Attention (SASA)-modulet tildeler opmærksomhed til relevante kropsdele, hvilket hjælper med at undgå overflødige eller irrelevante transformationer.

Outputbilledet opskaleres derefter tilbage til den oprindelige 2K‑opløsning ved hjælp af processer, der ligner den standardiserede deepfake‑arkitektur fra 2017, som populære pakker som DeepFaceLab er afledt af; opskaleringsprocessen er også almindelig i GAN‑redigeringsrammer.

Opmærksomhedsnetværket for skemaet er modelleret efter Compositional De-Attention Networks (CODA), et akademisk samarbejde fra 2019 mellem USA/Singapore og Amazon (AMZN ) AI og Microsoft.

Tests

Det flow‑baserede rammeværk blev testet mod tidligere flow‑baserede metoder FAL og Animating Through Warping (ATW) samt billedoversættelsesarkitekturer Pix2PixHD og GFLA, med SSIM, PSNR og LPIPS som evalueringsmålinger.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Resultater af de indledende tests (pilens retning i overskrifterne angiver, om lavere eller højere tal er bedst).

Baseret på disse anvendte målinger overgår forfatternes system de tidligere arkitekturer.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Udvalgte resultater. Se venligst den originale PDF, der er linket i denne artikel, for sammenligninger i højere opløsning.

Udover de automatiserede målinger gennemførte forskerne en brugerundersøgelse (sidste kolonne i resultattabellen vist tidligere), hvor 40 deltagere hver blev vist 30 spørgsmål tilfældigt udvalgt fra en pulje på 100 spørgsmål relateret til billederne fremstillet via de forskellige metoder. 70 % af respondenterne foretrak den nye teknik som mere ‘visuelt tiltalende’.

Udfordringer

Det nye papir udgør en sjælden udflugt i AI‑baseret kropsmanipulation. Billedsyntesesektoren er i øjeblikket langt mere interesseret i enten at generere redigerbare kroppe via metoder som Neural Radiance Fields (NeRF) eller er fastholdt i at udforske GAN’ernes latente rum og potentialet i autoencodere til ansigtsmanipulation.

Forfatternes initiativ er i øjeblikket begrænset til at producere ændringer i den opfattede vægt, og de har ikke implementeret nogen form for inpainting‑teknik, der ville genoprette baggrunden, som uundgåeligt afsløres, når man slanker et billede af en person.

De foreslår dog, at portræt‑matting og baggrundsblanding gennem teksturel inferens enkelt kunne løse problemet med at genoprette de dele af verden, som tidligere var skjult i billedet af menneskelig ‘imperfektion’.

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

En foreslået løsning til at genoprette baggrunden, som afsløres ved AI‑drevet fedtreduktion.

 

* Selvom preprinten refererer til supplerende materiale, der giver flere detaljer om datasættet samt yderligere eksempler fra projektet, er placeringen af dette materiale ikke gjort tilgængeligt i papiret, og den tilsvarende forfatter har endnu ikke svaret på vores anmodning om adgang.

Først offentliggjort 10. marts 2022.

Forfatter inden for maskinlæring, domænespecialist i menneskelig billedsyntese. Tidligere chef for forskningsindhold hos Metaphysic.ai, indtil den blev opløst i DNEGs Brahma.ai.
Websted: martinanderson.ai
Kontakt: martin@martinanderson.ai