Andersons vinkel

Falsk ‘Bedre’ Kropper med AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ny forskning fra Alibaba DAMO Academy tilbyr en AI‑drevet arbeidsflyt for automatisering av omforming av kroppsbilder – en sjelden innsats i en datavisjonssektor som for tiden er opptatt med ansiktsbaserte manipulasjoner som deepfakes og GAN‑basert ansiktsredigering.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Innsatt i «resultat»-kolonnene, de genererte oppmerksomhetskartene som definerer områdene som skal endres. Kilde: https://arxiv.org/pdf/2203.04670.pdf

Forskerne bruker en arkitektur basert på estimat av skelettposisjon for å takle den større kompleksiteten bildesyntese‑ og redigeringssystemer møter når de skal konseptualisere og parametrisere eksisterende kroppsbilder, i hvert fall på et detaljnivå som faktisk tillater meningsfull og selektiv redigering.

Estimerte skelettkart hjelper med å individuere og fokusere oppmerksomheten på kroppsområder som sannsynligvis skal retusjeres, for eksempel overarmsområdet.

Systemet gjør det mulig for en bruker å sette parametere som kan endre utseendet på vekt, muskelmasse eller vektfordeling i helkropps‑ eller halvkropps‑foto av personer, og kan generere vilkårlige transformasjoner på både påkledde og nakne kroppssegmenter.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Venstre: inngangsbildet; midt: et varmekart over de avledede oppmerksomhetsområdene; høyre: det transformerte bildet.

Motivasjonen bak arbeidet er utviklingen av automatiserte arbeidsflyter som kan erstatte de tidkrevende digitale manipuleringene fotografer og grafiske produksjonsartister utfører i ulike mediegrener, fra mote til magasin‑stil og promomateriale.

Generelt, erkjenner forfatterne, blir disse transformasjonene vanligvis utført med «warp»-teknikker i Photoshop og andre tradisjonelle bitmap‑redigerere, og brukes nesten utelukkende på bilder av kvinner. Derfor består det tilpassede datasettet som er utviklet for å lette den nye prosessen hovedsakelig av bilder av kvinnelige modeller:

«Ettersom kropp‑retusjering hovedsakelig etterspørres av kvinner, er flertallet av samlingen vår kvinnelige bilder, med variasjon i alder, rase (Afrikansk:Asiatisk:Kaukasisk = 0,33:0,35:0,32), positur og klær.»

Artikkelen paper har tittelen Structure-Aware Flow Generation for Human Body Reshaping og er skrevet av fem forfattere tilknyttet Alibabas globale DAMO Academy.

Datasettutvikling

Som vanlig for bildesyntese‑ og redigeringssystemer krevde prosjektets arkitektur et skreddersydd treningsdatasett. Forfatterne engasjerte tre fotografer til å lage standard Photoshop‑manipulasjoner av passende bilder fra bildedatabasen Unsplash, noe som resulterte i et datasett – kalt BR-5K* – bestående av 5 000 høy‑kvalitetsbilder i 2K‑oppløsning.

Forskerne understreker at målet med trening på dette datasettet ikke er å produsere «idealiserte» og generaliserte trekk knyttet til en indeks for attraktivitet eller ønsket utseende, men snarere å trekke ut de sentrale funksjonskartene som er assosiert med profesjonelle manipuleringer av kroppsbilder.

De innrømmer imidlertid at manipuleringene til slutt reflekterer transformerende prosesser som går fra «ekte» til en forhåndsdefinert idé om «ideell»:

«Vi inviterte tre profesjonelle kunstnere til å retusjere kropper i Photoshop uavhengig av hverandre, med mål om å oppnå slanke figurer som samsvarer med populær estetikk, og valgte den beste som sann‑grunnlag.»

Siden rammeverket ikke håndterer ansikter i det hele tatt, ble disse uskarpgjort før de ble inkludert i datasettet.

Arkitektur og kjernebegreper

Systemets arbeidsflyt innebærer å mate inn et høy‑oppløsningsportrett, nedskalere det til en lavere oppløsning som passer inn i de tilgjengelige beregningsressursene, og ekstrahere et estimert skelett‑pose‑kart (andre figur fra venstre i bildet under), samt Part Affinity Fields (PAF‑er), som ble innovert i 2016 av The Robotics Institute ved Carnegie Mellon University (se videoen nedenfor).

Part Affinity Fields hjelper med å definere orienteringen av lemmer og den generelle tilknytningen til det bredere skjelettet, og gir det nye prosjektet et ekstra oppmerksomhets‑/lokaliseringsverktøy.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Fra 2016‑papiret om Part Affinity Fields, kodede PAF‑er lem‑orientering som en del av en 2‑D‑vektor som også inkluderer lem‑posisjonen generelt. Kilde: https://arxiv.org/pdf/1611.08050.pdf

Selv om de ved første øyekast virker irrelevante for vekt‑utseende, er skelettkart nyttige for å styre de endelige transformeringsprosessene mot kroppsdeler som skal endres, for eksempel overarmer, bakdel og lår.

Etter dette mates resultatene inn i en Structure Affinity Self‑Attention (SASA) i prosessens sentrale flaskehals (se bildet under).

SASA regulerer konsistensen i flytgeneratoren som driver prosessen, og resultatene sendes deretter til warp‑modulen (andre fra høyre i bildet ovenfor), som anvender transformasjonene lært fra trening på de manuelle revisjonene inkludert i datasettet.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Structure Affinity Self‑Attention (SASA)‑modulen tildeler oppmerksomhet til relevante kroppsdeler, og bidrar til å unngå overflødige eller irrelevante transformasjoner.

Den resulterende bilden blir deretter opp‑skalert tilbake til den opprinnelige 2K‑oppløsningen, ved hjelp av prosesser som ligner på den standardiserte deepfake‑arkitekturen fra 2017 som populære pakker som DeepFaceLab er bygget på; opp‑skalering er også vanlig i GAN‑redigeringsrammeverk.

Oppmerksomhetsnettet for skjemaet er modellert etter Compositional De‑Attention Networks (CODA), et 2019‑årig akademisk samarbeid mellom USA/Singapore med Amazon (AMZN ) AI og Microsoft.

Tester

Det flyt‑baserte rammeverket ble testet mot tidligere flyt‑baserte metoder FAL og Animating Through Warping (ATW), samt bildetranslasjonsarkitekturer Pix2PixHD og GFLA, med SSIM, PSNR og LPIPS som evalueringsmål.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Resultater fra innledende tester (pilretning i overskriftene indikerer om lavere eller høyere tall er best).

Basert på de valgte måleparametrene overgår forfatternes system de tidligere arkitekturene.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Utvalgte resultater. Se den originale PDF‑en som er lenket i denne artikkelen for sammenligninger i høyere oppløsning.

I tillegg til de automatiserte målingene gjennomførte forskerne en brukerstudie (siste kolonne i resultat‑tabellen som ble vist tidligere), hvor 40 deltakere hver ble vist 30 tilfeldig valgte spørsmål fra en pool på 100 spørsmål knyttet til bildene produsert med de ulike metodene. 70 % av respondentene foretrakk den nye teknikken som mer «visuelt tiltalende».

Utfordringer

Den nye artikkelen representerer et sjeldent forsøk på AI‑basert kropp‑manipulering. Bildesyntesefeltet er for tiden langt mer opptatt av enten å generere redigerbare kropper via metoder som Neural Radiance Fields (NeRF), eller av å utforske latentrommet i GAN‑er og potensialet til autoenkodere for ansiktsmanipulering.

Forfatternes initiativ er foreløpig begrenset til å produsere endringer i oppfattet vekt, og de har ikke implementert noen form for in‑painting‑teknikk som kan gjenopprette bakgrunnen som uunngåelig blir synlig når man slanker et bilde av noen.

De foreslår imidlertid at portrett‑matting og bakgrunns‑blanding gjennom tekstur‑inferenz enkelt kan løse problemet med å gjenopprette de delene av verden som tidligere var skjult i bildet av menneskelig «imperfeksjon».

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Et foreslått løsningsforslag for å gjenopprette bakgrunnen som blir synlig etter AI‑drevet fett‑reduksjon.

 

* Selv om preprinten refererer til tilleggs­materiale som gir flere detaljer om datasettet, samt flere eksempler fra prosjektet, er ikke dette materialet gjort tilgjengelig i artikkelen, og korresponderende forfatter har ennå ikke svart på vår forespørsel om tilgang.

Først publisert 10. mars 2022.

Skribent innen maskinlæring, domenespesialist i menneskelig bildesyntese. Tidligere leder for forskningsinnhold hos Metaphysic.ai, frem til oppløsningen i DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai