Andersons vinkel
Fremme ‘bedre’ kropp med AI

Ny forskning fra Alibaba DAMO-akademiet tilbyr en AI-drevet arbeidsflyt for automatisering av omformingen av bilder av kropp – en sjelden innsats i et datavisjonsområde som for tiden er dominert av ansiktsbaserte manipulasjoner som deepfakes og GAN-basert ansiktsredigering.

Innsatt i ‘resultat’ kolonner, de genererte oppmerksomhetskartene som definerer områdene som skal endres. Kilde: https://arxiv.org/pdf/2203.04670.pdf
Forskerne bruker skjelettposisjonsestimering for å takle den større kompleksiteten som bilde-syntese- og redigeringsystemer møter når de forsøker å konseptualisere og parametrisere eksisterende kroppsbilder, i alle fall på et nivå av granularitet som tillater meningsfull og selektiv redigering.

Estimerte skjelett-kart hjelper til å individuere og fokusere oppmerksomhet på områder av kroppen som sannsynligvis vil bli retusjert, som overarm-området.
Systemet muliggjør at en bruker kan sette parametre som kan endre utseendet av vekt, muskelmasse eller vektfordeling i full-lengde- eller mid-lengde-foto av mennesker, og kan generere vilkårlige transformasjoner på kledd eller ukledd kroppsdeler.

Venstre, innputt-bildet; midten, en varme-kart over de avledede oppmerksomhetsområdene; høyre, det transformerte bildet.
Motivasjonen for arbeidet er utviklingen av automatiserte arbeidsflyter som kan erstatte de omfattende digitale manipulasjoner som fotografene og produksjonsgrafikere gjennomfører i ulike mediegrener, fra mote til magasin-stil og publisitetsmateriale.
Generelt erkjenner forfatterne at disse transformasjonene vanligvis blir brukt med ‘warp’-teknikker i Photoshop og andre tradisjonelle bitmap-redigeringer, og nesten eksklusivt brukes på bilder av kvinner. Derfor består den tilpassede datasetten som er utviklet for å muliggjøre den nye prosessen hovedsakelig av bilder av kvinnelige subjekter:
‘Ettersom kroppsretusjering hovedsakelig er ønsket av kvinner, er majoriteten av vårt samling kvinnelige bilder, med tanke på diversitet av alder, rase (Afrikaner:Asiater:Kaukasier = 0,33:0,35:0,32), posisjoner og klær.’
Den artikkelen heter Struktur-bevisst flyt-generering for menneskekropps-omformning, og kommer fra fem forfattere tilknyttet Alibabas globale DAMO-akademi.
Datasett-utvikling
Som vanlig er tilfelle med bilde-syntese- og redigerings-systemer, krevde arkitekturen for prosjektet en tilpasset trening-datasett. Forfatterne bestilte tre fotografer til å produsere standard Photoshop-manipulasjoner av passende bilder fra stock-fotografi-nettstedet Unsplash, med resultatet av en datasett – tittel BR-5K* – på 5 000 høykvalitets-bilder i 2K-oppløsning.
Forskerne understreker at målet med trening på dette datasettet ikke er å produsere ‘idealiserende’ og generaliserte trekk relatert til en indeks av tiltrekning eller ønsket utseende, men heller å trekke ut de sentrale funksjons-mappingene assosiert med profesjonelle manipulasjoner av kropps-bilder.
Men de innrømmer at manipulasjonene til slutt reflekterer transformative prosesser som kartlegger en fremgang fra ‘reell’ til en forhåndsbestemt forestilling om ‘ideell’:
‘Vi inviterer tre profesjonelle kunstnere til å retusjere kroppene ved hjelp av Photoshop uavhengig, med målet om å oppnå slanke figurer som møter den populære estetikken, og velger den beste som grunn-sannhet.’
Ettersom rammen ikke omhandler ansikter i det hele tatt, ble disse uskarpt før de ble inkludert i datasettet.
Arkitektur og kjernekonsepter
Systemets arbeidsflyt innebærer å mata inn et høyoppløst portrett, nedprøve det til en lavere oppløsning som kan passe inn i de tilgjengelige beregningsressursene, og trekke ut en estimert skjelett-kart-pose (andre figur fra venstre i bildet under), samt Part Affinity Fields (PAF), som ble innovert i 2016 av The Robotics Institute at Carnegie Mellon University (se video innlejret rett under).
Part Affinity Fields hjelper til å definere orientering av lemmer og generell assosiasjon med den bredere skjelett-rammen, og gir det nye prosjektet en ekstra oppmerksomhets-/lokalisering-verktøy.

Fra 2016 Part Affinity Fields-artikkelen, predikerer PAF-er lem-orientering som en del av en 2D-vektor som også inkluderer den generelle posisjonen av lemmen. Kilde: https://arxiv.org/pdf/1611.08050.pdf
Til tross for deres åpenbare irrelevans for utseendet av vekt, er skjelett-kart nyttige i å rette de endelige transformative prosessene til deler av kroppen som skal endres, som overarmer, bakre og lår.
Etter dette, mates resultatene til en Structure Affinity Self-Attention (SASA) i den sentrale flaskehalsen av prosessen (se bildet under).

SASA-regulerer konsistensen av flyt-generatoren som driver prosessen, og resultatene av dette blir deretter matet til warp-modulen (andre fra høyre i bildet over), som anvender transformasjonene som er lært fra trening på de manuelle revisjonene inkludert i datasettet.

Structure Affinity Self-Attention (SASA)-modulen tildeler oppmerksomhet til relevante kroppsdeler, og hjelper til å unngå unødvendige eller irrelevante transformasjoner.
Utgangs-bildet blir deretter oppsamplet tilbake til den opprinnelige 2K-oppløsningen, ved hjelp av prosesser som ikke er så forskjellige fra standard, 2017-stil deepfake-arkitektur som populære pakker som DeepFaceLab har blitt avledet fra; oppsampnings-prosessen er også vanlig i GAN-redigerings-rammeverk.
Oppmerksomhets-nettverket for skjemaet er modellert etter Compositional De-Attention Networks (CODA), en 2019 US/Singapore-akademisk samarbeid med Amazon AI og Microsoft.
Tester
Den flyt-baserte rammen ble testet mot tidligere flyt-baserte metoder FAL og Animating Through Warping (ATW), samt bilde-oversettelses-arkitekturer Pix2PixHD og GFLA, med SSIM, PSNR og LPIPS som evaluering-mål.

Resultater av initielle tester (pil-retning i header-indikatorer viser om lavere eller høyere tall er best).
Basert på disse adopterte målene, overgår forfatternes system de tidligere arkitekturene.

Utvalgte resultater. Vennligst se den opprinnelige PDF-lenken i denne artikkelen for høyere oppløsning-sammenligninger.
I tillegg til de automatiske målene, gjennomførte forskerne en bruker-undersøkelse (siste kolonne i resultattabellen ovenfor), hvor 40 deltakere hver ble vist 30 spørsmål som var tilfeldig valgt fra en 100-spørsmåls-pool relatert til bildene produsert via de ulike metodene. 70% av respondentene foretrakk den nye teknikken som mer ‘visuelt tiltalende’.
Utfordringer
Den nye artikkelen representerer en sjelden utflukt i AI-basert kropp-manipulasjon. Bilde-syntese-sektoren er for tiden mye mer interessert i å generere redigerbare kropp via metoder som Neural Radiance Fields (NeRF), eller er fiksert på å utforske den latente rommet til GAN-er og potensialet til auto-encodere for ansikts-manipulasjon.
Forfatternes initiativ er for tiden begrenset til å produsere endringer i oppfattet vekt, og de har ikke implementert noen form for inpainting-teknikk som ville gjenopprette bakgrunnen som uunngåelig blir avdekket når du slimmer ned et bilde av noen.
Men de foreslår at portrett-matting og bakgrunn-blanding gjennom tekstur-inferens kunne trivialt løse problemet med å gjenopprette deler av verden som tidligere var skjult i bildet av menneskelig ‘imperfeksjon’.

En foreslått løsning for å gjenopprette bakgrunn som blir avdekket av AI-drevet fedme-reduksjon.
* Selv om forhånds-utgaven henviser til supplementært materiale som gir mer detaljer om datasettet, samt ytterligere eksempler fra prosjektet, er plasseringen av dette materialet ikke tilgjengelig i artikkelen, og den korresponderende forfatteren har ennå ikke svart på vår forespørsel om tilgang.
Først publisert 10. mars 2022.












