Andersons vinkel

Fejka ‘bättre’ kroppar med AI

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ny forskning från Alibaba DAMO Academy erbjuder ett AI‑drivet arbetsflöde för att automatiskt omforma bilder av kroppar – ett sällsynt inslag i en datorsektorsgren som för närvarande domineras av ansiktsbaserade manipulationer såsom deepfakes och GAN‑baserad ansiktsredigering.

I 'result'-kolumnerna visar de genererade uppmärksamhetskartorna vilka områden som ska ändras. Källa: https://arxiv.org/pdf/2203.04670.pdf

Inbäddat i ‘result’-kolumnerna, de genererade uppmärksamhetskartorna som definierar områdena som ska ändras. Källa: https://arxiv.org/pdf/2203.04670.pdf

Forskarnas arkitektur använder skelettposeestimering för att hantera den större komplexitet som bildsyntes‑ och redigeringssystem möter när de ska konceptualisera och parametrisera befintliga kroppsbilder, åtminstone till en granularitetsnivå som faktiskt möjliggör meningsfull och selektiv redigering.

Beräknade skelettkartor hjälper till att identifiera och fokusera uppmärksamheten på kroppsområden som sannolikt ska retuscheras, såsom överarmsområdet.

Systemet möjliggör i slutändan för en användare att ställa in parametrar som kan förändra utseendet på vikt, muskelmassa eller viktfördelning i helkropps‑ eller halvkropps‑fotografier av personer, och kan generera godtyckliga transformationer på både klädda och otäckta kroppsdelar.

Till vänster indatabilden, i mitten en värmekarta över de härledda uppmärksamhetsområdena och till höger den transformerade bilden.

Vänster, indatavbilden; mitten, en värmekarta över de härledda uppmärksamhetsområdena; höger, den transformerade bilden.

Motivationen bakom arbetet är utvecklingen av automatiserade arbetsflöden som kan ersätta de mödosamma digitala manipulationerna som fotografer och produktgrafiska artister utför i olika mediegrenar, från mode till magasinliknande produktion och publicitetsmaterial.

I allmänhet erkänner författarna att dessa transformationer vanligtvis appliceras med ‘warp’-tekniker i Photoshop och andra traditionella bitmapredigerare, och de används nästan uteslutande på bilder av kvinnor. Följaktligen består den anpassade dataset som utvecklats för att underlätta den nya processen huvudsakligen av fotografier av kvinnliga motiv:

‘Eftersom kroppretuschering huvudsakligen efterfrågas av kvinnor, är majoriteten av vår samling kvinnliga foton, med hänsyn till variation i ålder, etnicitet (Afrikansk:Asiatisk:Kaukasisk = 0.33:0.35:0.32), poser och kläder.’

Artikeln heter Structure-Aware Flow Generation for Human Body Reshaping och kommer från fem författare knutna till Alibabas globala DAMO Academy.

Datasetutveckling

Som ofta är fallet med bildsyntes‑ och redigeringssystem krävde projektets arkitektur ett anpassat tränings‑dataset. Författarna anlade tre fotografer för att producera standard Photoshop‑manipulationer av lämpliga bilder från stockfotowebbplatsen Unsplash, vilket resulterade i ett dataset – benämnt BR-5K* – med 5 000 högkvalitativa bilder i 2K‑upplösning.

Forskarna betonar att syftet med att träna på detta dataset inte är att producera ‘idealiserade’ och generella egenskaper relaterade till ett attraktivitet‑ eller önskvärt‑utseende‑index, utan snarare att extrahera de centrala funktionskartorna som är förknippade med professionella manipulationer av kroppsbilder.

De medger dock att manipulationerna i slutändan speglar transformerande processer som kartlägger en övergång från ‘verklig’ till en förinställd idé om ‘ideal’:

‘Vi bjuder in tre professionella artister att retuschera kroppar med Photoshop oberoende av varandra, med målet att uppnå slanka figurer som motsvarar den populära estetiken, och väljer den bästa som markdata.’

Eftersom ramverket inte hanterar ansikten alls, suddades dessa ut innan de inkluderades i datasetet.

Arkitektur och grundkoncept

Systemets arbetsflöde innebär att mata in ett högupplöst porträtt, ner‑sampla det till en lägre upplösning som får plats i de tillgängliga beräkningsresurserna, samt extrahera en uppskattad skelett‑kartpose (andra bilden från vänster i bilden nedan), samt Part Affinity Fields (PAFs), som introducerades 2016 av The Robotics Institute vid Carnegie Mellon University (se videon som är inbäddad direkt nedan).

Part Affinity Fields hjälper till att definiera lemarnas orientering och deras allmänna samband med den bredare skelettstrukturen, vilket ger det nya projektet ett extra uppmärksamhets‑/lokaliseringsverktyg.

I 2016 års artikel om Part Affinity Fields kodar de förutsagda PAF:erna lemmarnas orientering som en del av en tvådimensionell vektor som även omfattar lemmens allmänna position. Källa: https://arxiv.org/pdf/1611.08050.pdf

I 2016 års artikel om Part Affinity Fields kodar de förutsagda PAF:erna lemmarnas orientering som en del av en 2D‑vektor som även omfattar lemmens allmänna position. Källa: https://arxiv.org/pdf/1611.08050.pdf

Trots deras uppenbara irrelevans för viktens utseende är skelettkartor användbara för att styra de slutgiltiga transformerande processerna till kroppsdela som ska ändras, såsom överarmar, bakdel och lår.

Efter detta matas resultaten in i en Structure Affinity Self-Attention (SASA) i processens centrala flaskhals (se bilden nedan).

SASA reglerar konsistensen hos flödesgeneratorn som driver processen, vars resultat sedan skickas till warp‑modulen (andra från höger i bilden ovan), som applicerar de transformationer som lärts från träning på de manuella revideringarna som ingår i datasetet.

Modulen Structure Affinity Self-Attention (SASA) fördelar uppmärksamhet till relevanta kroppsdelar och hjälper till att undvika överflödiga eller irrelevanta transformationer.

Structure Affinity Self-Attention (SASA)-modulen fördelar uppmärksamhet till relevanta kroppsdelar, vilket hjälper till att undvika överflödiga eller irrelevanta transformationer.

Den resulterande bilden uppsamplas därefter tillbaka till den ursprungliga 2K‑upplösningen, med processer som liknar den standardiserade deepfake‑arkitekturen från 2017, som populära paket som DeepFaceLab har hämtat; uppsamplingsprocessen är också vanlig i GAN‑redigeringsramverk.

Uppmärksamhetsnätverket för schemat är modellerat efter Compositional De-Attention Networks (CODA), ett akademiskt samarbete från 2019 mellan USA/Singapore med Amazon (AMZN ) AI och Microsoft.

Tester

Det flödesbaserade ramverket testades mot tidigare flödesbaserade metoder FAL och Animating Through Warping (ATW), samt bildöversättningsarkitekturer Pix2PixHD och GFLA, med SSIM, PSNR och LPIPS som utvärderingsmått.

Resultat från de inledande testerna; pilarnas riktning i rubrikerna visar om lägre eller högre värden är bäst.

Resultat från initiala tester (pilriktning i rubrikerna indikerar om lägre eller högre siffror är bäst).

Baserat på dessa antagna mått överträffar författarnas system de tidigare arkitekturerna.

Utvalda resultat. Se den ursprungliga PDF-filen som länkas i artikeln för jämförelser i högre upplösning.

Utvalda resultat. Vänligen se den ursprungliga PDF‑filen som länkas i denna artikel för jämförelser i högre upplösning.

Utöver de automatiserade måtten genomförde forskarna en användarstudie (sista kolumnen i resultattabellen som visas tidigare), där 40 deltagare visades 30 slumpmässigt utvalda frågor från en pool på 100 frågor som rörde bilderna som producerats med de olika metoderna. 70 % av svararna föredrog den nya tekniken som mer ‘visuellt tilltalande’.

Utmaningar

Den nya artikeln representerar ett sällsynt steg in i AI‑baserad kroppmanipulation. Bildsyntes‑sektorn är för närvarande mycket mer intresserad av att generera redigerbara kroppar via metoder som Neural Radiance Fields (NeRF), eller är fixerad vid att utforska GAN‑s latentrum och potentialen hos autoencoders för ansiktsmanipulation.

Författarnas initiativ är för närvarande begränsat till att producera förändringar i upplevd vikt, och de har inte implementerat någon form av inpainting‑teknik som skulle återställa bakgrunden som oundvikligen avslöjas när man smalnar av en bild av någon.

De föreslår dock att porträtt‑matting och bakgrundsblandning genom texturinferens enkelt skulle kunna lösa problemet med att återställa de delar av världen som tidigare gömdes i bilden av mänsklig ‘imperfektion’.

En föreslagen lösning för att återställa den bakgrund som blir synlig vid AI-driven fettminskning.

Ett föreslaget sätt att återställa bakgrunden som avslöjas av AI‑driven fettminskning.

 

* Även om förhandsutskriften hänvisar till kompletterande material som ger mer detaljer om datasetet, samt ytterligare exempel från projektet, är platsen för detta material inte tillgänglig i artikeln, och den korresponderande författaren har ännu inte svarat på vår begäran om åtkomst.

Först publicerad 10 mars 2022.

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai