Andersonin kulma
Väärennetään ‘parempia’ kehoja tekoälyn avulla

Uusi tutkimus Alibaba DAMO -akatemiasta tarjoaa tekoälypohjaisen työnkulun kehon kuvien muodon muuttamisen automatisoimiseksi – harvinainen ponnistus tietokonenäköalalla, joka on tällä hetkellä keskittynyt kasvopohjaisiin manipulointeihin kuten deepfakeihin ja GAN-pohjaiseen kasvojen muokkaukseen.

Sisällytetty ‘tulos’-sarakkeisiin, luodut huomiointikartat, jotka määrittelevät muokattavat alueet. Lähde: https://arxiv.org/pdf/2203.04670.pdf
Tutkijoiden arkkitehtuuri käyttää luurankoposeen arviointia käsittelemään suurempaa monimutkaisuutta, jonka kuvagenerointi- ja muokkausjärjestelmät kohtaavat olemassa olevien kehon kuvien konseptoinnissa ja parametroinnissa, ainakin sellaisella tarkkuustasolla, joka mahdollistaa merkityksellisen ja valikoivan muokkauksen.

Arvioidut luurankokartat auttavat yksilöimään ja kohdistamaan huomion kehon alueille, joihin todennäköisesti tehdään korjauksia, kuten yläkäsivarren alueelle.
Järjestelmä mahdollistaa käyttäjän asettaa parametreja, joilla voidaan muuttaa painon, lihasmassan tai painon jakautumisen ulkonäköä täysikokoisissa tai puolipitkillä valokuvilla, ja se pystyy tuottamaan mielivaltaisia muunnoksia pukeutuneilla tai pukeutumattomilla kehon osilla.

Vasen, syötekuva; keskellä, johdetuista huomioalueista koostuva lämpökartta; oikealla, muokattu kuva.
Työn motivaatio on kehittää automatisoituja työnkulkuja, jotka voisivat korvata valokuvaajien ja tuotantografiikoiden tekemiä työläitä digitaalisia manipulointeja eri medioiden aloilla, muotialasta lehtityyppiseen tuotantoon ja mainosmateriaaleihin.
Yleisesti ottaen tekijät myöntävät, että näitä muunnoksia sovelletaan yleensä ‘warp’-tekniikoilla Photoshopissa ja muissa perinteisissä bittikarttakäsittelyohjelmissa, ja niitä käytetään lähes yksinomaan naiskuvissa. Tästä johtuen uusi prosessi mahdollistava räätälöity tietoaineisto koostuu pääosin naisten kuvista:
‘Koska kehon jälkikäsittelyä haluavat pääasiassa naiset, suurin osa kokoelmastamme on naiskuvia, ottaen huomioon ikä-, rotu- (afrikkalainen:aasialainen:valkoihoinen = 0,33:0,35:0,32), poseeraus- ja vaatetusmonimuotoisuuden.’
Artikkeli tutkimus on nimeltään Structure-Aware Flow Generation for Human Body Reshaping, ja se on peräisin viideltä Alibaba:n globaalista DAMO-akademiasta.
Aineiston kehittäminen
Kuten yleensä kuvagenerointi- ja muokkausjärjestelmien tapauksessa, projektin arkkitehtuuri vaati räätälöidyn harjoitusdatan. Tekijät palkkasivat kolme valokuvaajaa tuottamaan tavallisia Photoshop-manipulaatioita sopivista kuvista, jotka on haettu varastokuvapalvelusta Unsplash, mikä johti tietoaineistoon – nimeltään BR-5K* – 5 000 korkealaatuista kuvaa 2 K-resoluutiolla.
Tutkijat korostavat, että tämän aineiston avulla harjoittelun tavoitteena ei ole tuottaa ‘ihannetettuja’ ja yleistettyjä piirteitä, jotka liittyvät vetovoimaisuuden tai halutun ulkonäön indeksiin, vaan pikemminkin poimia keskeiset piirteiden kartoitukset, jotka liittyvät ammatillisiin kehonkuvien manipulointeihin.
Kuitenkin he myöntävät, että manipuloinnit lopulta heijastavat muuntoprosesseja, jotka kuvaavat siirtymää ‘todellisesta’ ennalta asetettuun ‘ihanteelliseen’ käsitykseen:
‘Kutsumme kolme ammattilaista muokkaamaan kehoja Photoshopilla itsenäisesti, tavoitteena saavuttaa hoikat hahmot, jotka vastaavat suosittua estetiikkaa, ja valitsemme parhaan maaperäarvona.’
Koska kehys ei käsittele kasvoja lainkaan, ne sumennettiin ennen sisällyttämistä aineistoon.
Arkkitehtuuri ja keskeiset käsitteet
Järjestelmän työnkulku sisältää korkean resoluution muotokuvan syöttämisen, sen alennuksen alempaan resoluutioon, joka mahtuu käytettävissä oleviin laskentaresursseihin, ja arvioidun luurankokartan poseen (toinen kuva vasemmalta alla olevassa kuvassa) sekä Part Affinity Fields (PAF:t), jotka innovoi vuonna 2016 Carnegie Mellon Universityn Robotics Institute -laitoksessa (katso alla upotettu video).
Part Affinity Fields auttavat määrittelemään raajojen suuntautumista ja yleistä yhteyttä laajempaan luurankorakenteeseen, tarjoten uudelle projektille lisähuomiointi-/lokalisointityökalun.

Vuoden 2016 Part Affinity Fields -paperista, ennustetut PAF:t koodaavat raajojen suuntautumisen osana 2D-vektoria, joka sisältää myös raajan yleisen sijainnin. Lähde: https://arxiv.org/pdf/1611.08050.pdf
Huolimatta niiden ilmeisestä merkityksettömyydestä painon ulkonäön kannalta, luurankokartat ovat hyödyllisiä ohjaamaan lopullisia muuntoprosesseja kehon osiin, jotka on korjattava, kuten yläkäsivarret, takapuoli ja reidet.
Tämän jälkeen tulokset syötetään Structure Affinity Self-Attention (SASA) -moduuliin prosessin keskeisessä pullonkaulassa (katso alla oleva kuva).

SASA säätelee prosessia ruokkivan virtausgeneraattorin johdonmukaisuutta, jonka tulokset siirretään sitten vääntämismoduuliin (toinen oikealta yllä olevassa kuvassa), joka soveltaa aineistoon sisältyneistä manuaalisista tarkistuksista opittuja muunnoksia.

Structure Affinity Self-Attention (SASA) -moduuli kohdistaa huomion olennaisiin kehon osiin, auttaen välttämään ylimääräisiä tai merkityksettömiä muunnoksia.
Tulostettu kuva skaalataan sen jälkeen takaisin alkuperäiseen 2 K-resoluutioon käyttäen prosesseja, jotka eivät poikkea merkittävästi standardista, vuonna 2017 kehitetystä deepfake-arkkitehtuurista, josta suosittuja paketteja kuten DeepFaceLab on johdettu; skaalausprosessi on myös yleinen GAN-muokkauskehyksissä.
Skeeman huomioverkko on mallinnettu Compositional De-Attention Networks (CODA), vuoden 2019 Yhdysvaltain/Singaporen akateemiseksi yhteistyöksi Amazonin (AMZN ) AI:n ja Microsoftin kanssa.
Testit
Virtauspohjaista kehystä testattiin aiempia virtauspohjaisia menetelmiä FAL ja Animating Through Warping (ATW) sekä kuvansiirtoarkkitehtuureja Pix2PixHD ja GFLA vastaan, käyttäen SSIM-, PSNR- ja LPIPS-mittareita arviointimittareina.

Alkuperäisten testien tulokset (nuolen suunta otsikoissa osoittaa, ovatko pienemmät vai suuremmat arvot parempia).
Näiden mittareiden perusteella tekijöiden järjestelmä ylittää aiemmat arkkitehtuurit.

Valitut tulokset. Katso alkuperäistä PDF:ää, joka on linkitetty tähän artikkeliin, saadaksesi tarkempia vertailuja korkeammassa resoluutiossa.
Automaattisten mittareiden lisäksi tutkijat toteuttivat käyttäjätestin (tulostaulukon viimeinen sarake, joka on aiemmin kuvattu), jossa 40 osallistujaa sai jokaiselle 30 satunnaisesti valittua kysymystä 100 kysymyksen joukosta, jotka liittyvät eri menetelmillä tuotettuihin kuviin. 70 % vastaajista piti uutta tekniikkaa visuaalisesti houkuttelevampana.
Haasteet
Uusi tutkimus edustaa harvinaista suuntausta kohti tekoälypohjaista kehonmanipulaatiota. Kuvagenerointialaa kiinnostaa tällä hetkellä enemmän joko muokattavien kehojen luominen menetelmillä kuten Neural Radiance Fields (NeRF), tai se on kiinnittynyt GAN:ien latenttialan ja autoenkoodereiden potentiaalin tutkimiseen kasvojen manipuloinnissa.
Tekijöiden aloitteessa on tällä hetkellä rajoituksena vain koetun painon muutosten tuottaminen, eikä he ole toteuttaneet minkäänlaista inpainting-tekniikkaa, joka palauttaisi taustan, joka väistämättä paljastuu, kun joku kuvaa ohennetaan.
He kuitenkin ehdottavat, että muotokuvien mattaus ja taustan sekoittaminen tekstuurin inferenssin avulla voisivat yksinkertaisesti ratkaista ongelman palauttaa ne osat maailmasta, jotka aiemmin piilotettiin kuvassa ihmisen ‘epätäydellisyyden’ takia.

Ehdotettu ratkaisu taustan palauttamiseksi, jonka AI-pohjainen rasvan vähennys paljastaa.
* Vaikka esijulkaisu viittaa lisämateriaaliin, joka antaa tarkempia tietoja aineistosta sekä lisäesimerkkejä projektista, tämän materiaalin sijaintia ei ole julkaistu paperissa, eikä vastuullinen tekijä ole vielä vastannut pyyntöömme pääsystä.
Ensimmäinen julkaisu 10. maaliskuuta 2022.












