Andersonin kulma

Väärennetyt ‘paremmat’ kehot AI:n avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Alibaban DAMO-akatemian uusi tutkimus tarjoaa AI-pohjaisen työnkulun valokuvien kehon muokkaamiseen – harvinainen ponnistus tietokoneen näön alalla, joka on tällä hetkellä keskittynyt kasvojen manipulointiin, kuten deepfake- ja GAN-pohjaisiin kasvojen muokkauksiin.

Kuvan 'tulokset' -sarakkeissa on luodut huomioivat kartat, jotka määrittävät muokattavat alueet. Lähde: https://arxiv.org/pdf/2203.04670.pdf

Kuvan ‘tulokset’ -sarakkeissa on luodut huomioivat kartat, jotka määrittävät muokattavat alueet. Lähde: https://arxiv.org/pdf/2203.04670.pdf

Tutkijoiden arkkitehtuuri käyttää luurankopohjaista asennetunnistusta ratkaisemaan kuvien synteesin ja muokkaamisen järjestelmien monimutkaisuutta, ainakin sellaisella tarkkuudella, joka mahdollistaa merkityksellisen ja valikoivan muokkaamisen.

Arvioidut luurankokartat auttavat erottamaan ja kohdistamaan huomiota kehon alueisiin, jotka ovat todennäköisesti muokattavissa, kuten ylävartalon alue.

Järjestelmä mahdollistaa lopulta käyttäjän asettaa parametreja, jotka voivat muuttaa kehon ulkonäön, kuten painoa, lihasmassaa tai painon jakautumista täysipituisissa tai puolipituisissa valokuvissa, ja pystyy luomaan mielivaltaisia muodonmuutoksia vaatetun tai alastoman kehon osille.

Vasemmalla, syötekuva; keskellä, lämpökartta johdettuista huomioalueilta; oikealla, muunnettu kuva.

Vasemmalla, syötekuva; keskellä, lämpökartta johdettuista huomioalueilta; oikealla, muunnettu kuva.

Tutkimuksen motivaatio on automaattisten työnkulkujen kehittäminen, jotka voivat korvata vaativat digitaaliset manipulaatiot, joita valokuvaajat ja tuotantografiikka-artistit tekevät eri medioiden aloilla, muodista mainosmateriaaleihin.

Yleensä tutkijat myöntävät, että nämä muodonmuutokset sovelletaan yleensä ‘vääntö’-tekniikoilla ohjelmistoissa kuten Photoshop ja muissa perinteisissä bitmap-muokkausohjelmissa, ja ne käytetään lähes yksinomaan naisten kuvissa. Sen vuoksi tutkijoiden kehittämä mukautettu tietokanta, joka helpottaa uutta prosessia, koostuu pääasiassa naisten valokuvista:

‘Koska kehon muokkaus on pääasiassa naisten toive, suurin osa kokoelmastamme on naisten valokuvia, jotka ottaa huomioon ikäryhmien, rotujen (Afrikan:Aasian:Kaukasian = 0,33:0,35:0,32), asentojen ja vaatteiden monimuotoisuuden.’

Artikkeli on otsikoitu Rakenteen tunnistava virtausgeneraattori ihmiskehon muokkaamiseen, ja se on peräisin viideltä Alibaban DAMO-akatemian tutkijalta.

Tietokannan kehittäminen

Kuten yleensä on tapahtunut kuvien synteesi- ja muokkausjärjestelmissä, tutkijoiden arkkitehtuuri vaati mukautetun koulutustietokannan. Tutkijat tilasivat kolmelta valokuvaajalta standardin mukaiset Photoshop-muokkaukset sopivista valokuvista Unsplash-valokuvapalvelusta, josta syntyi tietokanta – nimeltään BR-5K* – 5000 korkealaatuista kuvaa 2K-resoluutiolla.

Tutkijat korostavat, että koulutuksen tavoitteena ei ole tuottaa ‘ihannetun’ ja yleistettyjä piirteitä, jotka liittyvät esteettisiin arvoihin tai toivottuun ulkonäköön, vaan pikemminkin poimia keskeiset piirteet, jotka liittyvät ammattimaiseen kehon muokkaamiseen.

Kuitenkin he myöntävät, että muokkaukset lopulta heijastavat muodonmuutoksia, jotka kulkevat ‘todellisesta’ kohti ennalta määriteltyä ‘ihannetta’:

‘Kutsuimme kolme ammattitaiteilijaa muokkaamaan kehoja Photoshopilla itsenäisesti, tavoitteena saavuttaa hoikkat kehot, jotka vastaavat suosittuja esteettisiä arvoja, ja valitsimme parhaan version perusversiona.’

Koska järjestelmä ei käsittele kasvoja lainkaan, ne peitettiin ennen kuin ne lisättiin tietokantaan.

Arkkitehtuuri ja keskeiset käsitteet

Järjestelmän työnkulku käsittää syötteenä korkearesoluution valokuvan, sen pienentämisen alempaan resoluutioon, joka mahtuu käytettävissä oleviin laskentaresursseihin, ja arvioidun luurankokartan (toinen kuva vasemmalta) sekä osien suhteen kentät (PAF), jotka kehitettiin vuonna 2016 Carnegie Mellonin yliopiston Robotics-instituutissa (katso video alla).

Osien suhteen kentät auttavat määrittämään raajojen suunnan ja yleisen liittymisen laajempaan luurankorakenteeseen, tarjoamalla uudelle hankkeelle lisän huomio-/lokaalointityökalun.

Vuoden 2016 osien suhteen kenttien artikkelista, ennustetut PAF:t koodaavat raajojen suunnan osana 2D-vektoria, joka sisältää myös raajan yleisen sijainnin. Lähde: https://arxiv.org/pdf/1611.08050.pdf

Vuoden 2016 osien suhteen kenttien artikkelista, ennustetut PAF:t koodaavat raajojen suunnan osana 2D-vektoria, joka sisältää myös raajan yleisen sijainnin. Lähde: https://arxiv.org/pdf/1611.08050.pdf

Luurankokartat ovat hyödyllisiä lopullisten muodonmuutosten ohjaamisessa kehon osiin, jotka on muokattava, kuten yläraajat, takamuksat ja reidet.

Tämän jälkeen tulokset syötetään Structure Affinity Self-Attention (SASA) -moduuliin prosessin keskellä (katso kuva alla).

SASA säätelee virtausgeneraattorin johdonmukaisuutta, jonka tulokset välitetään lopuksi muodonmuutosmoduuliin (toinen oikealta kuvassa), joka soveltaa opittuja muodonmuutoksia koulutusaineistosta.

Rakenteen suhteen itsehuomio (SASA) -moduuli kohdistaa huomiota merkityksellisiin kehon osiin, auttaen välttämään tarpeettomat tai epäolennaiset muodonmuutokset.

Rakenteen suhteen itsehuomio (SASA) -moduuli kohdistaa huomiota merkityksellisiin kehon osiin, auttaen välttämään tarpeettomat tai epäolennaiset muodonmuutokset.

Lopullinen kuva skalioidaan takaisin alkuperäiseen 2K-resoluutioon prosesseilla, jotka eivät poikkea olennaisesti vuoden 2017 deepfake-arkkitehtuurista, josta suositut paketit kuten DeepFaceLab on johdettu; ylös-skalausprosessi on myös yleinen GAN-muokkauskehyksissä.

Huomioverkko skeemalle on mallinnettu Komposiittinen de-huomioverkko (CODA), yhteistyössä Amazon AI:n ja Microsoftin kanssa vuonna 2019.

Testit

Virtauspohjainen kehys testattiin aiempien virtauspohjaisten menetelmien FAL ja Animaatio kautta Warp (ATW) vastaan, sekä kuvien käännösarkkitehtuureja Pix2PixHD ja GFLA, SSIM, PSNR ja LPIPS arviointimittareina.

Alkuvaiheen testien tulokset (nuolen suunta otsikoissa osoittaa, onko alempia tai korkeampia arvoja parempia).

Alkuvaiheen testien tulokset (nuolen suunta otsikoissa osoittaa, onko alempia tai korkeampia arvoja parempia).

Tutkijoiden järjestelmä ylittää aiemmat arkkitehtuurit näiden mittareiden perusteella.

Valitut tulokset. Katso alkuperäinen PDF-tiedosto tähän artikkeliin korkeampiresoluutioisina vertailuina.

Valitut tulokset. Katso alkuperäinen PDF-tiedosto tähän artikkeliin korkeampiresoluutioisina vertailuina.

Lisäksi automaattisten mittareiden ohella tutkijat suorittivat käyttäjätutkimuksen (edellä mainitun taulukon viimeinen sarake), jossa 40 osanottajaa esiteltiin 30 kysymystä satunnaisesti valittuna 100 kysymyksen joukosta, jotka liittyivät eri menetelmillä tuotettuihin kuviin. 70 % vastaajista suosi uutta tekniikkaa ‘näyttävimpänä’.

Haasteet

Uusi artikkeli edustaa harvinaista ekskursiota AI-pohjaiseen kehon manipulaatioon. Kuvien synteesiin keskittyvä ala on tällä hetkellä enemmän kiinnostunut joko kehon luomisesta muokattavissa olevaksi menetelmillä kuten Neural Radiance Fields (NeRF) tai sitten se on keskittynyt latentin avaruuden tutkimiseen GAN:eissa ja autoenkoodereiden potentiaalissa kasvojen manipulointiin.

Tutkijoiden aloite on tällä hetkellä rajoitettu tuottamaan muutoksia aistittuun painoon, ja he eivät ole toteuttaneet mitään täytäntöönpanotekniikkaa, joka palauttaisi taustan, joka paljastuu, kun kuva slimmiin.

He ehdottavat kuitenkin, että muotokuvaus ja taustan sekoittaminen tekstuurien johtamisen kautta voisi ratkaista helposti ongelman, joka liittyy maailman osien palauttamiseen, jotka olivat aiemmin piilossa kehon ‘epätäydellisyyden’ takia.

Ehdotettu ratkaisu taustan palauttamiseen, joka paljastuu AI-vetämän rasvan vähentämisen kautta.

Ehdotettu ratkaisu taustan palauttamiseen, joka paljastuu AI-vetämän rasvan vähentämisen kautta.

 

* Vaikka esijulkaisu viittaa lisämateriaaliin, joka antaa tarkempia tietoja tietokannasta sekä lisää esimerkkejä hankkeesta, tämän materiaalin sijainti ei ole saatavilla artikkelissa, eikä vastaava kirjoittaja ole vastannut pyyntöömme pääsystä.

Julkaistu ensimmäisen kerran 10. maaliskuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai