Andersonin kulma

RigNeRF: Uusi Deepfake-Menetelmä, Joka Käyttää Neuraalista ValaistusKenttää

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uusi tutkimus, joka on kehitetty Adobessa, tarjoaa ensimmäisen toimivan ja tehokkaan deepfake-menetelmän, joka perustuu Neuraalisiin ValaistusKenttiin (NeRF) – ehkä ensimmäinen oikea innovaatio arkkitehtuurissa tai lähestymistavassa viiden vuoden aikana siitä, kun deepfakes ilmaantui vuonna 2017.

Menetelmä, joka on nimetty RigNeRF, käyttää 3D-muokattavia kasvomalleja (3DMM) välittömänä välineenä halutun syötteen (ts. identiteetin, joka halutaan lisätä NeRF-renderiin) ja neuronaalisen avaruuden välillä, menetelmä, joka on laajalti hyväksytty viime vuosina Generative Adversarial Network (GAN) -kasvosynteesilähestymistavoissa, joista kukaan ei ole vielä tuottanut toimivia ja hyödyllisiä kasvonkorvauskehyksiä videoille.

<img class="wp-image-181995 size-full" src="https://www.unite.ai/wp-content/uploads/2022/06/RigNerf_example001.gif" alt="Lisämateriaalista uudesta artikkelista nähdään 3D-muokattava kasvomalli (3DMM) toimimassa välikappaleena 70 sekunnin mittaisen oikean videon ja Neuraalisen ValaistusKentän visualisaation välillä. Korkearesoluutioinen versio tästä klipistä, sekä monista muista, on nähtävissä projektisivulla, tai tämän artikkelin lopussa olevissa upotetuissa videoissa. Lähde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html” width=”800″ height=”346″ /> Erikoista perinteisiin deepfake-videoihin verrattuna, ei mikään liikkuva sisältö ole “oikeaa”, vaan se on exploroitavissa oleva neuronaalinen avaruus, joka on koulutettu lyhyestä videomateriaalista. Oikealla puolella nähdään 3D-muokattava kasvomalli (3DMM) toimimassa välikappaleena halutuissa muokkauksissa (‘hymyile’, ‘katso vasemmalle’, ‘katso ylös’ jne.) ja Neuraalisen ValaistusKentän visualisaation välillä. Korkearesoluutioinen versio tästä klipistä, sekä monista muista, on nähtävissä projektisivulla, tai tämän artikkelin lopussa olevissa upotetuissa videoissa. Lähde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html Lähde: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3D-muokattavat kasvomallit ovat käytännössä CGI-malleja, joiden parametreja voidaan sovittaa abstrakteimmaksi kuvasynteesijärjestelmiksi, kuten NeRF ja GAN, jotka ovat muuten vaikeasti ohjattavissa.

Mitä näet yllä olevassa kuvassa (keskikuva, mies sinisessä paidassa), sekä alla olevassa kuvassa (vasen kuva, mies sinisessä paidassa), ei ole “oikeaa” videota, johon on lisätty “väärennös”-kasvo, vaan täysin syntetisoitu kohtaus, joka on olemassa ainoastaan volumetrinen neuronaalinen renderöinti – mukaan lukien keho ja tausta:

Yllä olevassa esimerkissä oikean elämän video oikealla puolella (nainen punaisessa mekossa) käytetään “nukkeksi” RigNeRF:llä tallennettua identiteettiä (mies sinisessä paidassa) vasemmalla puolella, joka (kirjoittajat väittävät) on ensimmäinen NeRF-pohjainen järjestelmä, joka saavuttaa asennon ja ilmeen erottamisen ja pystyy suorittamaan uusia näkökulmia.

Miehen hahmo vasemmalla puolella yllä olevassa kuvassa “tallennettiin” 70 sekunnin mittaisesta älypuhelinvideosta, ja syöteaineisto (mukaan lukien koko kohtausinformaatio) koulutettiin neljällä V100-grafiikkaprosessorilla saadakseen kohtauksen.

Koska 3DMM-tyyppiset parametrinen kehykset ovat myös saatavilla kokonaisen kehon parametrinen CGI-välikappale (eikä ainoastaan kasvojen kehyksiä), RigNeRF avaa mahdollisuuden täydellisiin deepfake-kokonaisuuksiin, joissa oikean ihmisen liike, teksturaatti ja ilme siirretään CGI-pohjaiseen parametriseen kerrokseen, joka kääntäisi toiminnan ja ilmeen NeRF-ympäristöihin ja videoihin.

Mitä tulee RigNeRF:ään – onko se deepfake-menetelmä nykyisessä merkityksessä, jossa otsikot ymmärtävät termin? Vai onko se vain toinen puolivillainen, puutteellinen järjestelmä DeepFaceLabiin ja muihin vuonna 2017 kehitettyihin autoencoder-pohjaisiin deepfake-järjestelmiin?

Uuden tutkimuksen tutkijat ovat yksiselitteisiä tässä suhteessa:

‘Olemme menetelmä, joka pystyy elävöittämään kasvoja, RigNeRF on altis väärinkäytölle pahantahtoisilla toimijoilla, jotka voivat luoda deepfake-kuvia.’

Uusi artikkeli on nimeltään RigNeRF: Täysin ohjattavissa olevat neuronaaliset 3D-muotokuvat, ja se on peräisin ShahRukh Atharilta Stonybrookin yliopistosta, joka oli Adoben harjoittelija RigNeRF:n kehityksen aikana, ja neljältä muulta Adoben tutkijalta.

Autoencoder-pohjaisten deepfakeiden ulkopuolella

Useimmat viralliset deepfake-videot, jotka ovat saaneet otsikot viime vuosina, on tuottanut autoencoder-pohjaiset järjestelmät, jotka perustuvat koodiin, joka julkaistiin vuonna 2017 kieltäytyneellä r/deepfakes-subredditissä – vaikka se ei ollut kopioidu GitHubiin, jossa se on forkattu yli tuhat kertaa, ei vähiten suositun (vaikka kiistanalaisen) DeepFaceLab-jakelun, ja myös FaceSwap-projektin.

Lisäksi GAN:in ja NeRF:in, autoencoder-kehykset ovat kokeilleet 3D-muokattavia kasvomalleja “opasteina” parannelle kasvosynteesikehyksille. Esimerkki tästä on HifiFace-projekti heinäkuulta 2021. Kuitenkaan mikään käytännöllinen tai suosittu aloite ei näytä kehittyneen tästä lähestymistavasta tähän asti.

RigNeRF:n kohtauksien tiedot hankitaan tallentamalla lyhyitä älypuhelinvideoita. Tutkijat käyttivät iPhone XR:ää tai iPhone 12:ta kaikissa kokeissa. Ensimmäisen tallennuksen aikana koehenkilö pyydetään esittämään laaja valikoima kasvojen ilmeitä ja puhumaan, kun kamera liikkuu ympärillä.

Toisessa tallennuksessa kamera pysyy paikallaan, kun koehenkilö liikuttaa päätään eri suuntiin ja esittää erilaisia ilmeitä. Tuloksena olevat 40-70 sekunnin mittaiset videomateriaalit (noin 1200-2100 kehystä) edustavat koko aineistoa, jota käytetään mallin kouluttamiseen.

Datakeruun vähentäminen

Toisin kuin autoencoder-järjestelmät, kuten DeepFaceLab, jotka vaativat suhteellisen työlään ja kohdennetun valokuvien keräämisen ja kuraation, useita tuhansia erilaisia valokuvia, usein otettuina YouTube-videoista ja muista sosiaalisen median kanavista, sekä elokuvista (julkkisten deepfake-kuvien tapauksessa).

Tuloksena olevat koulutetut autoencoder-mallit on usein tarkoitettu käytettäviksi monissa eri tilanteissa. Kuitenkin ahkerimmat “julkkis”-deepfake-käyttäjät voivat kouluttaa kokonaisia malleja alusta alkaen yhteen videoon, vaikka koulutus voi kestää viikkoja.

Vaikka uuden tutkimuksen tutkijat ovat varoittaneet, “mosaiikki”- ja laajasti kootuista aineistoista, jotka voimavat AI-pornoa ja suosittuja YouTube/TikTok-deepfake-uudelleenjärjestelyjä, näyttävät epätodennäköisiltä tuottavan hyväksyttäviä ja johdonmukaisia tuloksia RigNeRF-järjestelmässä, jolla on kohtauskohtainen menetelmä. Ottaen huomioon aineiston keräämisen rajoitukset uudessa tutkimuksessa, tämä voi olla jonkin verran lisäsuojaa vastaan tahallista identiteetin väärinkäyttöä.

NeRF:n sovittaminen deepfake-videolle

NeRF on fotogrammetria-pohjainen menetelmä, jossa pieni määrä lähdetikkuja otetaan eri näkökulmista ja koostetaan exploroitavaksi 3D-neuronaaliseksi avaruudeksi. Tämä lähestymistapa tuli tunnetuksi aiemmin tänä vuonna, kun NVIDIA julkaisi Instant NeRF-järjestelmän, joka pystyy leikkaamaan NeRF:n koulutusaikaan liittyvät suuret kustannukset muutamiin minuutteihin tai jopa sekunteihin:

Instant NeRF. Lähde: https://www.youtube.com/watch?v=DJ2hcC1orc4

Tuloksena oleva Neuraalinen ValaistusKenttä on käytännössä staattinen ympäristö, jota voidaan tutkia, mutta jota on vaikea muokata. Tutkijat toteavat, että kaksi aiempaa NeRF-pohjaista aloitetta – HyperNeRF + E/P ja NerFACE – ovat kokeilleet kasvojen videosynteesiä, ja (ilmeisesti täydellisyyden ja tarkkuuden vuoksi) asettaneet RigNeRF:n näiden kahden kehyksen rinnalle testikierrokselle:

Instant NeRF. Lähde: https://www.youtube.com/watch?v=DJ2hcC1orc4

Laadullinen vertailu RigNeRF:n, HyperNeRF:n ja NerFACE:n välillä. Katso linkitetyt lähdevideot ja PDF-tiedostot korkeampilaatuisista versioista. Staattinen kuva: https://arxiv.org/pdf/2012.03065.pdf

Laadullinen vertailu RigNeRF:n, HyperNeRF:n ja NerFACE:n välillä. Katso linkitetyt lähdevideot ja PDF-tiedostot korkeampilaatuisista versioista. Staattinen kuva: https://arxiv.org/pdf/2012.03065.pdf

Kuitenkin tässä tapauksessa tulokset, jotka suosivat RigNeRF:ää, ovat melko poikkeuksellisia, kahdesta syystä: ensinnäkin, kirjoittajat toteavat, että “ei ole olemassa oikeudenmukaista vertailua”; toiseksi, tämä on edellyttänyt RigNeRF:n kykyjen rajoittamista osittain vastaamaan edellisten järjestelmien rajoitettua toiminnallisuutta.

Koska tulokset eivät ole vain edellisten töiden parannusta, vaan edustavat “murrosta” NeRF:n muokattavuudessa ja hyödyllisyydessä, jätämme testikierroksen sivuun ja tarkastelemme, mitä RigNeRF tekee eri tavalla kuin edeltäjänsä.

Yhdistetyt vahvuudet

NerFACE:n pääasiallinen rajoitus, joka pystyy luomaan asento-/ilmeohjauksen NeRF-ympäristössä, on se, että se olettaa, että lähdemateriaali on tallennettu staattisella kameralla. Tämä tarkoittaa käytännössä, että se ei voi tuottaa uusia näkökulmia, jotka ylittävät sen tallennusrajat. Tämä tuottaa järjestelmän, joka voi luoda “liikkuva portaita”, mutta joka ei sovellu deepfake-tyyppisille videoille.

HyperNeRF, toisaalta, pystyy tuottamaan uusia ja hyperrealistisia näkökulmia, mutta sillä ei ole välineitä, joilla voidaan muuttaa pään asentoa tai kasvojen ilmeitä, mikä ei johda mihinkään kilpailijaan autoencoder-pohjaisiin deepfake-järjestelmiin.

RigNeRF pystyy yhdistämään nämä kaksi erillistä toiminnallisuutta luomalla “kanonisen avaruuden”, oletusarvon, josta poikkeamat ja muodonmuutokset voidaan suorittaa 3DMM-moduulin syötteen avulla.

Kanonisen avaruuden luominen (ei asentoa, ei ilmettä), johon 3DMM:llä tuotetut muodonmuutokset (ts. asennot ja ilmeet) voivat vaikuttaa.

Kanonisen avaruuden luominen (ei asentoa, ei ilmettä), johon 3DMM:llä tuotetut muodonmuutokset (ts. asennot ja ilmeet) voivat vaikuttaa.

Koska 3DMM-järjestelmä ei vastaa täysin tallennettua koehenkilöä, on tärkeää kompensoida tämä prosessissa. RigNeRF saavuttaa tämän deformaatiokentän etuoikeuden kautta, joka lasketaan monikerroksisesta perceptronista (MLP) lähdemateriaalista.

Kameraparametrit, jotka tarvitaan deformaatioiden laskemiseen, hankitaan COLMAP:sta, kun taas ilmeen ja muodon parametreja hankitaan DECA:sta.

Asema optimoidaan edelleen maamerkin sovittamisen ja COLMAP:n kameraparametrien kautta, ja lopullinen videotuotos on pienennetty 256×256-resoluutioon koulutusta varten (laitevaatimusten rajoittama prosessi, joka vaivaa myös autoencoder-pohjaista deepfake-koulutusta).

Tämän jälkeen deformaatioverkko koulutetaan neljällä V100:lla – vaikuttavalla laitteistolla, joka ei todennäköisesti ole saatavilla harrastelijoiden ulottuvilla (vaikka koneoppimisen koulutuksessa on usein mahdollista vaihtaa voima ajan sijasta ja hyväksyä, että mallin koulutus kestää päiviä tai jopa viikkoja).

Johtopäätöksessään tutkijat toteavat:

‘Toisin kuin muut menetelmät, RigNeRF, 3DMM-ohjatun deformaatiomoduulin ansiosta, pystyy mallintamaan pään asennon, kasvojen ilmeitä ja koko 3D-muotokuvan korkealla uskottavuudella, mikä johtaa parempiin rekonstruktioihin terävillä yksityiskohdilla.’

Katso alla olevat upotetut videot lisätietojen ja tuloksien kuvamateriaalin vuoksi.

 

 

Julkaistu ensimmäisen kerran 15. kesäkuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai