Andersonin kulma

Disneyn yhdistää CGI:n ja neurorenderoinnin “outo laakso” -ongelman ratkaisemiseksi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Disneyn AI-tutkimusosasto on kehittänyt hybridimenetelmän elokuvanlaaduiselle kasvojen simulaatiolle, yhdistämällä kasvojen neurorenderoinnin vahvuudet ja CGI-pohjaisen lähestymistavan johdonmukaisuuden.

Tutkimusartikkeli on otsikoitu Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering, ja siitä on esitetty 10-minuuttinen video Disney Research -YouTube-kanavalla (upotettu artikkelin loppuun*).

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=k-RKSGbWLng

Meshes combined with neural facial renders. Katso video artikkelin lopusta tarkemman ja laadukkaamman esityksen vuoksi. Source: https://www.youtube.com/watch?v=k-RKSGbWLng (korvattu myöhemmin osoitteella https://www.youtube.com/watch?v=TwpLqTmvqVk)

Videon mukaan kasvojen neurorenderointi (mukaan lukien deepfakes) voi tuottaa realistisempia silmiä ja suun sisäosia kuin CGI, kun taas CGI-pohjaiset kasvotekstuurit ovat johdonmukaisempia ja sopivampia elokuvanlaaduiselle VFX-tuotannolle.

Siksi Disney kokeilee NVIDIA:n StyleGan2 -neurorogeneraattorin käyttämistä kasvojen ympäröivien piirteiden ja “elämänkriittisten” elementtien, kuten silmien, käsittelyyn, ja superimponoi johdonmukaiset CGI-kasvot ja -tekstuurit tulokseen.

Videosta (katso artikkelin loppu), Disneyn hybridilähestymistavan arkkitehtoninen konsepti, jossa vanhanaikainen CGI-mesh, jonka tyyppiä käytettiin nuoren Carrie Fisherin ja myöhäisen Peter Cushingin luomiseen elokuvaan Rogue One (2016), integroidaan neurorenderoituun kasvoympäristöön.

Videosta (katso artikkelin loppu), Disneyn hybridilähestymistavan arkkitehtoninen konsepti, jossa vanhanaikainen CGI-mesh, jonka tyyppiä käytettiin nuoren Carrie Fisherin ja myöhäisen Peter Cushingin luomiseen elokuvaan Rogue One (2016), integroidaan neurorenderoituun kasvoympäristöön.

Videossa viitataan myös usein kritiikkiin siitä, että CGI-kasvojen luominen, kuten myöhäisen brittiläisen Star Wars -näyttelijän Peter Cushingin luominen elokuvaan Rogue One (2016), on epäaidosti ja “outo laakso” -vaikutusta aiheuttava, myöntäen:

‘[On] vielä suuri aukko siinä, mitä ihmiset voivat helposti kaappailla ja renderöidä, ja lopullisissa fotorealistisissa digitaalisissa kaksoiskappaleissa, joissa on hiukset, silmät ja suun sisäosat. Tämän aukon sulkemiseen tarvitaan yleensä paljon manuaalista työtä taitavilta taiteilijoilta.’

Totuus on, että jopa nykyaikaisimmat kasvojen kaappaussysteemit eivät edes yritä jäljitellä silmiä, suun sisäosia tai hiuksia, joilla on todellisuudessa ongelmia aidon luonteen vuoksi (silmät) tai aikajatkuvuuden vuoksi (hiukset).

Videossa näytetään, mitä VFX-taiteilijat saavat tyypillisestä nykyaikaisesta kasvojen kaappaussessiosta. Silmät, hiukset, parta ja suun sisäosat on käsiteltävä eri tiimeissä tuotantoprosessissa.

Videossa näytetään, mitä VFX-taiteilijat saavat tyypillisestä nykyaikaisesta kasvojen kaappaussessiosta. Silmät, hiukset, parta ja suun sisäosat on käsiteltävä eri tiimeissä tuotantoprosessissa, lisäksi teksturointi ja valaistus.

Valaistuksen hallinta

Hybridilähestymistapa on myös hyödyllinen valaistuksen hallinnassa – merkittävä haaste kasvojen neurorenderoinnissa, koska CGI-ihon superimposiot voivat olla helpommin uudelleenvalottuvia.

Animaatioversio CGI/Neural -lähestymistavasta.

Animaatioversio CGI/Neural -lähestymistavasta.

Haastavampissa ympäristöissä, kuten ulkoisissa kuvauskohteissa, tutkijat ovat kehittäneet menetelmän, jossa voidaan täydentää ympäröivää aluetta henkilön ympärillä.

Musta reuna generoidaan, jotta voidaan luoda

Musta reuna generoidaan, jotta voidaan luoda “kangas” ympäröivien osien täydentämiseen ja CGI-ihon integroimiseen yhdistettyyn CGI/neuraaliseen tulokseen.

Videossa todetaan:

‘[Neuraalinen renderöinti] ei vastaa taustarajoitetta täydellisesti. – se on tarkoitettu vain ohjeeksi, koska optimointi realistisille ihmisille tärkeille osille, kuten hiuksille, silmille ja hampaille, on pääasiallinen tavoite. Haastavampaa on yrittää ylläpitää johdonmukaisuutta identiteetin ja ympäristön valaistuksen muutosten aikana.’

CGI-meshien luominen neurorenderöinteistä

Tutkimusryhmä on myös kehittänyt variational autoencoderin, joka on koulutettu suurella tietokannalla 3D-kasvoista, ja väittää, että se voi tuottaa “satunnaisia mutta uskottavia” 3D-kasvomesh-objekteja todellisista tiedoista.

Tässä tutkimuksessa on rajoituksia, jotka on voitettava, kuten hiusongelman saattaminen aikajatkuvuuteen neurorenderöinnissä, ja videossa (katso alla) on useita esimerkkejä nopeasti muuttuvista hiuksista muuten johdonmukaisessa panoraamassa CGI/neuraalikasvojen ympärillä.

Aikajatkuvuus neurorenderöinnissä on paljon laajempi ongelma kuin vain Disneyn, ja näyttää siltä, että myöhemmät järjestelmän versiot saattavat turvautua hiuslisäykseen jälkituotannossa tai muihin mahdollisiin lähestymistapoihin hiusten generointiin kuin toivoa, että joku uusi neurorogenerointimenetelmä lopulta ratkaisee ongelman.

Tiedon generointi

Menetelmää ehdotetaan myös mahdolliseksi keinoksi synteettisen datan generointiin ja kasvokuvien maailman monipuolistamiseen, josta on tullut viime vuosina vaarallisen yksipuolinen.

Disney näkee uuden tekniikan populoivan kasvokuvatietokantoja.

Disney näkee uuden tekniikan populoivan kasvokuvatietokantoja.

‘[Jokainen] fotorealistinen tulos, jonka generoimme, on perustuu todelliseen geometriaan ja ilmeisiin kartoituksiin, ja renderöidään tunnettuja kamerakulmia tunnetusta valaistuksesta. Tämä “todellinen” tieto voi olla elintärkeää sovellusten koulutukseen, kuten monokulaariseen 3D-kasvomallinnukseen, kasvontunnistukseen tai kohteen ymmärtämiseen. Ja jokainen renderöintitulos voidaan pitää datanäytteenä, ja voimme generoida monia eri yksilöiden muunnelmia.

‘Lisäksi, vaikka yksittäinen henkilö renderöidään yhdessä ilmeessä yhdestä näkökulmasta ja valaistuksesta, voimme generoida satunnaisia muunnelmia fotorealistisesta renderöinnistä muuttamalla satunnaisuuden siemeniä optimoinnin aikana.’

Tutkijat toteavat, että tämä konfiguroitavien tulosten monipuolisuus voi olla hyödyllistä kasvontunnistussovellusten koulutukseen, ja päättelevät:

‘[Meidän] menetelmä pystyy hyödyntämään nykyistä teknologiaa kasvojen ihoon kaappaamiseen, mallinnukseen ja renderöintiin, ja luomaan automaattisesti täydellisiä fotorealistisia kasvokuvia, jotka vastaavat haluttua identiteettiä, ilmettä ja kohteen määritystä. Tämä lähestymistapa soveltuu kasvojen renderöintiin elokuva- ja viihdealaan, jossa se säästää manuaalisten taiteilijoiden työtä, ja myös datan generointiin eri alojen syvällä oppimisessa.’

Lisätietoa uudesta lähestymistavasta löytyy 10-minuuttisesta videosta, joka on julkaistu tänään:

* Alkuperäinen videolinkki korvattiin toisella, joka näyttää olevan identtinen, 8 tuntia sen jälkeen, kun artikkeli julkaistiin. Muutin kaikki relevantit linkit, koska alkuperäistä videota ei enää ole.

 

8:24 GMT+2 – Korvasin videon, koska Disney Research -YouTube-kanava vaihtoi sen jostain syystä.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai