Andersons vinkel

Disney Kombinerer CGI Med Neuralt Rendering for å Tackle ‘Uncanny Valley’

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Disneys AI-forskningsavdeling har utviklet en hybridmetode for filmkvalitetsansiktsanimasjon, som kombinerer styrkene til ansiktsneuralt rendering med konsistensen til en CGI-basert tilnærming.

Den ventede artikkelen har tittelen Rendering med Stil: Kombinering av Tradisjonelle og Neurale Tilnærminger for Høykvalitets Ansiktsrendering, og er forhåndsvisning i en ny 10-minutters video på Disney Research YouTube-kanalen (innbettet i slutten av denne artikkelen*).

Mesh kombinerer med neurale ansiktsrenderinger. Kilde: https://www.youtube.com/watch?v=k-RKSGbWLng

Mesh kombinerer med neurale ansiktsrenderinger. Se videoinnbetning i slutten av artikkelen for bedre detalj og kvalitet. Kilde: https://www.youtube.com/watch?v=k-RKSGbWLng (erstattet med https://www.youtube.com/watch?v=TwpLqTmvqVk)

Som videoen bemerker, kan neuralt rendering av ansikter (inkludert deepfakes) produsere langt mer realistiske øyne og munninteriør enn CGI er i stand til, mens CGI-drevne ansiktsteksturer er mer konsistente og egnet for kinokvalitet VFX-utgang.

Derfor eksperimenterer Disney med å la NVIDIAs StyleGan2 neuralt generator håndtere omgivende trekk på et ansikt og ‘livskritiske’ elementer som øyne, mens de legger på konsistente CGI-ansiktshud og relaterte elementer i utgangen.

Fra videoen (se slutten av artikkelen), den arkitektoniske konseptet bak Disneys hybridtilnærming, hvor en gammeldags CGI-mesh, av typen som ble brukt til å gjenskape 'ung' Carrie Fisher og den avdøde Peter Cushing for Rogue One (2016), integreres i neuralt renderede ansiktsmiljøer.

Fra videoen (se slutten av artikkelen), den arkitektoniske konseptet bak Disneys hybridtilnærming, hvor en gammeldags CGI-mesh, av typen som ble brukt til å gjenskape ‘ung’ Carrie Fisher og den avdøde Peter Cushing for Rogue One (2016), integreres i neuralt renderede ansiktsmiljøer.

Videoen gjør en underforstått henvisning til hyppig kritikk av uautentisiteten og ‘uncanny valley’-effekten av CGI-gjenskapelsen av den avdøde britiske Star Wars-skuespilleren Peter Cushing i Rogue One (2016), og innrømmer:

‘[Det] er fortsatt et stort gap mellom hva folk kan enkelt fange og rendre versus finalt fotorealistisk digitale dobbeltgjengere, komplette med hår, øyne og innermunn. For å lukke dette gapet, trenger det vanligvis mye manuell arbeid fra dyktige kunstnere.’

I virkeligheten gjør selv de mest moderne ansiktsfangstsystemer ikke engang forsøk på å gjenskape øyne, munninteriør eller hår, som enten har problemer med autentisitet i slike tekniker (øyne) eller else av temporær konsistens (hår).

Videoen illustrerer hva VFX-kunstnere vil få etter en typisk moderne ansiktsfangstsessjon. Øyne, hår, ansiktsbehåring og munninteriør vil alle måtte håndteres av separate lag i produksjonspipelinen.

Videoen illustrerer hva VFX-kunstnere vil få etter en typisk moderne ansiktsfangstsessjon. Øyne, hår, ansiktsbehåring og munninteriør vil alle måtte håndteres av separate lag i produksjonspipelinen, i tillegg til tekstur og lys.

Belysningskontroll

Den hybridtilnærmingen er også en fordel med relighting – en merkbart utfordring for neuralt rendering av ansikter, siden CGI-hudoverlager kan være mer enkelt å relighte.

En animert versjon av CGI/Neuralt-tilnærmingen.

En animert versjon av CGI/Neuralt-tilnærmingen.

I mer utfordrende miljøer, som eksteriørinnspillinger, har forskerne utviklet en metode for å male inn rundt en slags demilitarisert sone rundt personen som blir ‘skapt’.

En svart margin genereres for å tillate en 'canvas' for å male inn de ytre delene av identiteten og integrere CGI-huden i den kombinerede CGI/neurale utgangen.

En svart margin genereres for å tillate en ‘canvas’ for å male inn de ytre delene av identiteten og integrere CGI-huden i den kombinerede CGI/neurale utgangen.

Videoen bemerker:

‘[Den] neurale renderingen matcher ikke bakgrunnsbegrensningen perfekt. – det er kun ment som en guide, siden optimalisering for realistiske menneskelige komponenter som hår, øyne og tenner er hovedmålet. Mer utfordrende er å prøve å opprettholde en konsistent identitet, mens man endrer miljølysningen.’

Opprettelse av CGI-Mesh fra Neurale Renderinger

Forskningsgruppen har også utviklet en variasjonsautoencoder trent på en (uspesifisert) stor database av 3D-ansiktsbilder, og hevder at den kan produsere ’tilfeldige men plausiblene’ 3D-ansiktsmesh fra grunnfakta.

Det er begrensninger for denne forskningen å overvinne, inkludert vanskeligheten med å få hår til å forbli temporært konsistent i neurale renderinger, og videoen (se nedenfor) viser flere eksempler på raskt muterende hår i en ellers konsistent panorering av en CGI/neuralt ansikt.

Temporær konsistens i neuralt videorendering er et langt videre problem enn bare Disneys, og det ser ut til at senere iterasjoner av dette systemet kan gå over til å legge til hår ‘i post’, eller andre mulige tilnærminger til hårgenerering enn å håpe at en ny neuralt tilnærming vil løse det.

Bruk til Datasettgenerering

Metoden foreslås også som en potensiell metode for å generere syntetiske data, og å berike ansiktsbildeforholdet, som i de siste årene har blitt farlig monoton.

Disney forestiller seg den nye teknikken populerer ansiktsbildeforholdet.

Disney forestiller seg den nye teknikken populerer ansiktsbildeforholdet.

‘[Hver] fotorealistisk resultat vi genererer har en underliggende korresponderende geometri, og utseendekart, renderet fra ukjente kamerautsikt med kjent lys. Denne ‘grunnfakta’-informasjonen kan være vital for å trene nedstrømsapplikasjoner, som monokulær, 3D-ansiktsrekonstruksjon, ansiktsgjenkjenning eller sceneforståelse. Og så hver resultatrender kan betraktes som en datasample, og vi kan generere mange variasjoner av mange forskjellige individer.

‘Fortsatt, selv for en enkelt person renderet i en enkelt uttrykk med en enkelt utsikt og lys, kan vi generere tilfeldige variasjoner av foto-real render ved å variere tilfeldighetsfrøet under optimalisering.’

Forskerne bemerker at denne mangfoldigheten av konfigurerbar utgang kan være nyttig i å trene ansiktsgjenkjenningapplikasjoner, og konkluderer:

‘[Vår] metode er i stand til å utnytte nåværende teknologi for ansikts hudfangst, modellering og rendering, og automatisk skape komplette fotorealistiske ansiktsrenderinger som matcher den ønskede identiteten, uttrykket og scenekonfigurasjonen. Denne tilnærmingen har anvendelser og ansiktsrendering for film og underholdning, og sparer manuelt arbeid for kunstnere, og også for datagenerering i forskjellige områder av dyp læring.’

For en dypere titt på den nye tilnærmingen, se den 10-minutters videoen som er sluppet i dag:

 * Den opprinnelige videoen ble erstattet med en annen tilsynelatende identisk en 8 timer etter at denne artikkelen ble publisert. Jeg endret alle relevante lenker, da det ikke er noen spor av den opprinnelige videoen.

 

8:24 GMT+2 – Erstattet videoen, da den ble byttet ut av Disney Research YouTube-kanalen av en eller annen grunn.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai