Andersons vinkel
Disney kombinerer CGI med neuralt rendering for at tackle “Uncanny Valley”

Disneys AI-forskningsafdeling har udviklet en hybridmetode til filmkvalitetsansigtsimulation, der kombinerer styrkerne fra ansigtsneuralt rendering med konsistensen af en CGI-baseret tilgang.
Den ventede artikel har titlen Rendering med Stil: Kombination af traditionelle og neurale tilgange for højkvalitetsansigtsrendering, og er forhåndsvist i en ny 10-minutters video på Disney Research YouTube-kanalen (indlejret i slutningen af denne artikel*).

Meshes kombineret med neurale ansigtsrenderinger. Se videoindlejring i slutningen af artiklen for bedre detalje og kvalitet. Kilde: https://www.youtube.com/watch?v=k-RKSGbWLng (erstattet af https://www.youtube.com/watch?v=TwpLqTmvqVk)
Som videoen bemærker, kan neuralt rendering af ansigter (herunder deepfakes) producere langt mere realistiske øjne og mundindhold end CGI er i stand til, mens CGI-drevne ansigtsteksturer er mere konsistente og egnede til cinema-niveau VFX-udgang.
Derfor eksperimenterer Disney med at lade NVIDIAs StyleGan2 neurale generator håndtere de omgivende træk af et ansigt og de ‘livskritiske’ elementer som øjne, mens de lægger konsistente CGI-ansigtshud og relaterede elementer ind i udgangen.

Fra videoen (se slutningen af artiklen), den arkitektoniske koncept bag Disneys hybridtilgang, hvor en gammeldags CGI-mesh, af den type der blev brugt til at genskabe ‘ung’ Carrie Fisher og den afdøde Peter Cushing til Rogue One (2016), integreres i neuralt-renderede ansigtsmiljøer.
Videoen gør en underforstået henvisning til hyppig kritik af den uægte og ‘uncanny valley’-effekten af CGI-genskabelsen af den afdøde britiske Star Wars-skuespiller Peter Cushing i Rogue One (2016), og indrømmer:
‘[Der er] stadig et enormt gap mellem, hvad folk kan lette fange og rendre, og endelige fotorealistiske digitale dobbeltgængere, komplet med hår, øjne og indre mund. For at lukke dette gap, kræver det normalt en masse manuel arbejde fra dygtige kunstnere.’
I virkeligheden gør selv de mest moderne ansigtscapture-systemer ikke engang forsøg på at genskabe øjne, mundindhold eller hår, som enten har problemer med ægthed i sådanne teknikker (øjne) eller også af temporal konsistens (hår).

Videoen viser, hvad VFX-kunstnere får efter en typisk moderne ansigtscapture-session. Øjne, hår, ansigtshår og mundindhold skal alle håndteres af separate hold i produktionsprocessen, samt tekstur og lys.
Lyskontrol
Den hybridtilgang er også en fordel med relighting – en bemærkelsesværdig udfordring for neuralt rendering af ansigter, da CGI-hudsuperpositioner kan reliters mere let.

En animeret version af CGI/Neural-tilgangen.
I mere udfordrende miljøer, såsom udendørs optagelser, har forskerne udviklet en metode til at inpainte omkring en slags demilitariseret zone omkring personen, der ‘skabes’.

En sort margin genereres for at give en ‘canvas’ til at inpainte de ydre dele af identiteten og integrere CGI-huden i den kombinerede CGI/neurale udgang.
Videoen bemærker:
‘[Den] neurale render ikke matcher baggrundsbegrænsningen perfekt. – det er kun ment som en vejledning, da optimering for realistiske menneskelige komponenter som hår, øjne og tænder er det primære mål. Endnu mere udfordrende er det at forsøge at opretholde en konsistent identitet, mens man ændrer miljøbelysningen.’
Oprettelse af CGI-Meshes fra Neurale Renderinger
Forskningsholdet har også udviklet en variationel autoencoder, der er trænet på en (uspecificeret) stor database af 3D-ansigtsbilleder, og hævder, at den kan producere ’tilfældige men plausibles’ 3D-ansigtsmeshes fra grundsandhedsdata.
Der er begrænsninger for denne forskning at overvinde, herunder vanskeligheden ved at få hår til at forblive temporalt konsistent i de neurale renderinger, og videoen (se nedenfor) viser flere eksempler på hurtigt muterende hår i en ellers konsistent panorering af et CGI/neuralt ansigt.
Temporal konsistens i neuralt videorendering er et langt større problem end blot Disneys, og det ser ud til, at senere iterationer af dette system kan føre til at tilføje hår ‘i post’, eller andre mulige tilgange til hårgenerering end at håbe, at en ny neuralt tilgang vil løse det.
Brug til Dataset-Generering
Metoden foreslås også som en potentiel metode til at generere syntetisk data og berige ansigtbilledsætlandskabet, som i de seneste år er blevet farligt ensartet.

Disney forestiller sig den nye teknik til at befolke ansigtbilledsæt.
‘[Hver] fotorealistisk resultat, vi genererer, har en underliggende korresponderende geometri og udseendekort, renderet fra ukendte kameraudsigtspunkter med kendt belysning. Denne ‘grundsandhedsinformation’ kan være vital for at træne downstream-applikationer, såsom monokulær, 3D-ansigtsrekonstruktion, ansigtsgenkendelse eller sceneforståelse. Og så kan hver rendereresultat betragtes som en datasample, og vi kan generere mange variationer af mange forskellige individer.
‘Desuden kan vi, selv for en enkelt person renderet i en enkelt udtryk med en enkelt synsvinkel og belysning, generere tilfældige variationer af den fotorealistiske render ved at variere randomiseringsfrøet under optimering.’
Forskerne bemærker, at denne diversitet af konfigurerbar udgang kan være nyttig til at træne ansigtsgenkendelsesapplikationer, og konkluderer:
‘[Vor] metode kan udnytte nuværende teknologi til ansigtshudfangning, modellering og rendering, og automatisk skabe komplette fotorealistiske ansigtsrenderinger, der matcher den ønskede identitet, udtryk og scenekonfiguration. Denne tilgang har anvendelser og ansigtsrendering til film og underholdning, hvilket sparer manuel arbejde for kunstnere og også til datagenerering i forskellige områder af dyb læring.’
For en dybere indsigt i den nye tilgang, se den 10-minutters video, der er udgivet i dag:
* Den originale videolink blev erstattet af en anden tilsyneladende identisk en 8 timer efter, at denne artikel blev offentliggjort. Jeg ændrede alle relevante links, da der ikke er nogen spor af den originale video.
8:24 GMT+2 – Erstattet video, da den blev udskiftet af Disney Research YouTube-kanalen af en eller anden grund.












