Andersons vinkel

Disney kombinerer CGI med neuralt rendering for at tackle den ‘uncanny valley’

mm
Føj Unite.AI til dine foretrukne kilder på Google

Disneys AI-forskningsafdeling har udviklet en hybridmetode til ansigtsimulering i filmkvalitet, der kombinerer styrkerne ved neuralt ansigtsrendering med konsistensen af en CGI-baseret tilgang.

Det kommende papir har titlen Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering og er forhåndsvist i en ny 10‑minutters video på Disney Research YouTube-kanal (indlejret i slutningen af denne artikel*).

Mesh'er kombineret med neurale ansigtsrenderinger. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Mesh’er kombineret med neurale ansigtsrenderinger. Se videoindlejringen i slutningen af artiklen for bedre detaljer og kvalitet. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Som videoen bemærker, kan neural rendering af ansigter (inklusive deepfakes) producere langt mere realistiske øjne og mundinteriører end CGI kan, mens CGI-drevne ansigtsteksturer er mere konsistente og velegnede til VFX-output på biografniveau.

Derfor eksperimenterer Disney med at lade NVIDIA’s StyleGan2 neurale generator håndtere de omgivende træk ved et ansigt og de ‘livsvigtige’ elementer som øjne, mens konsistent CGI-ansigtshud og relaterede elementer overlejres i outputtet.

Fra videoen (se slutningen af artiklen), det arkitektoniske koncept bag Disneys hybride tilgang, hvor et gammeldags CGI-mesh, af den type der blev brugt til at genskabe den 'unge' Carrie Fisher og den afdøde Peter Cushing til Rogue One (2016), integreres i neuralt renderede ansigtsmiljøer.

Fra videoen (se slutningen af artiklen), det arkitektoniske koncept bag Disneys hybride tilgang, hvor et gammeldags CGI-mesh, af den type der blev brugt til at genskabe den ‘unge’ Carrie Fisher og den afdøde Peter Cushing til Rogue One (2016), integreres i neuralt renderede ansigtsmiljøer.

Videoen refererer tacit til den hyppige kritik af den uautentiske og ‘uncanny valley’-effekt ved CGI-genskabelsen af den afdøde britiske Star Wars‑skuespiller Peter Cushing i Rogue One (2016), og indrømmer:

‘[Der er] stadig et enormt hul mellem hvad folk let kan fange og renderere versus endelige fotorealistiske digitale dobbeltgængere, komplette med hår, øjne og indre mund. For at lukke dette hul kræver det normalt meget manuelt arbejde fra dygtige kunstnere.’

Faktisk forsøger selv de mest moderne ansigtsoptagelsessystemer ikke at genskabe øjne, mundinteriører eller hår, som enten har autenticitetsproblemer i sådanne teknikker (øjne) eller problemer med tidsmæssig konsistens (hår).

Videoen illustrerer, hvad VFX‑kunstnere får efter en typisk moderne ansigtsoptagelsessession. Øjne, hår, ansigtshår og mundinteriører skal alle håndteres af separate hold i produktionspipeline.

Videoen illustrerer, hvad VFX‑kunstnere får efter en typisk moderne ansigtsoptagelsessession. Øjne, hår, ansigtshår og mundinteriører skal alle håndteres af separate hold i produktionspipeline, ud over teksturering og belysning.

Illumination Control

Den hybride tilgang er også en fordel ved genbelysning – en betydelig udfordring for neuralt rendering af ansigter, da CGI‑hudoverlejringer kan genbelyses lettere.

En animeret version af CGI/Neural-tilgangen.

En animeret version af CGI/Neural-tilgangen.

I mere udfordrende miljøer, såsom udendørsoptagelser, har forskerne udviklet en metode til inpainting omkring en slags demilitariseret zone omkring den person, der ‘skabes’.

En sort margen genereres for at give et 'lærred' til inpainting af identitetens ydre dele og integration af CGI‑hud i den kombinerede CGI/neuronale output.

En sort margen genereres for at give et ‘lærred’ til inpainting af identitetens ydre dele og integration af CGI‑hud i den kombinerede CGI/neuronale output.

‘[Den] neurale rendering matcher baggrundsbegrænsningen ikke perfekt. – den er kun ment som en vejledning, da optimering for realistiske menneskelige komponenter som hår, øjne og tænder er hovedmålet. En større udfordring er at forsøge at bevare en konsistent identitet, mens miljøbelysningen ændres.’

Creating CGI Meshes From Neural Renders

Forskningsholdet har også udviklet en variational autoencoder trænet på en (uspecificeret) stor database af 3D‑ansigtsbilleder og hævder, at den kan producere ’tilfældige men plausible’ 3D‑ansigtsmesh’er ud fra ground‑truth‑data.

Der er begrænsninger, som denne forskning skal overvinde, herunder vanskeligheden ved at få håret til at forblive tidsmæssigt konsistent i de neurale renders, og videoen (se nedenfor) viser flere eksempler på hurtigt muterende hår i en ellers konsistent panorering omkring et CGI/neuronalt ansigt.

Tidsmæssig konsistens i neurale videorenderinger er et langt bredere problem end kun Disneys, og det virker sandsynligt, at senere iterationer af dette system kan ty til at tilføje hår ‘i efterbehandlingen’ eller andre mulige tilgange til hårgenerering i stedet for at håbe på, at en ny neural metode til sidst vil løse det.

Uses for Dataset Generation

Metoden foreslås også som en potentiel metode til at generere syntetiske data og berige landskabet af ansigtsbilledsæt, som i de senere år er blevet farligt monotont.

Disney forestiller sig, at den nye teknik befolker ansigtsbilleddatasæt.

Disney forestiller sig, at den nye teknik befolker ansigtsbilleddatasæt.

‘[Hvert] fotorealistisk resultat vi genererer har en underliggende tilsvarende geometri og udseendemaps, renderet fra ukendte kameravinkler med kendt belysning. Denne ‘ground truth’-information kan være afgørende for træning af efterfølgende applikationer, såsom monokulær 3D‑ansigtsrekonstruktion, ansigtsgenkendelse eller sceneforståelse. Således kan hver render betragtes som en datasample, og vi kan generere mange variationer af mange forskellige individer.’

‘[Derudover] selv for en enkelt person renderet i et enkelt udtryk med en enkelt vinkel og belysning, kan vi generere tilfældige variationer af den fotorealistiske render ved at variere randomiseringsfrøet under optimeringen.’

‘[Vores] metode er i stand til at udnytte den nuværende teknologi til ansigtshudoptagelse, modellering og rendering, og automatisk skabe komplette fotorealistiske ansigtsrenders, der matcher den ønskede identitet, udtryk og scenekonfiguration. Denne tilgang har anvendelser inden for ansigtsrendering til film og underholdning, sparer manuel kunstnerarbejde, samt til datagenerering i forskellige felter inden for dyb læring.’

For et dybere kig på den nye tilgang, se den 10‑minutters video, der blev udgivet i dag:

* Det oprindelige videolink blev erstattet med et tilsyneladende identisk link 8 timer efter, at denne artikel blev offentliggjort. Jeg har ændret alle relevante links, da der ikke er nogen spor af den oprindelige video.

 

8:24 GMT+2 – Video erstattet, da den blev udskiftet af Disney Research YouTube-kanalen af en eller anden grund.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai