Andersons vinkel
Disney kombinerar CGI med neuralt rendering för att tackla ‘uncanny valley’

Disneys AI-forskningsavdelning har utvecklat en hybridmetod för ansiktsimulering av filmkvalitet, som kombinerar fördelarna med neuralt ansiktsrendering med konsistensen i ett CGI-baserat tillvägagångssätt.
Den pågående artikeln har titeln Rendera med stil: Kombinera traditionella och neurala metoder för högkvalitativ ansiktsrendering, och förhandsvisas i en ny 10‑minuters video på Disney Research YouTube‑kanal (inbäddad i slutet av den här artikeln*).

Meshes combined with neural facial renders. See video embed at end of article for better detail and quality. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk
Som videon påpekar, neural rendering av ansikten (inklusive deepfakes) kan producera mycket mer realistiska ögon och muninteriörer än vad CGI kan, medan CGI‑drivna ansikts‑texturer är mer konsekventa och lämpliga för VFX på biografisk nivå.
Därför experimenterar Disney med att låta NVIDIA:s StyleGan2 neurala generator hantera de omgivande funktionerna i ett ansikte och de ‘livsviktiga’ elementen såsom ögon, samtidigt som en konsekvent CGI‑ansiktshud och relaterade element läggs över i resultatet.

From the video (see end of article), the architectural concept behind Disney’s hybrid approach, where an old-school CGI mesh, of the type used to recreate ‘young’ Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.
Videon gör en tyst referens till den ofta förekommande kritiken av den oautentiska och ‘uncanny valley’-effekten i CGI‑rekonstruktionen av den avlidne brittiska Star Wars‑aktören Peter Cushing i Rogue One (2016), och medger:
‘[Det finns] fortfarande ett enormt gap mellan vad folk enkelt kan fånga och rendera jämfört med slutgiltiga fotorealistiska digitala dubletter, kompletta med hår, ögon och inre mun. För att överbrygga detta gap krävs vanligtvis mycket manuellt arbete från skickliga artister.’
Faktum är att även de mest moderna ansiktsfångstsystemen inte ens försöker återskapa ögon, muninteriörer eller hår, vilket antingen har autenticitetsproblem i sådana tekniker (ögon) eller brist på tidsmässig konsistens (hår).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline, in addition to texturing and lighting.
Illumination Control
Den hybridmetoden är också en fördel vid ombelysning – en betydande utmaning för neuralt renderande av ansikten, eftersom CGI‑hudöverlagringar kan ombelysas mycket enklare.

An animated version of the CGI/Neural approach.
I mer utmanande miljöer, såsom utomhusfilmning, har forskarna utvecklat en metod för inpainting runt en slags demilitariserad zon kring personen som ‘skapas’.

A black margin is generated to allow a ‘canvas’ for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.
Videon noterar:
‘[Den] neurala renderingen matchar inte bakgrundsrestriktionen perfekt. – den är bara avsedd som en guide, eftersom optimering för realistiska mänskliga komponenter som hår, ögon och tänder är huvudmålet. En större utmaning är att försöka behålla en konsekvent identitet, samtidigt som miljöbelysningen förändras.’
Creating CGI Meshes From Neural Renders
Forskarteamet har också utvecklat en variational autoencoder tränad på en (ospecificerad) stor databas med 3D‑ansiktsbilder, och hävdar att den kan producera ‘slumpmässiga men plausibla’ 3D‑ansiktsmeshar från ground‑truth‑data.
Det finns begränsningar som forskningen måste övervinna, inklusive svårigheten att få håret att förbli tidsmässigt konsistent i de neurala renderingarna, och videon (se nedan) visar flera exempel på snabbt muterande hår i en annars konsekvent panorering runt ett CGI/neuronalt ansikte.
Tidsmässig konsistens i neurala videorenderingar är ett mycket bredare problem än bara Disneys, och det verkar sannolikt att senare iterationer av detta system kan ta till att lägga till hår ‘i efterbearbetning’, eller andra möjliga metoder för hårgenerering snarare än att hoppas att en ny neural metod så småningom löser det.
Uses for Dataset Generation
Metoden föreslås även som en potentiell metod för att generera syntetisk data och berika landskapet av ansiktsbildsamlingar, som de senaste åren har blivit farligt monotona.
Disney envisages the new technique populating facial image datasets.
‘[Varje] fotorealistiskt resultat vi genererar har en underliggande motsvarande geometri och utseendemappar, renderade från okända kameraperspektiv med känd belysning. Denna ‘ground truth’-information kan vara avgörande för att träna nedströmsapplikationer, såsom monokulär 3D‑ansiktsrekonstruktion, ansiktsigenkänning eller scenförståelse. Således kan varje renderad resultat betraktas som ett dataprovs, och vi kan generera många variationer av många olika individer.
‘Dessutom, även för en enda person renderad i ett enda uttryck med en enda vy och belysning, kan vi generera slumpmässiga variationer av den fotorealistiska renderingen genom att variera randomiseringsfröet under optimeringen.’
Forskarnas noterar att denna mångfald av konfigurerbar output kan vara användbar vid träning av ansiktsigenkänningsapplikationer, och avslutar:
‘[Vår] metod kan utnyttja befintlig teknik för ansiktshudfångst, modellering och rendering, och automatiskt skapa kompletta fotorealistiska ansiktsrenderingar som matchar önskad identitet, uttryck och scenkonfiguration. Detta tillvägagångssätt har tillämpningar inom ansiktsrendering för film och underhållning, sparar manuellt arbete för artister och även för datagenerering inom olika områden av djupinlärning.’
För en djupare titt på den nya metoden, se den 10‑minuters video som släpptes idag:
https://www.unite.ai/wp-content/uploads/2021/11/dataset-generation.jpg
* Den ursprungliga videolänken ersattes med en annan som uppenbarligen var identisk 8 timmar efter att artikeln publicerades. Jag ändrade alla relevanta länkar, eftersom det inte finns någon spår av den ursprungliga videon.
8:24 GMT+2 – Video ersattes, eftersom den byttes ut av Disney Research YouTube‑kanalen av någon anledning.












