Andersons vinkel

Disney kombinerar CGI med neural rendering för att tackla “Uncanny Valley”

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Disneys AI-forskningsavdelning har utvecklat en hybridmetod för filmkvalitetsansiktsanimation, som kombinerar styrkorna hos ansiktsneuralt rendering med konsekvensen av en CGI-baserad approach.

Den väntade artikeln har titeln Rendering med stil: Kombinera traditionella och neurala metoder för högkvalitativ ansiktsrendering, och visas i en ny 10-minutersvideo på Disney Research YouTube-kanal (inbäddad i slutet av den här artikeln*).

Nät kombinerade med neuralt ansiktsrendering. Källa: https://www.youtube.com/watch?v=k-RKSGbWLng

Nät kombinerade med neuralt ansiktsrendering. Se videoinbäddning i slutet av artikeln för bättre detalj och kvalitet. Källa: https://www.youtube.com/watch?v=k-RKSGbWLng (ersatt av https://www.youtube.com/watch?v=TwpLqTmvqVk)

Som videon påpekar kan neuralt rendering av ansikten (inklusive deepfakes) producera mer realistiska ögon och muninteriörer än CGI kan, medan CGI-drivna ansiktstexter är mer konsekventa och lämpliga för cinema-nivå VFX-utdata.

Därför experimenterar Disney med att låta NVIDIAs StyleGan2 neurala generator hantera omgivande funktioner i ett ansikte och “livskritiska” element som ögon, medan de överlagrar konsekventa CGI-ansiktshud och relaterade element i utdata.

Från videon (se slutet av artikeln), den arkitektoniska konceptet bakom Disneys hybridapproach, där en gammaldags CGI-nät, av den typ som användes för att återskapa

Från videon (se slutet av artikeln), den arkitektoniska konceptet bakom Disneys hybridapproach, där en gammaldags CGI-nät, av den typ som användes för att återskapa “ung” Carrie Fisher och den avlidne Peter Cushing för Rogue One (2016), integreras i neuralt renderade ansiktsmiljöer.

Videon gör en tyst referens till den frekventa kritiken av den oäkta och “uncanny valley”-effekten av CGI-återgestaltningen av den avlidne brittiska Star Wars-skådespelaren Peter Cushing i Rogue One (2016), och medger:

‘[Det finns fortfarande] ett stort gap mellan vad människor kan enkelt fånga och rendera versus slutgiltiga fotorealistiska digitala dubletter, komplett med hår, ögon och inre mun. För att stänga detta gap krävs det vanligtvis mycket manuellt arbete från skickliga konstnärer.’

I själva verket försöker inte ens de mest moderna ansiktscapturing-systemen återskapa ögon, muninteriörer eller hår, som antingen har problem med autenticitet i sådana tekniker (ögon) eller också med tidsmässig konsekvens (hår).

Videon visar vad VFX-artister kommer att få efter en typisk modern ansiktscapturing-session. Ögon, hår, ansiktsbehåring och muninteriörer kommer alla att hanteras av separata team i produktionspipelinen.

Videon visar vad VFX-artister kommer att få efter en typisk modern ansiktscapturing-session. Ögon, hår, ansiktsbehåring och muninteriörer kommer alla att hanteras av separata team i produktionspipelinen, utöver texturering och belysning.

Belysningskontroll

Den hybridapproach är också en fördel med om-belysning – en noterbar utmaning för neuralt rendering av ansikten, eftersom CGI-hudöverlagringar kan belysas mer lätt.

En animerad version av CGI/Neural-approachen.

En animerad version av CGI/Neural-approachen.

I mer utmanande miljöer, som utomhusinspelningar, har forskarna utvecklat en metod för att måla omkring en sorts demilitariserad zon runt personen som “skapas”.

En svart marginal genereras för att tillåta en

En svart marginal genereras för att tillåta en “canvas” för att måla om de yttre delarna av identiteten och integrera CGI-huden i den kombinerade CGI/neurala utdata.

Videon påpekar:

‘[Det neurala renderingsresultatet] matchar inte bakgrundsrestriktionen perfekt. – det är bara menat som en guide, eftersom optimering för realistiska mänskliga komponenter som hår, ögon och tänder är det primära målet. Mer utmanande är att försöka upprätthålla en konsekvent identitet, medan man ändrar miljöbelysningen.’

Skapande av CGI-nät från neuralt rendering

Forskningsgruppen har också utvecklat en variational autoencoder som tränats på en (ospecificerad) stor databas med 3D-ansiktsbilder, och hävdar att den kan producera “slumpmässiga men trovärdiga” 3D-ansiktsnät från grunddata.

Det finns begränsningar för denna forskning att övervinna, inklusive svårigheten att få hår att förbli tidsmässigt konsekvent i de neurala renderingarna, och videon (se nedan) visar flera exempel på snabbt muterande hår i en annars konsekvent panorering av ett CGI/neuralt ansikte.

Tidsmässig konsekvens i neuralt videorendering är ett mycket bredare problem än bara Disneys, och det verkar troligt att senare iterationer av detta system kan använda sig av att lägga till hår “i post”, eller olika andra möjliga tillvägagångssätt för hårgenerering än att hoppas att en ny neural approach kommer att lösa det.

Användningar för datasetgenerering

Metoden föreslås också som en potentiell metod för att generera syntetiska data, och berika ansiktsbildslandskapet, som under de senaste åren har blivit farligt monotont.

Disney ser den nya tekniken som en möjlig metod för att fylla ansiktsbildsdatabaser.

Disney ser den nya tekniken som en möjlig metod för att fylla ansiktsbildsdatabaser.

‘[Varje] fotorealistiskt resultat vi genererar har en underliggande geometri och utseendekartor, renderade från okända kameravinklar med känd belysning. Denna “ground truth”-information kan vara viktig för att träna nerströmsapplikationer, såsom monokulär 3D-ansiktsrekonstruktion, ansiktsigenkänning eller scenförståelse. Och så kan varje renderingsresultat anses vara en datasample, och vi kan generera många variationer av många olika individer.

‘ Dessutom, även för en enda person som renderas i en enda uttryck med en enda vy och belysning, kan vi generera slumpmässiga variationer av det fotorealistiska renderingsresultatet genom att variera slumpmässighetsseeden under optimeringen.’

Forskarna påpekar att denna mångfald av konfigurerbar utdata kan vara användbar för att träna ansiktsigenkänningsapplikationer, och avslutar:

‘[Vår] metod kan utnyttja nuvarande teknik för ansiktshudfångst, modellering och rendering, och automatiskt skapa kompletta fotorealistiska ansiktsrenderingar som matchar den önskade identiteten, uttrycket och scenkonfigurationen. Denna approach har applikationer och ansiktsrendering för film och underhållning, och sparar manuellt arbete för konstnärer, och även för datagenerering inom olika områden av djupinlärning.’

För en djupare titt på den nya approachen, se den 10-minutersvideo som släpptes idag:

* Den ursprungliga videolänken ersattes med en annan, tydligen identisk länk, 8 timmar efter att artikeln publicerades. Jag ändrade alla relevanta länkar, eftersom det inte finns någon spåra av den ursprungliga videon.

 

8:24 GMT+2 – Videolänken ersattes, eftersom den byttes ut av Disney Research YouTube-kanal av någon anledning.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai