Andersons hoek

Disney combineert CGI met neurale rendering om het ‘Uncanny Valley’-effect aan te pakken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Disney’s AI-onderzoeksafdeling heeft een hybride methode ontwikkeld voor gezichtsimulatie van filmkwaliteit, waarbij de voordelen van neurale gezichtsrendering worden gecombineerd met de consistentie van een op CGI gebaseerde aanpak.

Het nog te verschijnen artikel draagt de titel Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering en wordt gepresenteerd in een nieuwe video van 10 minuten op het Disney Research YouTube-kanaal (ingesloten aan het einde van dit artikel*).

Meshes gecombineerd met neurale gezichtsrenderingen. Bron: https://www.youtube.com/watch?v=TwpLqTmvqVk

Meshes gecombineerd met neurale gezichtsrenderingen. Zie de video‑embed aan het einde van het artikel voor meer detail en kwaliteit. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Zoals de video aangeeft, kan neural rendering van gezichten (inclusief deepfakes) veel realistischer ogen en mondinterieurs produceren dan CGI kan, terwijl door CGI gegenereerde gezichts‑texturen consistenter en geschikter zijn voor VFX‑productie op filmniveau.

Daarom experimenteert Disney met het laten verwerken van de omringende kenmerken van een gezicht en de ‘levenskritieke’ elementen zoals ogen door NVIDIA’s StyleGan2 neurale generator, terwijl consistente CGI‑gezichtshuid en gerelateerde elementen in de output worden overlegd.

Uit de video (zie einde van het artikel), het architecturale concept achter Disney's hybride aanpak, waarbij een ouderwetse CGI‑mesh, van het type dat werd gebruikt om een 'jonge' Carrie Fisher en de overleden Peter Cushing voor Rogue One (2016) te recreëren, wordt geïntegreerd in neurale gezichtsomgevingen.

Uit de video (zie einde van het artikel), het architecturale concept achter Disney’s hybride aanpak, waarbij een ouderwetse CGI‑mesh, van het type dat werd gebruikt om een ‘jonge’ Carrie Fisher en de overleden Peter Cushing voor Rogue One (2016) te recreëren, wordt geïntegreerd in neurale gezichtsomgevingen.

De video maakt een impliciete verwijzing naar de frequente kritiek op de onechtheid en het ‘uncanny valley’-effect van de CGI-recreatie van de inmiddels overleden Britse Star Wars-acteur Peter Cushing in Rogue One (2016), en geeft toe:

‘[Er] is nog steeds een enorme kloof tussen wat mensen gemakkelijk kunnen vastleggen en renderen en uiteindelijke fotorealistische digitale dubbels, compleet met haar, ogen en binnenkant van de mond. Om deze kloof te overbruggen, is meestal veel handmatig werk van bekwame artiesten nodig.’

In werkelijkheid proberen zelfs de meest moderne gezichts‑capturesystemen niet eens ogen, mondinterieurs of haar te recreëren, die respectievelijk problemen hebben met authenticiteit (ogen) of met temporele consistentie (haar).

De video toont wat VFX‑artiesten zullen ontvangen na een typische moderne gezichts‑capturesessie. Ogen, haar, gezichtsbeharing en mondinterieurs moeten allemaal door afzonderlijke teams in de productiepijplijn worden afgehandeld.

De video toont wat VFX‑artiesten zullen ontvangen na een typische moderne gezichts‑capturesessie. Ogen, haar, gezichtsbeharing en mondinterieurs moeten allemaal door afzonderlijke teams in de productiepijplijn worden afgehandeld, naast texturering en belichting.

Verlichtingscontrole

De hybride aanpak biedt ook voordeel bij het opnieuw belichten – een opvallende uitdaging voor neurale rendering van gezichten, aangezien CGI‑huidoverlays gemakkelijker opnieuw belicht kunnen worden.

Een geanimeerde versie van de CGI/Neurale aanpak.

Een geanimeerde versie van de CGI/Neurale aanpak.

In meer uitdagende omgevingen, zoals buitenscènes, hebben de onderzoekers een methode ontwikkeld om in te vullen rondom een soort gedemilitariseerde zone rond de persoon die wordt ‘gecreëerd’.

Er wordt een zwarte marge gegenereerd om een 'canvas' te bieden voor het inpainten van de buitenste delen van de identiteit en het integreren van de CGI‑huid in de gecombineerde CGI/neurale output.

Er wordt een zwarte marge gegenereerd om een ‘canvas’ te bieden voor het inpainten van de buitenste delen van de identiteit en het integreren van de CGI‑huid in de gecombineerde CGI/neurale output.

‘[De] neurale render komt niet perfect overeen met de achtergrondbeperking. – het is alleen bedoeld als richtlijn, aangezien optimalisatie voor realistische menselijke componenten zoals haar, ogen en tanden het belangrijkste doel is. Uitdagender is het proberen een consistente identiteit te behouden, terwijl de verlichting van de omgeving wordt veranderd.’

CGI‑meshes maken vanuit neurale renders

Het onderzoeksteam heeft ook een variational autoencoder ontwikkeld, getraind op een (niet gespecificeerde) grote database van 3D‑gezichtsafbeeldingen, en beweert dat deze ‘willekeurige maar plausibele’ 3D‑gezichtsmeshes kan genereren vanuit ground‑truth‑data.

Er zijn beperkingen die dit onderzoek moet overwinnen, waaronder de moeilijkheid om haar temporeel consistent te houden in de neurale renders, en de video (zie hieronder) toont verschillende voorbeelden van snel muterend haar in een verder consistente pan rond een CGI/neurale gezicht.

Temporale consistentie in neurale video‑rendering is een veel groter probleem dan alleen dat van Disney, en het lijkt waarschijnlijk dat latere iteraties van dit systeem zullen terugvallen op het toevoegen van haar ‘in post’, of diverse andere mogelijke benaderingen voor haar‑generatie, in plaats van te hopen dat een nieuwe neurale aanpak dit uiteindelijk zal oplossen.

Toepassingen voor datasetgeneratie

De methode wordt ook voorgesteld als een potentiële manier om synthetische data te genereren en het landschap van gezichtsbeeldsets te verrijken, dat de afgelopen jaren gevaarlijk eentonig is geworden.

Disney voorziet dat de nieuwe techniek gezichtsbeelddatasets zal vullen.

Disney voorziet dat de nieuwe techniek gezichtsbeelddatasets zal vullen.

‘[Elke] fotorealistische uitkomst die we genereren heeft een onderliggende corresponderende geometrie en appearance‑maps, gerenderd vanuit onbekende camerahoeken met bekende verlichting. Deze ‘ground truth’-informatie kan van vitaal belang zijn voor het trainen van downstream‑applicaties, zoals monocale 3D‑gezichtsreconstructie, gezichtsherkenning of scene‑understanding. En dus kan elke render worden beschouwd als een datamonster, en we kunnen veel variaties genereren van vele verschillende individuen.’

‘Bovendien kunnen we zelfs voor één persoon, gerenderd in één uitdrukking met één kijkhoek en verlichting, willekeurige variaties van de fotorealistische render genereren door de randomisatie‑seed tijdens optimalisatie te variëren.’

De onderzoekers merken op dat deze diversiteit aan configureerbare output nuttig kan zijn bij het trainen van gezichtsherkenningsapplicaties, en concluderen:

‘[Onze] methode kan gebruikmaken van de huidige technologie voor het vastleggen, modelleren en renderen van gezichts‑huid, en automatisch volledige fotorealistische gezichts‑renders creëren die overeenkomen met de gewenste identiteit, uitdrukking en scène‑configuratie. Deze aanpak heeft toepassingen in gezichts‑rendering voor film en entertainment, waardoor handmatig werk voor artiesten wordt bespaard, en ook voor datageneratie in verschillende domeinen van deep learning.’

Voor een dieper inzicht in de nieuwe aanpak, bekijk de 10‑minuten video die vandaag is uitgebracht:

 * De oorspronkelijke videolink werd 8 uur na publicatie van dit artikel vervangen door een ogenschijnlijk identieke link. Ik heb alle relevante links aangepast, aangezien er geen spoor meer is van de originele video.

 

8:24 GMT+2 – Video vervangen, omdat deze om een of andere reden door het Disney Research YouTube‑kanaal is verwisseld.

Schrijver over machine learning, domeinspecialist in menselijke beeldsynthetisatie. Voormalig hoofd van onderzoekscontent bij Metaphysic.ai, tot de ontbinding ervan in DNEG's Brahma.ai.
Website: martinanderson.ai
Contact: martin@martinanderson.ai