Kąt Andersona
Disney łączy CGI z renderowaniem neuronowym, aby rozwiązać problem “dolinę niezgodności”

Dział badawczy Disneya opracował hybrydową metodę symulacji twarzy o jakości filmowej, łącząc zalety renderowania neuronowego twarzy z konzystencją podejścia opartego na CGI.
Czekający na publikację artykuł nosi tytuł Renderowanie z stylem: łączenie tradycyjnych i neuronowych podejść do renderowania twarzy o wysokiej jakości, a jego zapowiedź można zobaczyć w nowym 10-minutowym filmie na kanale Disney Research YouTube (wklejonym na końcu tego artykułu*).

Siataki połączone z neuronowymi renderowaniami twarzy. Zobacz wklejony film na końcu artykułu, aby zobaczyć lepsze szczegóły i jakość. Źródło: https://www.youtube.com/watch?v=k-RKSGbWLng (zastąpiony przez https://www.youtube.com/watch?v=TwpLqTmvqVk)
Jak podkreśla film, renderowanie neuronowe twarzy (w tym deepfakes) może wygenerować bardziej realistyczne oczy i wnętrza ust niż CGI, natomiast tekstury twarzy oparte na CGI są bardziej konzistentne i nadają się do efektów wizualnych na poziomie kinowym.
Dlatego też Disney eksperymentuje z wykorzystaniem generatora neuronowego NVIDIA StyleGan2 do obsługi otaczających cech twarzy i “życiowo ważnych” elementów, takich jak oczy, oraz nakładania konzistentnych tekstur twarzy opartych na CGI na wyjściu.

Z filmu (zobacz koniec artykułu), koncepcja architektoniczna hybrydowego podejścia Disneya, gdzie siatka CGI, tego samego rodzaju, który został wykorzystany do odtworzenia ‘młodej’ Carrie Fisher i zmarłego Petera Cushinga w Rogue One (2016), jest integrowana ze środowiskiem renderowania neuronowego twarzy.
Film zawiera niejawne odniesienie do częstej krytyki nieautentyczności i efektu “dolinę niezgodności” w CGI-rekonstrukcji zmarłego brytyjskiego aktora Star Wars Petera Cushinga w Rogue One (2016), przyznając:
‘[Jeszcze] istnieje ogromna luka między tym, co ludzie mogą łatwo przechwytywać i renderować, a ostatecznymi fotorealistycznymi cyfrowymi dublerami, w pełni wyposażonymi w włosy, oczy i wnętrza ust. Zamknięcie tej luki zazwyczaj wymaga dużej ilości ręcznej pracy wykwalifikowanych artystów.’
W rzeczywistości nawet najnowocześniejsze systemy przechwytywania twarzy nie próbują odtworzyć oczu, wnętrz ust ani włosów, które albo mają problemy z autentycznością w takich technikach (oczy), albo są niezgodne pod względem czasowym (włosy).

Film ilustruje to, co artyści VFX otrzymają po typowej nowoczesnej sesji przechwytywania twarzy. Oczy, włosy, broda i wnętrza ust będą musiały być obsługiwane przez oddzielne zespoły w pipeline produkcyjnym, oprócz tekstur i oświetlenia.
Kontrola oświetlenia
Hybrydowe podejście jest również korzystne w przypadku prześwietlenia – znaczącego wyzwania dla renderowania neuronowego twarzy, ponieważ nakładki skóry CGI mogą być łatwiej prześwietlone.

Animowana wersja podejścia CGI/Neuronowego.
W bardziej wymagających środowiskach, takich jak zewnętrzne zdjęcia, badacze opracowali metodę wypełniania wokół rodzaju strefy zdemilitaryzowanej wokół osoby “tworzonej”.

Generowany jest czarny margines, aby umożliwić “płótno” do wypełniania zewnętrznych części tożsamości i integrowania skóry CGI z połączonym wyjściem CGI/neuronowym.
Film zauważa:
‘[Renderowanie] neuronowe nie odpowiada idealnie ograniczeniom tła. – jest to tylko przewodnik, ponieważ optymalizacja dla realistycznych ludzkich składników, takich jak włosy, oczy i zęby, jest głównym celem. Bardziej wymagające jest utrzymanie spójnej tożsamości podczas zmiany oświetlenia środowiska.’
Tworzenie siatek CGI z renderowań neuronowych
Zespół badawczy opracował również autoencoder wariancji przeszkolony na (nieokreślonej) dużej bazie danych 3D twarzy i twierdzi, że może wygenerować “losowe, ale prawdopodobne” siatki 3D twarzy z danych rzeczywistych.
Istnieją ograniczenia, które należy pokonać, w tym trudność w utrzymaniu włosów w sposób spójny w czasie w renderowaniach neuronowych, a film (zobacz poniżej) pokazuje kilka przykładów szybko mutujących włosów w innym przypadku spójnego obrotu wokół twarzy CGI/neuronowej.
Spójność w czasie renderowania neuronowego jest znacznie szerszym problemem niż tylko Disneya, i wydaje się prawdopodobne, że późniejsze wersje tego systemu mogą się odwołać do dodania włosów “w postprodukcji” lub innych podejść do generowania włosów niż oczekiwanie, że nowe podejście neuronowe w końcu rozwiąże ten problem.
Zastosowania do generowania zbiorów danych
Metoda ta jest również proponowana jako potencjalna metoda generowania syntetycznych danych i wzbogacania krajobrazu obrazów twarzy, który w ostatnich latach stał się niebezpiecznie monotonny.

Disney wyobraża sobie nową technikę zaludniania zbiorów danych twarzy.
‘[Każdy] fotorealistyczny wynik, który generujemy, ma podstawową geometrię i mapy wyglądu, renderowane z nieznanych punktów widzenia z znanym oświetleniem. Ta “rzeczywista” informacja może być niezwykle ważna dla szkolenia aplikacji podrzędnych, takich jak monocularna, 3D rekonstrukcja twarzy, rozpoznawanie twarzy lub zrozumienie sceny. I tak każdy wynik renderowania może być uważany za próbkę danych, a my możemy generować wiele wariacji różnych osób.
‘Ponadto, nawet dla jednej osoby renderowanej w jednym wyrażeniu z jednym punktem widzenia i oświetleniem, możemy wygenerować losowe wariacje foto-realistycznego renderowania, zmieniając nasiono losowości podczas optymalizacji.’
Badacze zauważają, że ta różnorodność konfigurowalnego wyjścia może być przydatna w szkoleniu aplikacji rozpoznawania twarzy, kończąc:
‘[Nasza] metoda jest w stanie wykorzystać bieżącą technologię do przechwytywania, modelowania i renderowania skóry twarzy, oraz automatycznie tworzyć pełne fotorealistyczne renderowania twarzy, które odpowiadają pożądanej tożsamości, wyrażeniu i konfiguracji sceny. To podejście ma zastosowania w renderowaniu twarzy dla filmu i rozrywki, oszczędzając ręczną pracę artystom, oraz do generowania danych w różnych dziedzinach głębokiego uczenia.’
Aby uzyskać głębszy wgląd w nowe podejście, zobacz 10-minutowy film:
* Oryginalny link do filmu został zastąpiony innym, pozornie identycznym, 8 godzin po opublikowaniu tego artykułu. Zmieniłem wszystkie odpowiednie linki, ponieważ nie ma śladu po oryginalnym filmie.
8:24 GMT+2 – Zastąpiłem film, ponieważ został on zamieniony przez kanał Disney Research YouTube z jakiegoś powodu.












