Kąt Andersona

Disney łączy CGI z renderowaniem neuronowym, aby rozwiązać problem “dolinę niezgodności”

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Dział badawczy Disneya opracował hybrydową metodę symulacji twarzy o jakości filmowej, łącząc zalety renderowania neuronowego twarzy z konzystencją podejścia opartego na CGI.

Czekający na publikację artykuł nosi tytuł Renderowanie z stylem: łączenie tradycyjnych i neuronowych podejść do renderowania twarzy o wysokiej jakości, a jego zapowiedź można zobaczyć w nowym 10-minutowym filmie na kanale Disney Research YouTube (wklejonym na końcu tego artykułu*).

Siataki połączone z neuronowymi renderowaniami twarzy. Źródło: https://www.youtube.com/watch?v=k-RKSGbWLng

Siataki połączone z neuronowymi renderowaniami twarzy. Zobacz wklejony film na końcu artykułu, aby zobaczyć lepsze szczegóły i jakość. Źródło: https://www.youtube.com/watch?v=k-RKSGbWLng (zastąpiony przez https://www.youtube.com/watch?v=TwpLqTmvqVk)

Jak podkreśla film, renderowanie neuronowe twarzy (w tym deepfakes) może wygenerować bardziej realistyczne oczy i wnętrza ust niż CGI, natomiast tekstury twarzy oparte na CGI są bardziej konzistentne i nadają się do efektów wizualnych na poziomie kinowym.

Dlatego też Disney eksperymentuje z wykorzystaniem generatora neuronowego NVIDIA StyleGan2 do obsługi otaczających cech twarzy i “życiowo ważnych” elementów, takich jak oczy, oraz nakładania konzistentnych tekstur twarzy opartych na CGI na wyjściu.

Z filmu (zobacz koniec artykułu), koncepcja architektoniczna hybrydowego podejścia Disneya, gdzie siatka CGI, tego samego rodzaju, który został wykorzystany do odtworzenia 'młodej' Carrie Fisher i zmarłego Petera Cushinga w Rogue One (2016), jest integrowana ze środowiskiem renderowania neuronowego twarzy.

Z filmu (zobacz koniec artykułu), koncepcja architektoniczna hybrydowego podejścia Disneya, gdzie siatka CGI, tego samego rodzaju, który został wykorzystany do odtworzenia ‘młodej’ Carrie Fisher i zmarłego Petera Cushinga w Rogue One (2016), jest integrowana ze środowiskiem renderowania neuronowego twarzy.

Film zawiera niejawne odniesienie do częstej krytyki nieautentyczności i efektu “dolinę niezgodności” w CGI-rekonstrukcji zmarłego brytyjskiego aktora Star Wars Petera Cushinga w Rogue One (2016), przyznając:

‘[Jeszcze] istnieje ogromna luka między tym, co ludzie mogą łatwo przechwytywać i renderować, a ostatecznymi fotorealistycznymi cyfrowymi dublerami, w pełni wyposażonymi w włosy, oczy i wnętrza ust. Zamknięcie tej luki zazwyczaj wymaga dużej ilości ręcznej pracy wykwalifikowanych artystów.’

W rzeczywistości nawet najnowocześniejsze systemy przechwytywania twarzy nie próbują odtworzyć oczu, wnętrz ust ani włosów, które albo mają problemy z autentycznością w takich technikach (oczy), albo są niezgodne pod względem czasowym (włosy).

Film ilustruje to, co artyści VFX otrzymają po typowej nowoczesnej sesji przechwytywania twarzy. Oczy, włosy, broda i wnętrza ust będą musiały być obsługiwane przez oddzielne zespoły w pipeline produkcyjnym.

Film ilustruje to, co artyści VFX otrzymają po typowej nowoczesnej sesji przechwytywania twarzy. Oczy, włosy, broda i wnętrza ust będą musiały być obsługiwane przez oddzielne zespoły w pipeline produkcyjnym, oprócz tekstur i oświetlenia.

Kontrola oświetlenia

Hybrydowe podejście jest również korzystne w przypadku prześwietlenia – znaczącego wyzwania dla renderowania neuronowego twarzy, ponieważ nakładki skóry CGI mogą być łatwiej prześwietlone.

Animowana wersja podejścia CGI/Neuronowego.

Animowana wersja podejścia CGI/Neuronowego.

W bardziej wymagających środowiskach, takich jak zewnętrzne zdjęcia, badacze opracowali metodę wypełniania wokół rodzaju strefy zdemilitaryzowanej wokół osoby “tworzonej”.

Generowany jest czarny margines, aby umożliwić

Generowany jest czarny margines, aby umożliwić “płótno” do wypełniania zewnętrznych części tożsamości i integrowania skóry CGI z połączonym wyjściem CGI/neuronowym.

Film zauważa:

‘[Renderowanie] neuronowe nie odpowiada idealnie ograniczeniom tła. – jest to tylko przewodnik, ponieważ optymalizacja dla realistycznych ludzkich składników, takich jak włosy, oczy i zęby, jest głównym celem. Bardziej wymagające jest utrzymanie spójnej tożsamości podczas zmiany oświetlenia środowiska.’

Tworzenie siatek CGI z renderowań neuronowych

Zespół badawczy opracował również autoencoder wariancji przeszkolony na (nieokreślonej) dużej bazie danych 3D twarzy i twierdzi, że może wygenerować “losowe, ale prawdopodobne” siatki 3D twarzy z danych rzeczywistych.

Istnieją ograniczenia, które należy pokonać, w tym trudność w utrzymaniu włosów w sposób spójny w czasie w renderowaniach neuronowych, a film (zobacz poniżej) pokazuje kilka przykładów szybko mutujących włosów w innym przypadku spójnego obrotu wokół twarzy CGI/neuronowej.

Spójność w czasie renderowania neuronowego jest znacznie szerszym problemem niż tylko Disneya, i wydaje się prawdopodobne, że późniejsze wersje tego systemu mogą się odwołać do dodania włosów “w postprodukcji” lub innych podejść do generowania włosów niż oczekiwanie, że nowe podejście neuronowe w końcu rozwiąże ten problem.

Zastosowania do generowania zbiorów danych

Metoda ta jest również proponowana jako potencjalna metoda generowania syntetycznych danych i wzbogacania krajobrazu obrazów twarzy, który w ostatnich latach stał się niebezpiecznie monotonny.

Disney wyobraża sobie nową technikę zaludniania zbiorów danych twarzy.

Disney wyobraża sobie nową technikę zaludniania zbiorów danych twarzy.

‘[Każdy] fotorealistyczny wynik, który generujemy, ma podstawową geometrię i mapy wyglądu, renderowane z nieznanych punktów widzenia z znanym oświetleniem. Ta “rzeczywista” informacja może być niezwykle ważna dla szkolenia aplikacji podrzędnych, takich jak monocularna, 3D rekonstrukcja twarzy, rozpoznawanie twarzy lub zrozumienie sceny. I tak każdy wynik renderowania może być uważany za próbkę danych, a my możemy generować wiele wariacji różnych osób.

‘Ponadto, nawet dla jednej osoby renderowanej w jednym wyrażeniu z jednym punktem widzenia i oświetleniem, możemy wygenerować losowe wariacje foto-realistycznego renderowania, zmieniając nasiono losowości podczas optymalizacji.’

Badacze zauważają, że ta różnorodność konfigurowalnego wyjścia może być przydatna w szkoleniu aplikacji rozpoznawania twarzy, kończąc:

‘[Nasza] metoda jest w stanie wykorzystać bieżącą technologię do przechwytywania, modelowania i renderowania skóry twarzy, oraz automatycznie tworzyć pełne fotorealistyczne renderowania twarzy, które odpowiadają pożądanej tożsamości, wyrażeniu i konfiguracji sceny. To podejście ma zastosowania w renderowaniu twarzy dla filmu i rozrywki, oszczędzając ręczną pracę artystom, oraz do generowania danych w różnych dziedzinach głębokiego uczenia.’

Aby uzyskać głębszy wgląd w nowe podejście, zobacz 10-minutowy film:

* Oryginalny link do filmu został zastąpiony innym, pozornie identycznym, 8 godzin po opublikowaniu tego artykułu. Zmieniłem wszystkie odpowiednie linki, ponieważ nie ma śladu po oryginalnym filmie.

 

8:24 GMT+2 – Zastąpiłem film, ponieważ został on zamieniony przez kanał Disney Research YouTube z jakiegoś powodu.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai