Andersonův úhel
Disney kombinuje CGI s neurální renderací, aby se vypořádal s „údolím podivnosti“

Výzkumné oddělení Disney zaměřené na AI vyvinulo hybridní metodu pro filmovou simulaci obličejů, která spojuje výhody neurálního renderování obličejů s konzistencí přístupu založeného na CGI.
Čekající článek nese název Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering a představen je v novém 10‑minutovém videu na kanálu Disney Research na YouTube (vložený na konci tohoto článku*).

Mřížky spojené s neurálními renderovanými obličeji. Podívejte se na vložené video na konci článku pro lepší detail a kvalitu. Zdroj: https://www.youtube.com/watch?v=TwpLqTmvqVk
Jak video uvádí, neurální renderování obličejů (včetně deepfake) dokáže vytvořit mnohem realističtější oči a vnitřky úst než CGI, zatímco textury obličejů generované CGI jsou konzistentnější a vhodnější pro VFX na úrovni kina.
Proto Disney experimentuje s tím, že nechá neurální generátor NVIDIA StyleGan2 zpracovávat okolní rysy obličeje a „životně důležité“ prvky, jako jsou oči, a do výstupu překryje konzistentní CGI pleť obličeje a související elementy.

Z videa (viz konec článku) architektonický koncept Disneyho hybridního přístupu, kde je staromódní CGI mřížka, typu použitého k vytvoření „mladé“ Carrie Fisher a zesnulého Petra Cushinga pro Rogue One (2016), integrována do neurálně renderovaných prostředí obličejů.
Video nenápadně odkazuje na častou kritiku neautentičnosti a efektu „údolí podivnosti“ při CGI rekonstrukci zesnulého britského herce Star Wars Petra Cushinga ve filmu Rogue One (2016), a přiznává:
„[Stále] existuje obrovská mezera mezi tím, co lidé dokážou snadno zachytit a renderovat, a finálními fotorealistickými digitálními dvojníky, kompletními s vlasy, očima a vnitřkem úst. Uzavření této mezery obvykle vyžaduje hodně ruční práce zkušených umělců.“
Ve skutečnosti i ty nejmodernější systémy pro zachycení obličejů se nepokoušejí reprodukovat oči, vnitřky úst ani vlasy, které mají buď problémy s autentičností (oči), nebo s časovou konzistencí (vlasy).

Video ukazuje, co získají VFX umělci po typické moderní seanci zachycení obličeje. Oči, vlasy, vousy a vnitřky úst budou muset být zpracovány samostatnými týmy v produkčním workflow, kromě texturování a osvětlení.
Řízení osvětlení
Hybridní přístup také přináší výhodu při přeosvětlení – což je významná výzva pro neurální renderování obličejů, protože překrytí CGI pleti lze snadněji přeosvětlit.

Animovaná verze CGI/neurálního přístupu.
V náročnějších prostředích, jako jsou exteriérové natáčení, výzkumníci vyvinuli metodu doplňování (inpainting) kolem takzvané demilitarizované zóny obklopující osobu, která je „vytvářena“.

Generuje se černý okraj, který poskytuje „plátno“ pro doplňování vnějších částí identity a integraci CGI pleti do kombinovaného CGI/neurálního výstupu.
„[Neurální] render neodpovídá pozadí dokonale. – slouží pouze jako vodítko, protože hlavním cílem je optimalizace realistických lidských komponent, jako jsou vlasy, oči a zuby. Náročnější je zachovat konzistentní identitu při změně osvětlení prostředí.“
Vytváření CGI mřížek z neurálních renderů
Výzkumný tým také vyvinul variacionální autoenkodér trénovaný na (nespecifikované) velké databázi 3D obrázků obličejů a tvrdí, že dokáže generovat „náhodné, ale věrohodné“ 3D mřížky obličejů z pravdivých dat.
Existují omezení, která tento výzkum musí překonat, včetně obtížnosti udržet vlasy časově konzistentní v neurálních renderováních, a video (viz níže) ukazuje několik příkladů rychle mutujících vlasů v jinak konzistentním panoramatu kolem CGI/neurálního obličeje.
Časová konzistence v neurálním video renderování je mnohem širší problém než jen u Disney, a je pravděpodobné, že pozdější verze tohoto systému se mohou uchýlit k přidání vlasů „v post‑produkci“ nebo k různým dalším přístupům k tvorbě vlasů, místo aby spoléhaly na to, že nová neurální metoda to nakonec vyřeší.
Využití pro generování datových sad
Metoda je také navržena jako potenciální způsob generování syntetických dat a obohacení krajiny souborů obličejových snímků, která se v posledních letech stala nebezpečně monotónní.

Disney předpokládá, že nová technika bude zaplňovat datové sady obličejových snímků.
„[Každý] fotorealistický výsledek, který generujeme, má podkladovou odpovídající geometrii a mapy vzhledu, renderované z neznámých úhlů kamery se známým osvětlením. Tyto „ground truth“ informace mohou být zásadní pro trénink následných aplikací, jako je monokulární, 3D rekonstrukce obličeje, rozpoznávání obličejů nebo porozumění scéně. A tak každý renderovaný výsledek může být považován za datový vzorek a můžeme generovat mnoho variant mnoha různých jedinců.“
„Navíc i pro jedinou osobu renderovanou v jedné výrazu s jedním úhlem kamery a osvětlením můžeme generovat náhodné varianty fotorealistického renderu změnou semene náhodnosti během optimalizace.“
Výzkumníci poznamenávají, že tato rozmanitost konfigurovatelného výstupu by mohla být užitečná při trénování aplikací pro rozpoznávání obličejů, a uzavírají:
„[Naše] metoda dokáže využít současnou technologii pro zachycení, modelování a renderování pleťových vrstev obličeje a automaticky vytvořit kompletní fotorealistické rendery obličejů, které odpovídají požadované identitě, výrazu a konfiguraci scény. Tento přístup má aplikace v renderování obličejů pro film a zábavu, šetří manuální práci umělců a také pro generování dat v různých oblastech hlubokého učení.“
Pro podrobnější pohled na nový přístup si prohlédněte dnes vydané 10‑minutové video:
* Původní odkaz na video byl po 8 hodinách od zveřejnění tohoto článku nahrazen jiným zjevně identickým odkazem. Všechny relevantní odkazy jsem změnil, protože neexistuje žádná stopa po původním videu.
8:24 GMT+2 – Video bylo nahrazeno, protože jej z nějakého důvodu vyměnil kanál Disney Research na YouTube.












