Andersonův úhel
Disney kombinuje CGI s neuronovým renderováním, aby překonala “údolí neznáma”

Výzkumná divize Disney pro umělou inteligenci vyvinula hybridní metodu pro simulaci obličeje ve filmové kvalitě, která kombinuje přednosti neuronového renderování obličeje s konzistencí CGI-založeného přístupu.
Příští článek nese název Renderování se stylem: Kombinace tradičních a neuronových přístupů pro renderování obličeje vysoké kvality a je uveden v novém 10minutovém videu na kanálu Disney Research YouTube (vloženém na konci tohoto článku*).

Mřížky kombinované s neuronovým renderováním obličeje. Viz video vložené na konci článku pro lepší detail a kvalitu. Zdroj: https://www.youtube.com/watch?v=k-RKSGbWLng (který byl později nahrazen za https://www.youtube.com/watch?v=TwpLqTmvqVk)
Jak video uvádí, neuronové renderování obličeje (včetně deepfake) může produkovat daleko realističtější oči a vnitřní části úst než je CGI schopno, zatímco CGI-poháněné textury obličeje jsou konzistentnější a vhodnější pro výstup VFX na úrovni kin.
Disney proto experimentuje s tím, aby neuronový generátor NVIDIA StyleGan2 zpracovával okolní rysy obličeje a “životně důležité” prvky, jako jsou oči, zatímco superponuje konzistentní CGI kůži obličeje a související prvky do výstupu.

Z videa (viz konec článku), architektonický koncept za hybridním přístupem Disneye, kde je staromódní CGI mřížka, podobná té, která se používala k rekonstrukci ‘mladé’ Carrie Fisher a zesnulého Petera Cushinga pro Rogue One (2016), integrována do neuronově renderovaných prostředí obličeje.
Video obsahuje implicitní odkaz na častou kritiku neautentičnosti a “údolí neznáma” efektu CGI rekonstrukce zesnulého britského herce Star Wars Petera Cushinga v Rogue One (2016), a uvádí:
‘[Je] stále obrovská mezera mezi tím, co lidé mohou snadno zachytit a renderovat, a konečným fotorealistickým digitálním dvojníkem, kompletním s vlasy, očima a vnitřními částmi úst. Zavřít tuto mezeru obvykle vyžaduje大量 ruční práce od zkušených umělců.’
Ve skutečnosti ani nejmodernější systémy pro zachycení obličeje se ani nepokoušejí rekonstruovat oči, vnitřní části úst nebo vlasy, které buď mají problémy s autentičností (oči) nebo temporální konzistencí (vlasy).

Video ilustruje, co dostanou umělci VFX po typické moderní relaci zachycení obličeje. Oči, vlasy, vousy a vnitřní části úst budou muset být zpracovány samostatnými týmy v produkčním procesu, kromě textur a osvětlení.
Kontrola osvětlení
Hybridní přístup je také výhodou při opětovném osvětlení – významné výzvě pro neuronové renderování obličeje, protože superpozice CGI kůže může být snáze opětovně osvětlena.

Animovaná verze CGI/Neuronového přístupu.
V náročnějších prostředích, jako jsou exteriérové natáčení, výzkumníci vyvinuli metodu pro doplnění okolí kolem druhu demilitarizované zóny obklopující osobu, která je “vytvářena”.

Generuje se černý okraj, aby se vytvořil “canvas” pro doplnění vnějších částí identity a integraci CGI kůže do kombinovaného CGI/neuronového výstupu.
Video uvádí:
‘[Neuronový] render se nezcela shoduje s omezením pozadí. – je to pouze vodítko, protože optimalizace pro realistické lidské komponenty, jako jsou vlasy, oči a zuby, je hlavním cílem. Více náročné je udržet konzistentní identitu, zatímco se mění osvětlení prostředí.’
Vytvoření CGI mřížek z neuronových renderů
Výzkumný tým také vyvinul variabilní autoencoder, který byl vyškolován na velké databázi 3D obrázků obličeje, a tvrdí, že může produkovat “náhodné, ale věrohodné” 3D mřížky obličeje z ground truth dat.
Existují omezení, která musí toto výzkumu překonat, včetně obtíží s tím, aby vlasy zůstaly temporálně konzistentní v neuronových renderováních, a video (viz níže) ukazuje několik příkladů rychle se měnících vlasů v jinak konzistentním panoramatu CGI/neuronového obličeje.
Temporální konzistence v neuronovém video renderování je mnohem širším problémem než jen Disneyův, a zdá se, že pozdější iterace tohoto systému mohou využít přidání vlasů “v postu” nebo různých jiných přístupů k generování vlasů než doufají, že nějaký nový neuronový přístup nakonec problém vyřeší.
Použití pro generování dat
Metoda je navržena také jako potenciální metoda pro generování syntetických dat a obohacení krajiny obrázků obličeje, která se v posledních letech stala nebezpečně monotónní.

Disney si představuje, že nová technika osídlí datové sady obrázků obličeje.
‘[Každý] fotorealistický výsledek, který generujeme, má podkladovou geometrii a mapy vzhledu, renderované z neznámých úhlů kamery s známým osvětlením. Tyto “ground truth” informace mohou být vitální pro výuku downstream aplikací, jako je monokulární 3D rekonstrukce obličeje, rozpoznávání obličeje nebo porozumění scéně. A tak každý renderovaný výsledek může být považován za datový vzorek, a můžeme generovat mnoho variací mnoha různých jedinců.
‘Navíc, i pro jednu osobu renderovanou v jednom výrazu s jedním úhlem a osvětlením, můžeme generovat náhodné variace fotorealistického renderu změnou náhodného seedu během optimalizace.’
Výzkumníci uvádějí, že tato diverzita konfigurovatelného výstupu by mohla být užitečná pro výuku aplikací rozpoznávání obličeje, a uzavírají:
‘[Naše] metoda je schopna využít současnou technologii pro zachycení, modelování a renderování kůže obličeje, a automaticky vytvářet kompletní fotorealistické renderování obličeje, které odpovídá požadované identitě, výrazu a konfiguraci scény. Tento přístup má aplikace pro renderování obličeje ve filmu a zábavě, šetří manuální práci umělcům a také pro generování dat v různých oblastech hlubokého učení.’
Pro hlubší pohled na nový přístup, podívejte se na 10minutové video, které bylo vydáno dnes:
* Původní odkaz na video byl nahrazen jiným, zdánlivě identickým, 8 hodin po zveřejnění tohoto článku. Změnil jsem všechny relevantní odkazy, protože původní video již neexistuje.
8:24 GMT+2 – Nahradil jsem video, protože ho kanál Disney Research YouTube nahradil z nějakého důvodu.












