Andersonův úhel

Disney kombinuje CGI s neurální renderací, aby se vypořádal s „údolím podivnosti“

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumné oddělení Disney zaměřené na AI vyvinulo hybridní metodu pro filmovou simulaci obličejů, která spojuje výhody neurálního renderování obličejů s konzistencí přístupu založeného na CGI.

Čekající článek nese název Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering a představen je v novém 10‑minutovém videu na kanálu Disney Research na YouTube (vložený na konci tohoto článku*).

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Mřížky spojené s neurálními renderovanými obličeji. Podívejte se na vložené video na konci článku pro lepší detail a kvalitu. Zdroj: https://www.youtube.com/watch?v=TwpLqTmvqVk

Jak video uvádí, neurální renderování obličejů (včetně deepfake) dokáže vytvořit mnohem realističtější oči a vnitřky úst než CGI, zatímco textury obličejů generované CGI jsou konzistentnější a vhodnější pro VFX na úrovni kina.

Proto Disney experimentuje s tím, že nechá neurální generátor NVIDIA StyleGan2 zpracovávat okolní rysy obličeje a „životně důležité“ prvky, jako jsou oči, a do výstupu překryje konzistentní CGI pleť obličeje a související elementy.

From the video (see end of article), the architectural concept behind Disney's hybrid approach, where an old-school CGI mesh, of the type used to recreate 'young' Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

Z videa (viz konec článku) architektonický koncept Disneyho hybridního přístupu, kde je staromódní CGI mřížka, typu použitého k vytvoření „mladé“ Carrie Fisher a zesnulého Petra Cushinga pro Rogue One (2016), integrována do neurálně renderovaných prostředí obličejů.

Video nenápadně odkazuje na častou kritiku neautentičnosti a efektu „údolí podivnosti“ při CGI rekonstrukci zesnulého britského herce Star Wars Petra Cushinga ve filmu Rogue One (2016), a přiznává:

„[Stále] existuje obrovská mezera mezi tím, co lidé dokážou snadno zachytit a renderovat, a finálními fotorealistickými digitálními dvojníky, kompletními s vlasy, očima a vnitřkem úst. Uzavření této mezery obvykle vyžaduje hodně ruční práce zkušených umělců.“

Ve skutečnosti i ty nejmodernější systémy pro zachycení obličejů se nepokoušejí reprodukovat oči, vnitřky úst ani vlasy, které mají buď problémy s autentičností (oči), nebo s časovou konzistencí (vlasy).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline.

Video ukazuje, co získají VFX umělci po typické moderní seanci zachycení obličeje. Oči, vlasy, vousy a vnitřky úst budou muset být zpracovány samostatnými týmy v produkčním workflow, kromě texturování a osvětlení.

Řízení osvětlení

Hybridní přístup také přináší výhodu při přeosvětlení – což je významná výzva pro neurální renderování obličejů, protože překrytí CGI pleti lze snadněji přeosvětlit.

An animated version of the CGI/Neural approach.

Animovaná verze CGI/neurálního přístupu.

V náročnějších prostředích, jako jsou exteriérové natáčení, výzkumníci vyvinuli metodu doplňování (inpainting) kolem takzvané demilitarizované zóny obklopující osobu, která je „vytvářena“.

A black margin is generated to allow a 'canvas' for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

Generuje se černý okraj, který poskytuje „plátno“ pro doplňování vnějších částí identity a integraci CGI pleti do kombinovaného CGI/neurálního výstupu.

„[Neurální] render neodpovídá pozadí dokonale. – slouží pouze jako vodítko, protože hlavním cílem je optimalizace realistických lidských komponent, jako jsou vlasy, oči a zuby. Náročnější je zachovat konzistentní identitu při změně osvětlení prostředí.“

Vytváření CGI mřížek z neurálních renderů

Výzkumný tým také vyvinul variacionální autoenkodér trénovaný na (nespecifikované) velké databázi 3D obrázků obličejů a tvrdí, že dokáže generovat „náhodné, ale věrohodné“ 3D mřížky obličejů z pravdivých dat.

Existují omezení, která tento výzkum musí překonat, včetně obtížnosti udržet vlasy časově konzistentní v neurálních renderováních, a video (viz níže) ukazuje několik příkladů rychle mutujících vlasů v jinak konzistentním panoramatu kolem CGI/neurálního obličeje.

Časová konzistence v neurálním video renderování je mnohem širší problém než jen u Disney, a je pravděpodobné, že pozdější verze tohoto systému se mohou uchýlit k přidání vlasů „v post‑produkci“ nebo k různým dalším přístupům k tvorbě vlasů, místo aby spoléhaly na to, že nová neurální metoda to nakonec vyřeší.

Využití pro generování datových sad

Metoda je také navržena jako potenciální způsob generování syntetických dat a obohacení krajiny souborů obličejových snímků, která se v posledních letech stala nebezpečně monotónní.

Disney envisages the new technique populating facial image datasets.

Disney předpokládá, že nová technika bude zaplňovat datové sady obličejových snímků.

„[Každý] fotorealistický výsledek, který generujeme, má podkladovou odpovídající geometrii a mapy vzhledu, renderované z neznámých úhlů kamery se známým osvětlením. Tyto „ground truth“ informace mohou být zásadní pro trénink následných aplikací, jako je monokulární, 3D rekonstrukce obličeje, rozpoznávání obličejů nebo porozumění scéně. A tak každý renderovaný výsledek může být považován za datový vzorek a můžeme generovat mnoho variant mnoha různých jedinců.“

„Navíc i pro jedinou osobu renderovanou v jedné výrazu s jedním úhlem kamery a osvětlením můžeme generovat náhodné varianty fotorealistického renderu změnou semene náhodnosti během optimalizace.“

Výzkumníci poznamenávají, že tato rozmanitost konfigurovatelného výstupu by mohla být užitečná při trénování aplikací pro rozpoznávání obličejů, a uzavírají:

„[Naše] metoda dokáže využít současnou technologii pro zachycení, modelování a renderování pleťových vrstev obličeje a automaticky vytvořit kompletní fotorealistické rendery obličejů, které odpovídají požadované identitě, výrazu a konfiguraci scény. Tento přístup má aplikace v renderování obličejů pro film a zábavu, šetří manuální práci umělců a také pro generování dat v různých oblastech hlubokého učení.“

Pro podrobnější pohled na nový přístup si prohlédněte dnes vydané 10‑minutové video:

* Původní odkaz na video byl po 8 hodinách od zveřejnění tohoto článku nahrazen jiným zjevně identickým odkazem. Všechny relevantní odkazy jsem změnil, protože neexistuje žádná stopa po původním videu.

 

8:24 GMT+2 – Video bylo nahrazeno, protože jej z nějakého důvodu vyměnil kanál Disney Research na YouTube.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai