Погляд Anderson

Disney поєднує CGI з нейронним рендерингом, щоб подолати «зону незручності»

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідницький підрозділ Disney у галузі ШІ розробив гібридний метод для симуляції облич у кіноякісному рівні, поєднавши переваги нейронного рендерингу облич з послідовністю підходу на основі CGI.

Очікувана стаття має назву Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering і попередньо представлена у новому 10‑хвилинному відео на YouTube‑каналі Disney Research (вбудовано в кінці цієї статті*).

Meshes combined with neural facial renders. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Meshes combined with neural facial renders. See video embed at end of article for better detail and quality. Source: https://www.youtube.com/watch?v=TwpLqTmvqVk

Як зазначає відео, нейронний рендеринг облич (включаючи deepfake) може створювати значно реалістичніші очі та внутрішню частину рота, ніж це можливо за допомогою CGI, тоді як текстури облич, створені за допомогою CGI, більш послідовні та придатні для кінематографічного рівня VFX.

Тому Disney експериментує, дозволяючи нейронному генератору NVIDIA StyleGan2 обробляти навколишні риси обличчя та «життєво важливі» елементи, такі як очі, одночасно накладаючи послідовну CGI‑шкіру обличчя та пов’язані елементи на результат.

From the video (see end of article), the architectural concept behind Disney's hybrid approach, where an old-school CGI mesh, of the type used to recreate 'young' Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

From the video (see end of article), the architectural concept behind Disney’s hybrid approach, where an old-school CGI mesh, of the type used to recreate ‘young’ Carrie Fisher and the late Peter Cushing for Rogue One (2016), is integrated into neurally-rendered face environments.

Відео натякає на часту критику неавтентичності та ефекту «зони незручності» при CGI‑відтворенні покійного британського актора Star Wars Пітера Кашінга у Rogue One (2016), визнаючи:

‘[Існує] ще величезний розрив між тим, що люди можуть легко захопити та відрендерити, і фінальними фотореалістичними цифровими дублерами, включаючи волосся, очі та внутрішню частину рота. Щоб подолати цей розрив, зазвичай потрібна велика кількість ручної роботи кваліфікованих художників.’

Насправді навіть найсучасніші системи захоплення обличчя не намагаються відтворювати очі, внутрішню частину рота чи волосся, оскільки вони мають проблеми автентичності в таких технологіях (очі) або ж проблеми тимчасової послідовності (волосся).

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline.

The video illustrates what VFX artists will get after a typical modern facial capture session. Eyes, hair, facial hair, and mouth interiors will all have to be handled by separate teams in the production pipeline, in addition to texturing and lighting.

Контроль освітлення

Гібридний підхід також є перевагою при повторному освітленні – значному виклику для нейронного рендерингу облич, оскільки накладання CGI‑шкіри можна легше підсвітити.

An animated version of the CGI/Neural approach.

An animated version of the CGI/Neural approach.

У більш складних умовах, таких як зовнішні зйомки, дослідники розробили метод заповнення (inpainting) навколо своєрідної демілітаризованої зони, що оточує особу, яку «створюють».

A black margin is generated to allow a 'canvas' for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

A black margin is generated to allow a ‘canvas’ for inpainting the outer parts of the identity and integrating the CGI skin into the combined CGI/neural output.

Відео зазначає:

‘[Нейронний] рендер не ідеально відповідає обмеженням фону. – це лише орієнтир, оскільки оптимізація реалістичних людських компонентів, таких як волосся, очі та зуби, є головною метою. Складніше — спробувати зберегти послідовну ідентичність, змінюючи освітлення середовища.’

Створення CGI‑мешів із нейронних рендерів

Дослідницька команда також розробила варіаційний автокодер, навчений на (не зазначеній) великій базі 3D‑зображень облич, і стверджує, що він може генерувати «випадкові, але правдоподібні» 3D‑меші облич з даних ground truth.

Для цього дослідження існують обмеження, зокрема складність зберегти тимчасову послідовність волосся у нейронних рендерингах, а відео (див. нижче) демонструє кілька прикладів швидко змінюваного волосся в інакше послідовному панорамуванні навколо CGI/нейронного обличчя.

Тимчасова послідовність у нейронному відео‑рендерингу — набагато ширша проблема, ніж лише у Disney, і, ймовірно, подальші ітерації цієї системи можуть перейти до додавання волосся «після рендерингу», або інших можливих підходів до генерації волосся, замість сподівання, що новий нейронний підхід зрештою вирішить цю задачу.

Використання для генерації наборів даних

Метод також пропонується як потенційний спосіб створення синтетичних даних і збагачення ландшафту наборів зображень облич, який у останні роки став небезпечним монотонним.

Disney envisages the new technique populating facial image datasets.

Disney envisages the new technique populating facial image datasets.

‘[Кожен] фотореалістичний результат, який ми генеруємо, має підкладену відповідну геометрію та карти зовнішнього вигляду, відрендерені з невідомих точок зору камери при відомому освітленні. Ця інформація «ground truth» може бути важливою для навчання подальших застосувань, таких як монокулярна 3D‑реконструкція обличчя, розпізнавання облич або розуміння сцени. Тому кожен рендер результату можна вважати зразком даних, і ми можемо створювати багато варіацій багатьох різних осіб.’

‘Більше того, навіть для однієї особи, відрендереної в одному виразі з однієї точки зору та освітленням, ми можемо створювати випадкові варіації фотореалістичного рендеру, змінюючи зерно випадковості під час оптимізації.’

Дослідники зазначають, що ця різноманітність конфігурованих виходів може бути корисною при навчанні застосувань розпізнавання облич, підсумовуючи:

‘[Наш] метод може використати сучасні технології захоплення шкіри обличчя, моделювання та рендерингу, та автоматично створювати повні фотореалістичні рендери облич, що відповідають бажаній ідентичності, виразу та конфігурації сцени. Такий підхід має застосування у рендерингу облич для кіно та розваг, заощаджуючи ручну працю художників, а також у генерації даних у різних галузях глибокого навчання.’

Для більш детального ознайомлення з новим підходом перегляньте сьогодні випущене 10‑хвилинне відео:

 * Оригінальне посилання на відео було замінено іншим, схоже ідентичним, через 8 годин після публікації цієї статті. Я змінив усі відповідні посилання, оскільки немає слідів оригінального відео.

 

8:24 GMT+2 — Відео замінено, оскільки його замінив канал Disney Research на YouTube з якоїсь причини.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai