Погляд Anderson

RigNeRF: Новий метод глибоких підробок, який використовує нейронні поля радіанції

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження, проведені в Adobe, пропонують перший життєздатний і ефективний метод глибоких підробок на основі нейронних полів радіанції (NeRF) – можливо, перша справжня інновація в архітектурі або підході за останні п’ять років з моменту появи глибоких підробок у 2017 році.

Цей метод, названий RigNeRF, використовує тривимірні морфабельні моделі обличчя (3DMMs) як проміжний шар інструментальності між бажаним входом (тобто ідентичністю, яку потрібно імпонувати в NeRF-рендер) і нейронним простором, метод, який був широко прийнятий у останні роки генеративними суперницькими мережами (GAN) підходами синтезу обличчя, жодна з яких ще не продемонструвала функціональних і корисних фреймворків для заміни обличчя у відео.

З додаткового матеріалу до нової статті, ми бачимо 3D морфабельну модель обличчя (3DMM), яка діє як інтерфейс між 70 секундами справжнього відео, знятої на смартфоні, яке становить навчальний набір даних, і зазвичай стійкими параметрами візуалізації нейронного поля радіанції. Для високоякісної версії цього кліпу, а також багатьох інших, дивіться сторінку проекту або вкладені відео в кінці цієї статті. Джерело: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

На відміну від традиційних відео глибоких підробок, жоден з рухомого контенту, зображеного тут, не є ‘справжнім’, а радше є досліджуваним нейронним простором, який був навчений на короткому відео. Праворуч ми бачимо 3D морфабельну модель обличчя (3DMM), яка діє як інтерфейс між бажаними маніпуляціями (‘усміхатися’, ‘дивитися ліворуч’, ‘дивитися вгору’ тощо) і зазвичай недоступними параметрами візуалізації нейронного поля радіанції. Для високоякісної версії цього кліпу, а також інших прикладів, дивіться сторінку проекту, або вкладені відео в кінці цієї статті. Джерело: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3DMMs є ефективно моделями обличчя CGI, параметри яких можна адаптувати до більш абстрактних систем синтезу зображень, таких як NeRF і GAN, які в іншому випадку важко контролювати.

Що ви бачите на зображенні вище (середнє зображення, чоловік у синій сорочці), а також на зображенні прямо під ним (ліве зображення, чоловік у синій сорочці), не є ‘справжнім’ відео, у яке було вставлено невеликий шматок ‘фальшивого’ обличчя, а повністю синтезованою сценою, яка існує лише як об’ємний нейронний рендер – включаючи тіло і фон:

У прикладі прямо над цим справжнє відео праворуч (жінка у червоному платьї) використовується для ‘маріонетки’ захопленої ідентичності (чоловік у синій сорочці) ліворуч через RigNeRF, який (автори стверджують) є першою системою NeRF, яка досягла розділення пози і виразу, а також здатна виконувати нові синтези виду.

Чоловічу фігуру ліворуч на зображенні вище було ‘захоплено’ з 70-секундного відео на смартфоні, і вхідні дані (включаючи всю інформацію про сцену) були навчені на чотирьох V100 GPU, щоб отримати сцену.

Відтак 3DMM-стиль параметричних ригів також доступні як цілісні параметричні CGI-проксі (а не тільки риги обличчя), RigNeRF потенційно відкриває можливість повних глибоких підробок, де справжнє людське рух, текстура і вираз передаються до параметричного шару CGI, який потім перекладає дію і вираз у візуалізації середовища NeRF і відео.

Що стосується RigNeRF – чи це кваліфікується як метод глибоких підробок у поточному розумінні цього терміну? Чи це просто ще один напівхромий аутсайдер до DeepFaceLab і інших трудомістких, 2017-річних автоенкодерних систем глибоких підробок?

Дослідники нової статті неоднозначні щодо цього питання:

‘Будучи методом, який здатний оживляти обличчя, RigNeRF схильний до неправильного використання зловмисниками для генерації глибоких підробок.’

Нова стаття називається RigNeRF: Повністю керований нейронний 3D-портрет, і походять від ShahRukh Atha з Університету Стоні-Брук, стажера в Adobe під час розробки RigNeRF, і чотирьох інших авторів з Adobe Research.

Поза автоенкодерними глибокими підробками

Більшість вірусних глибоких підробок, які захопили заголовки за останні кілька років, виробляються автоенкодерними системами, отриманими з коду, який був опублікований на забороненому subreddit r/deepfakes у 2017 році – хоча не раніше, ніж був скопійований на GitHub, де він був форкований більше тисячі разів, не в останню чергу в популярну (хоча спірну) DeepFaceLab розподілення, і також проект FaceSwap.

Окрім GAN і NeRF, автоенкодерні фреймворки також експериментували з 3DMM як ‘директивами’ для покращення синтезу обличчя. Прикладом цього є проект HifiFace з липня 2021 року. Однак жодна придатна або популярна ініціатива не здається розвиненою з цього підходу на даний момент.

Дані для сцен RigNeRF отримуються шляхом захоплення коротких відео на смартфоні. Для проекту дослідники RigNeRF використовували iPhone XR або iPhone 12 для всіх експериментів. Для першої половини захоплення суб’єкт проситься виконувати широкий спектр виразів обличчя і мови, залишаючи голову нерухомою, поки камера рухається навколо нього.

Для другої половини захоплення камера залишається нерухомою, а суб’єкт повинен рухати головою, демонструючи широкий спектр виразів. Результатом є 40-70 секунд відео (приблизно 1200-2100 кадрів), яке становить весь набір даних, який буде використаний для навчання моделі.

Зменшення збору даних

Натомість автоенкодерні системи, такі як DeepFaceLab, вимагають відносно трудомісткого збору і кураторства тисяч різноманітних фотографій, часто взятих з відео на YouTube і інших соціальних мереж, а також з фільмів (у випадку глибоких підробок знаменитостей).

Результатом є навчені автоенкодерні моделі, які часто призначені для використання в різних ситуаціях. Однак найбільш ретельні ‘знамениті’ глибокі підробки можуть навчати цілі моделі з нуля для одного відео, незважаючи на те, що навчання може тривати тиждень або більше.

Незважаючи на попередню ноту дослідників нової статті, ‘лоскутне’ і широкомасштабно зібрані набори даних, які живлять AI-порнографію, а також популярні відео ‘глибоких підробок’ на YouTube/TikTok, здається, малоймовірно продемонструють прийнятні і послідовні результати в системі глибоких підробок, такій як RigNeRF, яка має сценарій, специфічний для сцени. З огляду на обмеження на захоплення даних, викладені в новій роботі, це може стати додатковим засобом захисту проти випадкового неправильного використання ідентичності зловмисниками.

Адаптація NeRF до відео глибоких підробок

NeRF – це фотограмметричний метод, у якому невелика кількість джерельних зображень, зроблених з різних точок зору, збирається в досліджуваний 3D нейронний простір. Цей підхід набув популярності на початку цього року, коли NVIDIA представила свою Instant NeRF систему, здатну скоротити надмірні часи навчання для NeRF до хвилин або навіть секунд:

Instant NeRF. Джерело: https://www.youtube.com/watch?v=DJ2hcC1orc4

Результатом є нейронне поле радіанції сцени, яке є суттєво статичним середовищем, яке можна досліджувати, але яке важко редагувати. Дослідники відзначають, що дві попередні ініціативи NeRF – HyperNeRF + E/P і NerFACE – спробували синтез обличчя у відео, і (очевидно, для цілей повноти і ретельності) поставили RigNeRF проти цих двох фреймворків у раунді тестування:

Instant NeRF. Джерело: https://www.youtube.com/watch?v=DJ2hcC1orc4

Якість порівняння між RigNeRF, HyperNeRF і NerFACE. Дивіться пов'язані джерельні відео і PDF для вищої якості версій. Статичне джерело зображення: https://arxiv.org/pdf/2012.03065.pdf

Якість порівняння між RigNeRF, HyperNeRF і NerFACE. Дивіться пов’язані джерельні відео і PDF для вищої якості версій. Статичне джерело зображення: https://arxiv.org/pdf/2012.03065.pdf

Однак у цьому випадку результати, які сприяють RigNeRF, є досить аномальними, з двох причин: по-перше, автори відзначають, що ‘немає існуючої роботи для порівняння яблука до яблука’; по-друге, це змусило обмежити можливості RigNeRF, щоб частково збігатися з більш обмеженою функціональністю попередніх систем.

Оскільки результати не є інкрементним покращенням попередньої роботи, а радше представляють ‘прорив’ у редагуванні і корисності NeRF, ми залишимо раунд тестування і побачимо, що робить RigNeRF по-іншому, ніж його попередники.

Об’єднані сили

Основним обмеженням NerFACE, яке може створювати контроль пози/виразу в середовищі NeRF, є те, що воно припускає, що джерельне відео буде знято статичною камерою. Це фактично означає, що воно не може виробляти нові види, які виходять за межі його обмежень захоплення. Це створює систему, яка може створювати ‘рушійні портрети’, але яка не підходить для відео глибоких підробок.

HyperNeRF, з іншого боку, хоча і здатний генерувати нові і гіперреалістичні види, не має інструментальності, яка дозволяє йому змінювати позу голови або вираз обличчя, що знову не призводить до жодного конкурента для автоенкодерних глибоких підробок.

RigNeRF здатний об’єднати ці дві ізольовані функції, створюючи ‘канонічний простір’, базовий рівень, від якого можуть бути здійснені відхилення і деформації через вхід з модуля 3DMM.

Створення 'канонічного простору' (без пози, без виразу), на якому можуть діяти деформації (тобто пози і вирази), вироблені через модуль 3DMM.

Створення ‘канонічного простору’ (без пози, без виразу), на якому можуть діяти деформації (тобто пози і вирази), вироблені через модуль 3DMM.

Оскільки система 3DMM не буде точно збігатися з захопленим суб’єктом, важливо компенсувати це в процесі. RigNeRF досягає цього за допомогою поля деформації до розрахованого з багатошарового перцептрону (MLP), отриманого з джерельного відео.

Параметри камери, необхідні для розрахунку деформацій, отримуються через COLMAP, тоді як параметри виразу і форми для кожного кадру отримуються з DECA.

Позиціонування далі оптимізується через підгонку орієнтирів і параметрів камери COLMAP, і, через обмеження обчислювальних ресурсів, вихідне відео розрізнюється до роздільної здатності 256×256 для навчання (процес зменшення, обмежений апаратним забезпеченням, який також переслідує сцену автоенкодерних глибоких підробок).

Після цього мережа деформації навчується на чотирьох V100 – потужному апаратному забезпеченні, яке, ймовірно, не буде доступне для випадкових ентузіастів (однак, де навчання моделей машинного навчання стосується, часто можна торгувати потужністю за час, і просто прийняти, що навчання моделі буде займати дні або навіть тижні).

У висновку дослідники заявляють:

‘На відміну від інших методів, RigNeRF, завдяки використанню 3DMM-керованого модуля деформації, здатний моделювати позу голови, вираз обличчя і всю 3D-сцену портрета з високою точністю, що дає кращу реконструкцію з чіткими деталями.’

Дивіться вкладені відео нижче для进一步ої інформації та відео результатів.

 

 

Перша публікація 15 червня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai