Взгляд Anderson

RigNeRF: Новый метод глубоких подделок, использующий нейронные поля радианса

mm
Добавьте Unite.AI в избранные источники в Google

Новая исследовательская работа, разработанная в Adobe, предлагает первый жизнеспособный и эффективный метод глубоких подделок на основе нейронных полей радианса (NeRF) – perhaps первый реальный инновационный подход в архитектуре или подходе за пять лет с момента появления глубоких подделок в 2017 году.

Метод, озаглавленный RigNeRF, использует трехмерные морфабельные модели лица (3DMMs) в качестве промежуточного слоя инструментальности между желаемым входом (т.е. идентификатором, который необходимо наложить на рендер NeRF) и нейронным пространством, метод, который был широко принят в последние годы подходами синтеза лица на основе генеративных противостоящих сетей (GAN), ни один из которых не смог произвести функциональные и полезные фреймворки для замены лица в видео.

Из дополнительного материала новой статьи мы видим трехмерную морфабельную модель лица (3DMM), действующую в качестве интерфейса между 70 секундами реального видео, снятого на смартфон, которое составляют обучающий набор данных, и обычно стоическими параметрами визуализации нейронного поля радианса. Для высококачественной версии этого клипа, а также многих других, см. страницу проекта или встроенные видео в конце этой статьи. Источник: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

В отличие от традиционных видео глубоких подделок, абсолютно никакого движущегося контента, изображенного здесь, не является ‘реальным’, а представляет собой исследуемое нейронное пространство, которое было обучено на коротком видео. Справа мы видим трехмерную морфабельную модель лица (3DMM), действующую в качестве интерфейса между желаемыми манипуляциями (‘улыбка’, ‘посмотрите влево’, ‘посмотрите вверх’ и т. д.) и обычно неуправляемыми параметрами визуализации нейронного поля радианса. Для высококачественной версии этого клипа, а также других примеров, см. страницу проекта, или встроенные видео в конце этой статьи. Источник: https://shahrukhathar.github.io/2022/06/06/RigNeRF.html

3DMMs по сути являются моделями лица CGI, параметры которых можно адаптировать к более абстрактным системам синтеза изображений, таким как NeRF и GAN, которые в противном случае трудно контролировать.

Что вы видите на изображении выше (среднее изображение, человек в синей рубашке), а также на изображении прямо ниже (левое изображение, человек в синей рубашке), не является ‘реальным’ видео, в которое наложен небольшой фрагмент ‘фальшивого’ лица, а представляет собой полностью синтезированную сцену, существующую исключительно в качестве объемного нейронного рендеринга – включая тело и фон:

В примере прямо выше реальное видео справа (женщина в красном платье) используется для ‘марионетки’ захваченной идентификатор (человек в синей рубашке) слева через RigNeRF, который (по утверждению авторов) является первой системой NeRF, способной достичь разделения позы и выражения, а также выполнять новые виды синтеза.

Мужская фигура слева на изображении выше была ‘захвачена’ из 70-секундного видео на смартфон, и входные данные (включая всю информацию о сцене) затем были обучены на четырех V100 GPU, чтобы получить сцену.

Поскольку 3DMM-стиль параметрических ригов также доступны в качестве полностью параметрических прокси-CGI для всего тела (а не только ригов лица), RigNeRF потенциально открывает возможность полных глубоких подделок, где реальное человеческое движение, текстура и выражение передаются в параметрический слой CGI, который затем переводит действие и выражение в рендеринги среды и видео NeRF.

Что касается RigNeRF – квалифицируется ли он как метод глубоких подделок в том смысле, в котором заголовки понимают этот термин? Или это просто еще один полуфункциональный аутсайдер по сравнению с DeepFaceLab и другими трудоемкими, основанными на автоэнкодерах системами глубоких подделок 2017 года?

Исследователи новой статьи не оставляют сомнений по этому поводу:

‘Будучи методом, способным оживлять лица, RigNeRF склонен к неправильному использованию злыми акторами для создания глубоких подделок.’

Новая статья озаглавлена RigNeRF: Полностью контролируемые нейронные 3D-портреты, и исходит от ShahRukh Atha из Университета Stonybrook, стажера в Adobe во время разработки RigNeRF, и четырех других авторов из Adobe Research.

За пределами автоэнкодерных глубоких подделок

Большинство вирусных глубоких подделок, которые захватили заголовки за последние несколько лет, производятся автоэнкодерными системами, полученными из кода, опубликованного на запрещенном subreddit r/deepfakes в 2017 году – хотя и не раньше, чем он был скопирован на GitHub, где он в настоящее время был форкнут более тысячи раз, не говоря уже о том, что он вошел в популярную (хотя и спорную) DeepFaceLab и проект FaceSwap.

Помимо GAN и NeRF, автоэнкодерные фреймворки также экспериментировали с 3DMM в качестве ‘руководств’ для улучшения синтеза лица. Примером этого является проект HifiFace из июля 2021 года. Однако не кажется, что какие-либо жизнеспособные инициативы были разработаны из этого подхода на данный момент.

Данные для сцен RigNeRF получаются путем захвата коротких видео на смартфон. Для проекта исследователи RigNeRF использовали iPhone XR или iPhone 12 для всех экспериментов. Для первой половины захвата субъекту предлагается выполнить широкий спектр выражений лица и речи, сохраняя голову неподвижной, пока камера перемещается вокруг него.

Для второй половины захвата камера сохраняет фиксированное положение, а субъекту необходимо перемещать голову, демонстрируя широкий спектр выражений. Результатом являются 40-70 секунд видео (около 1200-2100 кадров), которые представляют собой весь набор данных, который будет использоваться для обучения модели.

Сокращение сбора данных

Напротив, автоэнкодерные системы, такие как DeepFaceLab, требуют относительно трудоемкого сбора и курирования тысяч разнообразных фотографий, часто взятых из видео на YouTube и других социальных медиа-каналов, а также из фильмов (в случае глубоких подделок знаменитостей).

Результатом являются обученные автоэнкодерные модели, которые часто предназначены для использования в различных ситуациях. Однако наиболее тщательные ‘глубокие подделки’ могут обучать целые модели с нуля для одного видео, несмотря на то, что обучение может занять неделю или более.

Несмотря на предупреждающую заметку от исследователей новой статьи, ‘лоскутное’ и собранное из различных источников набор данных, который питает AI-порнографию, а также популярные ‘глубокие подделки’ на YouTube/TikTok, кажется, вряд ли произведет приемлемые и последовательные результаты в системе глубоких подделок, такой как RigNeRF, которая имеет сцено-специфический метод. Учитывая ограничения на сбор данных, изложенные в новой работе, это может оказаться, в некоторой степени, дополнительной защитой от случайного неправильного использования идентификатора злыми подделщиками.

Адаптация NeRF к видео глубоких подделок

NeRF является фотограмметрическим методом, в котором небольшое количество исходных изображений, снятых с различных точек зрения, собирается в исследуемое 3D нейронное пространство. Этот подход приобрел известность ранее в этом году, когда NVIDIA представила свою Instant NeRF систему, способную сократить чрезмерное время обучения NeRF до минут или даже секунд:

Instant NeRF. Источник: https://www.youtube.com/watch?v=DJ2hcC1orc4

Результатом является сцена нейронного поля радианса, которая по сути является статической средой, которую можно исследовать, но которую трудно редактировать. Исследователи отмечают, что две предыдущие инициативы NeRF – HyperNeRF + E/P и NerFACE – попытались синтезировать видео лица, и (видимо, ради полноты и тщательности) поставили RigNeRF против этих двух фреймворков в раунде тестирования:

Instant NeRF. Источник: https://www.youtube.com/watch?v=DJ2hcC1orc4

Качественное сравнение между RigNeRF, HyperNeRF и NerFACE. См. связанные источники видео и PDF для более высококачественных версий. Статическое изображение источника: https://arxiv.org/pdf/2012.03065.pdf

Качественное сравнение между RigNeRF, HyperNeRF и NerFACE. См. связанные источники видео и PDF для более высококачественных версий. Статическое изображение источника: https://arxiv.org/pdf/2012.03065.pdf

Однако в этом случае результаты, которые отдают предпочтение RigNeRF, довольно аномальны, по двум причинам: во-первых, авторы отмечают, что ‘не существует существующей работы для яблоко-к-яблоку сравнения’; во-вторых, это потребовало ограничения возможностей RigNeRF, чтобы хотя бы частично соответствовать более ограниченной функциональности предыдущих систем.

Поскольку результаты не являются постепенным улучшением предыдущей работы, а представляют собой ‘прорыв’ в редактируемости и полезности NeRF, мы оставим раунд тестирования в стороне и вместо этого посмотрим, что делает RigNeRF по-другому, чем его предшественники.

Сочетание сильных сторон

Основным ограничением NerFACE, которое может создавать контроль позы/выражения в среде NeRF, является то, что оно предполагает, что исходное видео будет снято с помощью статической камеры. Это фактически означает, что оно не может производить новые виды, выходящие за пределы его ограничений захвата. Это производит систему, которая может создавать ‘движущиеся портреты’, но которая не подходит для видео глубоких подделок.

HyperNeRF, с другой стороны, хотя и способен генерировать новые и гиперреалистичные виды, не имеет инструментальности, которая позволяла бы ему изменять положение головы или выражения лица, что снова не приводит к какому-либо конкуренту для автоэнкодерных глубоких подделок.

RigNeRF способен объединить эти две изолированные функциональности, создавая ‘каноническое пространство’, базовую линию, от которой могут быть совершены отклонения и деформации через входные данные от модуля 3DMM.

Создание 'канонического пространства' (без позы, без выражения), на котором могут действовать деформации (т.е. позы и выражения), произведенные через модуль 3DMM.

Создание ‘канонического пространства’ (без позы, без выражения), на котором могут действовать деформации (т.е. позы и выражения), произведенные через модуль 3DMM.

Поскольку система 3DMM не будет точно соответствовать захваченному субъекту, важно компенсировать это в процессе. RigNeRF достигает этого с помощью поля деформации, рассчитанного из многослойного перцептрона (MLP), полученного из исходного видео.

Параметры камеры, необходимые для расчета деформаций, получаются через COLMAP, а параметры выражения и формы для каждого кадра получаются из DECA.

Позиционирование дополнительно оптимизируется через подгонку ориентиров и параметров камеры COLMAP, и, из-за ограничений на вычислительные ресурсы, выходное видео снижается до разрешения 256×256 для обучения (процесс сжатия, ограниченный аппаратным обеспечением, который также поражает сцену глубоких подделок на основе автоэнкодеров).

После этого сеть деформаций обучается на четырех V100 – мощном оборудовании, которое вряд ли будет доступно случайным энтузиастам (однако, где обучение машинного обучения имеет отношение, часто можно обменять мощность на время и просто принять, что обучение модели будет делом дней или даже недель).

В заключение, исследователи заявляют:

‘В отличие от других методов, RigNeRF, благодаря использованию модуля деформации, управляемого 3DMM, способен моделировать положение головы, выражения лица и полую 3D-сцену с высокой точностью, что дает лучшие реконструкции с четкими деталями.’

См. встроенные видео ниже для получения дополнительной информации и кадров результатов.

 

 

Опубликовано впервые 15 июня 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai