Взгляд Anderson
Разделение идентичности и контекста – следующая революция в технологии дипфейков

CGI-данные используются в новом проекте для получения большего контроля над изображениями дипфейков. Хотя вы все еще не можете эффективно использовать CGI-головы для заполнения пробелов в наборах данных дипфейков, новая волна исследований по разделению идентичности и контекста означает, что скоро вам, возможно, не придется.
Создатели некоторых из самых успешных вирусных видео дипфейков за последние несколько лет очень тщательно выбирают исходные видео, избегая устойчивых профильных кадров (т.е. видов, популярных в полицейских процедурах ареста), острых углов и необычных или преувеличенных выражений. Все чаще демонстрационные видео, созданные вирусными дипфейкерами, представляют собой отредактированные компиляции, которые выбирают “самые легкие” углы и выражения для дипфейка.
Фактически, наиболее подходящим целевым видео для вставки дипфейка знаменитости является то, где исходный человек (чья идентичность будет стерта дипфейком) смотрит прямо в камеру, с минимальным диапазоном выражений.

Большинство популярных дипфейков в последние годы показывали объекты, смотрящие прямо в камеру, и либо выражающие только популярные выражения (например, улыбку), которые можно легко извлечь из кадров папарацци, либо (как в случае с фейковым Сильвестром Сталлоне в роли Терминатора в 2019 году, показанном слева), идеально без выражения, поскольку нейтральные выражения чрезвычайно распространены, что делает их легко включаемыми в модели дипфейков.
Поскольку технологии дипфейков, такие как DeepFaceLab и FaceSwap, выполняют эти более простые замены очень хорошо, мы достаточно впечатлены тем, что они делают, и не замечаем того, чего они не могут сделать, и часто даже не пытаемся.

Кадры из известного видео дипфейка, где Арнольд Шварценеггер превращается в Сильвестра Сталлоне – если углы не слишком сложны. Профили остаются постоянной проблемой для текущих подходов к дипфейкам, частично потому, что программное обеспечение с открытым исходным кодом, используемое для определения поз лица в рамках дипфейков, не оптимизировано для боковых видов, но в основном потому, что подходящего исходного материала в одном или обоих необходимых наборах данных не хватает. Источник: https://www.youtube.com/watch?v=AQvCmQFScMA
Новые исследования из Израиля предлагают новый метод использования синтетических данных, таких как CGI-головы, для выведения дипфейков в 2020-е годы,真正 разделив идентичность лица (т.е. основные характеристики лица “Тома Круза” со всех сторон) от контекста (т.е. смотрящего вверх, смотрящего в сторону, хмурящегося, хмурящегося в темноте, сморщивающего брови, закрывающего глаза, и т. д.).

Новая система дискретно отделяет позу и контекст (т.е. подмигивание) от кодирования идентичности человека, используя несвязанные синтетические данные лица (показаны слева). В верхнем ряду мы видим “подмигивание”, перенесенное на идентичность Барака Обамы, вызванное выученной нелинейной траекторией латентного пространства GAN, представленной CGI-изображением слева. В ряду ниже мы видим перенесенный уголок рта на бывшего президента. Внизу справа мы видим оба характерных признака, примененных одновременно. Источник: https://arxiv.org/pdf/2111.08419.pdf
Это не простое манипулирование головой дипфейка, техника, более подходящая для аватаров и частичной синхронизации губ, и которая имеет ограниченный потенциал для полноценных преобразований видео дипфейка.
Скорее, это представляет собой способ вперед для фундаментального разделения инструментальности (такой как ‘изменить угол головы’, ‘создать хмурость’) от идентичности, предлагая путь к высокоуровневой, а не “производной” синтезу изображений на основе дипфейков.
Новая статья называется Delta-GAN-Encoder: Кодирование семантических изменений для явного редактирования изображений, используя несколько синтетических образцов, и исходит из исследователей в Технионе – Израильском технологическом институте.
Чтобы понять, что означает эта работа, давайте посмотрим, как в настоящее время производятся дипфейки – от сайтов дипфейк-порно до Industrial Light and Magic (поскольку репозиторий DeepFaceLab с открытым исходным кодом в настоящее время доминирует как в “любительском”, так и в профессиональном дипфейке).
Что мешает текущей технологии дипфейков?
Дипфейки в настоящее время создаются путем обучения модели машинного обучения кодировщика/декодировщика на двух папках изображений лиц – человека, которого вы хотите “закрасить” (в предыдущем примере это Арни), и человека, которого вы хотите наложить на кадр (Слай).

Примеры различных поз и условий освещения в двух разных наборах лиц. Обратите внимание на характерное выражение в конце третьего ряда в столбце А, которое вряд ли имеет близкий аналог в другом наборе данных.
Система кодировщика/декодировщика затем сравнивает каждое отдельное изображение в каждой папке с каждым другим, сохраняя, улучшая и повторяя эту операцию за hundreds тысяч итераций (часто в течение недели), пока она не поймет основные характеристики обеих идентичностей достаточно хорошо, чтобы поменять их местами по желанию.
Для каждого из двух людей, участвующих в процессе, то, что дипфейк-архитектура учит о идентичности, запутано с контекстом. Она не может выучить и применить принципы о какой-либо общей позе “навсегда”, а нуждается в множестве примеров в наборе данных для каждой идентичности, которая будет участвовать в замене лица.
Следовательно, если вы хотите поменять две идентичности, которые делают что-то более необычное, чем просто улыбка или взгляд прямо в камеру, вам понадобится много экземпляров этой конкретной позы/идентичности в обоих наборах лиц:

Поскольку характеристики лица и позы в настоящее время запутаны, широкий паритет выражений, поз головы и (в меньшей степени) освещения необходим в двух наборах лиц для обучения эффективной модели дипфейка на системах, таких как DeepFaceLab. Чем меньше конкретная конфигурация (например, “профиль/улыбка/освещение на солнце”) представлена в обоих наборах лиц, тем менее точно она будет отображаться в видео дипфейка, если это необходимо.
Если набор А содержит необычную позу, но набор Б не имеет ее, вы практически обречены; независимо от того, как долго вы обучаете модель, она никогда не научится хорошо воспроизводить эту позу между идентичностями, потому что у нее не было полной информации, когда она была обучена.
Даже если у вас есть совпадающие изображения, это может не быть достаточно: если набор А имеет совпадающую позу, но с резким боковым освещением, по сравнению с плоско освещенной эквивалентной позой в другом наборе лиц, качество замены не будет так хорошим, как если бы каждая имела общие характеристики освещения.
Почему данные так скудны?
Если вы не арестованы регулярно, у вас, вероятно, нет многих профильных снимков. Те, что есть, вы, скорее всего, выбросили. Поскольку агентства по продаже фотографий также делают то же самое, профильные снимки лиц трудно найти.
Дипфейкеры часто включают несколько копий ограниченных профильных данных, которые у них есть для идентичности в наборе лиц, просто чтобы эта поза получила хотя бы немного внимания и времени во время обучения, вместо того, чтобы быть отброшенной как выброс.

Но существует намного больше возможных типов профильных снимков лиц, чем, вероятно, доступно для включения в набор данных – улыбка, хмурость, крик, плач, темное освещение, презрение, скука, радость, освещение от вспышки, смотрящий вверх, смотрящий вниз, глаза открыты, глаза закрыты… и так далее. Любая из этих поз, в различных комбинациях, может быть необходима в целевом видео дипфейка.
И это только профили. Сколько фотографий у вас есть, где вы смотрите прямо вверх? У вас достаточно, чтобы в широком смысле представить 10 000 возможных выражений, которые вы можете носить, находясь в этойexact позе с этого exact угла камеры, покрывая хотя бы некоторые из одного миллиона возможных сред освещения?
Вероятно, у вас даже нет одной фотографии, где вы смотрите вверх. И это только два угла из сотен, необходимых для полного покрытия.
Даже если бы было возможно сгенерировать полное покрытие лица со всех сторон при различных условиях освещения, полученный набор данных был бы слишком большим для обучения, в порядке сотен тысяч изображений; и даже если бы он мог быть обучен, природа процесса обучения для текущих дипфейк-рамок выбросила бы большую часть этой дополнительной информации в пользу ограниченного числа производных функций, потому что текущие рамки являются редукционистскими и не очень масштабируемыми.
Синтетическая замена
С момента появления дипфейков дипфейкеры экспериментировали с использованием изображений в стиле CGI, голов, созданных в 3D-приложениях, таких как Cinema4D и Maya, для генерации этих “пропавших” поз.

Нет необходимости в ИИ; актриса воссоздана в традиционной программе CGI, Cinema 4D, с использованием сеток и битмаппированных текстур – технологии, которая восходит к 1960-м годам, хотя и получила широкое распространение только с 1990-х годов. В теории, эта модель лица могла бы быть использована для генерации исходных данных дипфейка для необычных поз, стилей освещения и выражений лица. На практике она была мало или совсем не полезна для дипфейка, поскольку “фальшивость” рендеринга склонна просачиваться в обмененные видео. Источник: изображение этого автора на https://rossdawson.com/futurist/implications-of-ai/comprehensive-guide-ai-artificial-intelligence-visual-effects-vfx/
Этот метод обычно быстро брошен новыми практиками дипфейка, потому что хотя он может обеспечить позы и выражения, которые в противном случае недоступны, синтетический вид CGI-лицев часто просачивается в замены из-за запутывания идентичности и контекстной/семантической информации.
Это может привести к внезапному появлению лиц “зоны неудобства” в иначе убедительном видео дипфейка, когда алгоритм начинает использовать единственные данные, которые у него могут быть для необычной позы или выражения – явно фальшивые лица.

Среди самых популярных объектов для дипфейкеров 3D-алгоритм дипфейка для австралийской актрисы Марго Робби включен в состав установки DeepFaceLive, версии DeepFaceLab, которая может выполнять дипфейки в прямом эфире, например, в сессии веб-камеры. CGI-версия, показанная выше, могла бы быть использована для получения необычных “пропавших” углов в наборах данных дипфейка. Источник: https://sketchfab.com/3d-models/margot-robbie-bust-for-full-color-3d-printing-98d15fe0403b4e64902332be9cfb0ace
CGI-лица как отсоединенные концептуальные рекомендации
Вместо этого новый метод Delta-GAN Encoder (DGE) от израильских исследователей более эффективен, потому что информация о позе и контексте из CGI-изображений полностью отделена от “идентичности” целевого объекта.
Мы можем увидеть этот принцип в действии на изображении ниже, где различные ориентации головы получены с помощью CGI-изображений в качестве рекомендаций. Поскольку характеристики идентичности не связаны с контекстными характеристиками, нет просачивания ни фальшивого синтетического вида CGI-лица, ни идентичности, изображенной в нем:

С новым методом вам не нужно искать три отдельных реальных источника, чтобы создать дипфейк с нескольких углов – вы можете просто повернуть CGI-голову, чьи абстрактные характеристики наложены на идентичность без утечки какой-либо информации об идентичности.

Delta-GAN-Encoder. Верхняя левая группа: угол исходного изображения можно изменить за секунду, чтобы отобразить новое исходное изображение, которое отражается в выходных данных; верхняя правая группа: освещение также отделено от идентичности, что позволяет наложить стили освещения; нижняя левая группа: несколько деталей лица изменены, чтобы создать “грустное” выражение; нижняя правая группа: изменен один отдельный деталь выражения лица, так что глаза морщатся.
Это разделение идентичности и контекста достигается на этапе обучения. Конвейер для новой архитектуры дипфейка ищет вектор в предварительно обученной генеративной состязательной сети (GAN), который соответствует изображению, подлежащему трансформации – методология Sim2Real, которая основана на проекте 2018 года из исследовательского отдела ИБМ.
Исследователи отмечают:
‘С несколькими образцами, которые различаются по конкретному атрибуту, можно выучить разъединенное поведение предварительно обученной запутанной генеративной модели. Нет необходимости в точных реальных образцах для достижения этой цели, которая не обязательно осуществима.
‘Используя нереалистичные образцы данных, можно достичь той же цели, используя семантику закодированных латентных векторов. Применение желаемых изменений к существующим образцам данных можно выполнить без явного исследования поведения латентного пространства.’
Исследователи предсказывают, что основные принципы разъединения, изученные в проекте, могут быть перенесены в другие области, такие как симуляции интерьерной архитектуры, и что метод Sim2Real, принятый для Delta-GAN-Encoder, может в конечном итоге позволить инструментальности дипфейка на основе простых эскизов, а не CGI-входных данных.
Можно утверждать, что степень, в которой новая израильская система может или не может синтезировать видео дипфейка, намного менее значима, чем прогресс, которого достигло исследование в разъединении контекста и идентичности, получив больше контроля над латентным пространством GAN.
Разъединение – это активная область исследований в синтезе изображений; в январе 2021 года исследовательская работа под руководством Amazon демонстрировала подобный контроль позы и разъединение, и в 2018 году статья из Шеньженских институтов передовых технологий при Китайской академии наук достигла прогресса в генерации произвольных точек зрения в GAN.













