Взгляд Anderson
Новая и более простая методика глубоких фейков, превосходящая предыдущие подходы

Сотрудничество между китайской группой исследователей искусственного интеллекта и исследователями из США привело к разработке того, что может быть первой真正ной инновацией в технологии глубоких фейков с момента ее появления четыре года назад.
Новый метод может выполнять операции по замене лиц, которые превосходят все существующие框架 на стандартных перцептивных тестах, без необходимости обширного сбора и курирования больших专ических наборов данных и их обучения в течение недели для одной идентичности. Для примеров, представленных в новой статье, модели были обучены на всём двух популярных наборов данных знаменитостей, на одном GPU NVIDIA Tesla P40 в течение примерно трех дней.

Полное видео доступно в конце этой статьи. В этом примере из видео в дополнительных материалах, предоставленных одним из авторов новой статьи, лицо Скарлетт Йоханссон переносится на исходное видео. CihaNet устраняет проблему маскирования краев при выполнении замены, формируя и реализуя более глубокие отношения между исходной и целевой идентичностью, что означает конец ‘очевидных границ’ и других ошибок наложения, которые возникают в традиционных подходах к глубоким фейкам. Source: Source: https://mitchellx.github.io/#video
Новый подход устраняет необходимость ‘приклеивать’ трансплантированную идентичность грубо в целевое видео, что часто приводит к появлению артефактов, которые появляются там, где фальшивое лицо заканчивается, и настоящее, лежащее в основе лицо начинается. Вместо этого используются ‘карты галлюцинаций’, чтобы выполнить более глубокое смешивание визуальных аспектов, поскольку система разделяет идентичность и контекст намного более эффективно, чем текущие методы, и поэтому может смешать целевую идентичность на более глубоком уровне.

Из статьи. Преобразования CihaNet осуществляются посредством карт галлюцинаций (нижний ряд). Система использует информацию о контексте (т.е. направление лица, волосы, очки и другие препятствия и т. д.) полностью из изображения, в которое будет наложена новая идентичность, и информацию об идентичности лица полностью из человека, который будет вставлен в изображение. Эта способность разделить лицо и контекст имеет решающее значение для успеха системы. Source: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
По сути, новая карта галлюцинаций обеспечивает более полный контекст для замены, в отличие от жестких масок, которые часто требуют обширной курирования (и в случае DeepFaceLab, отдельного обучения) и обеспечивают ограниченную гибкость в плане реального включения двух идентичностей.

Из примеров, представленных в дополнительных материалах, используя наборы данных FFHQ и Celeb-A HQ, на VGGFace и Forensics++. Первые два столбца показывают случайно выбранные (реальные) изображения, которые будут заменены. Следующие четыре столбца показывают результаты замены, используя четыре наиболее эффективных метода, в настоящее время доступных, а последний столбец показывает результат из CihaNet. Был использован репозиторий FaceSwap, а не более популярный DeepFaceLab, поскольку оба проекта являются форками исходного кода Deepfakes 2017 года на GitHub. Хотя каждый проект с тех пор добавил модели, методы, разнообразные интерфейсы и дополнительные инструменты, основной код, который делает возможными глубокие фейки, никогда не менялся и остается общим для обоих. Source: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
Статья статья, озаглавленная Одноэтапная сеть галлюцинации контекста и идентичности, написана исследователями, связанными с JD AI Research и Университетом Массачусетса в Амхерсте, и была поддержана Национальной ключевой программой исследований и разработок Китая под номером гранта 2020AAA0103800. Она была представлена на 29-й Международной конференции ACM по мультимедиа, 20-24 октября, в Чэнду, Китай.
Нет необходимости в ‘лицевой’ паритете
И наиболее популярное в настоящее время программное обеспечение для глубоких фейков, DeepFaceLab, и конкурирующий форк FaceSwap, выполняют извилистые и часто ручные рабочие процессы, чтобы определить, в каком направлении находится лицо, какие препятствия мешают (снова, вручную), и должны справляться с многими другими раздражающими препятствиями (включая освещение), которые делают их использование далеко не ‘point-and-click’ опытом, который неточно изображается в СМИ с момента появления глубоких фейков.
Напротив, CihaNet не требует, чтобы две изображения были обращены прямо к камере, чтобы извлечь и использовать полезную информацию об идентичности из одного изображения.

В этих примерах набор программного обеспечения для глубоких фейков был проверен на задаче замены лиц, которые не только различаются по идентичности, но и не обращены в одном направлении. Программное обеспечение, полученное из исходного репозитория глубоких фейков (такого как очень популярный DeepFaceLab и FaceSwap, показанный выше), не может справиться с разницей в углах между двумя изображениями, которые будут заменены (см. третий столбец). Тем временем, CihaNet может абстрагировать идентичность правильно, поскольку ‘поз’ лица не является неотъемлемой частью информации об идентичности.
Архитектура
Проект CihaNet, по словам авторов, был вдохновлен сотрудничеством 2019 года между Microsoft Research и Пекинским университетом, называемым FaceShifter, хотя он вносит некоторые заметные и критические изменения в основную архитектуру старого метода.
FaceShifter использует две сети адаптивной нормализации экземпляров (AdaIN) для обработки информации об идентичности, которая затем транспонируется в целевое изображение через маску, аналогично текущему популярному программному обеспечению для глубоких фейков (и со всеми его ограничениями), используя дополнительную HEAR-Net (которая включает отдельно обученную подсеть, обученную на препятствиях для затенения – дополнительный слой сложности).
Вместо этого новая архитектура直接 использует эту ‘контекстную’ информацию для преобразовательного процесса, через двухэтапную единую каскадную адаптивную нормализацию экземпляров (C-AdaIN), которая обеспечивает последовательность контекста (т.е. кожи лица и затенения) областей, связанных с идентичностью.
Вторая подсеть, имеющая решающее значение для системы, называется блоком замены (SwapBlk), который генерирует интегрированную особенность из контекста ссылочного изображения и встроенной ‘идентичности’ информации из исходного изображения, минуя множество стадий, необходимых для достижения этого посредством обычных средств.
Чтобы помочь различать контекст и идентичность, для каждого уровня генерируется карта галлюцинации, которая заменяет мягкую сегментационную маску и действует на более широкий спектр особенностей для этой критической части процесса глубоких фейков.

По мере роста значения карты галлюцинации (показано справа) появляется более четкий путь между идентичностями.
Таким образом, весь процесс замены выполняется в одной стадии и без постобработки.
Данные и тестирование
Чтобы протестировать систему, исследователи обучили четыре модели на двух очень популярных и разнообразных открытых наборах изображений – CelebA-HQ и наборе данных Flickr-Faces-HQ от NVIDIA (FFHQ), каждый из которых содержит 30 000 и 70 000 изображений соответственно.
Не было выполнено никакой обрезки или фильтрации этих базовых наборов данных. В каждом случае исследователи обучили всю каждую базу данных на одном GPU Tesla в течение трех дней, с скоростью обучения 0,0002 на оптимизации Adam.
Затем они отрендерили серию случайных замен среди тысяч личностей, представленных в наборах данных, без учета того, были ли лица похожи или даже совпадали по полу, и сравнили результаты CihaNet с выводом из четырех ведущих фреймворков глубоких фейков: FaceSwap (который заменяет более популярный DeepFaceLab, поскольку он разделяет базовый кодовый фонд в исходном репозитории 2017 года, который привел глубокие фейки в мир); вышеупомянутый FaceShifter; FSGAN; и SimSwap.
При сравнении результатов через VGG-Face, FFHQ, CelebA-HQ и FaceForensics++, авторы обнаружили, что их новая модель превосходит все предыдущие модели, как указано в таблице ниже.

Три метрики, использованные при оценке результатов, были структурным подобием (SSIM), ошибка оценки позы и точность извлечения идентичности, которая рассчитывается на основе процента успешно извлеченных пар.
Исследователи утверждают, что CihaNet представляет собой лучший подход в плане качественных результатов и заметный прогресс в текущем состоянии искусства в технологиях глубоких фейков, удаляя бремя обширных и трудоемких архитектур маскирования и методологий, и достигая более полезного и действенного разделения идентичности и контекста.
Взгляните ниже, чтобы увидеть дополнительные видео примеры новой методики. Вы можете найти полную видеозапись здесь.
Из дополнительных материалов для новой статьи CihaNet выполняет замену лиц на различных идентичностях. Source: https://mitchellx.github.io/#video














