Взгляд Anderson

Почему дипфейки не могут передавать нюансы эмоций

mm
Добавьте Unite.AI в избранные источники в Google
The Book of Boba Fett - Disney

Премьера 6-го эпизода спин-оффа «Звездных войн» «Книга Бобы Фетта»似乎 разделела мнение фанатов. Получив общее одобрение, существует распространенное предположение в социальных сетях, что значительно улучшенная реконструкция де-эйджированного Марка Хэмилла (по сравнению с его предыдущим появлением в финале 2-го сезона «Мандалорца» в 2020 году) является прямым результатом того, что Industrial Light and Magic наняла любительского практика дипфейков Shamook (который радикально улучшил свою работу с открытым исходным кодом); и что изображения персонажа должны быть сочетанием технологии дипфейков, возможно, отредактированной с помощью CGI.

На данный момент существует ограниченное подтверждение этого, хотя Shamook сказал мало миру с тех пор, как на него был наложен контракт ILM NDA. Тем не менее, работа является замечательным улучшением по сравнению с CGI 2020 года; она демонстрирует некоторую «блескость», связанную с моделями дипфейков, полученными из архивных работ; и в целом соответствует лучшему текущему визуальному стандарту для дипфейков.

Другой ветвью мнения фанатов является то, что новая попытка «Молодой Люк» имеет другой набор недостатков, чем предыдущая. Может быть, наиболее показательно, что отсутствие выразительности и тонких, уместных эмоций в очень длинных последовательностях с новым воспроизведением Скайуокера более типично для дипфейков, чем для CGI; The Verge описала симуляцию «Бобы Фетта» в терминах «неуютного, пустого лица замороженного лица Марка Хэмилла 1983 года».

Независимо от технологий, стоящих за новой реконструкцией ILM, дипфейки имеют фундаментальную проблему с нюансами эмоций, которую трудно решить либо путем изменений в архитектуре, либо путем улучшения исходного обучающего материала, и которую обычно избегают путем тщательного выбора, который делают вирусные дипфейкеры при выборе целевого видео.

Ограничения лицевой выравнивания

Два наиболее часто используемых репозитория дипфейков с открытым исходным кодом – DeepFaceLab (DFL) и FaceSwap, оба получены из анонимного и спорного исходного кода 2017 года, при этом DFL имеет огромное преимущество в индустрии VFX, несмотря на его ограниченную инструментальность.

Каждый из этих пакетов изначально задача извлечения лицевых ориентиров из лиц, которые он смог определить из исходного материала (т. е. кадров видео и/или статических изображений).

Сетевая лицевая выравнивание (FAN) Адриана Булата в действии, из официального репозитория. Источник: https://github.com/1adrianb/face-alignment

Сетевая лицевая выравнивание (FAN) в действии, из официального репозитория. Источник: https://github.com/1adrianb/face-alignment

И DFL, и FaceSwap используют Сетевую лицевую выравнивание (FAN) библиотеку. FAN может создавать 2D- и 3D-ориентиры (см. изображение выше) для извлеченных лиц. 3D-ориентиры могут учитывать воспринимаемую ориентацию лица, вплоть до крайних профилей и относительно острых углов.

Однако очевидно, что это очень примитивные рекомендации для управления и оценки пикселей:

Из форума FaceSwap, грубый индикатор доступных ориентиров для лицевых линий. Источник: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

Из форума FaceSwap, грубый индикатор доступных ориентиров для лицевых линий. Источник: https://forum.faceswap.dev/viewtopic.php?f=25&t=27

Самые базовые линии лица учтены: глаза могут расширяться и закрываться, как и челюсть, а базовые конфигурации рта (такие как улыбка, хмурость и т. д.) могут быть отслежены и адаптированы. Лицо может вращаться в любом направлении до примерно 200 градусов от точки зрения камеры.

За пределами этого, эти ограничения довольно грубы для того, как пиксели будут вести себя внутри этих границ, и представляют собой единственно真正 математические и точные лицевые рекомендации в整个 процессе дипфейков. Процесс обучения просто сравнивает, как пиксели расположены внутри или рядом с этими границами.

Обучение в DeepFaceLab. Источник: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Обучение в DeepFaceLab. Источник: https://medium.com/geekculture/realistic-deepfakes-with-deepfacelab-530e90bd29f2

Поскольку нет возможности учитывать топологию подчастей лица (выпукость и вогнутость щек, детали старения, ямочки и т. д.), даже невозможно попытаться совместить такие «тонкие» подфункции между источником («лицо, которое вы хотите переписать») и целевым («лицо, которое вы хотите вставить») идентификатором.

Сделать все возможное с ограниченными данными

Получение совпадающих данных между двумя идентификаторами для целей обучения дипфейков не легко. Чем необычнее угол, который вам нужно совместить, тем больше вам, возможно, придется идти на компромисс в отношении того, действительно ли этот (редкий) угол совпадает между идентификаторами A и B и действительно ли он имеет одинаковое выражение.

Близко, но не совсем совпадает.

Близко, но не совсем совпадает.

В примере выше два идентификатора довольно похожи по расположению, но это так близко, как может получить этот набор данных к точному совпадению.

Явные различия остаются: угол и объектив не совсем совпадают, и освещение также не совпадает; субъект A не имеет глаз, полностью закрытых, в отличие от субъекта B; качество изображения и сжатие хуже в субъекте A; и каким-то образом субъект B кажется намного счастливее, чем субъект A.

Но, знаете, это все, что у нас есть, поэтому нам придется тренироваться на этом в любом случае.

Поскольку это совпадение A><B имеет так много необычных элементов, вы можете быть уверены, что в наборе есть мало, если есть, подобные пары.

Следовательно, обучение, скорее всего, недооценит его или переоценит его.

Недооценка: Если это совпадение является истинным меньшинством (т. е. родительский набор данных довольно велик и не часто имеет характеристики этих двух фотографий), оно не получит много времени обучения по сравнению с более «популярными» (т. е. легкими/нейтральными) парами. Следовательно, этот угол/выражение не будет хорошо представлено в дипфейке, созданном с помощью обученной модели.

Переоценка: В отчаянии от скудных данных-соответствий для таких редких пар A><B дипфейкеры иногда дублируют пару несколько раз в наборе данных, чтобы она получила лучший шанс стать функцией в окончательной модели. Это приведет к переоценке, когда дипфейк-видео, созданные с помощью модели, с большой вероятностью педантично повторят несоответствия, которые очевидны между двумя фотографиями, такие как различия в степени, в которой глаза закрыты.

На изображении ниже мы видим, как Владимир Путин обучается в DeepFaceLab для замены на Кевина Спейси. Здесь обучение относительно продвинуто на 160 000 итераций.

Источник: https://i.imgur.com/OdXHLhU.jpg (первоначально с сайта, на который я не могу ссылаться здесь).

Источник: https://i.imgur.com/OdXHLhU.jpg

Случайный наблюдатель может утверждать, что Путин выглядит немного, ну, космичнее, чем Спейси в этих тестовых заменах. Давайте посмотрим, что онлайн-программа распознавания эмоций делает с несоответствием в выражениях:

Источник: https://www.noldus.com/facereader/measure-your-emotions

Источник: https://www.noldus.com/facereader/measure-your-emotions

Согласно этому оракулу, который анализирует более подробную топографию лица, чем DFL и Faceswap, Спейси менее злой, отвратительный и презрительный, чем получившийся дипфейк Путина в этом паре.

Неравные выражения приходят в составе связанного пакета, поскольку популярные приложения дипфейков не имеют возможности регистрировать или совпадать выражения или эмоции, кроме как косвенно, как сырое сопоставление пикселя с пикселем.

Для нас эти различия огромны. Мы учимся читать лицевые выражения как базовый механизм выживания с раннего возраста и продолжаем полагаться на этот навык во взрослом возрасте для целей социальной интеграции и прогресса, спаривания и как постоянной основы для оценки угрозы. Поскольку мы так чувствительны к микровыражениям, технологии дипфейков в конечном итоге должны будет учесть это.

Против течения

Хотя революция дипфейков принесла обещание вставки «классических» кинозвезд в современные фильмы и телешоу, ИИ не может вернуться назад во времени и снять их классические работы в более совместимом разрешении и качестве, что имеет решающее значение для этого использования.

При условии (и для наших целей, это не имеет значения, если это неправильно), что реконструкция Хэмилла в «Бобе Фетте» была в основном работой обученной модели дипфейков, набор данных для модели должен был использовать кадры из периода, близкого к хронологии шоу (т. е. Хэмилл как ранний тридцатилетний в период производства «Возвращения Джедая», 1981-83).

Фильм был снят на пленку Eastman Color Negative 250T 5293/7293, 250ASA-эмульсию, которая считалась средней до мелкозернистой в то время, но была превзойдена по ясности, цветовому диапазону и точности даже к концу 1980-х годов. Это пленка своего времени, и оперативный масштаб «Джедая» позволил мало крупных планов даже для ведущих актеров, что делает проблемы с зерном еще более критичными, поскольку исходные лица занимают только часть кадра.

Набор сцен Хэмилла в Возвращении Джедая (1983).

Набор сцен Хэмилла в Возвращении Джедая (1983).

Кроме того, многие спецэффектные кадры с Хэмиллом прошли через оптическую печать, что увеличило зерно пленки. Однако доступ к архивам Lucasfilm – которые, вероятно, хорошо сохранили мастер-негативы и могли предложить часы дополнительных неиспользованных сырых кадров – мог бы преодолеть эту проблему.

Иногда возможно охватить диапазон лет актерской карьеры, чтобы увеличить и разнообразить набор данных дипфейков. В случае с Хэмиллом дипфейкеры ограничены его изменением внешности после автомобильной аварии в 1977 году и тем, что он сразу же начал свою вторую карьеру как признанный актер озвучивания после «Джедая», что делает исходный материал относительно скудным.

Ограниченный диапазон эмоций?

Если вам нужно, чтобы ваш дипфейковый актер жевал декорации, вам понадобится исходный материал, содержащий необычно широкий диапазон лицевых выражений. Может быть, что единственный возрастно-апроприатный материал, доступный для этого, не содержит многих из этих выражений.

Например, к моменту, когда сюжетная арка «Возвращения Джедая» состоялась, персонаж Хэмилла в основном овладел своими эмоциями, развитие, абсолютно центральное для оригинальной мифологии франшизы. Следовательно, если вы создаете модель дипфейка Хэмилла из данных «Джедая», вам придется работать с более ограниченным диапазоном эмоций и необычной лицевой композицией, которую роль Хэмилла требовала от него в то время, по сравнению с его более ранними работами в франшизе.

Даже если вы считаете, что есть моменты в «Возвращении Джедая», когда персонаж Скайуокера находится под стрессом и может предоставить материал для более широкого диапазона выражений, материал лица в этих сценах все равно кратковременный и подвержен размытию движения и быстрому монтажу, типичному для сцен действия; поэтому данные довольно несбалансированы.

Обобщение: Слияние эмоций

Если реконструкция Скайуокера в «Бобе Фетте» действительно является дипфейком, отсутствие выразительного диапазона, которое было обвинено в нем с некоторых сторон, не будет полностью обусловлено ограниченным исходным материалом. Процесс обучения дипфейков – это поиск обобщенной модели, которая успешно извлекает центральные функции из тысяч изображений и может хотя бы попытаться создать дипфейк угла, который был отсутствующим или редким в наборе данных.

Если бы не эта гибкость, архитектура дипфейков просто копировала и вставляла базовые морфы на кадр за кадром, не учитывая ни временную адаптацию, ни контекст.

Однако болезненная компромисс за эту универсальность заключается в том, что верность выражениям, скорее всего, станет жертвой процесса, и любые выражения, которые есть «тонкие», могут не быть правильными. Мы все играем на своих лицах как на 100-пьесочном оркестре и хорошо к этому приспособлены, тогда как программное обеспечение дипфейков аргументированно лишено хотя бы струнного отдела.

Различие воздействия в выражениях

Лицевые движения и их влияние на нас не являются единым языком для всех лиц; поднятая бровь, которая выглядит беззаботно на Роджере Муре, может выглядеть менее утонченно на Сете Рогане, тогда как соблазнительная привлекательность Мэрилин Монро может перевести в более отрицательную эмоцию, если дипфейкована на человека, чья наиболее доступная роль – «злой» или «дисаффектный» (например, персонаж Обри Плазы за семь сезонов «Парков и зон отдыха»).

Следовательно, пиксель-за-пиксель эквивалентность между наборами лиц A/B не обязательно полезна в этом отношении; но это все, что предлагается в программном обеспечении дипфейков с открытым исходным кодом.

Что, вероятно, необходимо, – это каркас дипфейков, который не только может распознавать выражения и выводить эмоции, но и имеет возможность воплощать высокоуровневые понятия, такие как злой, соблазнительный, скучный, усталый и т. д., и категоризировать эти эмоции и связанные с ними выражения в каждом из двух наборов лиц, а не изучать и реплицировать расположение рта или век.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai