Взгляд Anderson
Имитирование «лучших» тел с помощью ИИ

Новое исследование из академии Alibaba DAMO предлагает рабочий процесс, основанный на ИИ, для автоматизации изменения формы изображений тел — редкое усилие в области компьютерного зрения, в которой в настоящее время доминируют манипуляции с лицами, такие как дипфейки, и редактирование лиц на основе GAN.

Вставка в столбцы «result», сгенерированные карты внимания, определяющие области, подлежащие изменению. Источник: https://arxiv.org/pdf/2203.04670.pdf
Архитектура исследователей использует оценку позы скелета, чтобы справиться с более высокой сложностью, с которой сталкиваются системы синтеза и редактирования изображений при концептуализации и параметризации существующих изображений тел, по крайней мере до уровня детализации, позволяющего выполнять осмысленное и избирательное редактирование.

Оцененные карты скелета помогают выделять и сосредотачивать внимание на участках тела, которые, вероятно, будут ретушированы, например, область верхней части руки.
В конечном итоге система позволяет пользователю задавать параметры, которые могут менять внешний вид веса, мышечной массы или распределения веса на полноразмерных или средних фотографиях людей, а также генерировать произвольные трансформации одетых или обнажённых частей тела.

Слева — исходное изображение; посередине — тепловая карта полученных областей внимания; справа — преобразованное изображение.
Мотивацией работы является разработка автоматизированных рабочих процессов, которые могли бы заменить трудоёмкие цифровые манипуляции, выполняемые фотографами и графическими художниками в различных отраслях медиа, от моды до журнального контента и промо-материалов.
В целом, как отмечают авторы, эти трансформации обычно применяются с помощью техник «warp» в Photoshop и других традиционных растровых редакторах и почти исключительно используются для изображений женщин. Следовательно, специально разработанный набор данных, созданный для облегчения нового процесса, состоит преимущественно из фотографий женских субъектов:
‘Поскольку ретуширование тела в основном востребовано женщинами, большинство наших фотографий — женские, учитывая разнообразие возрастов, рас (Африканская:Азиатская:Кавказская = 0.33:0.35:0.32), поз и одежды.’
Статья paper называется Structure-Aware Flow Generation for Human Body Reshaping и написана пятью авторами, связанными с глобальной академией DAMO компании Alibaba.
Разработка набора данных
Как обычно происходит с системами синтеза и редактирования изображений, архитектуре проекта потребовался индивидуализированный обучающий набор данных. Авторы привлекли трёх фотографов для создания стандартных манипуляций в Photoshop над подходящими изображениями с фотостока Unsplash, что привело к набору данных — названному BR-5K* — из 5 000 высококачественных изображений с разрешением 2K.
Исследователи подчёркивают, что цель обучения на этом наборе данных не состоит в создании «идеализированных» и обобщённых признаков, связанных с индексом привлекательности или желаемого внешнего вида, а в извлечении центральных карт признаков, связанных с профессиональными манипуляциями изображений тел.
Однако они признают, что манипуляции в конечном итоге отражают трансформационные процессы, переводящие изображение от «реального» к заранее заданному представлению об «идеальном»:
‘Мы пригласили трёх профессиональных художников независимо ретушировать тела в Photoshop с целью получения стройных фигур, соответствующих популярной эстетике, и выбрали лучшую в качестве эталона.’
Поскольку в рамках системы лица не обрабатываются, они были размыты перед включением в набор данных.
Архитектура и основные концепции
Рабочий процесс системы включает загрузку портрета высокого разрешения, понижение его до более низкого разрешения, подходящего под доступные вычислительные ресурсы, и извлечение оценённой позы скелетной карты (вторая фигура слева на изображении ниже), а также полей аффинности частей (PAFs), которые были разработаны в 2016 году Институтом робототехники Университета Карнеги‑Меллон (см. встроенное ниже видео).
Поля аффинности частей помогают определить ориентацию конечностей и их общую связь с более широкой скелетной структурой, предоставляя новому проекту дополнительный инструмент внимания/локализации.

Из статьи 2016 года о полях аффинности частей, предсказанные PAFs кодируют ориентацию конечностей как часть 2‑мерного вектора, который также включает общее положение конечности. Источник: https://arxiv.org/pdf/1611.08050.pdf
Несмотря на их кажущуюся незначительность для внешнего вида веса, карты скелета полезны для направления финальных трансформационных процессов к тем частям тела, которые необходимо изменить, таким как верхняя часть рук, ягодицы и бедра.
После этого результаты передаются в модуль Structure Affinity Self-Attention (SASA) в центральном узком месте процесса (см. изображение ниже).

SASA регулирует согласованность генератора потока, который питает процесс; полученные результаты затем передаются в модуль искажения (второй справа на изображении выше), который применяет трансформации, изученные во время обучения на ручных правках, включённых в набор данных.

Модуль Structure Affinity Self-Attention (SASA) распределяет внимание на соответствующие части тела, помогая избежать лишних или нерелевантных трансформаций.
Полученное изображение затем масштабируется обратно до исходного разрешения 2K с использованием процессов, схожих со стандартной архитектурой дипфейков 2017 года, на основе которой впоследствии были созданы такие популярные пакеты, как DeepFaceLab; процесс увеличения также распространён в фреймворках редактирования GAN.
Сеть внимания для схемы построена на основе Compositional De-Attention Networks (CODA), академического сотрудничества США/Сингапура 2019 года с Amazon (AMZN ) AI и Microsoft.
Тесты
Фреймворк, основанный на потоке, был протестирован против предыдущих методов, основанных на потоке FAL и Animating Through Warping (ATW), а также архитектур трансляции изображений Pix2PixHD и GFLA, используя SSIM, PSNR и LPIPS в качестве метрик оценки.

Результаты начальных тестов (направление стрелки в заголовках указывает, лучше ли более низкие или более высокие показатели).
Исходя из этих метрик, система авторов превосходит предыдущие архитектуры.

Отобранные результаты. Пожалуйста, обратитесь к оригинальному PDF, связанному в этой статье, для сравнения в более высоком разрешении.
Помимо автоматических метрик, исследователи провели пользовательское исследование (последний столбец таблицы результатов, изображённый ранее), в котором 40 участников получили по 30 вопросов, случайным образом выбранных из пула из 100 вопросов, касающихся изображений, полученных различными методами. 70 % респондентов отдали предпочтение новой технике как более «визуально привлекательной».
Проблемы
Новая статья представляет редкое погружение в манипуляцию телами с помощью ИИ. Сектор синтеза изображений в настоящее время гораздо более заинтересован в генерации редактируемых тел с помощью методов, таких как Neural Radiance Fields (NeRF), либо сосредоточен на изучении латентного пространства GAN и потенциала автокодеров для манипуляций с лицами.
Инициатива авторов в настоящее время ограничивается изменением воспринимаемого веса, и они не реализовали никакую технику заполнения (inpainting), которая могла бы восстановить фон, неизбежно раскрывающийся при уменьшении веса на изображении человека.
Тем не менее, они предполагают, что матирование портрета и смешивание фона с помощью текстурного вывода могут тривиально решить проблему восстановления частей сцены, ранее скрытых в изображении из‑за человеческой «недостаточности».

Предлагаемое решение для восстановления фона, раскрывающегося при уменьшении жира с помощью ИИ.
* Хотя препринт ссылается на дополнительный материал, содержащий более подробную информацию о наборе данных, а также дополнительные примеры проекта, место расположения этого материала не указано в статье, и соответствующий автор пока не ответил на наш запрос о доступе.
Первоначально опубликовано 10 марта 2022 года.












