Взгляд Anderson

Имитирование «лучших» тел с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из академии Alibaba DAMO предлагает рабочий процесс, основанный на ИИ, для автоматизации изменения формы изображений тел — редкое усилие в области компьютерного зрения, в которой в настоящее время доминируют манипуляции с лицами, такие как дипфейки, и редактирование лиц на основе GAN.

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

Вставка в столбцы «result», сгенерированные карты внимания, определяющие области, подлежащие изменению. Источник: https://arxiv.org/pdf/2203.04670.pdf

Архитектура исследователей использует оценку позы скелета, чтобы справиться с более высокой сложностью, с которой сталкиваются системы синтеза и редактирования изображений при концептуализации и параметризации существующих изображений тел, по крайней мере до уровня детализации, позволяющего выполнять осмысленное и избирательное редактирование.

Оцененные карты скелета помогают выделять и сосредотачивать внимание на участках тела, которые, вероятно, будут ретушированы, например, область верхней части руки.

В конечном итоге система позволяет пользователю задавать параметры, которые могут менять внешний вид веса, мышечной массы или распределения веса на полноразмерных или средних фотографиях людей, а также генерировать произвольные трансформации одетых или обнажённых частей тела.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

Слева — исходное изображение; посередине — тепловая карта полученных областей внимания; справа — преобразованное изображение.

Мотивацией работы является разработка автоматизированных рабочих процессов, которые могли бы заменить трудоёмкие цифровые манипуляции, выполняемые фотографами и графическими художниками в различных отраслях медиа, от моды до журнального контента и промо-материалов.

В целом, как отмечают авторы, эти трансформации обычно применяются с помощью техник «warp» в Photoshop и других традиционных растровых редакторах и почти исключительно используются для изображений женщин. Следовательно, специально разработанный набор данных, созданный для облегчения нового процесса, состоит преимущественно из фотографий женских субъектов:

‘Поскольку ретуширование тела в основном востребовано женщинами, большинство наших фотографий — женские, учитывая разнообразие возрастов, рас (Африканская:Азиатская:Кавказская = 0.33:0.35:0.32), поз и одежды.’

Статья paper называется Structure-Aware Flow Generation for Human Body Reshaping и написана пятью авторами, связанными с глобальной академией DAMO компании Alibaba.

Разработка набора данных

Как обычно происходит с системами синтеза и редактирования изображений, архитектуре проекта потребовался индивидуализированный обучающий набор данных. Авторы привлекли трёх фотографов для создания стандартных манипуляций в Photoshop над подходящими изображениями с фотостока Unsplash, что привело к набору данных — названному BR-5K* — из 5 000 высококачественных изображений с разрешением 2K.

Исследователи подчёркивают, что цель обучения на этом наборе данных не состоит в создании «идеализированных» и обобщённых признаков, связанных с индексом привлекательности или желаемого внешнего вида, а в извлечении центральных карт признаков, связанных с профессиональными манипуляциями изображений тел.

Однако они признают, что манипуляции в конечном итоге отражают трансформационные процессы, переводящие изображение от «реального» к заранее заданному представлению об «идеальном»:

‘Мы пригласили трёх профессиональных художников независимо ретушировать тела в Photoshop с целью получения стройных фигур, соответствующих популярной эстетике, и выбрали лучшую в качестве эталона.’

Поскольку в рамках системы лица не обрабатываются, они были размыты перед включением в набор данных.

Архитектура и основные концепции

Рабочий процесс системы включает загрузку портрета высокого разрешения, понижение его до более низкого разрешения, подходящего под доступные вычислительные ресурсы, и извлечение оценённой позы скелетной карты (вторая фигура слева на изображении ниже), а также полей аффинности частей (PAFs), которые были разработаны в 2016 году Институтом робототехники Университета Карнеги‑Меллон (см. встроенное ниже видео).

Поля аффинности частей помогают определить ориентацию конечностей и их общую связь с более широкой скелетной структурой, предоставляя новому проекту дополнительный инструмент внимания/локализации.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

Из статьи 2016 года о полях аффинности частей, предсказанные PAFs кодируют ориентацию конечностей как часть 2‑мерного вектора, который также включает общее положение конечности. Источник: https://arxiv.org/pdf/1611.08050.pdf

Несмотря на их кажущуюся незначительность для внешнего вида веса, карты скелета полезны для направления финальных трансформационных процессов к тем частям тела, которые необходимо изменить, таким как верхняя часть рук, ягодицы и бедра.

После этого результаты передаются в модуль Structure Affinity Self-Attention (SASA) в центральном узком месте процесса (см. изображение ниже).

SASA регулирует согласованность генератора потока, который питает процесс; полученные результаты затем передаются в модуль искажения (второй справа на изображении выше), который применяет трансформации, изученные во время обучения на ручных правках, включённых в набор данных.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Модуль Structure Affinity Self-Attention (SASA) распределяет внимание на соответствующие части тела, помогая избежать лишних или нерелевантных трансформаций.

Полученное изображение затем масштабируется обратно до исходного разрешения 2K с использованием процессов, схожих со стандартной архитектурой дипфейков 2017 года, на основе которой впоследствии были созданы такие популярные пакеты, как DeepFaceLab; процесс увеличения также распространён в фреймворках редактирования GAN.

Сеть внимания для схемы построена на основе Compositional De-Attention Networks (CODA), академического сотрудничества США/Сингапура 2019 года с Amazon (AMZN ) AI и Microsoft.

Тесты

Фреймворк, основанный на потоке, был протестирован против предыдущих методов, основанных на потоке FAL и Animating Through Warping (ATW), а также архитектур трансляции изображений Pix2PixHD и GFLA, используя SSIM, PSNR и LPIPS в качестве метрик оценки.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

Результаты начальных тестов (направление стрелки в заголовках указывает, лучше ли более низкие или более высокие показатели).

Исходя из этих метрик, система авторов превосходит предыдущие архитектуры.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

Отобранные результаты. Пожалуйста, обратитесь к оригинальному PDF, связанному в этой статье, для сравнения в более высоком разрешении.

Помимо автоматических метрик, исследователи провели пользовательское исследование (последний столбец таблицы результатов, изображённый ранее), в котором 40 участников получили по 30 вопросов, случайным образом выбранных из пула из 100 вопросов, касающихся изображений, полученных различными методами. 70 % респондентов отдали предпочтение новой технике как более «визуально привлекательной».

Проблемы

Новая статья представляет редкое погружение в манипуляцию телами с помощью ИИ. Сектор синтеза изображений в настоящее время гораздо более заинтересован в генерации редактируемых тел с помощью методов, таких как Neural Radiance Fields (NeRF), либо сосредоточен на изучении латентного пространства GAN и потенциала автокодеров для манипуляций с лицами.

Инициатива авторов в настоящее время ограничивается изменением воспринимаемого веса, и они не реализовали никакую технику заполнения (inpainting), которая могла бы восстановить фон, неизбежно раскрывающийся при уменьшении веса на изображении человека.

Тем не менее, они предполагают, что матирование портрета и смешивание фона с помощью текстурного вывода могут тривиально решить проблему восстановления частей сцены, ранее скрытых в изображении из‑за человеческой «недостаточности».

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

Предлагаемое решение для восстановления фона, раскрывающегося при уменьшении жира с помощью ИИ.

 

* Хотя препринт ссылается на дополнительный материал, содержащий более подробную информацию о наборе данных, а также дополнительные примеры проекта, место расположения этого материала не указано в статье, и соответствующий автор пока не ответил на наш запрос о доступе.

Первоначально опубликовано 10 марта 2022 года.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai