Взгляд Anderson

Создание «лучших» тел с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование академии Alibaba DAMO предлагает ИИ-ориентированный рабочий процесс для автоматизации перестановки изображений тел – редкая попытка в секторе компьютерного зрения, в настоящее время занятом манипуляциями с лицами, такими как глубокие подделки и редактирование лиц на основе ГАН.

Врезка в столбцы 'результат', сгенерированные карты внимания, определяющие области для изменения. Источник: https://arxiv.org/pdf/2203.04670.pdf

Врезка в столбцы ‘результат’, сгенерированные карты внимания, определяющие области для изменения. Источник: https://arxiv.org/pdf/2203.04670.pdf

Архитектура исследователей использует оценку позы скелета для решения более сложной проблемы, с которой сталкиваются системы синтеза и редактирования изображений, а именно концептуализация и параметризация существующих изображений тел, по крайней мере, на уровне детализации, который позволяет проводить осмысленную и избирательную редакцию.

Оцененные карты скелета помогают индивидуализировать и сосредоточить внимание на областях тела, которые, скорее всего, будут отредактированы, таких как область верхней части руки.

Система в конечном итоге позволяет пользователю задавать параметры, которые могут изменить внешний вид веса, мышечной массы или распределения веса на полных или средних фотографиях людей и может генерировать произвольные преобразования на одетых или обнаженных участках тела.

Слева, входное изображение; в середине, тепловая карта полученных областей внимания; справа, преобразованное изображение.

Слева, входное изображение; в середине, тепловая карта полученных областей внимания; справа, преобразованное изображение.

Мотивацией для работы является разработка автоматизированных рабочих процессов, которые могли бы заменить трудоемкие цифровые манипуляции, выполняемые фотографами и художниками в различных областях медиа, от моды до выходных материалов и публичных материалов.

В целом, авторы признают, что эти преобразования обычно применяются с помощью методов ‘искажения’ в Photoshop и других традиционных редакторах растровой графики и почти исключительно используются на изображениях женщин. Следовательно, созданная для этого процесса пользовательская база данных в основном состоит из изображений женских объектов:

‘Поскольку редактирование тела в основном желательно для женщин, большинство нашей коллекции составляют фотографии женщин, учитывая разнообразие возрастов, рас (Африканское: Азиатское: Кавказское = 0,33: 0,35: 0,32), поз, и одежды.’

Статья называется Structure-Aware Flow Generation for Human Body Reshaping, и исходит от пяти авторов, связанных с глобальной академией Alibaba DAMO.

Разработка базы данных

Как обычно бывает с системами синтеза и редактирования изображений, архитектура проекта требовала настраиваемой базы данных для обучения. Авторы заказали трех фотографов для создания стандартных манипуляций с изображениями из сайта Unsplash, в результате чего получили базу данных – BR-5K* – из 5000 высококачественных изображений с разрешением 2K.

Исследователи подчеркивают, что целью обучения на этой базе данных является не создание ‘идеализированных’ и обобщенных функций, связанных с индексом привлекательности или желаемого вида, а rather извлечение центральных функциональных карт, связанных с профессиональными манипуляциями с изображениями тел.

Однако они признают, что манипуляции в конечном итоге отражают преобразующие процессы, которые отображают прогресс от ‘реального’ до предустановленного понятия ‘идеального’:

‘Мы приглашаем трех профессиональных художников отредактировать тела с помощью Photoshop независимо, с целью достижения стройных фигур, соответствующих популярной эстетике, и выбираем лучший из них как эталон.’

Поскольку каркас не занимается лицами вообще, они были размыты перед включением в базу данных.

Архитектура и основные концепции

Рабочий процесс системы включает в себя подачу высококачественного портрета, снижение его разрешения до более низкого разрешения, которое может поместиться в доступные вычислительные ресурсы, и извлечение оцененной карты позы скелета (второе изображение слева), а также полей сродства частей (PAF), которые были инновированы в 2016 году Институтом робототехники в Университете Карнеги-Меллон (см. видео, встроенное непосредственно ниже).

Поля сродства частей помогают определить ориентацию конечностей и общую связь с более широким скелетным каркасом, предоставляя новому проекту дополнительный инструмент внимания/локализации.

Из статьи 2016 года о полях сродства частей, предсказанные PAF кодируют ориентацию конечности как часть 2D-вектора, который также включает общую позицию конечности. Источник: https://arxiv.org/pdf/1611.08050.pdf

Из статьи 2016 года о полях сродства частей, предсказанные PAF кодируют ориентацию конечности как часть 2D-вектора, который также включает общую позицию конечности. Источник: https://arxiv.org/pdf/1611.08050.pdf

Несмотря на их apparent неважность для внешнего вида веса, карты скелета полезны для направления окончательных преобразующих процессов к частям тела, которые необходимо изменить, таким как верхние руки, rear и бедра.

После этого результаты подаются в Structure Affinity Self-Attention (SASA) в центральной бутылке процесса (см. изображение ниже).

SASA регулирует последовательность генератора, который питает процесс, результаты которого затем передаются в модуль искажения (второй справа на изображении выше), который применяет преобразования, полученные из обучения на ручных редактированиях, включенных в базу данных.

Модуль Structure Affinity Self-Attention (SASA) распределяет внимание на соответствующие части тела, помогая избежать посторонних или ненужных преобразований.

Модуль Structure Affinity Self-Attention (SASA) распределяет внимание на соответствующие части тела, помогая избежать посторонних или ненужных преобразований.

Выходное изображение затем увеличивается до исходного разрешения 2K, используя процессы, не слишком отличающиеся от стандартной, 2017-стиля архитектуры глубоких подделок, из которой были получены популярные пакеты, такие как DeepFaceLab; процесс увеличения также распространен в рамках редактирования ГАН.

Сеть внимания для схемы моделируется по образцу Compositional De-Attention Networks (CODA), совместного проекта 2019 года между Amazon AI и Microsoft.

Тесты

Потоковый каркас был протестирован на предыдущих потоковых методах FAL и Animating Through Warping (ATW), а также на архитектурах перевода изображений Pix2PixHD и GFLA, с SSIM, PSNR и LPIPS в качестве метрик оценки.

Результаты первоначальных тестов (направление стрелки в заголовках указывает, является ли более низкое или более высокое значение лучшим).

Результаты первоначальных тестов (направление стрелки в заголовках указывает, является ли более низкое или более высокое значение лучшим).

На основе этих принятых метрик система авторов превосходит предыдущие архитектуры.

Выбранные результаты. Пожалуйста, обратитесь к исходному PDF, связанному с этой статьей, для более высокого разрешения сравнений.

Выбранные результаты. Пожалуйста, обратитесь к исходному PDF, связанному с этой статьей, для более высокого разрешения сравнений.

Помимо автоматических метрик, исследователи провели пользовательское исследование (последний столбец таблицы результатов, показанный ранее), в котором 40 участников были показаны 30 вопросов, случайным образом выбранных из пула вопросов, связанных с изображениями, полученными через различные методы. 70% респондентов предпочли новый метод как более ‘визуально привлекательный’.

Проблемы

Новая статья представляет собой редкое исследование в области ИИ-ориентированного манипулирования телом. Сектор синтеза изображений в настоящее время гораздо больше заинтересован либо в генерации редактируемых тел с помощью методов, таких как Neural Radiance Fields (NeRF), либо фокусируется на изучении潜ного пространства ГАН и потенциала автоэнкодеров для манипулирования лицами.

Инициатива авторов в настоящее время ограничена производством изменений в воспринимаемом весе, и они не реализовали никаких методов инпейтинга, которые могли бы восстановить фон, который неизбежно открывается, когда вы уменьшаете изображение человека.

Однако они предлагают, что портретная матировка и слияние фона через текстурную инференцию могли бы тривиально решить проблему восстановления частей мира, которые были ранее скрыты в изображении человеческими ‘несовершенствами’.

Предложенное решение для восстановления фона, который открывается ИИ-ориентированным уменьшением жира.

Предложенное решение для восстановления фона, который открывается ИИ-ориентированным уменьшением жира.

 

* Хотя предпубликация ссылается на дополнительные материалы, которые предоставляют более подробную информацию о базе данных, а также дополнительные примеры из проекта, местонахождение этого материала не указано в статье, и соответствующий автор еще не ответил на наш запрос о доступе.

Опубликовано впервые 10 марта 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai