Взгляд Anderson
Перестановка типов человеческого тела с помощью ИИ

Новое исследовательское сотрудничество из Китая предлагает новый метод перестановки человеческого тела на изображениях, используя координированную двойную нейронную сеть, руководимую параметрической моделью, которая позволяет конечному пользователю модулировать вес, рост и пропорции тела в интерактивном графическом интерфейсе.

Параметрическая модуляция формы тела, с ползунками, изменяющими три доступные функции. Источник: https://arxiv.org/pdf/2203.10496.pdf
Эта работа предлагает несколько улучшений над недавним подобным проектом из Alibaba, поскольку она может убедительно изменить рост и пропорции тела, а также вес, и имеет выделенную нейронную сеть для «заполнения» фона, который может быть раскрыт «тонкими» изображениями тела. Она также улучшает заметный ранее параметрический метод для перестановки тела, удаляя необходимость в обширном человеческом вмешательстве во время формулирования преобразования.
Новая архитектура, названная NeuralReshaper, подгоняет параметрическую 3D-модель человека к исходному изображению, а затем использует искажения в модели для адаптации исходного изображения к новым параметрам.
Система способна обрабатывать преобразования тела на одетых, а также на полуодетых (т.е. в пляжной одежде) фигурах.
Преобразования этого типа в настоящее время представляют большой интерес для сектора исследований моды и ИИ, который произвел ряд платформ на основе StyleGAN/CycleGAN и общих нейронных сетей для виртуальных примерок, которые могут адаптировать доступные вещи к форме и типу тела пользователя, или помочь с визуальной конформацией.
Статья под названием Single-image Human-body Reshaping with Deep Neural Networks была опубликована исследователями из Университета Чжэцзяна в Ханчжоу и Школы креативных медиа в Городском университете Гонконга.
SMPL Fitting
NeuralReshaper использует Skinned Multi-Person Linear Model (SMPL), разработанную Институтом интеллектуальных систем Макса Планка и известной компанией Industrial Light and Magic в 2015 году.

Параметрические люди SMPL из сотрудничества Planck/ILM 2015 года. Источник: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf
На первом этапе процесса генерируется модель SMPL из исходного изображения, к которому желательно применить преобразования тела. Адаптация модели SMPL к изображению следует методологии Human Mesh Recovery (HMR), предложенной университетами Германии и США в 2018 году.
Три параметра для деформации (вес, рост, пропорции тела) рассчитываются на этом этапе, вместе с учетом параметров камеры, таких как фокусное расстояние. 2D-ключевые точки и сгенерированное выравнивание силуэта обеспечивают ограничение для деформации в виде 2D-силуэта, дополнительную меру оптимизации, которая увеличивает точность границ и позволяет аутентичное заполнение фона дальше по трубопроводу.

Этапы подгонки SMPL: слева, исходное изображение; второе слева, результат оптимизации, полученный из метода, описанного в исследовании 2016 года под руководством Института интеллектуальных систем Макса Планка; третье слева, прямой результат вывода из предварительно обученной модели для восстановления формы и позы человека; второе справа, результат, полученный после оптимизации 2D-ключевых точек; и, наконец, справа, завершенная подгонка после оптимизации силуэта (см. выше).
NeuralReshaper Architecture
NeuralReshaper запускает две нейронные сети параллельно: кодировщик переднего плана, который генерирует преобразованную форму тела, и кодировщик фона, который фокусируется на заполнении «деокклюзивных» областей фона (в случае, например, «сбрасывания» веса тела – см. изображение ниже).
Training and Experiments
NeuralReshaper реализован в PyTorch на единственной видеокарте NVIDIA 1080ti с 11 ГБ видеопамяти. Сеть была обучена в течение 100 эпох с использованием оптимизатора Adam, с генератором, установленным на целевую потерю 0,0001, и дискриминатором, установленным на целевую потерю 0,0004. Обучение происходило на размере партии 8 для проприетарного набора данных на открытом воздухе (составленного из COCO, MPII и LSP), и 2 для обучения на наборе данных DeepFashion.
Ниже приведены некоторые примеры исключительно из набора данных DeepFashion, обученные для NeuralReshaper, с исходными изображениями всегда слева.
Parametric Necessity
Как отмечается в статье, преобразования одного и того же изображения этого типа представляют собой плохо поставленную задачу в синтезе изображений. Многие трансформативные GAN и кодировщики могут использовать парные изображения (например, различные проекты, предназначенные для эффекта эскиз>фото и фото>эскиз преобразований).
Однако в данном случае это потребовало бы парные изображения с одинаковыми людьми в разных физических конфигурациях, таких как «до и после» изображения в рекламе диет или пластической хирургии – данные, которые трудно получить или сгенерировать.
Альтернативно, трансформативные GAN-сети могут быть обучены на более разнообразных данных и могут выполнять преобразования, находя латентное направление между исходным изображением (оригинальным кодом изображения) и желаемым классом (в данном случае «толстым», «тонким», «высоким» и т. д.). Однако этот подход в настоящее время слишком ограничен для целей тонкой перестановки тела.
Подходы Neural Radiance Fields (NeRF) намного более продвинуты в полноэкранной симуляции, чем большинство систем, основанных на GAN, но остаются специфичными для сцены и требуют больших ресурсов, с в настоящее время очень ограниченной способностью редактировать типы тела таким же образом, как NeuralReshaper и предыдущие проекты (за исключением масштабирования всего тела относительно его окружения).
Пространство GAN-латентности трудно контролировать; VAE в одиночку еще не решают сложности полноэкранного воспроизведения; и способность NeRF последовательно и реалистично переделывать человеческие тела еще находится в зачаточном состоянии. Поэтому включение «традиционных» методов CGI, таких как SMPL, кажется, будет продолжать использоваться в секторе исследований синтеза изображений человека, как метод сдерживания и консолидации функций, классов и латентных кодов, параметры и эксплуатация которых еще не полностью поняты в этих новых технологиях.
Первое издание 31 марта 2022 года.

















