Взгляд Anderson

Перестановка типов человеческого тела с помощью ИИ

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследовательское сотрудничество из Китая предлагает новый метод перестановки человеческого тела на изображениях, используя координированную двойную нейронную сеть, руководимую параметрической моделью, которая позволяет конечному пользователю модулировать вес, рост и пропорции тела в интерактивном графическом интерфейсе.

Параметрическая модуляция формы тела, с ползунками, изменяющими три доступные функции. Источник: https://arxiv.org/pdf/2203.10496.pdf

Параметрическая модуляция формы тела, с ползунками, изменяющими три доступные функции. Источник: https://arxiv.org/pdf/2203.10496.pdf

Эта работа предлагает несколько улучшений над недавним подобным проектом из Alibaba, поскольку она может убедительно изменить рост и пропорции тела, а также вес, и имеет выделенную нейронную сеть для «заполнения» фона, который может быть раскрыт «тонкими» изображениями тела. Она также улучшает заметный ранее параметрический метод для перестановки тела, удаляя необходимость в обширном человеческом вмешательстве во время формулирования преобразования.

Новая архитектура, названная NeuralReshaper, подгоняет параметрическую 3D-модель человека к исходному изображению, а затем использует искажения в модели для адаптации исходного изображения к новым параметрам.

Система способна обрабатывать преобразования тела на одетых, а также на полуодетых (т.е. в пляжной одежде) фигурах.

Преобразования этого типа в настоящее время представляют большой интерес для сектора исследований моды и ИИ, который произвел ряд платформ на основе StyleGAN/CycleGAN и общих нейронных сетей для виртуальных примерок, которые могут адаптировать доступные вещи к форме и типу тела пользователя, или помочь с визуальной конформацией.

Статья под названием Single-image Human-body Reshaping with Deep Neural Networks была опубликована исследователями из Университета Чжэцзяна в Ханчжоу и Школы креативных медиа в Городском университете Гонконга.

SMPL Fitting

NeuralReshaper использует Skinned Multi-Person Linear Model (SMPL), разработанную Институтом интеллектуальных систем Макса Планка и известной компанией Industrial Light and Magic в 2015 году.

Параметрические люди SMPL из сотрудничества Planck/ILM 2015 года. Источник: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

Параметрические люди SMPL из сотрудничества Planck/ILM 2015 года. Источник: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

На первом этапе процесса генерируется модель SMPL из исходного изображения, к которому желательно применить преобразования тела. Адаптация модели SMPL к изображению следует методологии Human Mesh Recovery (HMR), предложенной университетами Германии и США в 2018 году.

Три параметра для деформации (вес, рост, пропорции тела) рассчитываются на этом этапе, вместе с учетом параметров камеры, таких как фокусное расстояние. 2D-ключевые точки и сгенерированное выравнивание силуэта обеспечивают ограничение для деформации в виде 2D-силуэта, дополнительную меру оптимизации, которая увеличивает точность границ и позволяет аутентичное заполнение фона дальше по трубопроводу.

Этапы подгонки SMPL: слева, исходное изображение; второе слева, результат оптимизации, полученный из метода, описанного в исследовании 2016 года под руководством Института интеллектуальных систем Макса Планка; третье слева, прямой результат вывода из предварительно обученной модели для восстановления формы и позы человека; второе справа, результат, полученный после оптимизации 2D-ключевых точек; и, наконец, справа, завершенная подгонка после оптимизации силуэта (см. выше).

Этапы подгонки SMPL: слева, исходное изображение; второе слева, результат оптимизации, полученный из метода, описанного в исследовании 2016 года под руководством Института интеллектуальных систем Макса Планка; третье слева, прямой результат вывода из предварительно обученной модели для восстановления формы и позы человека; второе справа, результат, полученный после оптимизации 2D-ключевых точек; и, наконец, справа, завершенная подгонка после оптимизации силуэта (см. выше).

NeuralReshaper Architecture

NeuralReshaper запускает две нейронные сети параллельно: кодировщик переднего плана, который генерирует преобразованную форму тела, и кодировщик фона, который фокусируется на заполнении «деокклюзивных» областей фона (в случае, например, «сбрасывания» веса тела – см. изображение ниже).

Training and Experiments

NeuralReshaper реализован в PyTorch на единственной видеокарте NVIDIA 1080ti с 11 ГБ видеопамяти. Сеть была обучена в течение 100 эпох с использованием оптимизатора Adam, с генератором, установленным на целевую потерю 0,0001, и дискриминатором, установленным на целевую потерю 0,0004. Обучение происходило на размере партии 8 для проприетарного набора данных на открытом воздухе (составленного из COCO, MPII и LSP), и 2 для обучения на наборе данных DeepFashion.

Слева, исходные изображения, справа, пропорциональный вывод NeuralReshaper.

Слева, исходные изображения, справа, пропорциональный вывод NeuralReshaper.

Ниже приведены некоторые примеры исключительно из набора данных DeepFashion, обученные для NeuralReshaper, с исходными изображениями всегда слева.

Parametric Necessity

Как отмечается в статье, преобразования одного и того же изображения этого типа представляют собой плохо поставленную задачу в синтезе изображений. Многие трансформативные GAN и кодировщики могут использовать парные изображения (например, различные проекты, предназначенные для эффекта эскиз>фото и фото>эскиз преобразований).

Однако в данном случае это потребовало бы парные изображения с одинаковыми людьми в разных физических конфигурациях, таких как «до и после» изображения в рекламе диет или пластической хирургии – данные, которые трудно получить или сгенерировать.

Альтернативно, трансформативные GAN-сети могут быть обучены на более разнообразных данных и могут выполнять преобразования, находя латентное направление между исходным изображением (оригинальным кодом изображения) и желаемым классом (в данном случае «толстым», «тонким», «высоким» и т. д.). Однако этот подход в настоящее время слишком ограничен для целей тонкой перестановки тела.

Подходы Neural Radiance Fields (NeRF) намного более продвинуты в полноэкранной симуляции, чем большинство систем, основанных на GAN, но остаются специфичными для сцены и требуют больших ресурсов, с в настоящее время очень ограниченной способностью редактировать типы тела таким же образом, как NeuralReshaper и предыдущие проекты (за исключением масштабирования всего тела относительно его окружения).

Пространство GAN-латентности трудно контролировать; VAE в одиночку еще не решают сложности полноэкранного воспроизведения; и способность NeRF последовательно и реалистично переделывать человеческие тела еще находится в зачаточном состоянии. Поэтому включение «традиционных» методов CGI, таких как SMPL, кажется, будет продолжать использоваться в секторе исследований синтеза изображений человека, как метод сдерживания и консолидации функций, классов и латентных кодов, параметры и эксплуатация которых еще не полностью поняты в этих новых технологиях.

Первое издание 31 марта 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]