Взгляд Anderson

Создание полноценных глубоких подделок путем объединения нескольких NeRF

mm
Добавьте Unite.AI в избранные источники в Google

Сектор исследований по синтезу изображений густо усеян новыми предложениями систем, способных создавать полноценное видео и фотографии молодых людей – в основном молодых женщин – в различных типах одежды. Большинство сгенерированных изображений статичны; иногда представления даже движутся, хотя обычно не очень хорошо.

Темп этой конкретной исследовательской ветви очень медленный по сравнению с текущим головокружительным уровнем прогресса в смежных областях, таких как латентные модели диффузии; однако исследовательские группы, большинство из которых находится в Азии, продолжают упорно работать над этой проблемой.

Одна из десятков, если не сотен, предложенных или полу запущенных 'виртуальных примерок' систем за последние 10-15 лет, где тела оцениваются с помощью машинного обучения на основе распознавания объектов и адаптируются к предложенным предметам одежды. Источник: https://www.youtube.com/watch?v=2ZXrgGyhbak

Одна из десятков, если не сотен, предложенных или полу запущенных ‘виртуальных примерок’ систем за последние 10-15 лет, где тела оцениваются с помощью машинного обучения на основе распознавания объектов и адаптируются к предложенным предметам одежды. Источник: https://www.youtube.com/watch?v=2ZXrgGyhbak

Цель состоит в том, чтобы создать новые системы, которые позволили бы сделать ‘виртуальные примерки’ для модной и одежной индустрии – системы, которые могут адаптироваться как к клиенту, так и к конкретному продукту, который в настоящее время доступен или скоро будет выпущен, без неуклюжести реального времени наложения одежды, или необходимости просить клиентов отправить немного откровенные фотографии для ML-основанных конвейеров рендеринга.

Ни одна из популярных архитектур синтеза не кажется легко адаптируемой к этой задаче: латентное пространство генеративных противостоящих сетей (GAN) не подходит для создания убедительного временного движения (или даже редактирования в целом); хотя хорошо способны генерировать реалистичное человеческое движение, нейронные радиационные поля (NeRF) обычно естественно устойчивы к тому типу редактирования, который необходим для ‘замены’ людей или одежды по желанию; автоэнкодеры потребуют обременительного обучения, специфичного для человека/одежды; и латентные модели диффузии, как и GAN, не имеют родных временных механизмов для генерации видео.

EVA3D

EVA3D, из Наньянского технологического университета в Сингапуре, является первым указанием на подход, который был долгожданным – использование множества сетей нейронных радиационных полей, каждая из которых посвящена отдельной части тела, и которые затем составляются в собранную и связную визуализацию.

Мобильная молодая женщина, составленная из нескольких сетей NeRF, для EVA3D. Источник: https://hongfz16.github.io/projects/EVA3D.html

Мобильная молодая женщина, составленная из нескольких сетей NeRF, для EVA3D. Источник: https://hongfz16.github.io/projects/EVA3D.html

Результаты, в плане движения,…хороши. Хотя визуализации EVA3D не выходят из долины неуклюжести, они могут хотя бы увидеть съезд с того места, где они стоят.

Что делает EVA3D выдающимся, так это то, что исследователи, стоящие за ним, почти уникально в секторе полноценного синтеза изображений, осознали, что одна сеть (GAN, NeRF или иная) не сможет справиться с редактируемой и гибкой полноценной генерацией человеческих изображений в течение нескольких лет – частично из-за темпа исследований, и частично из-за ограничений аппаратного обеспечения и других логистических ограничений.

Поэтому команда Наньяна разделила задачу на 16 сетей и несколько технологий – подход, уже принятый для нейронного рендеринга городских сред в Block-NeRF и CityNeRF, и который, вероятно, станет все более интересным и потенциально плодотворным полумерой для достижения полноценных глубоких подделок в течение следующих пяти лет, в зависимости от новых концептуальных или аппаратных разработок.

Не все проблемы, присутствующие при создании этого типа ‘виртуальной примерки’, являются техническими или логистическими, и статья очерчивает некоторые проблемы с данными, особенно в отношении обучения без учителя:

‘[Модные] наборы данных в основном имеют очень ограниченные человеческие позы (большинство из них подобны стоящим позам), и высоко несбалансированные углы обзора (большинство из них передние виды). Это несбалансированное распределение 2D-данных может препятствовать обучению без учителя 3D-генеративных моделей, что приводит к трудностям в синтезе новых видов/поз.

Рабочий процесс EVA3D разделяет человеческое тело на 16 отдельных частей, каждая из которых генерируется через свою собственную сеть NeRF. Очевидно, что это создает достаточно ‘размороженных’ секций, чтобы быть в состоянии оживить фигуру через захват движения или другие типы данных движения. Кроме этого преимущества, это также позволяет системе назначить максимальные ресурсы тем частям тела, которые ‘продают’ общее впечатление.

Например, человеческие ноги имеют очень ограниченный диапазон артикуляции, в то время как аутентичность лица и головы, кроме качества всего тела движения в целом, вероятно, будет фокусным токеном аутентичности для рендеринга.

Качественное сравнение между EVA3D и предыдущими методами. Авторы утверждают, что достигли лучших результатов в этом отношении.

Качественное сравнение между EVA3D и предыдущими методами. Авторы утверждают, что достигли лучших результатов в этом отношении.

Подход радикально отличается от NeRF-ориентированного проекта, с которым он концептуально связан – 2021 года A-NeRF, из Университета Британской Колумбии и Reality Labs Research, который стремился добавить внутренний управляющий скелет к в противном случае конвенциональной ‘цельной’ представлению NeRF, что делает его более трудным для распределения ресурсов обработки по разным частям тела на основе необходимости.

Предыдущие движения – A-NeRF оснащает 'запеченную' NeRF таким же типом гибкого и артикулированного центрального каркаса, который индустрия VFX так долго использовала для анимации CGI-персонажей. Источник: https://lemonatsu.github.io/anerf/

Предыдущие движения – A-NeRF оснащает ‘запеченную’ NeRF таким же типом гибкого и артикулированного центрального каркаса, который индустрия VFX так долго использовала для анимации CGI-персонажей. Источник: https://lemonatsu.github.io/anerf/

Вместе с большинством подобных человеко-ориентированных проектов, которые стремятся использовать латентное пространство различных популярных подходов, EVA3D использует Skinned Multi-Person Linear Model (SMPL), ‘традиционный’ метод CGI для добавления инструментальности к общей абстракции текущих методов синтеза. Ранее в этом году другая статья, на этот раз из Университета Чжэцзяна в Ханчжоу и Школы креативных медиа в Городском университете Гонконга, использовала такие методы для выполнения нейронной перестановки тела.

Качественные результаты EVA3D на DeepFashion.

Качественные результаты EVA3D на DeepFashion.

Метод

Модель SMPL, используемая в процессе, настроена на человеческий ‘приор’ – человека, который, по сути, добровольно глубоко подделан EVA3D, и его веса кожи ведут переговоры о различиях между каноническим пространством (т.е. ‘в покое’, или ‘нейтральной’ позой модели SMPL) и тем, как окончательный вид рендерится.

Концептуальный рабочий процесс для EVA3D. Источник: https://arxiv.org/pdf/2210.04888.pdf

Концептуальный рабочий процесс для EVA3D. Источник: https://arxiv.org/pdf/2210.04888.pdf

Как видно на иллюстрации выше, ограничивающие рамки SMPL используются в качестве определений границ для 16 сетей, которые в конечном итоге составят тело. Обратный алгоритм Linear Blend Skinning (LBS) модели SMPL затем используется для передачи видимых отобранных лучей в каноническое (пассивное) пространство. Затем 16 подсетей запрашиваются на основе этих конфигураций и в конечном итоге формируются в окончательный рендер.

Целая композитная NeRF затем используется для построения 3D-рамки GAN.

Рендеринги второй стадии рамки GAN в конечном итоге будут обучены на настоящих 2D-изображениях коллекций людей/моды.

Рендеринги второй стадии рамки GAN в конечном итоге будут обучены на настоящих 2D-изображениях коллекций людей/моды.

Каждая подсеть, представляющая часть человеческого тела, состоит из сложенных многослойных перцептронов (MLP) с SIREN (синусоидальным представлением сетей) активацией. Хотя SIREN решает множество проблем в рабочем процессе, подобном этому, и в подобных проектах, он склонен к переобучению, а не обобщению, и исследователи предлагают, что альтернативные библиотеки могут быть использованы в будущем (см. конец статьи).

Данные, обучение и тесты

EVA3D сталкивается с необычными проблемами с данными из-за ограничений и шаблонного стиля поз, доступных в модных наборах данных, которые, как правило, лишены альтернативных или новых видов и повторяются, возможно, намеренно, чтобы сосредоточить внимание на одежде, а не на человеке, который ее носит.

Из-за этого несбалансированного распределения поз EVA3D использует человеческие приоры (см. выше) на основе геометрии модели SMPL, и затем предсказывает поле Signed Distance Field (SDF) смещения этой позы, а не прямую целевую позу.

Для поддержки экспериментов исследователи использовали четыре набора данных: DeepFashion; SHHQ; UBCFashion; и AIST Dance Video Database (AIST Dance DB).

Последние два содержат более разнообразные позы, чем первые два, но представляют одних и тех же людей повторно, что компенсирует эту разнообразность; в кратце, данные более чем сложны, учитывая задачу.

Примеры из SSHQ. Источник: https://arxiv.org/pdf/2204.11823.pdf

Примеры из SSHQ. Источник: https://arxiv.org/pdf/2204.11823.pdf

Базовые линии использовались ENARF-GAN, первый проект, который рендерил визуальные NeRF из 2D-изображений наборов данных; Stanford и NVIDIA’s (NVDA ) EG3D; и StyleSDF, сотрудничество между Университетом Вашингтона, Adobe (ADBE ) Research и Стэнфордским университетом – все методы, требующие библиотек супер-разрешения, чтобы масштабироваться от родного до высокого разрешения.

Метрики, принятые для использования, были спорной Frechet Inception Distance (FID) и Kernel Inception Distance (KID), вместе с Процентом правильных ключевых точек (PCKh@0.5).

В количественных оценках EVA3D лидировал во всех метриках в четырех наборах данных:

Количественные результаты.

Количественные результаты.

Исследователи отмечают, что EVA3D достигает наименьшей скорости ошибки для рендеринга геометрии, критического фактора в проекте этого типа. Они также наблюдают, что их система может контролировать сгенерированную позу и достигать более высоких баллов PCKh@0.5, в отличие от EG3D, единственного конкурирующего метода, который набрал более высокий балл в одной категории.

EVA3D работает родно в разрешении 512x512px, хотя его можно легко и эффективно масштабировать до разрешения HD, добавив слои масштабирования, как это сделала Google с ее предложением видео-текст в разрешении 1024 Imagen Video.

Метод не безграничен. Статья отмечает, что активация SIREN может вызвать круглые артефакты, которые можно исправить в будущих версиях, используя альтернативное базовое представление, такое как EG3D, в сочетании с 2D-декодером. Кроме того, трудно точно приспособить SMPL к источникам модных данных.

Наконец, система не может легко приспособиться к более крупным и жидким предметам одежды, таким как большие платья; такие предметы одежды демонстрируют тот же тип жидкой динамики, который делает создание нейронно-рендеренного волоса таким вызовом. Предположительно, подходящее решение могло бы помочь решить обе проблемы.

 

Опубликовано впервые 12 октября 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai