Взгляд Anderson

SofGAN: Ган-генератор лиц с повышенным контролем

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи в Шанхае и США разработали систему генерации портретов на основе Ган, которая позволяет пользователям создавать новые лица с беспрецедентным уровнем контроля над отдельными аспектами, такими как волосы, глаза, очки, текстуры и цвет.

Чтобы продемонстрировать универсальность системы, создатели предоставили интерфейс в стиле Photoshop, где пользователь может直接 рисовать семантические элементы сегментации, которые будут переинтерпретированы в реалистичные изображения, и которые даже можно получить, рисуя непосредственно над существующими фотографиями.

В примере ниже используется фотография актера Дэниела Рэдклиффа в качестве шаблона для трассировки (и целью не является создание его портрета, а rather общее фотореалистичное изображение). Когда пользователь заполняет различные элементы, включая дискретные аспекты, такие как очки, они идентифицируются и интерпретируются в выходном изображении:

Использование одного изображения в качестве материала для трассировки портрета, сгенерированного SofGAN. Источник: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Использование одного изображения в качестве материала для трассировки портрета, сгенерированного SofGAN. Источник: https://www.youtube.com/watch?v=xig8ZA3DVZ8

Статья paper озаглавлена SofGAN: Ган-генератор портретов с динамическим стилем, и возглавляется Анпеем Ченом и Руянгом Лю, вместе с двумя другими исследователями из Шанхайского технологического университета и еще одним из Калифорнийского университета в Сан-Диего.

Разделяя особенности

Основной вклад работы не столько в предоставлении удобного интерфейса, сколько в ‘разделении’ характеристик изученных лицевых особенностей, таких как поза и текстура, что позволяет SofGAN также генерировать лица, находящиеся под косыми углами к точке зрения камеры.

Необычно среди генераторов лиц на основе генеративных противостоящих сетей, SofGAN может изменять угол зрения по желанию, в пределах массива углов, присутствующих в обучающих данных. Источник: https://arxiv.org/pdf/2007.03780.pdf

Необычно среди генераторов лиц на основе генеративных противостоящих сетей, SofGAN может изменять угол зрения по желанию, в пределах массива углов, присутствующих в обучающих данных. Источник: https://arxiv.org/pdf/2007.03780.pdf

Поскольку текстуры теперь разделены от геометрии, форма лица и текстура также могут быть манипулированы как отдельные сущности. По сути, это позволяет изменять расу исходного лица, скандальное практика, которая теперь имеет потенциально полезное применение для создания расово-сбалансированных наборов данных машинного обучения.

SofGAN также поддерживает искусственное старение и коррекцию стиля, согласованную с атрибутами на уровне, не видимом в подобных системах сегментации-изображения, таких как GauGAN от NVIDIA и игровая нейронная система рендеринга от Intel.

SofGAN может реализовать старение как итеративный стиль.

SofGAN может реализовать старение как итеративный стиль.

Другим прорывом для методологии SofGAN является то, что обучение не требует парных сегментаций/реальных изображений, а может быть直接 обучено на непарных реальных изображениях.

Исследователи заявляют, что ‘разделение’ архитектуры SofGAN было вдохновлено традиционными системами рендеринга изображений, которые разбивают отдельные аспекты изображения. В визуальных эффектах рабочие процессы элементы для композита обычно разбиваются до самых мелких компонентов, с специалистами, посвященными каждому компоненту.

Поле семантической занятости (SOF)

Чтобы достичь этого в рамках машинного обучения синтеза изображений, исследователи разработали поле семантической занятости (SOF), расширение традиционного поля занятости, которое индивидуализирует составные элементы портретов. SOF был обучен на калиброванных многообразных семантических картах сегментации, но без какого-либо надзора за основой.

Множественные итерации из одной карты сегментации (внизу слева).

Множественные итерации из одной карты сегментации (внизу слева).

Кроме того, 2D-карты сегментации получаются путем трассировки вывода SOF, прежде чем быть текстурированными генератором Ган. ‘Синтетические’ карты семантической сегментации также кодируются в пространстве низкой размерности через трехслойный кодировщик, чтобы обеспечить непрерывность вывода при изменении точки зрения.

Схема обучения пространственно смешивает два случайных стиля для каждого семантического региона:

Архитектура для SofGAN.

Архитектура для SofGAN.

Исследователи утверждают, что SofGAN достигает более низкого расстояния Фричета-Инсепшена (FID) по сравнению с текущими альтернативными подходами, а также более высокого метрика сходства изображений, изучаемого с помощью обучения (LPIPS).

Ранее подходы StyleGAN часто были осложнены энтропией особенностей, при которой элементы, составляющие изображение, неразрывно связаны друг с другом, вызывая появление нежелательных элементов вместе с желаемым элементом (например, серьги могут появиться, когда форма уха отображается, которая была проинформирована на этапе обучения изображением, на котором были серьги).

Трассировка луча используется для расчета объема карт сегментации, что позволяет получить множественные точки зрения.

Трассировка луча используется для расчета объема карт сегментации, что позволяет получить множественные точки зрения.

Наборы данных и обучение

Три набора данных были использованы при разработке различных реализаций SofGAN: CelebAMask-HQ, репозиторий из 30 000 высококачественных изображений, взятых из набора данных CelebA-HQ; NVIDIA’s Flickr-Faces-HQ (FFHQ), который содержит 70 000 изображений, где исследователи размечали изображения с помощью предварительно обученного парсера лиц; и самопроизведенная группа из 122 портретных сканов с вручную размеченными семантическими областями.

SOF состоит из трех обучаемых подмодулей – гиперсети, трассировщика луча (см. изображение выше) и классификатора. Генератор Semantic Instance Wised (SIW) StyleGAN в проекте настроен аналогично StyleGAN2 по определенным аспектам. Аугментация данных применяется посредством случайного масштабирования и обрезки, а обучение включает в себя регуляризацию пути каждые четыре шага. Всего процесс обучения занял 22 дня, чтобы достичь 800 000 итераций на четырех GPU RTX 2080 Ti с использованием CUDA 10.1.

Статья не упоминает конфигурацию карт 2080, которые могут вместить от 11 ГБ до 22 ГБ видеопамяти каждая, что означает, что общий объем видеопамяти, использованной для обучения SofGAN в течение почти месяца, составляет от 44 ГБ до 88 ГБ.

Исследователи наблюдают, что приемлемые, обобщенные, высокоуровневые результаты начали появляться довольно рано в процессе обучения, на 1500 итерациях, через три дня после начала обучения. Остальная часть обучения была посвящена предсказуемому, медленному движению к получению мелких деталей, таких как волосы и особенности глаз.

SofGAN обычно достигает более реалистичных результатов из одной карты сегментации, чем соперничающие методы, такие как SPADE от NIVDIA и Pix2PixHD, и SEAN.

Ниже представлено видео, выпущенное исследователями. Дополнительные видео, размещенные на сервере проекта, доступны на странице проекта.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai