Взгляд Anderson

Оркестровка синтеза лица с помощью семантической сегментации

mm
Добавьте Unite.AI в избранные источники в Google

Проблема с изобретением человеческих лиц с помощью сети генеративных противостояний (GAN) заключается в том, что реальные данные, которые обеспечивают фальшивые изображения, приходят с нежелательными и неразделимыми атрибутами, такими как волосы на голове (и/или лице), фоны и различные виды лицевых украшений, таких как очки, шляпы и серьги; и что эти периферийные аспекты личности неизбежно связаны с лицом в (‘или вокруг) которого они встроены.

При наиболее распространенных архитектурах GAN эти элементы не могут быть изменены в своем собственном выделенном пространстве, а скорее тесно связаны с лицом, в (или вокруг) которого они встроены.

Обычно также невозможно указать или повлиять на внешний вид подразделов лица, созданного GAN, таких как сужение глаз, удлинение носа или изменение цвета волос, так же, как это может сделать художник-портретист.

Однако сектор исследований синтеза изображений работает над этим:

Новые исследования по генерации лица на основе GAN разделили различные разделы лица на отдельные области, каждая из которых имеет свой собственный 'генератор', работающий в концерте с другими генераторами для изображения. В среднем ряду мы видим, как оркестрирующая 'фич-карта' строит дополнительные области лица. Источник: https://arxiv.org/pdf/2112.02236.pdf

Новые исследования по генерации лица на основе GAN разделили различные разделы лица на отдельные области, каждая из которых имеет свой собственный ‘генератор’, работающий в концерте с другими генераторами для изображения. В среднем ряду мы видим, как оркестрирующая ‘фич-карта’ строит дополнительные области лица. Источник: https://arxiv.org/pdf/2112.02236.pdf

В новой статье исследователи из американского филиала китайского многонационального технологического гиганта ByteDance использовали семантическую сегментацию, чтобы разделить составные части лица на отдельные секции, каждая из которых имеет свой собственный генератор, что позволяет добиться большей степени дезентанглемента. Или, по крайней мере, восприимчивого дезентанглемента.

Статья называется SemanticStyleGAN: Learning Compositional Generative Priors for Controllable Image Synthesis and Editing, и сопровождается медиа-обогащенной страницей проекта, на которой представлены многочисленные примеры различных тонких преобразований, которые можно добиться, когда лицевые и головные элементы изолированы таким образом.

Текстура лица, стиль и цвет волос, форма и цвет глаз и многие другие аспекты когда-то неразделимых функций GAN теперь могут быть дезентанглированы, хотя качество разделения и уровень инструментальности могут варьироваться в разных случаях. Источник: https://semanticstylegan.github.io/

Текстура лица, стиль и цвет волос, форма и цвет глаз и многие другие аспекты когда-то неразделимых функций GAN теперь могут быть де-факто дезентанглированы, хотя качество разделения и уровень инструментальности могут варьироваться в разных случаях. Источник: https://semanticstylegan.github.io/

Неподконтрольное латентное пространство

Сеть генеративных противостояний, обученная для генерации лиц, такой как генератор StyleGan2, который питает популярный веб-сайт thispersondoesnotexist.com, образует сложные взаимосвязи между ‘фичами’ (не в смысле лица), которые она получает из анализа тысяч реальных лиц, чтобы научиться создавать реалистичные человеческие лица.

Эти тайные процессы являются ‘латентными кодами’, коллективно латентным пространством. Они трудно анализируются и, следовательно, трудно инструментализируются.

На прошлой неделе появился новый проект синтеза изображений, который пытается ‘отобразить’ это gần-оккультное пространство во время самого процесса обучения, и затем использовать эти карты для интерактивного навигации по нему, и были предложены различные другие решения для получения более глубокого контроля над контентом, синтезированным GAN.

Были достигнуты некоторые успехи, с разнообразным предложением архитектур GAN, которые пытаются ‘достичь’ латентного пространства каким-то образом и контролировать генерацию лиц оттуда. Такие усилия включают InterFaceGAN, StyleFlow, GANSpace и StyleRig, среди других предложений в постоянно-продуктивном потоке новых статей.

Что они все имеют общего, так это ограниченные степени дезентанглемента; изобретательные GUI-слайдеры для различных аспектов (таких как ‘волосы’ или ‘выражение’) склонны тащить фон и/или другие элементы в процесс преобразования, и ни один из них (включая обсуждаемую статью) не решил проблему временного нейронного волоса.

Разделяя и завоевывая латентное пространство

В любом случае, исследование ByteDance принимает другой подход: вместо того, чтобы пытаться раскрыть тайны единой GAN, работающей над всем сгенерированным изображением лица, SemanticStyleGAN формулирует подход, основанный на композиции, где лица ‘составляются’ отдельными процессами генерации.

Чтобы добиться этого различия (лицевых) функций, SemanticStyleGAN использует Fourier Features, чтобы сгенерировать семантическую сегментационную карту (грубо окрашенные различия лицевой топографии, показанные внизу справа на изображении ниже), чтобы выделить лицевые области, которые получат отдельное, посвященное внимание.

Архитектура нового подхода, который налагает промежуточный слой семантической сегментации на лицо, эффективно превращая框 в оркестратора нескольких генераторов для различных аспектов изображения.

Архитектура нового подхода, который налагает промежуточный слой семантической сегментации на лицо, эффективно превращая框 в оркестратора нескольких генераторов для различных аспектов изображения.

Сегментационные карты генерируются для фальшивых изображений, которые систематически представляются дискриминатору GAN для оценки при улучшении модели, и для (нефальшивых) исходных изображений, используемых для обучения.

В начале процесса Многослойный Персептрон (MLP) изначально отображает случайно выбранные латентные коды, которые затем будут использоваться для управления весами нескольких генераторов, которые будут каждый брать под контроль секцию лица, которое будет произведено.

Каждый генератор создает фич-карту и симулированную глубинную карту из Fourier Features, которые поданы ему вверх по потоку. Этот вывод является основой для сегментационных масок.

Ниже по потоку рендер-сеть обусловлена только предыдущими фич-картами, и теперь знает, как сгенерировать более высокую разрешающую сегментационную маску, облегчающую окончательное производство изображения.

Наконец, раздвоенный дискриминатор наблюдает за конкатенированной распределением как RGB-изображений (которые для нас являются окончательным результатом), так и сегментационных масок, которые позволили им быть разделенными.

С помощью SemanticStyleGAN нет нежелательных визуальных помех, когда ‘настраиваются’ изменения лицевых функций, потому что каждая лицевая функция была отдельно обучена в рамках оркестровочного框а.

Замена фонов

Поскольку целью проекта является получение большего контроля над сгенерированной средой, процесс рендеринга/композиции включает генератор фона, обученный на реальных изображениях.

Одной из убедительных причин, почему фоны не тащатся в манипуляции с лицом в SemanticStyleGAN, является то, что они находятся на более дальнем слое и являются полными, хотя и частично скрытыми наложенными лицами.

Одной из убедительных причин, почему фоны не тащатся в манипуляции с лицом в SemanticStyleGAN, является то, что они находятся на более дальнем слое и являются полными, хотя и частично скрытыми наложенными лицами.

Поскольку сегментационные карты приведут к лицам без фонов, эти ‘вставляемые’ фоны не только обеспечивают контекст, но и настроены так, чтобы быть уместными в плане освещения для наложенных лиц.

Обучение и данные

‘Реалистичные’ модели были обучены на первых 28 000 изображениях в CelebAMask-HQ, измененных до 256×256 пикселей, чтобы вместить пространство обучения (т.е. доступную VRAM, которая диктует максимальный размер пакета на итерацию).

Были обучены несколько моделей, и были экспериментированы различные инструменты, наборы данных и архитектуры во время процесса разработки и различных тестов на удаление. Самая большая продуктивная модель проекта имела разрешение 512×512, обучалась в течение 2,5 дней на восьми NVIDIA Tesla V100 GPU. После обучения генерация одного изображения занимает 0,137 секунды на лобовом GPU без параллелизации.

Более карикатурно/аниме-стильные эксперименты, продемонстрированные в многочисленных видео на странице проекта (см. ссылку выше), получены из различных популярных наборов данных, основанных на лицах, включая Toonify, MetFaces и Bitmoji.

Временное решение?

Авторы утверждают, что нет причины, почему SemanticStyleGAN не может быть применен к другим областям, таким как пейзажи, машины, церкви и все другие ‘стандартные’ тестовые области, к которым новые архитектуры обычно подвергаются на ранних этапах их карьеры.

Однако статья признает, что по мере увеличения количества классов для области (такой как ‘машина’, ‘‘уличный фонарь’, ‘пешеход’, ‘здание’, ‘машина’ и т.д.), этот поэтапный подход может стать невозможным в нескольких отношениях, без дальнейшей работы по оптимизации. Например, набор данных CityScapes имеет 30 классов в 8 категориях.

Трудно сказать, является ли текущий интерес к завоеванию латентного пространства более直接ым таким же обреченным, как алхимия; или же латентные коды в конечном итоге будут расшифрованы и контролируемы – развитие, которое могло бы сделать этот более ‘внешне сложный’ тип подхода излишним.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: [email protected]