Взгляд Anderson
Редактирование潜在空间 GAN с помощью ‘Blobs’

Новое исследование Университета Калифорнии в Беркли и Adobe (ADBE ) предлагает способ直接 редактировать гиперреалистичный контент, который может быть создан с помощью сети генеративных противостояний (GAN), но который обычно не может быть контролируем, анимирован или свободно манипулирован в манере, знакомой пользователям Photoshop и специалистам по CGI.
Метод, названный BlobGAN, включает в себя создание сетки «блобов» – математических конструкций, которые напрямую сопоставляются с контентом в潜在空间 GAN.
Перемещая блобы, можно перемещать «объекты» в представлении сцены, интуитивным образом, который ближе к методам CGI и CAD, чем многие из текущих попыток сопоставить и контролировать潜在空间 GAN:

Манипуляция сценой с помощью BlobGAN: при перемещении «блобов» пользователем, расположение潜在ных объектов и стилей в GAN соответствующим образом изменяется. Для более подробных примеров см. прилагаемое видео в конце этой статьи или на https://www.youtube.com/watch?v=KpUv82VsU5k
Поскольку блобы соответствуют «объектам» в сцене, отображаемой в潜在空间 GAN, все объекты изначально дезентанглированы, что делает возможным их индивидуальное изменение:

Объекты можно изменять в размере, уменьшать, клонировать и удалять, среди других операций.
Как и любой объект в программном обеспечении для редактирования фотографий (или даже текста), блоб можно дублировать и затем манипулировать:

Блобы можно дублировать в интерфейсе, и их соответствующие潜在ные представления также будут «скопированы и вставлены». Источник: https://dave.ml/blobgan/#results
BlobGAN также может парсить новые, выбранные пользователем изображения в свой潜在ный пространство:

С помощью BlobGAN не нужно включать изображения, которые вы хотите манипулировать,直接 в обучающие данные и затем искать их潜атные коды, но можно вводить выбранные изображения по желанию и манипулировать ими. Источник: https://dave.ml/blobgan/#results
Более подробные результаты можно увидеть здесь, и в прилагаемом видео на YouTube (встроенном в конце этой статьи). Также есть интерактивный демонстрационный материал Colab демо*, и репозиторий GitHub репозиторий**.
Этот вид инструментальности и объема может показаться наивным в пост-Photoshop эпохе, и параметрические программные пакеты, такие как Cinema4D и Blender, уже позволяли пользователям создавать и настраивать 3D-мировые за десятилетия; но это представляет собой перспективный подход к укрощению эксцентричностей и арканной природы潜在ного пространства в сети генеративных противостояний, с помощью использования代理-сущностей, сопоставленных с潜атными кодами.
Авторы утверждают:
‘На сложном много категорийном наборе данных внутренних сцен BlobGAN превосходит Style-GAN2 по качеству изображения, измеренному по FID.’
Статья называется BlobGAN: Пространственно-дезентанглированные представления сцен, и написана двумя исследователями из Университета Калифорнии в Беркли, вместе с тремя из Adobe Research.
Посредник
BlobGAN приносит новую парадигму в синтез изображений GAN. Предыдущие подходы к решению дискретных сущностей в潜атном пространстве, как указывает новая статья, были либо «сверху вниз», либо «снизу вверх».
«Сверху вниз» метод в GAN или классификаторе изображений рассматривает изображения сцен как классы, такие как «спальня», «церковь», «лицо» и т. д. Этот вид текст/изображение пары питает новое поколение многомодальных рамок синтеза изображений, таких как недавний DALL-E 2 от OpenAI.
«Снизу вверх» подходы, вместо этого, сопоставляют каждый пиксель в изображении с классом, меткой или категорией. Такие подходы используют различные методы, хотя семантическая сегментация является популярной текущей исследовательской ветвью.
Авторы комментируют:
‘Оба пути кажутся неудовлетворительными, поскольку ни один из них не может обеспечить легкие способы рассуждения о частях сцены как сущностях. Части сцены либо «запечатаны» в едином запутанном潜атном векторе (сверху вниз), либо необходимо группировать их вместе из отдельных пиксельных меток (снизу вверх).’
Вместо этого BlobGAN предлагает непосредственное среднеуровневое представление, или прокси-рамку для генеративных моделей.

Сетка макета сопоставляет локальные (и контролируемые) «блобы» сущности с潜атными кодами. Источник: https://arxiv.org/pdf/2205.02837.pdf
Гауссовские (т. е. основанные на шуме) блобы упорядочены по глубине и представляют собой «бутылочное горлышко» в архитектуре, которое присваивает сопоставление каждой сущности, решая самую большую проблему, которая существует для манипуляции контентом GAN: дезентанглирование (также проблема для архитектур, основанных на автоэнкодерах). Результатом является «блоб-карта», используемая для манипуляции декодером BlobGAN.
Архитектура и данные
Сущности в блоб-карте преобразуются в изображения с помощью пересмотренного производного StyleGAN2 сети, в подходе, который черпает вдохновение из предыдущих исследований NVIDIA (NVDA ).

Пересмотренное производное StyleGAN 2 от исследований NVIDIA. Источник: https://arxiv.org/pdf/1912.04958.pdf
StyleGAN 2 изменен в BlobGAN для принятия входных данных из блоб-карты вместо единого глобального вектора, как это обычно бывает.

Серия манипуляций, возможных с помощью BlobGAN, включая «автозавершение» пустой спальни и изменение размера и местоположения элементов в комнате.
По аналогии, вместо того, чтобы создавать огромное и сложное здание (潜атное пространство) сразу, и затем иметь возможность исследовать его бесконечные пути, BlobGAN отправляет в начало компонентные блоки, и всегда знает, где они находятся. Это дезентанглирование контента и местоположения является основным нововведением работы.
* Не функционален на момент написания
** Код еще не опубликован на момент написания
Опубликовано впервые 8 мая 2022 года.












