Погляд Anderson
SofGAN: Генератор ГАН-образів людей з більшим контролем

Дослідники в Шанхаї та США розробили систему генерації портретів на основі ГАН, яка дозволяє користувачам створювати нові обличчя з раніше недоступним рівнем контролю над окремими аспектами, такими як волосся, очі, окуляри, текстури та кольори.
Щоб продемонструвати гнучкість системи, її творці надали інтерфейс у стилі Photoshop, де користувач може безпосередньо малювати семантичні елементи сегментації, які будуть переінтерпретовані у реалістичні зображення, і які навіть можна отримати, малюючи прямо на існуючих фотографіях.
У прикладі нижче використовується зображення актора Данієла Редкліффа як шаблон для трасування (і метою не є створення подібності до нього, а скоріше загалом фотореалістичного зображення). Коли користувач заповнює різні елементи, включаючи окремі аспекти, такі як окуляри, вони ідентифікуються та інтерпретуються у виведеному зображенні:

Використання одного зображення як матеріалу для трасування портрету, згенерованого SofGAN. Джерело: https://www.youtube.com/watch?v=xig8ZA3DVZ8
Стаття стаття називається SofGAN: Генератор портретних зображень з динамічним стилем і ведена Анпеєм Ченом та Руйянгом Ліу, разом з двома іншими дослідниками з Шанхайського технологічного університету та одним з університету Каліфорнії в Сан-Дієго.
Відокремлення ознак
Основний внесок роботи полягає не так багато у забезпеченні зручного інтерфейсу користувача, а радше у «відокремленні» характеристик вивчених особливостей обличчя, таких як поза та текстура, що дозволяє SofGAN також генерувати обличчя, які знаходяться під косими кутами до точки зору камери.

Незвичайно серед генераторів обличчя на основі Генеративних суперницьких мереж, SofGAN може змінювати кут огляду за бажанням, в межах масиву кутів, присутніх у навчальних даних. Джерело: https://arxiv.org/pdf/2007.03780.pdf
Відтак, оскільки текстури тепер відокремлені від геометрії, форму обличчя та текстуру можна також маніпулювати як окремими сутностями. Насправді це дозволяє змінювати расу джерельного обличчя, практику, яка тепер має потенційно корисне застосування для створення расово-балансированих наборів даних машинного навчання.

SofGAN також підтримує штучне старіння та корекцію стилю на рівні, незрівнянному з подібними системами сегментації>зображення, такими як GauGAN від NVIDIA та система нейронного рендерингу Intel.

SofGAN може реалізовувати старіння як ітеративний стиль.
Іншим проривом для методології SofGAN є те, що навчання не вимагає парних сегментацій/реальних зображень, а може бути безпосередньо навчено на непарних реальних зображеннях світу.
Дослідники заявляють, що «відокремлювальна» архітектура SofGAN була натхнена традиційними системами рендерингу зображень, які розкладають окремі аспекти зображення. У візуальних ефектах робочих процесів елементи для композиту часто розкладаються на найдрібніші компоненти, з chuyênцями, присвяченими кожному компоненту.
Поле семантичної зайнятості (SOF)
Щоб досягти цього у рамках машинного навчання з синтезу зображень, дослідники розробили поле семантичної зайнятості (SOF), розширення традиційного поля зайнятості, яке індивідуалізує компонентні елементи портретних зображень. SOF був навчений на каліброваних багатогранних семантичних картах сегментації, але без будь-якого нагляду за ground truth.

Багатьох ітерацій з одного сегментаційного зображення (ліворуч внизу).
Крім того, 2D-сегментаційні карти отримуються шляхом трасування виводу SOF, після чого текстуруються генератором ГАН. «Синтетичні» семантичні карти сегментації також кодуються в низьковимірному просторі через тришаровий кодувальник, щоб забезпечити безперервність виводу при зміні точки зору.
Схема навчання просторово змішує два випадкових стилі для кожної семантичної області:
Дослідники стверджують, що SofGAN досягає нижчої відстані Фрідета-Інсепшена (FID) порівняно з поточними альтернативними підходами стану мистецтва (SOTA), а також вищої метрики схожості зображень, заснованої на навчених перцептивних патчах (LPIPS).
Попередні підходи StyleGAN часто ускладнювалися зв’язком особливостей, при якому елементи, які складають зображення, були незворотньо пов’язані один з одним, що спричиняло появу нежаданих елементів поряд з бажаним елементом (наприклад, сережки могли з’явитися, коли форма вуха була відтворена під час навчання з зображенням, яке містить сережки).

Трасування променів використовується для розрахунку об’єму семантичних карт сегментації, що дозволяє отримувати несколько точок зору.
Набори даних та навчання
Для розробки різних реалізацій SofGAN використовувалися три набори даних: CelebAMask-HQ, репозиторій із 30 000 високоякісних зображень, взятих із набору даних CelebA-HQ; Flickr-Faces-HQ від NVIDIA (FFHQ), який містить 70 000 зображень, де дослідники позначили зображення за допомогою попередньо навченої програми розпізнавання обличчя; і самопродукований набір із 122 портретних сканів з вручну позначеними семантичними областями.
SOF складається з трьох навчальних підмодулів – гіпермережі, трасувальника променів (див. зображення вище) та класифікатора. Генератор StyleGAN проекту SIW налаштовується подібно до StyleGAN2 за певними аспектами. Регуляризація даних застосовується через випадкове масштабування та обрізання, а навчання відбувається кожні чотири кроки. Цілій процес навчання зайняв 22 дні для досягнення 800 000 ітерацій на чотирьох GPU RTX 2080 Ti через CUDA 10.1.
У статті не згадується конфігурація карт 2080, які можуть вміщувати від 11 ГБ до 22 ГБ відеопам’яті кожна, що означає, що загальна використана відеопам’ять для навчання SofGAN протягом більшої частини місяця становила від 44 ГБ до 88 ГБ.
Дослідники спостерігають, що прийнятні узагальнені результати високого рівня почали з’являтися досить рано у процесі навчання, на 1500-ій ітерації, через три дні після початку навчання. Решта часу навчання зайняла повільне просування до отримання деталей, таких як волосся та особливості очей.
SofGAN загалом досягає більш реалістичних результатів з одного сегментаційного зображення, ніж суперницькі методи, такі як SPADE від NIVDIA та Pix2PixHD, а також SEAN.
Нижче знаходиться відео, випущене дослідниками. Додаткові відео, розміщені на сервері проекту, доступні на сторінці проекту.














