Погляд Anderson
Непередбачена вигода від мапування.latent простору GAN

При спробі покращити якість та достовірність зображень, згенерованих штучним інтелектом, група дослідників з Китаю та Австралії випадково відкрила метод інтерактивного контролю latent простору Генеративної суперницької мережі (GAN) – загадкової обчислювальної матриці, що стоїть за новою хвилею технік синтезу зображень, які мають революціонізувати кіно, ігри, соціальні медіа та інші галузі розваг та досліджень.
Їх відкриття, побічний продукт основної мети проекту, дозволяє користувачеві довільно та інтерактивно досліджувати latent простір GAN мишкою, як при перемотуванні відео або перегляді книги.

Витяг з супровідного відео дослідників (див. вкладення в кінці статті для більшої кількості прикладів). Відзначте, що користувач маніпулює трансформаціями за допомогою «grab»-курсора (верхній лівий ріг). Джерело: https://www.youtube.com/watch?v=k7sG4XY5rIc
Метод використовує «теплові карти» для вказівки тих областей зображення, які потрібно покращити під час виконання GAN тисячі (або сотень тисяч) разів. Теплові карти призначені для покращення якості зображення, вказуючи GAN, де він помиляється, щоб його наступна спроба була кращою; але, випадково, це також надає «карту» всього latent простору, яку можна просувати, рухаючи мишкою.

Просторова візуальна увага, виділена за допомогою GradCAM, яка вказує області, що потребують уваги, накладаючи яскраві кольори. Джерело: https://arxiv.org/pdf/2112.00718.pdf
Стаття називається «Покращення рівноваги GAN за рахунок підвищення просторової уваги» і походить від дослідників Китайського університету Гонконгу та Австралійського національного університету. Окрім статті, відео та інших матеріалів можна знайти на сторінці проекту.
Робота знаходиться на початковому етапі і зараз обмежена низькою роздільною здатністю зображень (256×256), але це доказ концепції, який обіцяє розбити «чорну скриньку» latent простору і з’являється в той час, коли кілька дослідницьких проектів намагаються здобути більший контроль над синтезом зображень.
Хоча такі зображення привабливі (і ви можете побачити більше з них, у вищій роздільній здатності, у відео, вкладеному в кінці цієї статті), те, що, можливо, ще більш значуще, полягає в тому, що проект знайшов спосіб створити покращену якість зображення і, потенційно, зробити це швидше, вказуючи GAN конкретно, де він помиляється під час навчання.
Але, як Суперницька вказує, GAN не є єдиною сутністю, а радше нерівною боротьбою між владою та трудом. Щоб зрозуміти, які покращення дослідники зробили в цьому відношенні, давайте розглянемо, як ця війна характеризувалася до цього часу.
Жалюгідна доля Генератора
Якщо ви коли-небудь були переслідувані думкою, що якийсь новий предмет одягу, який ви купили, був виготовлений у потогонному цеху в експлуатовані країні, або мали боса чи клієнта, який постійно казав вам «Зробіть ще раз!» без жодних вказівок, що саме було не так з вашою останньою спробою, пожаліть Генератор у Генеративній суперницькій мережі.

Генератор – це тягловий транспорт, який протягом останніх п’яти років допомагав GAN створювати фотореалістичні зображення людей, яких не існує, підвищувати старі відеоігри до роздільної здатності 4K, і перетворювати сторічний фільм у кольорове зображення з частотою 60 кадрів за секунду, серед інших чудових штучних новинок.

Від створення фотореалістичних зображень людей, яких не існує, до відновлення старих фільмів і оживлення архівних відеоігор, GAN був зайнятий протягом останніх років.
Генератор проходить через всі навчальні дані знову і знову (наприклад, зображення облич, щоб створити GAN, який може створювати фотографії випадкових, неіснуючих людей), одне зображення за раз, протягом днів або навіть тижнів, поки він не зможе створити зображення, які є так само переконливими, як і справжні фотографії, які він вивчав.
Як Генератор знає, що він робить якийсь прогрес кожної спроби?
У Генератора є босс з пекла.

Безжалісна непрозорість Дискримінатора
Робота Дискримінатора полягає в тому, щоб сказати Генератору, що він не створив зображення, яке є автентичним щодо оригінальних даних, і сказати йому «Зробіть ще раз». Дискримінатор не каже Генератору що було не так з його останньою спробою; він просто робить приватний огляд і порівнює згенероване зображення з джерельними зображеннями (також приватно) і присвоює зображенню оцінку.
Оцінка ніколи не є достатньо доброю. Дискримінатор не зупиниться говорити «Зробіть ще раз», поки дослідники не вимкнуть його (коли вони вирішать, що додаткове навчання не покращить результат).
У такий спосіб, без жодної конструктивної критики, і озброєний лише оцінкою, метрика якої є загадкою, Генератор повинен випадково здогадуватися, які частини або аспекти зображення спричинили вищу оцінку, ніж раніше. Це приведе його до багатьох подальших незадовільних шляхів, перш ніж він змінить щось позитивно enough, щоб отримати вищу оцінку.
Дискримінатор як наставник і вчитель
Інновація, яку надає нове дослідження, полягає в тому, що Дискримінатор тепер вказує Генератору які частини зображення були незадовільними, щоб Генератор міг зосередитися на цих областях у своїй наступній ітерації, і не викидав частини, які були оцінені вище. Природа відносин змінилася з суперницької на співробітницьку.

Щоб виправити дисбаланс знань між Дискримінатором і Генератором, дослідники використали GradCAM як механізм, здатний формулювати знання Дискримінатора у вигляді візуальної допомоги для наступної спроби Генератора.
Новий метод навчання, який називається EqGAN, включає існуючі техніки та методи за стандартними настройками, включаючи використання архітектури StyleGan2.

Архітектура EqGAN. Просторова кодування Генератора вирівнюється з просторовою увагою Дискримінатора, з випадковими зразками просторових теплових карт (див. попереднє зображення) закодованими назад у Генератор через просторове кодування (SEL). GradCAM – це механізм, за допомогою якого карти уваги Дискримінатора стають доступними Генератору.
GradCAM генерує теплові карти (див. вище зображення), які відображають критику Дискримінатора щодо останньої ітерації, і робить це доступним для Генератора.
Після закінчення навчання модель залишається як артефакт цього співробітницького процесу, але також може бути використана для дослідження кінцевого.latent коду інтерактивним способом, продемонстрованим у відео дослідників (див. нижче).
EqGAN
Проект використовував кілька популярних наборів даних, включаючи набори даних LSUN Cat і Churches, а також FFHQ. Відео нижче також демонструє приклади маніпуляції з обличчями та котами за допомогою EqGAN.
Усі зображення були змінені в розмірі до 256×256 перед навчанням EqGAN на офіційній реалізації StyleGAN2. Модель була навчена з розміром партії 64 на 8 GPU до тих пір, поки Дискримінатор не побачив понад 25 мільйонів зображень.
Тестування результатів системи на вибраних зразках з використанням відстані Фрідера-Інсепшена (FID), автори встановили метрику, яку називають Індикатором дисбалансу (DI) – ступінь, в якій Дискримінатор зберігає свій знаний перевагу над Генератором, з метою звуження цього розриву.
За три навчені набори даних нова метрика показала корисний спад після кодування просторової уваги у Генератор, з покращеною рівновагою, продемонстрованою як FID, так і DI.

Дослідники роблять висновок:
‘Ми сподіваємося, що ця робота зможе надихнути більше робіт щодо перегляду рівноваги GAN і розробки нових методів для покращення якості синтезу зображень шляхом маневрування рівновагою GAN. Ми також проведемо більше теоретичних досліджень цієї проблеми в майбутній роботі.’
І продовжують:
‘Якісні результати показують, що наш метод успішно змусив Генератор зосередитися на конкретних регіонах. Експерименти на різних наборах даних підтверджують, що наш метод пом’якшує дисбаланс у навчанні GAN і суттєво покращує загальну якість синтезу зображень. Результуjící модель з просторовою увагою також дозволяє інтерактивну маніпуляцію вихідним зображенням.’
Подивіться на відео нижче для більшої інформації про проект і подальші приклади динамічного та інтерактивного дослідження latent простору в GAN.
11:12am 4th Dec 2021 – Виправлено URL для GradCAM і впорядковано навколишній посилання.












