Взгляд Anderson
Неожиданная выгода от картографирования潜在ного пространства GAN

Пытаясь улучшить качество и достоверность изображений, сгенерированных с помощью ИИ, группа исследователей из Китая и Австралии случайно обнаружила метод интерактивного управления潜在ным пространством сети генеративных противостояний (GAN) – загадочной вычислительной матрицей, стоящей за новой волной техник синтеза изображений, которые должны революционизировать кино, игры и социальные сети, а также многие другие сектора развлечений и исследований.
Их открытие, побочный продукт основной цели проекта, позволяет пользователю произвольно и интерактивно исследовать潜在ное пространство GAN с помощью мыши, как если бы он просматривал видео или листал книгу.

Фрагмент видео исследователей (см. встроенное видео в конце статьи для многих других примеров). Обратите внимание, что пользователь манипулирует преобразованиями с помощью «grab»-курсора (вверху слева). Источник: https://www.youtube.com/watch?v=k7sG4XY5rIc
Метод использует «тепловые карты», чтобы указать, какие области изображения следует улучшить, пока GAN проходит через один и тот же набор данных thousands (или hundreds of thousands) раз. Тепловые карты предназначены для улучшения качества изображения, указывая GAN, где он ошибается, чтобы его следующая попытка была лучше; но, совпадение, это также предоставляет «карту» всего潜在ного пространства, которое можно просматривать, перемещая мышь.

Пространственная визуальная внимательность, подчеркнутая с помощью GradCAM, которая указывает области, требующие внимания, накладывая яркие цвета. Источник: https://arxiv.org/pdf/2112.00718.pdf
Статья называется «Улучшение равновесия GAN за счет повышения пространственной осведомленности» и исходит от исследователей Китайского университета Гонконга и Австралийского национального университета.除了 статье, видео и другие материалы можно найти на странице проекта.
Работа находится на ранней стадии, и в настоящее время ограничена низкокачественными изображениями (256×256), но это доказательство концепции, которое обещает раскрыть «черный ящик»潜在ного пространства и происходит в то время, когда несколько исследовательских проектов стремятся получить больший контроль над синтезом изображений.
Хотя такие изображения увлекательны (и вы можете увидеть больше их, в лучшем качестве, в видео, встроенном в конце этой статьи), то, что, возможно, еще более значимо, – это то, что проект нашел способ создать улучшенное качество изображения и, возможно, сделать это быстрее, указывая GAN конкретно, где он ошибается во время обучения.
Но, как Противостояние указывает, GAN не является единым целым, а rather неравным конфликтом между властью и трудом. Чтобы понять, какие улучшения исследователи внесли в этом отношении, давайте посмотрим, как эта война характеризовалась до сих пор.
Печальное положение Генератора
Если вы когда-либо были преследуемы мыслью, что какой-то новый предмет одежды, который вы купили, был произведен в потогонном цеху в эксплуатируемой стране, или имели начальника или клиента, который постоянно говорил вам «Сделайте еще раз!» без указания, что было не так с вашей последней попыткой, пожалейте немного Генератор, часть сети генеративных противостояний.

Генератор – это работник, который помогал GAN создавать фотореалистичных людей, которых не существует, масштабировать старые видеоигры до 4k-разрешения, и превращать century-old кадры в полноцветное HD-изображение при 60 кадрах в секунду, среди других чудесных новинок ИИ.

От создания фотореалистичных лиц несуществующих людей до восстановления древних кадров и оживления архивных видеоигр, GAN был занят в последние годы.
Генератор проходит через все обучающие данные снова и снова (например, картинки лиц, чтобы создать GAN, который может создавать фотографии случайных, несуществующих людей), одну фотографию за раз, в течение дней или даже недель, пока он не сможет создавать изображения, которые так же убедительны, как и настоящие фотографии, которые он изучал.
Итак, как Генератор знает, что он делает прогресс, каждую попытку создать изображение, лучше, чем его предыдущая попытка?
Генератор имеет начальника из ада.

Безжалостная непрозрачность Дискриминатора
Задача Дискриминатора – сказать Генератору, что он не сделал достаточно хорошо в создании аутентичного изображения, и сделать еще раз. Дискриминатор не говорит Генератору что было не так с его последней попыткой; он просто берет частный взгляд на него, сравнивает сгенерированное изображение с исходными изображениями (снова, частным образом), и присваивает изображению оценку.
Оценка никогда не бывает достаточно хорошей. Дискриминатор не перестанет говорить «Сделайте еще раз», пока исследователи не выключат его (когда они решат, что дополнительное обучение не улучшит вывод).
Таким образом, в отсутствие конструктивной критики и вооруженный только оценкой, чья метрика является загадкой, Генератор должен случайно угадывать, какие части или аспекты изображения вызвали более высокую оценку, чем раньше. Это приведет его к многим дальнейшим неудовлетворительным путям, прежде чем он изменит что-то достаточно положительно, чтобы получить более высокую оценку.
Дискриминатор как наставник и учитель
Инновация, предоставленная новым исследованием, заключается в том, что Дискриминатор теперь указывает Генератору какие части изображения были неудовлетворительными, чтобы Генератор мог сосредоточиться на этих областях в своей следующей итерации, и не выбрасывать разделы, которые были оценены выше. Природа отношений изменилась от конфронтационной к сотруднической.

Чтобы исправить несоответствие понимания между Дискриминатором и Генератором, исследователи использовали GradCAM как механизм, способный сформулировать прозрения Дискриминатора в визуальную обратную связь для следующей попытки Генератора.
Новый метод обучения называется EqGAN. Для максимальной воспроизводимости исследователи включили существующие техники и методы при стандартных настройках, включая использование архитектуры StyleGan2.

Архитектура EqGAN. Пространственная кодировка Генератора выровнена с пространственной осведомленностью Дискриминатора, с случайными образцами пространственных тепловых карт (см. предыдущее изображение) закодированных обратно в генератор через пространственную кодировку (SEL). GradCAM – это механизм, с помощью которого карты внимания Дискриминатора становятся доступными генератору.
GradCAM производит тепловые карты (см. выше изображения), которые отражают критику Дискриминатора последней итерации и делают это доступным Генератору.
Как только модель обучена, карта остается как артефакт этого сотруднического процесса, но также может быть использована для исследования окончательного潜在ного кода в интерактивной форме, продемонстрированной в видео исследователей (см. ниже).
EqGAN
Проект использовал ряд популярных наборов данных, включая наборы LSUN Cat и Churches, а также FFHQ. Видео ниже также включает примеры манипуляции лицами и кошками с помощью EqGAN.
Все изображения были изменены до 256×256 перед обучением EqGAN на официальной реализации StyleGAN2. Модель была обучена с размером пакета 64 на 8 GPU до тех пор, пока Дискриминатор не был подвергнут более 25 миллионам изображений.
Тестирование результатов системы на выбранных образцах с помощью метрики Frechet Inception Distance (FID), авторы установили метрику, называемую Disequilibrium Indicator (DI) – степень, в которой Дискриминатор сохраняет свое знание над Генератором, с целью сужения этого разрыва.
На трех обученных наборах данных новая метрика показала полезное снижение после кодирования пространственной осведомленности в Генератор, с улучшенным равновесием, продемонстрированным как FID, так и DI.

Исследователи заключили:
‘Мы надеемся, что эта работа может вдохновить больше исследований по пересмотру равновесия GAN и разработке новых методов для улучшения качества синтеза изображений путем маневрирования равновесием GAN. Мы также будем проводить больше теоретических исследований по этому вопросу в будущей работе.’
И продолжили:
‘Качественные результаты показывают, что наш метод успешно заставляет Генератор сосредоточиться на конкретных регионах. Эксперименты на различных наборах данных подтверждают, что наш метод смягчает дисбаланс в обучении GAN и существенно улучшает общее качество синтеза изображений. Результатная модель с пространственной осведомленностью также позволяет интерактивно манипулировать выходным изображением.’
Посмотрите видео ниже для получения более подробной информации о проекте и дальнейших примеров динамического и интерактивного исследования潜在ного пространства в GAN.
11:12 утра 4 декабря 2021 года – исправлена ссылка на GradCAM и приведена в порядок окружающая ссылка.












