Взгляд Anderson
Проектирование изменений климата в фотографиях с помощью генеративных противостоящих сетей

Команда исследователей из Канады и США разработала метод машинного обучения для наложения катастрофических последствий изменения климата на реальные фотографии с помощью генеративных противостоящих сетей (GAN), с целью снижения “дистанцирования” – нашей неспособности связаться с гипотетическими или абстрактными сценариями, связанными с изменением климата.

ClimateGAN оценивает геометрию из рассчитанной глубинной карты перед добавлением отражающей способности в наложенной водной поверхности. Источник: https://arxiv.org/pdf/2110.02871.pdf
Проект назван ClimateGAN, и является частью более широких исследований по разработке интерактивных сред, в которых пользователи могут исследовать проектированные миры, пострадавшие от наводнений, экстремальной жары и других серьезных последствий изменения климата.
Обсуждая мотивацию за этой инициативой, исследователи заявляют:
‘Изменение климата является серьезной угрозой для человечества, и действия, необходимые для предотвращения его катастрофических последствий, включают изменения в политике и индивидуальном поведении. Однако для принятия действий необходимо понять последствия изменения климата, даже если они кажутся абстрактными и далекими.
‘Проектирование потенциальных последствий экстремальных климатических событий, таких как наводнения, в знакомых местах может помочь сделать абстрактные последствия изменения климата более конкретными и поощрить к действию.’
Основной целью инициативы является создание системы, в которой пользователь может ввести свой адрес (или любой адрес) и увидеть версию изображения из Google Street View, пострадавшего от изменения климата. Однако алгоритмы трансформации, используемые в ClimateGAN, требуют некоторых оценочных знаний высоты объектов на фотографии, которые не включены в метаданные, предоставляемые Google для Street View, и поэтому получение такой оценочной информации остается продолжающимся вызовом.
Данные и архитектура
ClimateGAN использует не监督ируемый пайплайн перевода изображения в изображение с двумя фазами: слоем Masker, который оценивает, где теоретически должна существовать водная поверхность в целевом изображении; и модулем Painter для реалистичного рендеринга воды в пределах установленной маски, учитывая отражающую способность оставшейся не заслоненной геометрии над водной поверхностью.

Архитектура для ClimateGAN. Вход проходит через общий кодировщик в трехэтапный процесс маскирования, прежде чем быть переданным в модуль Painter. Две сети обучаются независимо и работают только вместе во время генерации новых изображений.
Большая часть обучающих данных была выбрана из наборов данных CityScapes и Mapillary. Однако, поскольку существующих данных для изображений наводнений относительно мало, исследователи объединили существующие доступные наборы данных с новым “виртуальным миром”, разработанным с помощью игрового движка Unity3D.

Сцены из виртуальной среды Unity3D.
Виртуальный мир Unity3D содержит около 1,5 км местности и включает городские, пригородные и сельские районы, которые исследователи “затопили”. Это позволило сгенерировать “до” и “после” изображения для дополнительной проверки правильности для рамки ClimateGAN.
Блок Masker адаптирует код ADVENT 2018 года для обучения, добавляя дополнительные данные в соответствии с результатами 2019 года французской исследовательской инициативы DADA. Исследователи также добавили декодер сегментации для подачи блока Masker дополнительной информации о семантике входного изображения (т.е. помеченной информации, обозначающей область, например, “здание”).
Декодер маски наводнения рассчитывает возможную водную поверхность и работает на основе популярного фреймворка SPADE для рендеринга низкокачественных входных данных.

Нажмите, чтобы увеличить. Вместе с семантической сегментацией (третья колонка) информация глубинной карты позволяет определить геометрию на фотографии, предоставляя руководство для границ “водной” поверхности. Это можно сделать с помощью процессов машинного обучения, хотя такая информация все чаще включается в датчики мобильных устройств потребительского уровня. В нижней строке мы видим, что архитектура ClimateGAN успешно сгенерировала “затопленную” версию исходной фотографии, даже если промежуточные этапы не смогли точно захватить геометрию сложной сцены.
Хотя исследователи использовали GauGAN, работающий на основе SPADE, для модуля Painter, было необходимо условить GauGAN на выходе блока Masker, а не на общей семантической карте сегментации, как это происходит при нормальном использовании, поскольку изображения должны были быть преобразованы в соответствии с линиями водной поверхности, а не подвергаться широким, общим преобразованиям.
Оценка качества
Метрики для оценки качества полученных изображений были сформированы путем пометки тестового набора из 180 изображений Google Street View различного типа, включая городские сцены и более сельские изображения из различных географических мест. Изображения были вручную помечены как не могут быть затоплены, должны быть затоплены и могут быть затоплены.

Это позволило сформулировать три метрики: ошибка прогнозирования (перцептивная ошибка прогнозирования по размеру в преобразованном изображении), F05 балл и согласованность краев. Для сравнения исследователи протестировали данные на предыдущих моделях перевода изображения в изображение (IIT), включая InstaGAN, CycleGAN и MUNIT.

В тестах пользователей ClimateGAN был признан более реалистичным, чем пять конкурирующих архитектур IIT. Синий цвет представляет степень, в которой пользователи предпочитают ClimateGAN изученному альтернативному методу.
Исследователи признают, что отсутствие данных о высоте в исходных изображениях делает трудным произвольное наложение высот водной поверхности на изображения, если пользователь хочет увеличить “фактор Роланда Эммериха” немного. Они также признают, что эффекты наводнения чрезмерно ограничены зоной наводнения и намерены изучить методы, с помощью которых можно добавить несколько уровней наводнения (т.е. после отступления первоначального потока) в методологию.
Код ClimateGAN был опубликован на GitHub, вместе с дополнительными примерами сгенерированных изображений.

В другом примере, из присутствия GitHub для проекта, смог добавлен к городскому изображению таким образом, который знаком большинству практиков VFX – глубинная карта используется как своего рода отступающая “белая маска”, так что плотность смога/тумана увеличивается на расстоянии, покрытом на фотографии. Источник: https://github.com/cc-ai/climategan












