Погляд Anderson

Проєктування змін клімату в фотографіях за допомогою генеративних суперницьких мереж

mm
Додайте Unite.AI до бажаних джерел у Google

Команда дослідників з Канади та США розробила метод машинного навчання для накладення катастрофічних наслідків змін клімату на реальні фотографії за допомогою генеративних суперницьких мереж (GAN), з метою зменшення “відстані” – нашої неможливості пов’язати себе з гіпотетичними або абстрактними сценаріями щодо змін клімату.

ClimateGAN оцінює геометрію з розрахованої глибинної карти перед додаванням відбивності в накладеному водному поверхні. Джерело: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN оцінює геометрію з розрахованої глибинної карти перед додаванням відбивності в накладеному водному поверхні. Джерело: https://arxiv.org/pdf/2110.02871.pdf

Проєкт ClimateGAN є частиною ширшої дослідницької роботи з розробки інтерактивних середовищ, в яких користувачі можуть досліджувати проєктовані світ, які були вплинути зміни клімату.

Обговорюючи мотивацію цієї ініціативи, дослідники заявляють:

‘Зміни клімату є великою загрозою для людства, і дії, необхідні для запобігання їх катастрофічних наслідків, включають зміни в політиці та індивідуальному поведінці. Однак для того, щоб вжити дії, необхідно зрозуміти наслідки змін клімату, хоча вони можуть здаватися абстрактними та віддаленими. ‘

‘Накладення потенційних наслідків екстремальних кліматичних подій, таких як повені, в знайомих місцях, може допомогти зробити абстрактні наслідки змін клімату більш конкретними та сприяти діям.’

Основною метою проєкту є створення системи, в якій користувач може ввійти свою адресу (або будь-яку адресу) і побачити версію зображення з Google Street View, на яку вплинули зміни клімату. Однак алгоритми перетворення за допомогою ClimateGAN вимагають деяких знань про висоту об’єктів на фотографії, які не входять до метаданих, які Google надає для Street View, тому отримання такого алгоритму залишається тривалим викликом.

Дані та архітектура

ClimateGAN використовує не наглядану систему перекладу зображень у зображення з двома фазами: шар Masker, який оцінює, де теоретично може бути рівень води в цільовому зображенні; і модуль Painter для реалістичного відтворення води в межах встановленого маска, враховуючи відбивність не закритої геометрії над рівнем води.

Архітектура ClimateGAN. Вхідний сигнал проходить через спільний кодувальник у триступінчатий процес маскування перед тим, як бути переданим до модулю Painter. Дві мережі тренуються незалежно та працюють лише в тандемі під час генерації нових зображень.

Архітектура ClimateGAN. Вхідний сигнал проходить через спільний кодувальник у триступінчатий процес маскування перед тим, як бути переданим до модулю Painter. Дві мережі тренуються незалежно та працюють лише в тандемі під час генерації нових зображень.

Більшість тренувальних даних була вибрана з наборів даних CityScapes та Mapillary. Однак, оскільки існуючі дані про повені є відносно рідкісними, дослідники поєднали існуючі доступні набори даних з новим “віртуальним світом”, розробленим за допомогою ігрового двигуна Unity3D.

Сцени з віртуального середовища Unity3D.

Сцени з віртуального середовища Unity3D.

Середовище Unity3D містить близько 1,5 км території, включаючи міські, приміські та сільські райони, які дослідники “затопили”. Це дозволило згенерувати “до” і “після” зображення для додаткової перевірки правильності для рамки ClimateGAN.

Блок Masker адаптує код ADVENT 2018 року для навчання, додаючи додаткові дані у відповідності з висновками французької дослідницької ініціативи DADA 2019 року. Дослідники також додали декодер сегментації, щоб надати блоку Masker додаткову інформацію щодо семантики вхідного зображення (тобто позначену інформацію, яка позначає область, таку як “будівля”).

Декодер маски повені розраховуємо можливий рівень води та використовує популярний інструмент SPADE для відновлення зображень.

Разом з семантичною сегментацією (третій стовпець) інформація про глибинну карту дозволяє визначити геометрію на фотографії, надавши орієнтир для меж

Натисніть, щоб збільшити. Разом з семантичною сегментацією (третій стовпець) інформація про глибинну карту дозволяє визначити геометрію на фотографії, надавши орієнтир для меж “повені”. Це можна вивести за допомогою процесів машинного навчання, хоча така інформація все частіше включена в датчики мобільних пристроїв споживачів. У нижньому рядку ми бачимо, що архітектура ClimateGAN успішно відтворила “затоплену” версію оригінальної фотографії, хоча проміжні стадії не змогли точно захопити геометрію складної сцени.

Хоча дослідники використовували інструмент GauGAN, який використовує SPADE, для модулю Painter, було необхідно умовити GauGAN на виході блоку Masker, а не на загальній семантичній карті, як це відбувається в нормальному використанні, оскільки зображення мали бути перетворені у відповідності з позначеннями рівня води, а не піддаватися широким, загальним перетворенням.

Оцінка якості

Метрики для оцінки якості отриманих зображень були розроблені шляхом маркування тестової вибірки з 180 зображень Google Street View різного типу, включаючи міські сцени та більш сільські зображення з різноманітних географічних місць. Зображення були вручну позначені як не можуть бути затоплені, повинні бути затоплені та можуть бути затоплені.

Це дозволило сформулювати три метрики: помилкова швидкість (сприйняті прогнозовані області за розміром у перетвореному зображенні), F05 Бал та крайова узгодженість. Для порівняння дослідники протестували дані на попередніх моделях перекладу зображень у зображення, включаючи InstaGAN, CycleGAN та MUNIT.

У тестах користувачів ClimateGAN показав вищу ступінь реалізму, ніж п'ять конкуруючих архітектур IIT. Синій колір позначає ступінь, у якій користувачі віддавали перевагу ClimateGAN порівняно з досліджуваним альтернативним методом.

У тестах користувачів ClimateGAN показав вищу ступінь реалізму, ніж п’ять конкуруючих архітектур IIT. Синій колір позначає ступінь, у якій користувачі віддавали перевагу ClimateGAN порівняно з досліджуваним альтернативним методом.

Дослідники визнають, що відсутність даних про висоту в джерельних зображеннях робить складним довільне накладення висоти рівня води в зображеннях, якщо користувач хоче збільшити “фактор Роланда Еммеріха” трохи. Вони також визнають, що ефекти повені обмежені надто вузько повеневими зонами, і планують дослідити методи, за допомогою яких можна додати кілька рівнів повені (тобто після відступу первинної повені) до методології.

Код ClimateGAN було розміщено на GitHub, разом з додатковими прикладами згенерованих зображень.

У іншому прикладі, з присутністю GitHub для проєкту, дим додано до міського зображення таким чином, який буде знайомий більшості фахівців VFX - глибинна карта використовується як種

У іншому прикладі, з присутністю GitHub для проєкту, дим додано до міського зображення таким чином, який буде знайомий більшості фахівців VFX – глибинна карта використовується як種 “білого” маска, так що густина диму/туману збільшується по відстані, покритій на фотографії. Джерело: https://github.com/cc-ai/climategan

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai