Ángulo de Anderson
Proyectar el cambio climático en fotos con redes adversarias generativas

Un equipo de investigadores de Canadá y EE. UU. ha desarrollado un método de aprendizaje automático para superponer los efectos catastróficos del cambio climático en fotos reales utilizando Redes Adversarias Generativas (GAN), con el objetivo de reducir la “distancia” – nuestra incapacidad para relacionarnos con escenarios hipotéticos o abstractos relacionados con el cambio climático.

ClimateGAN estima la geometría a partir de una depth-map calculada antes de agregar reflectividad en una superficie de agua superpuesta. Fuente: https://arxiv.org/pdf/2110.02871.pdf
El proyecto, titulado ClimateGAN, es parte de un esfuerzo de investigación más amplio para desarrollar entornos interactivos donde los usuarios pueden explorar mundos proyectados que han sido afectados por inundaciones, calor extremo y otras consecuencias graves del cambio climático.
Al discutir la motivación detrás de la iniciativa, los investigadores afirman:
‘El cambio climático es una amenaza importante para la humanidad, y las acciones necesarias para prevenir sus consecuencias catastróficas incluyen cambios en la toma de decisiones políticas y en el comportamiento individual. Sin embargo, tomar medidas requiere comprender los efectos del cambio climático, incluso si parecen abstractos y distantes.
‘Proyectar las posibles consecuencias de eventos climáticos extremos, como inundaciones, en lugares familiares puede ayudar a hacer que los impactos abstractos del cambio climático sean más concretos y fomentar la acción.’
Un objetivo principal de la iniciativa es permitir un sistema en el que un usuario pueda ingresar su dirección (o cualquier dirección) y ver una versión afectada por el cambio climático de la imagen correspondiente de Google Street View. Sin embargo, los algoritmos de transformación detrás de ClimateGAN requieren algún conocimiento estimado de la altura de los elementos en la foto, que no se incluye en los metadatos que Google proporciona para Street View, y así obtener tal algoritmo de estimación sigue siendo un desafío en curso.
Datos y Arquitectura
ClimateGAN utiliza una canalización de traducción de imagen a imagen no supervisada con dos fases: una capa Masker, que estima dónde existiría teóricamente una superficie de agua nivelada en la imagen objetivo; y un módulo Painter para renderizar agua de manera realista dentro de los límites de la máscara establecida, y tiene en cuenta la reflectividad de la geometría no oculta restante por encima de la línea de agua.

La arquitectura para ClimateGAN. La entrada procede a través de un codificador compartido en un proceso de enmascaramiento de tres etapas antes de pasar al módulo Painter. Las dos redes se entrenan de forma independiente y solo operan en conjunto durante la generación de nuevas imágenes.
La mayoría de los datos de entrenamiento se seleccionaron de los conjuntos de datos CityScapes y Mapillary. Sin embargo, dado que los datos existentes para imágenes de inundaciones son relativamente escasos, los investigadores combinaron los conjuntos de datos existentes disponibles con un ‘mundo virtual’ novel desarrollado con el motor de juego Unity3D.

Escenas del entorno virtual Unity3D.
El mundo Unity3D contiene alrededor de 1,5 km de terreno y incluye áreas urbanas, suburbanas y rurales, que los investigadores “inundaron”. Esto permitió la generación de imágenes “antes” y “después” para obtener más datos de verdad para el marco de trabajo ClimateGAN.
La unidad Masker adapta el código ADVENT de 2018 para el entrenamiento, agregando datos adicionales en línea con los hallazgos de 2019 de la iniciativa de investigación francesa DADA. Los investigadores también agregaron un decodificador de segmentación para alimentar a la unidad Masker con información adicional sobre la semántica de la imagen de entrada (es decir, información etiquetada que denota un dominio, como ‘edificio’).
El decodificador de máscara de inundación calcula una línea de agua factible y está impulsado por el popular marco de procesamiento de imágenes SPADE de NVIDIA.

Haga clic para ampliar. Junto con la segmentación semántica (tercera columna), la información de la depth-map permite delinear la geometría en una foto, proporcionando una guía para los márgenes del ‘agua de inundación’. Esto se puede inferir a través de procesos de aprendizaje automático, aunque dicha información se está incluyendo cada vez más en sensores de dispositivos móviles de consumo. En la fila inferior, vemos que la arquitectura ClimateGAN ha renderizado con éxito una versión ‘inundada’ de la foto original, aunque las etapas intermedias no han capturado con precisión la geometría de una escena compleja.
Aunque los investigadores utilizaron GauGAN de NVIDIA, impulsado por SPADE, para el módulo Painter, fue necesario condicionar a GauGAN en la salida de la unidad Masker, y no en una mapa de segmentación semántica generalizado, como ocurre en el uso normal, ya que las imágenes tenían que transformarse de acuerdo con las delimitaciones de la línea de agua, en lugar de estar sujetas a transformaciones generales amplias.
Evaluación de la Calidad
Las métricas para evaluar la calidad de las imágenes resultantes se facilitaron etiquetando un conjunto de prueba de 180 imágenes de Google Street View de diferentes tipos, incluyendo escenas urbanas y más rurales de diversas ubicaciones geográficas. Las imágenes se etiquetaron manualmente como no se puede inundar, debe inundar y puede inundar.

Esto permitió la formulación de tres métricas: tasa de error (áreas de predicción percibidas por tamaño en la imagen transformada), Puntuación F05 y coherencia de bordes. Para comparar, los investigadores probaron los datos en modelos de traducción de imagen a imagen (IIT) anteriores, incluyendo InstaGAN, CycleGAN y MUNIT.

En pruebas de usuario, ClimateGAN se encontró que logra un mayor grado de realismo que cinco arquitecturas IIT competidoras. El azul representa el grado en que los usuarios prefirieron ClimateGAN al método alternativo estudiado.
Los investigadores admiten que la falta de datos de altura en las imágenes de origen hace que sea difícil imponer arbitrariamente alturas de la línea de agua en las imágenes, si el usuario desea aumentar un poco el ‘factor Roland Emmerich’. También admiten que los efectos de la inundación están limitados en exceso al área de la inundación y pretenden investigar métodos para agregar múltiples niveles de inundación (es decir, después de la recesión de una inundación inicial) a la metodología.
El código de ClimateGAN ha sido puesto a disposición en GitHub, junto con ejemplos adicionales de imágenes renderizadas.

En otro ejemplo, de la presencia de GitHub para el proyecto, se agrega smog a una imagen de ciudad de una manera que será familiar para la mayoría de los practicantes de VFX – la depth-map se utiliza como una especie de ‘máscara de desvanecimiento blanco’ recedente, de modo que la densidad de smog/niebla aumenta a lo largo de la distancia cubierta en la foto. Fuente: https://github.com/cc-ai/climategan












