زاوية Anderson

عرض تأثيرات تغير المناخ على الصور باستخدام الشبكات التوليدية المعارضة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

طور فريق من الباحثين من كندا والولايات المتحدة طريقة تعلم الآلة لوضع تأثيرات تغير المناخ الكارثية على الصور الحقيقية باستخدام الشبكات التوليدية المعارضة (GANs)، بهدف تقليل “التعريف” – عدم khảنا للارتباط بالسيناريوهات المتخيلة أو المجردة المتعلقة بتغير المناخ.

ClimateGAN estimates geometry from a calculated depth-map before adding reflectivity in a superimposed water surface. Source: https://arxiv.org/pdf/2110.02871.pdf

ClimateGAN estimates geometry from a calculated depth-map before adding reflectivity in a superimposed water surface. Source: https://arxiv.org/pdf/2110.02871.pdf

المشروع، الذي يحمل عنوان ClimateGAN، هو جزء من جهود بحثية أوسع لتحويل البيئات التفاعلية حيث يمكن للمستخدمين استكشاف العوالم المحسوبة التي تأثرت بالفيضانات والحرارة الشديدة والنتائج الخطيرة الأخرى لتغير المناخ.

ناقش الباحثون الدافع وراء المبادرة، وقالوا:

‘تغير المناخ هو تهديد كبير للبشرية، والactions المطلوبة لمنع عواقبه الكارثية تشمل التغييرات في كل من صنع السياسات والسلوك الفردي. ومع ذلك، فإن اتخاذ الإجراءات يتطلب فهم تأثيرات تغير المناخ، حتى لو بدت مجردة وبعيدة.’

‘وضع النتائج المحتملة للحدث المناخي الشديد مثل الفيضانات في الأماكن المألوفة يمكن أن يساعد في جعل التأثيرات المجردة لتغير المناخ أكثر ملموسية وتحفز على العمل.’

الهدف الرئيسي للمبادرة هو تمكين نظام يمكن للمستخدم من إدخال عنوانه (أو أي عنوان) ومشاهدة نسخة متأثرة بتغير المناخ من الصورة المقابلة من جوجل ستريت فيو. ومع ذلك، فإن خوارزميات التحويل وراء ClimateGAN تتطلب بعض المعرفة المقدرة لارتفاع العناصر في الصورة، والتي لا يتم تضمينها في البيانات الوصفية التي توفرها جوجل لستريت فيو، وبالتالي فإن الحصول على خوارزمية تقديرية بشكل منهجي يبقى تحديًا مستمرًا.

البيانات والهيكل

يستخدم ClimateGAN خط أنابيب غير مُشرّع لترجمة الصور إلى صور مع مراحل اثنتين: طبقة Masker، التي تقدر حيث يمكن أن توجد سطح ماء مستوى نظريًا في الصورة الهدف؛ ووحدة Painter لتجسيد الماء بشكل واقعي داخل حدود Масك المحددة، ويعطي اهتمامًا بالانعكاسية للجغرافيا غير المحجوبة المتبقية فوق خط الماء.

The architecture for ClimateGAN. Input proceeds through a shared encoder into a three-stage masking process before being passed to the Painter module. The two networks are trained independently, and only operate in tandem during the generation of new images.

The architecture for ClimateGAN. Input proceeds through a shared encoder into a three-stage masking process before being passed to the Painter module. The two networks are trained independently, and only operate in tandem during the generation of new images.

تم اختيار معظم بيانات التدريب من مجموعات بيانات CityScapes و Mapillary. ومع ذلك، نظرًا لأن البيانات الحالية لصور الفيضانات نادرة نسبيًا، قام الباحثون بدمج مجموعات البيانات المتاحة مع عالم افتراضي جديد تم تطويره باستخدام محرك ألعاب Unity3D.

Scenes from the Unity3D virtual environment.

Scenes from the Unity3D virtual environment.

يحتوي عالم Unity3D على حوالي 1.5 كم من التضاريس، ويشمل المناطق الحضرية والضواحي والريفية، والتي غمرها الباحثون. هذا مكن من توليد صور “قبل” و “بعد” إضافية لبيانات التدريب الإضافية لإطار ClimateGAN.

تعمل وحدة Masker على تعديل رمز ADVENT لعام 2018 لتدريب، بإضافة بيانات إضافية وفقًا لنتائج عام 2019 من المبادرة البحثية الفرنسية DADA. كما أضاف الباحثون محول تقسيم لتقديم وحدة Masker معلومات إضافية حول معاني الصورة الإدخالية (أي معلومات ملصقة تحدد مجالًا، مثل “مبنى”).

يحسب محول Flood Mask خط ماء قابل للتحقيق، ويعمل بنظام NVIDIA الشهير SPADE لإعادة الرسم.

Together with semantic segmentation (third column), depth map information enables delineation of the geometry in a photo, providing a guideline for the margins of the 'flood water'. This can be inferred through machine learning processes, though such information is increasingly being included in consumer-level mobile device sensors. In the lowest row, we see that the ClimateGAN architecture has successfully rendered a 'flooded' version of the original photo even though the intermediate stages have failed to accurately capture the geometry of a complex scene.

انقر لتحويل الصورة. Together with semantic segmentation (third column), depth map information enables delineation of the geometry in a photo, providing a guideline for the margins of the ‘flood water’. This can be inferred through machine learning processes, though such information is increasingly being included in consumer-level mobile device sensors. In the lowest row, we see that the ClimateGAN architecture has successfully rendered a ‘flooded’ version of the original photo even though the intermediate stages have failed to accurately capture the geometry of a complex scene.

على الرغم من استخدام الباحثين نظام NVIDIA GauGAN، الذي يعمل بنظام SPADE، لوحدة Painter، كان من الضروري تقديم GauGAN على إخراج وحدة Masker، وليس على خريطة تقسيم семантиك مجردة، كما يحدث في الاستخدام العادي، لأن الصور يجب أن تتحول وفقًا لمحددات خط الماء، وليس خاضعة لتحويلات واسعة ومجردة.

تقييم الجودة

تم تسهيل مقاييس تقييم جودة الصور الناتجة عن طريق وضع علامات على مجموعة اختبار من 180 صورة من جوجل ستريت فيو من أنواع مختلفة، بما في ذلك المشاهد الحضرية والمزيد من الصور الريفية من مواقع جغرافية متنوعة. تم وضع علامات على الصور يدويًا على أنها لا يمكن فيضاناتها، يجب فيضاناتها، و يمكن فيضاناتها.

سمح ذلك بتشكيل ثلاثة مقاييس: معدل الخطأ (مناطق التنبؤ المتصورة حسب الحجم في الصورة المحولة)، F05 Score، و التماسك الحافي. من أجل المقارنة، قام الباحثون بتحليل البيانات على نماذج سابقة لترجمة الصور إلى صور، بما في ذلك InstaGAN و CycleGAN و MUNIT.

In user tests, ClimateGAN was found to achieve a higher degree of realism than five competing IIT architectures. Blue represents the degree to which users preferred ClimateGAN to the studied alternative method.

In user tests, ClimateGAN was found to achieve a higher degree of realism than five competing IIT architectures. Blue represents the degree to which users preferred ClimateGAN to the studied alternative method.

يعترف الباحثون بأن نقص بيانات الارتفاع في الصور المصدرية يجعل من الصعب فرض ارتفاعات خط الماء بشكل تعسفي في الصور، إذا أراد المستخدم زيادة “عامل رولاند إيميريش” قليلًا. كما يعترفون بأن تأثيرات الفيضانات محدودة بشكل مبالغ فيه لمنطقة الفيضانات، ويقصدون التحقيق في الطرق التي يمكن من خلالها إضافة مستويات متعددة من الفيضانات (أي بعد انحسار فيضان أولي) إلى المنهجية.

تم إتاحة رمز ClimateGAN على جيت هاب، إلى جانب أمثلة إضافية للصور المحولة.

In another example, from the GitHub presence for the project, smog is added to a city picture in a way that will be familiar to most VFX practitioners – the depth map is used as a kind of receding 'white-out mask', so that the density of smog/fog increases across the distance covered in the photo. Source: https://github.com/cc-ai/climategan

In another example, from the GitHub presence for the project, smog is added to a city picture in a way that will be familiar to most VFX practitioners – the depth map is used as a kind of receding ‘white-out mask’, so that the density of smog/fog increases across the distance covered in the photo. Source: https://github.com/cc-ai/climategan

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai