Anderson का एंगल
जलवायु परिवर्तन को फोटो में परियोजना देने के लिए जनरेटिव एडवर्सेरियल नेटवर्क का उपयोग

कैनेडा और अमेरिका के शोधकर्ताओं की एक टीम ने जनरेटिव एडवर्सेरियल नेटवर्क (GANs) का उपयोग करके वास्तविक फोटो में जलवायु परिवर्तन के विनाशकारी प्रभावों को सुपरइम्पोज़ करने के लिए एक मशीन लर्निंग विधि विकसित की है, जिसका उद्देश्य ‘दूरी’ को कम करना है – हमारी जलवायु परिवर्तन के संबंध में संभावित या अमूर्त परिदृश्यों से संबंधित नहीं होने की क्षमता।

ClimateGAN गणना की गई गहराई मानचित्र से ज्यामिति का अनुमान लगाता है और फिर जल सतह में परावर्तन जोड़ता है। स्रोत: https://arxiv.org/pdf/2110.02871.pdf
इस परियोजना को ClimateGAN नाम दिया गया है, जो जलवायु परिवर्तन से प्रभावित दुनिया को अन्वेषण करने के लिए इंटरैक्टिव वातावरण विकसित करने के लिए एक व्यापक शोध प्रयास का हिस्सा है, जहां उपयोगकर्ता बाढ़, अत्यधिक गर्मी और जलवायु परिवर्तन के अन्य गंभीर परिणामों से प्रभावित दुनिया का अन्वेषण कर सकते हैं।
इस पहल के पीछे के प्रेरणा पर चर्चा करते हुए, शोधकर्ता कहते हैं:
‘जलवायु परिवर्तन मानवता के लिए एक बड़ा खतरा है, और इसके विनाशकारी परिणामों को रोकने के लिए आवश्यक कार्रवाई में नीति निर्माण और व्यक्तिगत व्यवहार में परिवर्तन शामिल हैं। हालांकि, कार्रवाई करने के लिए जलवायु परिवर्तन के प्रभावों को समझना आवश्यक है, भले ही वे अमूर्त और दूरस्थ लगते हों। ‘
‘परिचित स्थानों में बाढ़ जैसी चरम जलवायु घटनाओं के संभावित परिणामों को परियोजना करने से जलवायु परिवर्तन के अमूर्त प्रभावों को अधिक ठोस बनाने में मदद मिल सकती है और कार्रवाई को प्रोत्साहित किया जा सकता है।’
इस पहल का एक मुख्य उद्देश्य एक प्रणाली को सक्षम करना है जहां एक उपयोगकर्ता अपना पता (या कोई भी पता) दर्ज कर सकता है और गूगल स्ट्रीट व्यू से संबंधित छवि का जलवायु परिवर्तन प्रभावित संस्करण देख सकता है। हालांकि, ClimateGAN के पीछे के परिवर्तन एल्गोरिदम को फोटो में आइटम के लिए कुछ अनुमानित ज्ञान की आवश्यकता होती है, जो गूगल स्ट्रीट व्यू के लिए प्रदान किए गए मेटाडेटा में शामिल नहीं है, और इसलिए ऐसा अनुमान एल्गोरिदम रूप से प्राप्त करना एक चल रही चुनौती है।
डेटा और वास्तुकला
ClimateGAN एक अनुप्रविष्ट छवि-से-छवि अनुवाद पाइपलाइन का उपयोग करता है जिसमें दो चरण होते हैं: एक मास्कर लेयर, जो теорेतically एक स्तर के पानी की सतह का अनुमान लगाती है जहां यह लक्ष्य छवि में मौजूद हो सकती है; और एक पेंटर मॉड्यूल जो मास्क की सीमाओं के भीतर वास्तविक रूप से पानी को प्रस्तुत करता है और जलरेखा से ऊपर के अवशिष्ट ज्यामिति की परावर्तनशीलता को ध्यान में रखता है।

ClimateGAN की वास्तुकला। इनपुट एक साझा एनकोडर के माध्यम से एक तीन-चरण मास्किंग प्रक्रिया में जाता है और फिर पेंटर मॉड्यूल में पास किया जाता है। दोनों नेटवर्क स्वतंत्र रूप से प्रशिक्षित होते हैं और केवल नए चित्रों के निर्माण के दौरान ही एक साथ काम करते हैं।
प्रशिक्षण डेटा का अधिकांश भाग CityScapes और Mapillary डेटासेट से चुना गया था। हालांकि, मौजूदा बाढ़ छवियों के लिए डेटा की कमी के कारण, शोधकर्ताओं ने मौजूदा उपलब्ध डेटासेट को एक नए ‘वर्चुअल वर्ल्ड’ के साथ जोड़ दिया, जिसे यूनिटी3डी गेम इंजन के साथ विकसित किया गया था।

यूनिटी3डी वर्चुअल वातावरण के दृश्य。
यूनिटी3डी दुनिया में लगभग 1.5 किमी का क्षेत्र है, जिसमें शहरी, उपनगरीय और ग्रामीण क्षेत्र शामिल हैं, जिन्हें शोधकर्ताओं ने ‘बाढ़’ दिया था। इससे ClimateGAN फ्रेमवर्क के लिए अतिरिक्त मैदान सत्य के लिए ‘पहले’ और ‘बाद’ की छवियों का निर्माण करने में मदद मिली।
मास्कर यूनिट 2018 ADVENT कोड का उपयोग प्रशिक्षण के लिए करता है, 2019 के फ्रांसीसी शोध पहल DADA से अतिरिक्त डेटा जोड़ता है। शोधकर्ताओं ने मास्कर यूनिट को अतिरिक्त जानकारी प्रदान करने के लिए एक सेगमेंटेशन डिकोडर भी जोड़ा, जो इनपुट छवि (जैसे कि ‘बिल्डिंग’) के सेमेंटिक्स के बारे में जानकारी प्रदान करता है।
बाढ़ मास्क डिकोडर एक व्यवहार्य जलरेखा की गणना करता है, और यह NVIDIA के बहुत लोकप्रिय SPADE इन-पेंटिंग फ्रेमवर्क द्वारा संचालित है।

क्लिक करें बढ़ाने के लिए। सेमेंटिक सेगमेंटेशन (तीसरे कॉलम) के साथ, गहराई मानचित्र जानकारी छवि में ज्यामिति को रेखांकित करने में मदद करती है, जो ‘बाढ़ पानी’ के मार्जिन के लिए एक दिशानिर्देश प्रदान करती है। यह मशीन लर्निंग प्रक्रियाओं के माध्यम से अनुमानित किया जा सकता है, हालांकि यह जानकारी उपभोक्ता-स्तर के मोबाइल डिवाइस सेंसर में बढ़ती जा रही है। निम्नलिखित पंक्ति में, हम देखते हैं कि ClimateGAN वास्तुकला ने एक ‘बाढ़’ संस्करण को सफलतापूर्वक प्रस्तुत किया है, भले ही मध्यवर्ती चरणों ने जटिल दृश्य की ज्यामिति को सटीक रूप से कब्जा नहीं किया हो।
हालांकि शोधकर्ताओं ने पेंटर मॉड्यूल के लिए NVIDIA GauGAN का उपयोग किया, जो SPADE द्वारा संचालित है, मास्कर के आउटपुट पर GauGAN को सशर्त बनाना आवश्यक था, न कि सामान्य सेमेंटिक सेगमेंटेशन मैप पर, क्योंकि छवियों को जलरेखा के अनुसार परिवर्तित किया जाना था, न कि व्यापक, सामान्य परिवर्तनों के अधीन।
गुणवत्ता का मूल्यांकन
परिणामी छवियों की गुणवत्ता का मूल्यांकन करने के लिए मेट्रिक्स को 180 गूगल स्ट्रीट व्यू छवियों के एक परीक्षण सेट को लेबल करके सुविधा प्रदान की गई, जिसमें शहरी दृश्य और विभिन्न भौगोलिक स्थानों से अधिक ग्रामीण छवियां शामिल थीं। छवियों को मैनुअल रूप से बाढ़ नहीं की जा सकती, बाढ़ होनी चाहिए, और बाढ़ हो सकती है के रूप में लेबल किया गया था।

इसने तीन मेट्रिक्स का गठन किया: त्रुटि दर (परिवर्तित छवि में अनुमानित क्षेत्र का आकार), F05 स्कोर, और किनारा संगति। तुलना के लिए, शोधकर्ताओं ने पूर्व छवि-से-छवि अनुवाद (IIT) मॉडल पर डेटा का परीक्षण किया, जिसमें InstaGAN, CycleGAN, और MUNIT शामिल थे।

उपयोगकर्ता परीक्षण में, ClimateGAN को पांच प्रतिस्पर्धी IIT वास्तुकला की तुलना में उच्च स्तर की वास्तविकता प्राप्त करने के लिए पाया गया। नीला रंग दर्शाता है कि उपयोगकर्ता ClimateGAN को अध्ययन की गई वैकल्पिक विधि की तुलना में कितना पसंद करते हैं।
शोधकर्ता स्वीकार करते हैं कि स्रोत छवियों में ऊंचाई डेटा की कमी इसे मनमाने रूप से जलरेखा की ऊंचाई को छवियों में लगाने में कठिन बना देती है, यदि उपयोगकर्ता ‘रोलैंड एमरिच फैक्टर’ को थोड़ा बढ़ाना चाहता है। वे यह भी स्वीकार करते हैं कि बाढ़ के प्रभाव बाढ़ के क्षेत्र में बहुत सीमित हैं, और वे विधि में कई स्तरों की बाढ़ (जैसे कि प्रारंभिक बाढ़ के पुनरावृत्ति के बाद) जोड़ने के तरीकों की जांच करने का इरादा रखते हैं।
ClimateGAN का कोड गिटहब पर उपलब्ध है, साथ ही साथ रेंडर की गई छवियों के अतिरिक्त उदाहरण भी हैं।

एक अन्य उदाहरण में, परियोजना के लिए गिटहब उपस्थिति से, एक शहर की तस्वीर में धुंएला जोड़ा जाता है, जो अधिकांश वीएफएक्स प्रैक्टिशनर्स के लिए परिचित होगा – गहराई मानचित्र का उपयोग एक प्रकार के पीछे की ओर ‘सफेद-आउट मास्क’ के रूप में किया जाता है, ताकि धुंएला/कोहरे की घनत्व फोटो में कवर की गई दूरी के साथ बढ़ जाती है। स्रोत: https://github.com/cc-ai/climategan












