Anderson का एंगल

जीएएन के लेटेंट स्पेस को मैप करने का अनपेक्षित लाभ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जबकि शोधकर्ताओं ने चीन और ऑस्ट्रेलिया से एआई द्वारा उत्पन्न छवियों की गुणवत्ता और विश्वासयोग्यता में सुधार करने का प्रयास किया, तो उन्होंने अनजाने में एक जेनरेटिव एडवर्सेरियल नेटवर्क (GAN) के लेटेंट स्पेस को नियंत्रित करने का एक तरीका खोज लिया – छवि संश्लेषण तकनीकों के पीछे गणनात्मक मैट्रिक्स जो फिल्मों, गेमिंग, सोशल मीडिया और कई अन्य मनोरंजन और शोध क्षेत्रों में क्रांति लाने वाले हैं।

उनकी खोज, परियोजना के केंद्रीय उद्देश्य का एक उप उत्पाद, एक उपयोगकर्ता को एक माउस के साथ एक जीएएन के लेटेंट स्पेस को मनमाने और इंटरैक्टिव रूप से अन्वेषण करने की अनुमति देता है, जैसे कि एक वीडियो के माध्यम से स्क्रॉल करना या एक पुस्तक के माध्यम से पत्तियां पलटना।

शोधकर्ताओं के साथी वीडियो (लेख के अंत में एम्बेड के लिए देखें) का एक अंश। ध्यान दें कि उपयोगकर्ता एक 'ग्रैब' कर्सर (शीर्ष बाएं) के साथ परिवर्तनों को मैनिपुलेट कर रहा है। स्रोत: https://www.youtube.com/watch?v=k7sG4XY5rIc

शोधकर्ताओं के साथी वीडियो (लेख के अंत में एम्बेड के लिए देखें) का एक अंश। ध्यान दें कि उपयोगकर्ता एक ‘ग्रैब’ कर्सर (शीर्ष बाएं) के साथ परिवर्तनों को मैनिपुलेट कर रहा है। स्रोत: https://www.youtube.com/watch?v=k7sG4XY5rIc

विधि ‘हीट मैप्स’ का उपयोग करती है ताकि यह इंगित किया जा सके कि छवि के कौन से क्षेत्र में सुधार की आवश्यकता है क्योंकि जीएएन एक ही डेटासेट के माध्यम से हजारों (या लाखों) बार चलता है। हीट मैप्स का उद्देश्य छवि की गुणवत्ता में सुधार करना है जीएएन को बताकर जहां यह गलत हो रहा है, ताकि इसका अगला प्रयास बेहतर हो; लेकिन, संयोग से, यह एक ‘मानचित्र’ भी प्रदान करता है जो एक माउस को घुमाकर ब्राउज़ किया जा सकता है।

स्पेशल विज़ुअल अटेंशन जो ग्रेडकैम के माध्यम से रंगों को चमकाकर ध्यान देने योग्य क्षेत्रों को इंगित करता है। ये नमूने शोधकर्ताओं की परियोजना में स्टाइलगैन2 के डिफ़ॉल्ट कार्यान्वयन के साथ उत्पन्न होते हैं। स्रोत: https://arxiv.org/pdf/2112.00718.pdf

स्पेशल विज़ुअल अटेंशन जो ग्रेडकैम के माध्यम से रंगों को चमकाकर ध्यान देने योग्य क्षेत्रों को इंगित करता है। स्रोत: https://arxiv.org/pdf/2112.00718.pdf

पत्र का शीर्षक _improving GAN Equilibrium by Raising Spatial Awareness है, और यह चीनी विश्वविद्यालय हांगकांग और ऑस्ट्रेलियाई राष्ट्रीय विश्वविद्यालय के शोधकर्ताओं से आया है। पत्र के अलावा, वीडियो और अन्य सामग्री परियोजना पृष्ठ पर पाई जा सकती है।

काम अभी भी प्रारंभिक है, और वर्तमान में कम रिज़ॉल्यूशन इमेजरी (256×256) तक सीमित है, लेकिन यह एक प्रूफ ऑफ कॉन्सेप्ट है जो जीएएन के लेटेंट स्पेस के ‘ब्लैक बॉक्स’ को तोड़ने का वादा करता है, और यह तब आता है जब कई शोध परियोजनाएं उस दरवाजे पर जोर दे रही हैं जीएएन के नियंत्रण में अधिक नियंत्रण की तलाश में।

ऐसी छवियों में रुचि हो सकती है (और आप लेख के अंत में एम्बेड किए गए वीडियो में उन्हें बेहतर रिज़ॉल्यूशन में देख सकते हैं), लेकिन शायद अधिक महत्वपूर्ण बात यह है कि परियोजना ने छवि की गुणवत्ता में सुधार करने का एक तरीका खोजा है, और संभावित रूप से इसे तेजी से करने के लिए, जीएएन को विशेष रूप से बताकर जहां यह प्रशिक्षण के दौरान गलत हो रहा है।

लेकिन, जैसा कि एडवर्सेरियल इंगित करता है, एक जीएएन एक एकल इकाई नहीं है, बल्कि एक असमान संघर्ष है जो अधिकार और श्रम के बीच है। इस युद्ध को समझने के लिए जो अब तक चला आ रहा है, आइए देखें कि शोधकर्ताओं ने इस संबंध में क्या सुधार किया है।

जेनरेटर की दयनीय स्थिति

यदि आप कभी इस विचार से परेशान हैं कि कुछ नए कपड़े जो आप खरीदते हैं विकसित देश में शोषणकारी देश में उत्पादित किए गए थे, या आपके पास एक बॉस या क्लाइंट था जो आपको ‘इसे फिर से करो!’ कहता था बिना यह बताए कि आपके पिछले प्रयास में क्या गलत था, तो जेनरेटिव एडवर्सेरियल नेटवर्क के जेनरेटर भाग के लिए थोड़ी दया रखें।

जेनरेटर वह कार्यकर्ता है जो पिछले पांच या इतने वर्षों से जीएएन को फोटोरियलिस्टिक लोगों को बनाने में मदद करके आपको प्रसन्न कर रहा है जो मौजूद नहीं है, पुराने वीडियो गेम को 4k रिज़ॉल्यूशन तक अपस्केल करना, और सदी पुराने फुटेज को पूर्ण-रंगीन एचडी आउटपुट में 60fps तक बदलना, अन्य कई आश्चर्यजनक एआई नवाचारों के बीच।

अवास्तविक लोगों के फोटोरियलिस्टिक चेहरे बनाने से लेकर पुराने फुटेज को बहाल करने और पुराने वीडियो गेम को पुनर्जीवित करने तक, जीएएन पिछले कुछ वर्षों में व्यस्त रहा है।

अवास्तविक लोगों के फोटोरियलिस्टिक चेहरे बनाने से लेकर पुराने फुटेज को बहाल करने और पुराने वीडियो गेम को पुनर्जीवित करने तक, जीएएन पिछले कुछ वर्षों में व्यस्त रहा है।

जेनरेटर प्रशिक्षण डेटा के माध्यम से एक-एक करके दिनों या सप्ताहों तक चलता है, जब तक कि यह वास्तविक फोटो की तुलना में उतनी ही आश्वस्त करने वाली छवियां बनाने में सक्षम नहीं हो जाता।

तो जेनरेटर को यह कैसे पता चलता है कि यह प्रगति कर रहा है, प्रत्येक बार जब यह एक छवि बनाने का प्रयास करता है जो इसके पिछले प्रयास से बेहतर हो?

जेनरेटर के पास एक नरक का बॉस है।

विवेचक की निर्मम अस्पष्टता

विवेचक का काम जेनरेटर को बताना है कि यह पर्याप्त रूप से अच्छा नहीं कर रहा है और इसे फिर से करो। विवेचक जेनरेटर को नहीं बताता है कि क्या इसके पिछले प्रयास में गलत था; यह केवल एक निजी नज़र डालता है, उत्पन्न की गई छवि की तुलना स्रोत छवियों (फिर से निजी तौर पर) से करता है, और छवि को एक स्कोर देता है।

स्कोर कभी पर्याप्त नहीं है। विवेचक ‘इसे फिर से करो’ कहना बंद नहीं करेगा जब तक कि शोध वैज्ञानिक इसे बंद नहीं कर देते (जब वे判断 करते हैं कि अतिरिक्त प्रशिक्षण आउटपुट में सुधार नहीं करेगा)

इस तरह, किसी भी निर्माणकारी आलोचना के अभाव में, और केवल एक स्कोर के साथ जिसका मीट्रिक एक रहस्य है, जेनरेटर को यादृच्छिक रूप से अनुमान लगाना होगा कि छवि के कौन से हिस्से या पहलू पिछले से बेहतर स्कोर प्राप्त करने के लिए पर्याप्त रूप से अच्छे थे।

विवेचक के रूप में शिक्षक और मार्गदर्शक

नई शोध द्वारा प्रदान की गई नवाचार मूल रूप से यह है कि विवेचक जेनरेटर को कौन से हिस्से असंतोषजनक थे, ताकि जेनरेटर अपने अगले प्रयास में उन क्षेत्रों पर ध्यान केंद्रित कर सके, और उन खंडों को बर्बाद न करे जो उच्च दर्जे के थे। संबंध की प्रकृति से संघर्षपूर्ण से सहयोगी में बदल गई है।

विवेचक और जेनरेटर के बीच ज्ञान की असमानता को दूर करने के लिए, शोधकर्ताओं ने जेनरेटर के अगले प्रयास के लिए एक दृश्य प्रतिक्रिया सहायता के रूप में ग्रेडकैम का उपयोग किया।

नई ‘संतुलन’ प्रशिक्षण विधि को EqGAN कहा जाता है। अधिकतम पुनरुत्पादन के लिए, शोधकर्ताओं ने मौजूदा तकनीकों और तरीकों को डिफ़ॉल्ट सेटिंग्स पर शामिल किया, जिसमें स्टाइलगैन2 आर्किटेक्चर का उपयोग शामिल है।

EqGAN का आर्किटेक्चर। जेनरेटर का स्पेशल एन्कोडिंग विवेचक की स्पेशल जागरूकता के साथ संरेखित है, स्पेशल हीटमैप्स (पिछली छवि देखें) के यादृच्छिक नमूनों को स्पेशल एन्कोडिंग लेयर (एसईएल) के माध्यम से जेनरेटर में वापस एन्कोड किया जाता है। ग्रेडकैम वह तंत्र है जिसके द्वारा विवेचक के ध्यान मानचित्र जेनरेटर के लिए उपलब्ध हैं।

EqGAN का आर्किटेक्चर। ग्रेडकैम वह तंत्र है जिसके द्वारा विवेचक के ध्यान मानचित्र जेनरेटर के लिए उपलब्ध हैं।

ग्रेडकैम हीटमैप (ऊपर देखें) उत्पन्न करता है जो विवेचक की आलोचना को प्रतिबिंबित करता है, और इसे जेनरेटर के लिए उपलब्ध बनाता है।

एक बार मॉडल प्रशिक्षित हो जाने के बाद, मानचित्र इस सहयोगी प्रक्रिया के एक कलाकृति के रूप में रहता है, लेकिन इसे जीएएन के अंतिम लेटेंट कोड को इंटरैक्टिव तरीके से अन्वेषण करने के लिए भी उपयोग किया जा सकता है जैसा कि शोधकर्ताओं के परियोजना वीडियो (नीचे देखें) में प्रदर्शित किया गया है।

EqGAN

परियोजना में एलएसयूएन बिल्ली और चर्च डेटासेट जैसे कई लोकप्रिय डेटासेट का उपयोग किया गया था, साथ ही एफएफएचक्यू डेटासेट। नीचे दिए गए वीडियो में EqGAN का उपयोग करके चेहरे और बिल्ली के हेरफेर के उदाहरण भी हैं।

सभी छवियों को प्रशिक्षण से पहले 256×256 तक बदल दिया गया था। EqGAN को आधिकारिक कार्यान्वयन पर स्टाइलगैन2 पर प्रशिक्षित किया गया था। मॉडल को 8 जीपीयू पर 64 के बैच आकार पर प्रशिक्षित किया गया था जब तक कि विवेचक को 25 मिलियन से अधिक छवियों के संपर्क में नहीं लाया गया।

फ्रेचेट इन्सेप्शन डिस्टेंस (एफआईडी) के साथ चयनित नमूनों पर परिणामों का परीक्षण करते हुए, लेखकों ने एक मीट्रिक बनाया जिसे असंतुलन संकेतक (डीआई) कहा जाता है – विवेचक द्वारा जेनरेटर पर बनाए रखा जाने वाला ज्ञान लाभ की डिग्री, जेनरेटर के साथ इस अंतर को कम करने के उद्देश्य से।

तीन प्रशिक्षित डेटासेट पर, नई मीट्रिक ने स्पेशल जागरूकता को जेनरेटर में एन्कोड करने के बाद एक उपयोगी गिरावट दिखाई, जिसमें दोनों एफआईडी और डीआई द्वारा बेहतर संतुलन का प्रदर्शन किया गया।

शोधकर्ता निष्कर्ष निकालते हैं:

‘हमें उम्मीद है कि यह काम जीएएन संतुलन को पुनः देखने और छवि संश्लेषण गुणवत्ता में सुधार के लिए जीएएन संतुलन को नियंत्रित करने के लिए अधिक नए तरीके विकसित करने के लिए प्रेरित करेगा। हम भविष्य के काम में इस मुद्दे पर और अधिक सैद्धांतिक जांच करेंगे।’

और जारी रखते हैं:

‘गुणात्मक परिणाम दिखाते हैं कि हमारी विधि सफलतापूर्वक [जेनरेटर] को विशिष्ट क्षेत्रों पर ध्यान केंद्रित करने के लिए मजबूर करती है। विभिन्न डेटासेट पर प्रयोग जीएएन प्रशिक्षण में असंतुलन को कम करने और समग्र छवि संश्लेषण गुणवत्ता में काफी सुधार करने की पुष्टि करते हैं। परिणामी मॉडल में स्पेशल जागरूकता भी आउटपुट छवि के इंटरैक्टिव मैनिपुलेशन को सक्षम बनाती है।’

परियोजना के बारे में अधिक जानकारी और जीएएन में लेटेंट स्पेस के गतिशील और इंटरैक्टिव अन्वेषण के और उदाहरणों के लिए नीचे दिए गए वीडियो पर एक नज़र डालें।

 

 

11:12am 4th Dec 2021 – ग्रेडकैम के लिए सुधारा गया यूआरएल और आसपास के संदर्भ को साफ किया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai