एआई मॉडल और प्लेटफ़ॉर्म
उच्च सटीकता वाली सेमेंटिक इमेज एडिटिंग EditGAN के साथ
जेनरेटिव एडवर्सेरियल नेटवर्क या जीएएन ने इमेज एडिटिंग उद्योग में नए अनुप्रयोगों का आनंद लिया है। पिछले कुछ महीनों से, EditGAN एआई/एमएल उद्योग में लोकप्रियता प्राप्त कर रहा है क्योंकि यह उच्च सटीकता और उच्च गुणवत्ता वाली सेमेंटिक इमेज एडिटिंग के लिए एक नवीन विधि है।
हम EditGAN मॉडल के बारे में विस्तार से चर्चा करेंगे और आपको बताएंगे कि यह सेमेंटिक इमेज एडिटिंग उद्योग में एक मील का पत्थर क्यों साबित हो सकता है।
तो आइए शुरू करें। लेकिन इससे पहले कि हम जानें कि EditGAN क्या है, यह जानना महत्वपूर्ण है कि EditGAN का महत्व क्या है और यह एक महत्वपूर्ण कदम क्यों है।
एडिटजीएन क्यों?
हालांकि पारंपरिक जीएएन आर्किटेक्चर ने एआई-आधारित इमेज एडिटिंग उद्योग को महत्वपूर्ण रूप से आगे बढ़ाया है, जीएएन आर्किटेक्चर को शून्य से बनाने में कुछ बड़ी चुनौतियाँ हैं।
- प्रशिक्षण चरण के दौरान, एक जीएएन आर्किटेक्चर को सेमेंटिक सेगमेंटेशन एनोटेशन के साथ उच्च मात्रा में लेबल वाले डेटा की आवश्यकता होती है।
- वे केवल उच्च स्तरीय नियंत्रण प्रदान करने में सक्षम हैं।
- और अक्सर, वे केवल छवियों के बीच आगे और पीछे इंटरपोलेट करते हैं।
यह देखा जा सकता है कि हालांकि पारंपरिक जीएएन आर्किटेक्चर काम करते हैं, वे व्यापक स्तर पर तैनाती के लिए प्रभावी नहीं हैं। पारंपरिक जीएएन आर्किटेक्चर की उप-मानक दक्षता के कारण EditGAN को 2022 में NVIDIA (NVDA ) द्वारा पेश किया गया था।
EditGAN एक प्रभावी विधि के रूप में प्रस्तावित किया गया है जो उच्च सटीकता और उच्च गुणवत्ता वाली सेमेंटिक इमेज एडिटिंग की अनुमति देता है, जो उपयोगकर्ताओं को छवियों को संशोधित करने की अनुमति देता है जो उनके उच्च विस्तृत सेगमेंटेशन मास्क को बदलकर। EditGAN एक स्केलेबल विधि है क्योंकि इसकी आर्किटेक्चर के कारण।
EditGAN मॉडल एक जीएएन फ्रेमवर्क पर बनाया गया है जो छवियों और उनके सेमेंटिक सेगमेंटेशन को संयुक्त रूप से मॉडल करता है, और केवल एक हाथ से लेबल वाले या एनोटेटेड प्रशिक्षण डेटा की आवश्यकता होती है। EditGAN के विकासकर्ताओं ने छवि को जीएएन के लेटेंट स्पेस में एम्बेड करने का प्रयास किया है ताकि छवि को प्रभावी ढंग से संशोधित किया जा सके और सेगमेंटेशन संपादन के अनुसार सशर्त लेटेंट कोड अनुकूलन किया जा सके। इसके अलावा, अनुकूलन को अमोर्टाइज करने के लिए, मॉडल लेटेंट स्पेस में “संपादन वेक्टर” खोजने का प्रयास करता है जो संपादन को महसूस करता है।
EditGAN फ्रेमवर्क की आर्किटेक्चर मॉडल को सीखने की अनुमति देती है कि कितने भी संपादन वेक्टर सीखे जा सकते हैं जो बाद में अन्य छवियों पर उच्च गति और दक्षता के साथ लागू किए जा सकते हैं। इसके अलावा, प्रायोगिक परिणाम यह दर्शाते हैं कि EditGAN छवियों को एक पहले से कभी नहीं देखे गए विवरण के स्तर के साथ संपादित कर सकता है जबकि छवि गुणवत्ता को अधिकतम तक बनाए रख सकता है।
संक्षेप में, EditGAN की आवश्यकता क्यों है, यह पहला जीएएन-आधारित इमेज एडिटिंग फ्रेमवर्क है जो
- बहुत उच्च सटीकता वाली संपादन।
- कुछ लेबल वाले डेटा के साथ काम कर सकता है।
- वास्तविक समय के दृश्यों में प्रभावी ढंग से तैनात किया जा सकता है।
- एक साथ कई संपादन के लिए संरचना की अनुमति देता है।
- जीएएन-जेनरेटेड, वास्तविक एम्बेडेड और यहां तक कि डोमेन के बाहर की छवियों पर काम करता है।
उच्च सटीकता वाली सेमेंटिक इमेज एडिटिंग EditGAN के साथ
स्टाइलजीएन2, एक राज्य के कला जीएएन फ्रेमवर्क के लिए इमेज सिंथेसिस, EditGAN का प्राथमिक इमेज जेनरेशन घटक है। स्टाइलजीएन2 फ्रेमवर्क लेटेंट कोड को मैप करता है जो एक बहुस्वरीय सामान्य वितरण से निकाला जाता है और इसे वास्तविक छवियों में मैप करता है।
स्टाइलजीएन2 एक गहरा जेनरेटिव मॉडल है जिसे उच्चतम गुणवत्ता वाली छवियों को सिंथेसाइज करने के लिए प्रशिक्षित किया गया है, साथ ही साथ छवियों की सेमेंटिक समझ भी हासिल की है।
सेगमेंटेशन प्रशिक्षण और अनुमान
EditGAN मॉडल एक प्रशिक्षण चरण के दौरान एक एन्कोडर का उपयोग करके एक छवि को जीएएन के लेटेंट स्पेस में एम्बेड करता है और एक नए छवि पर सेगमेंटेशन करने के लिए एक एन्कोडर को प्रशिक्षित करता है। EditGAN फ्रेमवर्क पिछले कार्यों पर बनाता है और एक एन्कोडर को प्रशिक्षित करता है जो छवियों को लेटेंट स्पेस में एम्बेड करता है। यहाँ का प्राथमिक उद्देश्य जीएन के नमूनों और वास्तविक जीवन प्रशिक्षण डेटा का उपयोग करके मानक पिक्सेल-वार एल2 और एलपीआईपीएस निर्माण हानियों के साथ एन्कोडर को प्रशिक्षित करना है। इसके अलावा, मॉडल जीएन नमूनों के साथ काम करते समय लेटेंट कोड का उपयोग करके एन्कोडर को स्पष्ट रूप से नियमित करता है।
परिणामस्वरूप, मॉडल डेटासेट से एनोटेटेड छवियों को सेमेंटिक सेगमेंटेशन के साथ लेटेंट स्पेस में एम्बेड करता है और सेगमेंटेशन शाखा को प्रशिक्षित करने के लिए क्रॉस एंट्रोपी हानि का उपयोग करता है।
लेटेंट स्पेस में सेमेंटिक्स खोजने के लिए सेगमेंटेशन संपादन का उपयोग
EditGAN का प्राथमिक उद्देश्य छवियों और सेमेंटिक सेगमेंटेशन के संयुक्त वितरण का उपयोग करके उच्च सटीकता वाली इमेज एडिटिंग के लिए है। मान लें कि हमारे पास एक छवि x है जिसे संपादित करने की आवश्यकता है, इसलिए मॉडल छवि को EditGAN के लेटेंट स्पेस में एम्बेड करता है या मॉडल से नमूने छवियों का उपयोग करता है। सेगमेंटेशन शाखा तब y या संबंधित सेगमेंटेशन को उत्पन्न करती है, मुख्य रूप से क्योंकि आरजीबी छवियों और सेगमेंटेशन दोनों में समान लेटेंट कोड w होते हैं। डेवलपर्स तब लेबलिंग या डिजिटल पेंटिंग टूल का उपयोग करके सेगमेंटेशन को संशोधित करने और इसे मैन्युअल रूप से अपनी आवश्यकताओं के अनुसार संपादित करने के लिए उपयोग कर सकते हैं।

अनुमान के दौरान संपादन के विभिन्न तरीके
अनुकूलन का उपयोग करके प्राप्त लेटेंट स्पेस संपादन वेक्टर सेमेंटिक रूप से अर्थपूर्ण होते हैं और अक्सर विभिन्न विशेषताओं के साथ विच्छिन्न होते हैं। इसलिए, एक नई छवि को संपादित करने के लिए, मॉडल छवि को सीधे लेटेंट स्पेस में एम्बेड कर सकता है और सीधे उन्हीं संपादन ऑपरेशनों को कर सकता है जो मॉडल ने पहले सीखा था, बिना अनुकूलन को फिर से शुरू किए। यह कहा जा सकता है कि मॉडल द्वारा सीखे गए संपादन वेक्टर मूल रूप से छवि को संपादित करने के लिए आवश्यक अनुकूलन को अमोर्टाइज करते हैं।
यह ध्यान देने योग्य है कि डेवलपर्स ने अभी तक विच्छिन्नता को पूरी तरह से पूरा नहीं किया है, और संपादन वेक्टर अक्सर अन्य छवियों पर उपयोग किए जाने पर सर्वोत्तम परिणाम नहीं देते हैं। हालांकि, इस समस्या को दूर किया जा सकता है अन्य छवियों के हिस्सों से संपादन आर्टिफैक्ट्स को हटाकर परीक्षण समय के दौरान कुछ अतिरिक्त अनुकूलन चरणों को पूरा करके।
हमारी वर्तमान ज्ञान के आधार पर, EditGAN फ्रेमवर्क का उपयोग तीन अलग-अलग मोड में छवियों को संपादित करने के लिए किया जा सकता है।
- संपादन वेक्टर के साथ वास्तविक समय संपादन
स्थानीयकृत और विच्छिन्न छवियों के लिए, मॉडल पिछले सीखे गए संपादन वेक्टर को विभिन्न स्केल के साथ लागू करके छवियों को संपादित करता है और इंटरैक्टिव दरों पर छवियों को मैनिपुलेट करता है।
- वेक्टर-आधारित संपादन के लिए स्व-पर्यवेक्षित परिष्करण का उपयोग
स्थानीयकृत छवियों के लिए जो अन्य छवियों के हिस्सों के साथ पूरी तरह से विच्छिन्न नहीं हैं, मॉडल पिछले सीखे गए संपादन वेक्टर का उपयोग करके छवि को संपादित करने के लिए शुरू करता है और परीक्षण समय के दौरान कुछ अतिरिक्त अनुकूलन चरणों को पूरा करके संपादन आर्टिफैक्ट्स को हटा देता है।
- अनुकूलन-आधारित संपादन
बड़े पैमाने पर और छवि-विशिष्ट संपादन करने के लिए, मॉडल शुरू से अनुकूलन करता है क्योंकि संपादन वेक्टर अन्य छवियों पर स्थानांतरण करने के लिए उपयोग नहीं किए जा सकते हैं।
कार्यान्वयन
EditGAN फ्रेमवर्क का मूल्यांकन चार अलग-अलग श्रेणियों में फैली छवियों पर किया गया है: कार, पक्षी, बिल्ली, और चेहरे। मॉडल की सेगमेंटेशन शाखा को 16, 30, 30, 16 के रूप में कार, पक्षी, बिल्ली, और चेहरों के लिए लेबल वाले प्रशिक्षण डेटा का उपयोग करके प्रशिक्षित किया जाता है। जब छवि को केवल अनुकूलन का उपयोग करके संपादित किया जाता है या जब मॉडल संपादन वेक्टर सीखने का प्रयास करता है, तो मॉडल 100 अनुकूलन चरणों का उपयोग एडम अनुकूलक के साथ करता है।
बिल्ली, कार, और चेहरों के डेटासेट के लिए, मॉडल डेटासेटजीएन के परीक्षण सेट से वास्तविक छवियों का उपयोग करता है जो जीएएन फ्रेमवर्क को प्रशिक्षित करने के लिए उपयोग नहीं की गई थीं। सीधे इन छवियों को EditGAN के लेटेंट स्पेस में एम्बेड किया जाता है और एन्कोडिंग का उपयोग किया जाता है। पक्षियों की श्रेणी के लिए, संपादन जीएएन-जेनरेटेड छवियों पर दिखाया गया है।
परिणाम
गुणात्मक परिणाम
डोमेन के भीतर परिणाम

उपरोक्त छवि EditGAN फ्रेमवर्क के प्रदर्शन को दर्शाती है जब यह नए छवियों पर पिछले सीखे गए संपादन वेक्टर को लागू करता है और 30 अनुकूलन चरणों का उपयोग करके छवियों को परिष्कृत करता है। EditGAN फ्रेमवर्क द्वारा किए गए संपादन ऑपरेशन सभी वर्गों के लिए विच्छिन्न हैं और छवियों की समग्र गुणवत्ता को बनाए रखते हैं। EditGAN और अन्य फ्रेमवर्क के परिणामों की तुलना करने पर, यह देखा जा सकता है कि EditGAN फ्रेमवर्क उच्च सटीकता वाली और जटिल संपादन करते समय विषय की पहचान और छवि गुणवत्ता को बनाए रखने में अन्य विधियों से बेहतर प्रदर्शन करता है।
जो आश्चर्यजनक है वह यह है कि EditGAN फ्रेमवर्क उच्च सटीकता वाली संपादन जैसे कि पुतलियों को फैलाना या कार के टायरों में पहिया के स्पोक्स को संपादित करना कर सकता है। इसके अलावा, EditGAN का उपयोग वस्तुओं के सेमेंटिक भागों को संपादित करने के लिए किया जा सकता है जो केवल कुछ पिक्सेल हैं या बड़े पैमाने पर छवि में संशोधन कर सकते हैं। यह ध्यान देने योग्य है कि EditGAN फ्रेमवर्क के कई संपादन ऑपरेशन जीएन प्रशिक्षण डेटा में दिखाई देने वाली छवियों के विपरीत हैं।
डोमेन के बाहर परिणाम
EditGAN के डोमेन के बाहर प्रदर्शन का मूल्यांकन करने के लिए, फ्रेमवर्क का परीक्षण मेटफेस डेटासेट पर किया गया है। EditGAN मॉडल इन-डोमेन वास्तविक चेहरों का उपयोग संपादन वेक्टर बनाने के लिए करता है। मॉडल तब मेटफेस पोर्ट्रेट्स को 100-चरण अनुकूलन प्रक्रिया का उपयोग करके एम्बेड करता है और 30-चरण स्व-पर्यवेक्षित परिष्करण प्रक्रिया के माध्यम से संपादन वेक्टर लागू करता है। परिणाम निम्नलिखित छवि में देखे जा सकते हैं।

मात्रात्मक परिणाम
EditGAN की इमेज एडिटिंग क्षमताओं को मात्रात्मक रूप से मापने के लिए, मॉडल मास्कजीएन द्वारा पहली बार पेश किए गए मुस्कान संपादन बेंचमार्क का उपयोग करता है। तटस्थ अभिव्यक्ति वाले चेहरों को मुस्कान वाले चेहरों से बदल दिया जाता है और प्रदर्शन तीन मापदंडों में मापा जाता है:
- सेमेंटिक सटीकता
मॉडल एक पूर्व-प्रशिक्षित मुस्कान विशेषता वर्गीकरणकर्ता का उपयोग करता है ताकि यह मापा जा सके कि संपादन के बाद छवियों में मुस्कान वाले चेहरे हैं या नहीं।
- वितरण स्तर की छवि गुणवत्ता
केर्नल इन्सेप्शन डिस्टेंस या कीआईडी और फ्रेचेट इन्सेप्शन डिस्टेंस या एफआईडी को सेलेबए टेस्ट डेटासेट और 400 संपादित परीक्षण छवियों के बीच गणना किया जाता है।
- पहचान संरक्षण
मॉडल की क्षमता को मापा जाता है कि यह संपादन के दौरान विषयों की पहचान को बनाए रख सकता है या नहीं, एक पूर्व-प्रशिक्षित आर्कफेस फीचर एक्सट्रैक्शन नेटवर्क का उपयोग करके।

उपरोक्त तालिका EditGAN फ्रेमवर्क के प्रदर्शन की तुलना मुस्कान संपादन बेंचमार्क पर अन्य बेसलाइन मॉडल के साथ करती है। EditGAN फ्रेमवर्क द्वारा ऐसे उच्च परिणाम प्राप्त करने की विधि तीन अलग-अलग बेसलाइन के साथ तुलना की जाती है:
- मास्कजीएन
मास्कजीएन गैर-मुस्कान वाली छवियों को उनके सेगमेंटेशन मास्क और एक लक्ष्य मुस्कान सेगमेंटेशन मास्क के साथ इनपुट के रूप में लेता है। यह ध्यान देने योग्य है कि EditGAN की तुलना में, मास्कजीएन फ्रेमवर्क को एक बड़ी मात्रा में एनोटेटेड डेटा की आवश्यकता होती है।
- स्थानीय संपादन
EditGAN अपने प्रदर्शन की तुलना स्थानीय संपादन के साथ भी करता है, जो एक विधि है जो स्थानीय संपादन को लागू करने के लिए जीएन विशेषताओं को क्लस्टर करती है और यह संदर्भ छवियों पर निर्भर करती है।
- इंटरफेसजीएन
इंटरफेसजीएन भी लेटेंट स्पेस में संपादन वेक्टर खोजने का प्रयास करता है, लेकिन EditGAN के विपरीत, इंटरफेसजीएन मॉडल एक बड़ी मात्रा में एनोटेटेड डेटा, सहायक विशेषता वर्गीकरणकर्ताओं का उपयोग करता है और इसमें संपादन की महीन सटीकता नहीं है।
- स्टाइलजीएन2डिस्टिलेशन
यह विधि एक वैकल्पिक दृष्टिकोण बनाती है जो वास्तविक छवि एम्बेडिंग की आवश्यकता नहीं है, और इसके बजाय एक संपादन-वेक्टर मॉडल का उपयोग करके एक प्रशिक्षण डेटासेट बनाती है।

सीमाएं
चूंकि EditGAN जीएएन फ्रेमवर्क पर आधारित है, इसलिए इसमें किसी अन्य जीएएन मॉडल की समान सीमा है: यह केवल उन छवियों के साथ काम कर सकता है जिन्हें जीएएन द्वारा मॉडल किया जा सकता है। EditGAN की जीएएन-मॉडल्ड छवियों के साथ काम करने की सीमा इसके व्यापक अनुप्रयोग का मुख्य कारण है। हालांकि, यह ध्यान देने योग्य है कि EditGAN के उच्च सटीकता वाले संपादन को संपादन वेक्टर का उपयोग करके अन्य अलग-अलग छवियों पर आसानी से स्थानांतरित किया जा सकता है।
निष्कर्ष
जीएएन इमेज एडिटिंग क्षेत्र में एक उद्योग मानक नहीं है क्योंकि इसकी सीमित व्यावहारिकता है। जीएएन फ्रेमवर्क को आमतौर पर उच्च मात्रा में एनोटेटेड प्रशिक्षण डेटा की आवश्यकता होती है, और वे अक्सर उच्च दक्षता और सटीकता नहीं देते हैं।
EditGAN पारंपरिक जीएएन फ्रेमवर्क द्वारा प्रस्तुत समस्याओं का सामना करने का प्रयास करता है, और यह उच्च गुणवत्ता और उच्च सटीकता वाली सेमेंटिक इमेज एडिटिंग के लिए एक प्रभावी विधि के रूप में सामने आने का प्रयास करता है। अब तक के परिणामों से पता चलता है कि EditGAN वास्तव में वही प्रदान करता है जो यह दावा करता है, और यह पहले से ही कुछ वर्तमान उद्योग मानक अभ्यासों और मॉडलों से बेहतर प्रदर्शन कर रहा है।












