Anderson का एंगल

SofGAN: एक जीएन जेनरेटर जो चेहरे के विभिन्न पहलुओं पर अधिक नियंत्रण प्रदान करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

शंघाई और अमेरिका के शोधकर्ताओं ने एक जीएन-आधारित पोर्ट्रेट जेनरेशन सिस्टम विकसित किया है जो उपयोगकर्ताओं को बाल, आंखें, चश्मे, बनावट और रंग जैसे व्यक्तिगत पहलुओं पर पहले से अनुपलब्ध स्तर का नियंत्रण प्रदान करता है।

सिस्टम की बहुमुखी प्रकृति को प्रदर्शित करने के लिए, निर्माताओं ने एक फोटोशॉप-शैली का इंटरफेस प्रदान किया है जहां उपयोगकर्ता सीधे सेमेंटिक सेगमेंटेशन तत्वों को आकर्षित कर सकते हैं जो वास्तविक छवियों में परिवर्तित हो जाएंगे, और जो मौजूदा फोटोग्राफ पर सीधे आकर्षित करके भी प्राप्त किए जा सकते हैं।

नीचे दिए गए उदाहरण में, अभिनेता डैनियल रेडक्लिफ की एक तस्वीर को ट्रेसिंग टेम्पलेट के रूप में उपयोग किया जाता है (और उद्देश्य उनके समान दिखने वाली छवि बनाना नहीं है, बल्कि एक सामान्य रूप से फोटोरियलिस्टिक छवि बनाना है)। जैसे ही उपयोगकर्ता विभिन्न तत्वों को भरता है, जिनमें चश्मे जैसे विविध पहलू शामिल हैं, वे पहचाने जाते हैं और आउटपुट ड्राइंग छवि में व्याख्या की जाती है:

एक छवि का उपयोग SofGAN द्वारा उत्पन्न पोर्ट्रेट के लिए ट्रेसिंग सामग्री के रूप में किया जा रहा है। स्रोत: https://www.youtube.com/watch?v=xig8ZA3DVZ8

एक छवि का उपयोग SofGAN द्वारा उत्पन्न पोर्ट्रेट के लिए ट्रेसिंग सामग्री के रूप में किया जा रहा है। स्रोत: https://www.youtube.com/watch?v=xig8ZA3DVZ8

शोध पत्र का शीर्षक SofGAN: एक पोर्ट्रेट इमेज जेनरेटर với डायनामिक स्टाइलिंग है, और इसका नेतृत्व अनपेई चेन और रुइयांग लियू ने किया है, साथ ही शंघाईटेक यूनिवर्सिटी के दो अन्य शोधकर्ताओं और कैलिफोर्निया विश्वविद्यालय के सैन डिएगो से एक अन्य शोधकर्ता ने भाग लिया है।

विशेषताओं को अलग करना

काम का प्राथमिक योगदान उपयोगकर्ता-मित्री यूएक्स प्रदान करने में नहीं है, बल्कि सीखे गए चेहरे की विशेषताओं को ‘अलग करने’ में है, जैसे कि मुद्रा और बनावट, जो SofGAN को कैमरे के दृष्टिकोण से अप्रत्यक्ष कोणों पर चेहरे भी उत्पन्न करने में सक्षम बनाता है।

चेहरे के जेनरेटर में असामान्य, जो जेनरेटिव एडवर्सेरियल नेटवर्क पर आधारित हैं, SofGAN दृष्टिकोण को इच्छानुसार बदल सकता है, प्रशिक्षण डेटा में मौजूद कोणों के सरणी की सीमा के भीतर। स्रोत: https://arxiv.org/pdf/2007.03780.pdf

चेहरे के जेनरेटर में असामान्य, जो जेनरेटिव एडवर्सेरियल नेटवर्क पर आधारित हैं, SofGAN दृष्टिकोण को इच्छानुसार बदल सकता है, प्रशिक्षण डेटा में मौजूद कोणों के सरणी की सीमा के भीतर। स्रोत: https://arxiv.org/pdf/2007.03780.pdf

चूंकि बनावट अब ज्यामिति से अलग हो गई है, चेहरे का आकार और बनावट को अलग-अलग इकाइयों के रूप में बदला जा सकता है। वास्तव में, यह चेहरे की दौड़ को बदलने की अनुमति देता है, एक विवादास्पद अभ्यास जो अब मशीन लर्निंग डेटासेट में पूर्वाग्रह को दूर करने के लिए एक संभावित अनुप्रयोग हो सकता है।

SofGAN कृत्रिम उम्र बढ़ाने और विशेषता-संगत शैली समायोजन का भी समर्थन करता है, जो NVIDIA के GauGAN और Intel के गेम-आधारित न्यूरल रेंडरिंग सिस्टम जैसे समान सेगमेंटेशन>इमेज सिस्टम में देखा जाने वाला एक अनोखा स्तर है।

SofGAN उम्र बढ़ाने को एक पुनरावृत्त शैली के रूप में लागू कर सकता है।

SofGAN उम्र बढ़ाने को एक पुनरावृत्त शैली के रूप में लागू कर सकता है।

सोफजीएन के तरीके के लिए एक और सफलता यह है कि प्रशिक्षण के लिए जोड़े गए सेगमेंटेशन/वास्तविक छवियों की आवश्यकता नहीं है, बल्कि यह सीधे असंबद्ध वास्तविक दुनिया की छवियों पर प्रशिक्षित किया जा सकता है।

शोधकर्ता कहते हैं कि सोफजीएन की ‘अलग करने’ वाली वास्तुकला पारंपरिक छवि रेंडरिंग सिस्टम से प्रेरित थी, जो छवि के व्यक्तिगत पहलुओं को अलग करती है। दृश्य प्रभाव कार्य प्रवाह में, एक संयोजन के तत्वों को अक्सर सबसे छोटे घटकों में तोड़ दिया जाता है, जिसमें प्रत्येक घटक के लिए विशेषज्ञ शामिल होते हैं।

सेमेंटिक ऑक्यूपेंसी फील्ड (एसओएफ)

इसे एक मशीन लर्निंग इमेज सिंथेसिस फ्रेमवर्क में प्राप्त करने के लिए, शोधकर्ताओं ने एक सेमेंटिक ऑक्यूपेंसी फील्ड (एसओएफ) विकसित किया, जो पारंपरिक ऑक्यूपेंसी फील्ड का एक विस्तार है जो चेहरे के पोर्ट्रेट के घटक तत्वों को अलग करता है। एसओएफ को कैलिब्रेटेड मल्टी-व्यू सेमेंटिक सेगमेंटेशन मैप्स पर प्रशिक्षित किया गया था, लेकिन किसी भी ग्राउंड ट्रुथ पर्यवेक्षण के बिना।

एकल सेगमेंटेशन मैप (नीचे बाएं) से कई पुनरावृत्तियां।

एकल सेगमेंटेशन मैप (नीचे बाएं) से कई पुनरावृत्तियां।

इसके अतिरिक्त, 2डी सेगमेंटेशन मैप्स एसओएफ के आउटपुट को रे ट्रेसिंग करके प्राप्त किए जाते हैं, जिसके बाद एक जीएन जेनरेटर द्वारा बनावट दी जाती है। ‘सिंथेटिक’ सेमेंटिक सेगमेंटेशन मैप्स को भी एक तीन-परत वाले एनकोडर के माध्यम से एक कम-आयामी स्थान में एनकोड किया जाता है ताकि दृष्टिकोण बदलने पर आउटपुट की निरंतरता सुनिश्चित की जा सके।

प्रशिक्षण योजना प्रत्येक सेमेंटिक क्षेत्र के लिए दो यादृच्छिक शैलियों को स्थानिक रूप से मिलाती है:

SofGAN की वास्तुकला।

SofGAN की वास्तुकला।

शोधकर्ता दावा करते हैं कि SofGAN वर्तमान वैकल्पिक राज्य-ऑफ-द-आर्ट (SOTA) दृष्टिकोणों की तुलना में कम फ्रेचेट इन्सेप्शन डिस्टेंस (FID) और उच्च सीखा हुआ संवेदी छवि पैच समानता (LPIPS) मेट्रिक हासिल करता है।

पिछले स्टाइलजीएन दृष्टिकोण अक्सर फीचर एंटैंगलमेंट से बाधित होते हैं, जहां छवि के घटक तत्व एक दूसरे के साथ अपरिवर्तनीय रूप से जुड़े होते हैं, जिससे अवांछित तत्व वांछित तत्व के साथ दिखाई देते हैं (उदाहरण के लिए, कान की बाली दिखाई दे सकती है जब कान का आकार जेनरेट किया जाता है जो प्रशिक्षण समय में कान की बाली वाली छवि से सूचित किया जाता है)।

रे मार्चिंग का उपयोग सेमेंटिक सेगमेंटेशन मैप्स के आयतन की गणना के लिए किया जाता है, जो कई दृष्टिकोणों को सक्षम बनाता है।

रे मार्चिंग का उपयोग सेमेंटिक सेगमेंटेशन मैप्स के आयतन की गणना के लिए किया जाता है, जो कई दृष्टिकोणों को सक्षम बनाता है।

डेटासेट और प्रशिक्षण

सोफजीएन के विभिन्न कार्यान्वयन के विकास में तीन डेटासेट का उपयोग किया गया था: सेलेबीएएमास्क-एचक्यू, जिसमें 30,000 उच्च-रिज़ॉल्यूशन वाली छवियां शामिल हैं; NVIDIA का फ्लिकर-फेस-एचक्यू (FFHQ), जिसमें 70,000 छवियां हैं; और 122 पोर्ट्रेट स्कैन का एक स्व-उत्पादित समूह जिसमें मैन्युअल रूप से लेबल किए गए सेमेंटिक क्षेत्र हैं।

एसओएफ में तीन प्रशिक्षण योग्य उप-मॉड्यूल हैं – हाइपर-नेट, एक रे मार्चर, और एक वर्गीकरणकर्ता। परियोजना के सेमेंटिक इंस्टेंस वाइज्ड (एसआईडब्ल्यू) स्टाइलजीएन जेनरेटर को स्टाइलजीएन2 के समान कुछ पहलुओं में कॉन्फ़िगर किया गया है। डेटा ऑगमेंटेशन को यादृच्छिक स्केलिंग और क्रॉपिंग के माध्यम से लागू किया जाता है, और प्रशिक्षण में हर चार चरणों पर पथ नियमितीकरण शामिल है। पूरी प्रशिक्षण प्रक्रिया में 22 दिन लगे 800,000 पुनरावृत्तियों तक पहुंचने के लिए चार आरटीएक्स 2080 टी जीपीयू पर सीउडीए 10.1 का उपयोग किया गया था।

शोधकर्ता观察 करते हैं कि स्वीकार्य सामान्यीकृत, उच्च-स्तरीय परिणाम प्रशिक्षण के शुरू में ही दिखाई देने लगे, 1500 पुनरावृत्तियों पर, तीन दिनों में प्रशिक्षण। शेष प्रशिक्षण बाल और आंख जैसे विस्तृत विवरण को प्राप्त करने के लिए एक धीमी गति से आगे बढ़ा।

SofGAN आमतौर पर एकल सेगमेंटेशन मैप से NVIDIA के SPADE और Pix2PixHD, और SEAN जैसे प्रतिद्वंद्वी तरीकों की तुलना में अधिक वास्तविक परिणाम प्राप्त करता है।

नीचे शोधकर्ताओं द्वारा जारी वीडियो है। आगे के स्व-होस्टेड वीडियो परियोजना पृष्ठ पर उपलब्ध हैं।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai