Anderson का एंगल

जीएएन के लेटेंट स्पेस को ‘ब्लॉब्स’ के साथ संपादित करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

यूसी बर्कले और एडोबी से नए शोध में जेनरेटिव एडवर्सेरियल नेटवर्क (GAN) द्वारा बनाई गई हाइपररियल सामग्री को सीधे संपादित करने का एक तरीका पेश किया गया है, जिसे आमतौर पर नियंत्रित, एनिमेटेड या फोटोशॉप उपयोगकर्ताओं और सीजीआई प्रैक्टिशनर्स के लिए परिचित तरीके से मुफ्त रूप से मैनिप्युलेट नहीं किया जा सकता है।

(ADBE )

इस विधि को BlobGAN नाम दिया गया है, जिसमें जीएएन के लेटेंट स्पेस में सामग्री को सीधे मैप करने वाले ‘ब्लॉब्स’ की एक ग्रिड बनाना शामिल है।

ब्लॉब्स को मूव करके, आप दृश्य प्रतिनिधित्व में ‘वस्तुओं’ को एक直观 तरीके से मूव कर सकते हैं, जो सीजीआई और सीएडी विधियों के करीब है और जेनरेटिव एडवर्सेरियल नेटवर्क के लेटेंट स्पेस को मैप और नियंत्रित करने के वर्तमान प्रयासों से अधिक है।

BlobGAN के साथ दृश्य मैनिपुलेशन: जब उपयोगकर्ता 'ब्लॉब्स' को मूव करता है, तो जीएएन में लेटेंट वस्तुओं और शैलियों का वितरण भी बदल जाता है। अधिक उदाहरणों के लिए, इस लेख के अंत में संलग्न वीडियो या https://www.youtube.com/watch?v=KpUv82VsU5k पर जाएं

BlobGAN के साथ दृश्य मैनिपुलेशन: जब उपयोगकर्ता ‘ब्लॉब्स’ को मूव करता है, तो जीएएन में लेटेंट वस्तुओं और शैलियों का वितरण भी बदल जाता है। अधिक उदाहरणों के लिए, इस लेख के अंत में संलग्न वीडियो या https://www.youtube.com/watch?v=KpUv82VsU5k पर जाएं

चूंकि ब्लॉब्स दृश्य में ‘वस्तुओं’ को मैप करते हैं जो जीएएन के लेटेंट स्पेस में हैं, सभी वस्तुएं a priori विच्छिन्न हैं, जिससे उन्हें व्यक्तिगत रूप से बदलना संभव हो जाता है:

वस्तुओं को आकार बदलने, सिकोड़ने, क्लोन करने और हटाने जैसे ऑपरेशन किए जा सकते हैं।

वस्तुओं को आकार बदलने, सिकोड़ने, क्लोन करने और हटाने जैसे ऑपरेशन किए जा सकते हैं।

फोटो एडिटिंग सॉफ्टवेयर (या यहां तक कि टेक्स्ट एडिटिंग सॉफ्टवेयर) में किसी भी वस्तु की तरह, एक ब्लॉब को डुप्लिकेट किया जा सकता है और बाद में मैनिप्युलेट किया जा सकता है:

ब्लॉब्स को इंटरफेस में डुप्लिकेट किया जा सकता है, और उनके संबंधित लेटेंट प्रतिनिधित्व भी 'कॉपी और पेस्ट' हो जाएंगे। स्रोत: https://dave.ml/blobgan/#results

ब्लॉब्स को इंटरफेस में डुप्लिकेट किया जा सकता है, और उनके संबंधित लेटेंट प्रतिनिधित्व भी ‘कॉपी और पेस्ट’ हो जाएंगे। स्रोत: https://dave.ml/blobgan/#results

BlobGAN लेटेंट स्पेस में नए, उपयोगकर्ता-चयनित छवियों को भी पार्स कर सकता है:

BlobGAN के साथ, आपको उन छवियों को शामिल करने की आवश्यकता नहीं है जिन्हें आप सीधे प्रशिक्षण डेटा में शामिल करना चाहते हैं और फिर उनके लेटेंट कोड की तलाश करनी है, लेकिन आप चुनिंदा छवियों को विलक्षण रूप से इनपुट कर सकते हैं और उन्हें मैनिप्युलेट कर सकते हैं। यहां बदली जा रही तस्वीरें पोस्ट-फैक्टो उपयोगकर्ता इनपुट हैं। स्रोत: https://dave.ml/blobgan/#results

BlobGAN के साथ, आपको उन छवियों को शामिल करने की आवश्यकता नहीं है जिन्हें आप सीधे प्रशिक्षण डेटा में शामिल करना चाहते हैं और फिर उनके लेटेंट कोड की तलाश करनी है, लेकिन आप चुनिंदा छवियों को विलक्षण रूप से इनपुट कर सकते हैं और उन्हें मैनिप्युलेट कर सकते हैं। यहां बदली जा रही तस्वीरें पोस्ट-फैक्टो उपयोगकर्ता इनपुट हैं। स्रोत: https://dave.ml/blobgan/#results

अधिक परिणाम यहां देखे जा सकते हैं, और इस लेख के अंत में संलग्न यूट्यूब वीडियो में। एक इंटरएक्टिव कोलाब डेमो* और एक गिटहब रेपो** भी है।

यह प्रकार की साधनता और दायरा पोस्ट-फोटोशॉप युग में निर्दोष लग सकता है, और पैरामेट्रिक सॉफ्टवेयर पैकेज जैसे सिनेमा4डी और ब्लेंडर ने दशकों से उपयोगकर्ताओं को 3डी दुनिया बनाने और अनुकूलित करने की अनुमति दी है; लेकिन यह जेनरेटिव एडवर्सेरियल नेटवर्क में लेटेंट स्पेस की विचित्रता और रहस्यमय प्रकृति को प्रशिक्षित करने के लिए एक आशाजनक दृष्टिकोण का प्रतिनिधित्व करता है, लेटेंट कोड के साथ मैप किए गए प्रॉक्सी एंटिटी का उपयोग करके।

लेखकों का दावा है:

‘एक चुनौतीपूर्ण मल्टी-कैटेगरी डेटासेट पर, BlobGAN छवि गुणवत्ता में FID द्वारा मापा गया Style-GAN2 से बेहतर प्रदर्शन करता है।’

लेख पेपर का शीर्षक BlobGAN: Spatially Disentangled Scene Representations है, और यह यूसी बर्कले के दो शोधकर्ताओं और एडोबी रिसर्च के तीन शोधकर्ताओं द्वारा लिखा गया है।

मध्यवर्ती

BlobGAN जीएएन इमेज सिंथेसिस में एक नई परिपाटी लाता है। पिछले दृष्टिकोण जीएएन या इमेज क्लासिफायर में विच्छिन्न एंटिटी को संबोधित करने के लिए, या तो ‘टॉप-डाउन’ या ‘बॉटम अप’ रहे हैं।

एक जीएएन या इमेज क्लासिफायर में टॉप-डाउन विधि दृश्यों की छवियों को वर्गों के रूप में मानती है, जैसे कि ‘बेडरूम’, ‘चर्च’, ‘चेहरा’, आदि। यह प्रकार का टेक्स्ट/इमेज जोड़ी एक नए पीढ़ी के मल्टीमॉडल इमेज सिंथेसिस फ्रेमवर्क को शक्ति प्रदान करती है, जैसे कि ओपनएआई का हालिया डीएलएल-ई 2।

बॉटम-अप दृष्टिकोण, इसके बजाय, छवि में प्रत्येक पिक्सेल को एक वर्ग, लेबल या श्रेणी में मैप करता है। ऐसे दृष्टिकोण विभिन्न तकनीकों का उपयोग करते हैं, हालांकि सेमेंटिक सेगमेंटेशन एक लोकप्रिय वर्तमान शोध धारा है।

लेखकों का टिप्पणी है:

‘दोनों पथ असंतोषजनक लगते हैं क्योंकि न तो दृश्य के हिस्सों को इकाइयों के रूप में तर्क करने के लिए आसान तरीके प्रदान कर सकता है। दृश्य के हिस्से या तो एक एकल जुड़े हुए लेटेंट वेक्टर (टॉप-डाउन) में बेक किए जाते हैं, या व्यक्तिगत पिक्सेल लेबल से एक साथ समूहीकृत किए जाने की आवश्यकता होती है (बॉटम-अप)।’

इसके बजाय, BlobGAN एक अनुप्रशिक्षित मध्य-स्तरीय प्रतिनिधित्व या जेनरेटिव मॉडल के लिए प्रॉक्सी फ्रेमवर्क प्रदान करता है।

लेआउट नेटवर्क स्थानीय (और नियंत्रित) 'ब्लॉब' एंटिटी को लेटेंट कोड में मैप करता है। केंद्र में रंगीन सर्कल एक 'ब्लॉब मैप' का गठन करते हैं। स्रोत: https://arxiv.org/pdf/2205.02837.pdf

लेआउट नेटवर्क स्थानीय (और नियंत्रित) ‘ब्लॉब’ एंटिटी को लेटेंट कोड में मैप करता है। केंद्र में रंगीन सर्कल एक ‘ब्लॉब मैप’ का गठन करते हैं। स्रोत: https://arxiv.org/pdf/2205.02837.pdf

गॉसियन (अर्थात शोर-आधारित) ब्लॉब्स गहराई-क्रमित होते हैं और वास्तुकला में एक बोतलनेक का प्रतिनिधित्व करते हैं जो प्रत्येक इकाई को एक मैपिंग सौंपता है, जो जीएएन सामग्री मैनिपुलेशन में सबसे बड़ी बाधा को हल करता है: विच्छिन्नता (जो ऑटोएनकोडर-आधारित वास्तुकला के लिए भी एक समस्या है)। परिणामी ‘ब्लॉब मैप’ का उपयोग BlobGAN के डिकोडर को मैनिप्युलेट करने के लिए किया जाता है।

लेखकों का उल्लेख है कि प्रणाली एक ऑफ-द-शेल्फ डिस्क्रिमिनेटर के माध्यम से दृश्यों को लेआउट और एंटिटी में विभाजित करना सीखती है, जो स्पष्ट लेबल का उपयोग नहीं करता है।

वास्तुकला और डेटा

ब्लॉब मैप में एंटिटी को छवियों में परिवर्तित करने के लिए एक संशोधित StyleGAN2-व्युत्पन्न नेटवर्क का उपयोग किया जाता है, जो पूर्व NVIDIA (NVDA ) शोध से प्रेरित है।

NVIDIA रिसर्च से एक संशोधित StyleGAN 2 डेरिवेटिव। इस काम में कुछ सिद्धांतों को अपनाया या अनुकूलित किया गया था। स्रोत: https://arxiv.org/pdf/1912.04958.pdf

NVIDIA रिसर्च से एक संशोधित StyleGAN 2 डेरिवेटिव। स्रोत: https://arxiv.org/pdf/1912.04958.pdf

StyleGAN 2 को BlobGAN में संशोधित किया गया है ताकि यह एक एकल वैश्विक वेक्टर के बजाय ब्लॉब मैप से इनपुट स्वीकार करे।

BlobGAN द्वारा संभव की गई मैनिपुलेशन की एक श्रृंखला, जिसमें एक बेडरूम दृश्य का 'ऑटोकम्प्लीशन' और कमरे में तत्वों का आकार बदलना और स्थानांतरण शामिल है। नीचे की पंक्ति में, हमें यह साधनता दिखाई देती है - ब्लॉब मैप।

BlobGAN द्वारा संभव की गई मैनिपुलेशन की एक श्रृंखला, जिसमें एक बेडरूम दृश्य का ‘ऑटोकम्प्लीशन’ और कमरे में तत्वों का आकार बदलना और स्थानांतरण शामिल है। नीचे की पंक्ति में, हमें यह साधनता दिखाई देती है – ब्लॉब मैप।

एक समानता के अनुसार, इसके बजाय एक विशाल और जटिल भवन (लेटेंट स्पेस) को एक बार में अस्तित्व में लाने के बजाय, BlobGAN शुरू में घटक ब्लॉक्स भेजता है और हमेशा जानता है कि वे कहां हैं। यह सामग्री और स्थान का विच्छिन्नता इस काम का मुख्य नवाचार है।

 

* समय पर लेखन के समय कार्यात्मक नहीं था
** कोड समय पर लेखन के समय प्रकाशित नहीं किया गया था

 

पहली बार 8 मई 2022 को प्रकाशित किया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai