Anderson का एंगल

NVIDIA का eDiffi डिफ्यूजन मॉडल ‘पेंटिंग विद वर्ड्स’ और अधिक की अनुमति देता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

स्टेबल डिफ्यूजन जैसे लेटेंट डिफ्यूजन जनरेटिव इमेज मॉडल के साथ सटीक रचनाएं बनाने का प्रयास करना मुश्किल हो सकता है; जो प्रणाली असाधारण विवरण बनाने और सरल पाठ-प्रॉम्प्ट से असाधारण छवियों को बुलाने में सक्षम है, वही कल्पनाशील और व्याख्यात्मक शक्तियाँ भी हैं जो छवि पीढ़ी पर फोटोशॉप-स्तर का नियंत्रण प्राप्त करने के लिए मुश्किल हो सकती हैं।

अब, NVIDIA रिसर्च से एक नया दृष्टिकोण, जिसे ensemble diffusion for images (eDiffi) कहा जाता है, पाइपलाइन में एक ही तरीके के बजाय कई एम्बेडिंग और व्याख्यात्मक विधियों के मिश्रण का उपयोग करके उत्पन्न सामग्री पर बहुत अधिक नियंत्रण की अनुमति देता है। नीचे दिए गए उदाहरण में, हम एक उपयोगकर्ता को देखते हैं जो प्रत्येक रंग को एक पाठ-प्रॉम्प्ट से एक शब्द का प्रतिनिधित्व करने के लिए रंग के तत्वों को चित्रित कर रहा है:

'पेंटिंग विद वर्ड्स' NVIDIA के eDiffi डिफ्यूजन मॉडल में दो नए क्षमताओं में से एक है। प्रत्येक रंग का डब एक प्रॉम्प्ट से एक शब्द का प्रतिनिधित्व करता है (पीढ़ी के दौरान बाएं किनारे पर उनके दिखाई देने को देखें), और लागू किया गया रंग क्षेत्र केवल उस तत्व से बना होगा। अधिक उदाहरणों और बेहतर रिज़ॉल्यूशन के लिए आधिकारिक वीडियो देखें

‘पेंटिंग विद वर्ड्स’ NVIDIA के eDiffi डिफ्यूजन मॉडल में दो नए क्षमताओं में से एक है। प्रत्येक रंग का डब एक प्रॉम्प्ट से एक शब्द का प्रतिनिधित्व करता है (पीढ़ी के दौरान बाएं किनारे पर उनके दिखाई देने को देखें), और लागू किया गया रंग क्षेत्र केवल उस तत्व से बना होगा। अधिक उदाहरणों और बेहतर रिज़ॉल्यूशन के लिए आधिकारिक वीडियो देखें https://www.youtube.com/watch?v=k6cOx9YjHJc

यह मूल रूप से ‘मास्क के साथ पेंटिंग’ है, और स्टेबल डिफ्यूजन में npainting पैराडाइम को उलट देता है, जो टूटी हुई या असंतोषजनक छवियों को ठीक करने या विस्तार करने पर आधारित है, या जो पहले से ही वांछित आकार में हो सकती हैं।

यहाँ, इसके बजाय, चित्रित डब के किनारे केवल एक ही अनोखे तत्व की अनुमानित सीमाओं का प्रतिनिधित्व करते हैं, जिससे उपयोगकर्ता को अंतिम कैनवास का आकार शुरू से ही निर्धारित करने और फिर विविध तत्वों को विविध रूप से जोड़ने की अनुमति मिलती है।

पेपर से उदाहरण। स्रोत: https://arxiv.org/pdf/2211.01324.pdf

पेपर से उदाहरण। स्रोत: https://arxiv.org/pdf/2211.01324.pdf

eDiffi में नियोजित विविध विधियों का अर्थ यह भी है कि प्रणाली लंबे और विस्तृत प्रॉम्प्ट्स में प्रत्येक तत्व को शामिल करने में बहुत बेहतर काम करती है, जबकि स्टेबल डिफ्यूजन और ओपनएआई के डीएलएल-ई 2 कुछ प्रॉम्प्ट्स के हिस्सों को प्राथमिकता देते हैं, जो या तो प्रॉम्प्ट में शब्दों के प्रकट होने के समय पर निर्भर करते हैं या अन्य कारकों पर, जैसे कि विभिन्न तत्वों को विच्छेदित करने में संभावित कठिनाई जो एक पूर्ण लेकिन व्यापक (पाठ-प्रॉम्प्ट के संबंध में) रचना के लिए आवश्यक है:

पेपर से: eDiffi अधिकतम संभव संख्या में तत्वों को प्रस्तुत करने तक प्रॉम्प्ट के माध्यम से अधिक व्यापक रूप से पुनरावृत्ति करने में सक्षम है। हालांकि eDiffi (दाएं-सबसे स्तंभ) के लिए सुधार परिणाम चेरी-पिक्ड हैं, स्टेबल डिफ्यूजन और डीएलएल-ई 2 से तुलना छवियां भी चेरी-पिक्ड हैं।

पेपर से: eDiffi अधिकतम संभव संख्या में तत्वों को प्रस्तुत करने तक प्रॉम्प्ट के माध्यम से अधिक व्यापक रूप से पुनरावृत्ति करने में सक्षम है। हालांकि eDiffi (दाएं-सबसे स्तंभ) के लिए सुधार परिणाम चेरी-पिक्ड हैं, स्टेबल डिफ्यूजन और डीएलएल-ई 2 से तुलना छवियां भी चेरी-पिक्ड हैं。

इसके अतिरिक्त, एक समर्पित टी5 पाठ-से-पाठ एनकोडर का उपयोग करने से eDiffi स्पष्ट अंग्रेजी पाठ को प्रस्तुत करने में सक्षम है, या तो एक प्रॉम्प्ट (यानी, छवि में [x] पाठ है) से अमूर्त रूप से अनुरोध किया जाता है या स्पष्ट रूप से अनुरोध किया जाता है (यानी, टी-शर्ट पर ‘एनवीडिया रॉक्स’ लिखा है):

eDiffi में समर्पित पाठ-से-पाठ प्रसंस्करण का अर्थ है कि पाठ को छवियों में साक्षर रूप से प्रस्तुत किया जा सकता है, न कि केवल एक पाठ-से-छवि व्याख्यात्मक परत के माध्यम से जो आउटपुट को विकृत करती है।

eDiffi में समर्पित पाठ-से-पाठ प्रसंस्करण का अर्थ है कि पाठ को छवियों में साक्षर रूप से प्रस्तुत किया जा सकता है, न कि केवल एक पाठ-से-छवि व्याख्यात्मक परत के माध्यम से जो आउटपुट को विकृत करती है।

नई प्रणाली में एक और लाभ यह है कि यह एकल छवि को शैली प्रॉम्प्ट के रूप में प्रदान करने की अनुमति देता है, न कि एक ड्रीमबूथ मॉडल या एक पाठ-आधारित एम्बेडिंग को प्रशिक्षित करने की आवश्यकता होती है जो एक शैली या शैली के कई उदाहरणों पर आधारित होती है।

शैली हस्तांतरण को एक संदर्भ छवि से एक पाठ-से-छवि प्रॉम्प्ट या यहां तक कि एक छवि-से-छवि प्रॉम्प्ट में लागू किया जा सकता है।

शैली हस्तांतरण को एक संदर्भ छवि से एक पाठ-से-छवि प्रॉम्प्ट या यहां तक कि एक छवि-से-छवि प्रॉम्प्ट में लागू किया जा सकता है।

टी5 टेक्स्ट एनकोडर

eDiffi में टी5 टेक्स्ट-टू-टेक्स्ट ट्रांसफॉर्मर (टी5) का उपयोग करना सुधारित परिणामों में एक महत्वपूर्ण तत्व है। औसत लेटेंट डिफ्यूजन पाइपलाइन प्रशिक्षित छवियों और उनके साथ जुड़े कैप्शन के बीच संबंध पर केंद्रित होती है जब वे इंटरनेट से स्क्रैप किए जाते हैं (या बाद में मैन्युअल रूप से समायोजित किए जाते हैं, हालांकि यह एक महंगा और इसलिए दुर्लभ हस्तक्षेप है)।

जुलाई 2020 के टी5 पेपर से - पाठ-आधारित परिवर्तन, जो eDiffi (और संभावित रूप से अन्य लेटेंट डिफ्यूजन मॉडल) में जनरेटिव इमेज वर्कफ्लो में सहायता कर सकते हैं। स्रोत: https://arxiv.org/pdf/1910.10683.pdf

जुलाई 2020 के टी5 पेपर से – पाठ-आधारित परिवर्तन, जो eDiffi (और संभावित रूप से अन्य लेटेंट डिफ्यूजन मॉडल) में जनरेटिव इमेज वर्कफ्लो में सहायता कर सकते हैं। स्रोत: https://arxiv.org/pdf/1910.10683.pdf

स्रोत पाठ को फिर से लिखने और टी5 मॉड्यूल चलाने से, मूल रूप से प्रशिक्षित मॉडल में प्रशिक्षित की तुलना में अधिक सटीक संघ और प्रस्तुतीकरण प्राप्त किए जा सकते हैं, लगभग पोस्ट फैक्टो मैनुअल लेबलिंग की तरह, अधिक विशिष्टता और अनुरोधित पाठ-प्रॉम्प्ट के निर्देशों के लिए अधिक अनुप्रयोगिता के साथ।

डिफ्यूजन प्रक्रिया में व्यवधान और पूरक

पेपर नोट्स कि एक विशिष्ट लेटेंट डिफ्यूजन मॉडल पाठ में शुरू होने वाली प्रक्रिया से शुरू होता है और शोर से एक छवि में जाता है।

जब शोर किसी प्रकार के खुरदरे लेआउट में हल हो जाता है जो पाठ-प्रॉम्प्ट में वर्णित होता है, तो पाठ-निर्देशित पहलू प्रक्रिया के मूल रूप से गिर जाता है, और प्रक्रिया का शेष भाग दृश्य विशेषताओं को बढ़ाने की ओर बढ़ जाता है।

इसका अर्थ है कि यदि कोई तत्व प्रारंभिक पाठ-निर्देशित शोर व्याख्या के चरण में हल नहीं हुआ है, तो इसे बाद में छवि में इंजेक्ट करना मुश्किल हो जाता है, क्योंकि दो प्रक्रियाएं (पाठ-से-लेआउट, और लेआउट-से-छवि) के बीच बहुत कम ओवरलैप होता है, और मूल लेआउट छवि संवर्द्धन प्रक्रिया तक पहुंचने से पहले ही बहुत जटिल हो जाता है।

पेशेवर संभावना

परियोजना पृष्ठ और यूट्यूब वीडियो पर केंद्रित उदाहरण पीआर-अनुकूल जेनरेशन पर केंद्रित हैं जो मीम-टास्टिक छवियां हैं। जैसा कि हमेशा, NVIDIA रिसर्च अपनी नवीनतम नवाचार को फोटोरियलिस्टिक या वीएफएक्स वर्कफ्लो में सुधार करने की संभावना को कम कर रहा है, साथ ही साथ गहरे नकली छवि और वीडियो में सुधार की संभावना को भी कम कर रहा है।

उदाहरणों में, एक शुरुआती या शौकिया उपयोगकर्ता विशिष्ट तत्व के प्लेसमेंट के लिए खुरदरे आउटलाइन्स स्केच करता है, जबकि एक अधिक व्यवस्थित वीएफएक्स वर्कफ्लो में, यह संभव हो सकता है कि eDiffi का उपयोग एक वीडियो तत्व के कई फ्रेमों को पाठ-से-छवि का उपयोग करके व्याख्या करने के लिए किया जाए, जिसमें रूपरेखाएं बहुत सटीक होती हैं और, उदाहरण के लिए, हरे रंग की स्क्रीन या एल्गोरिदमिक विधियों द्वारा पृष्ठभूमि को हटाने के माध्यम से आंकड़ों से बनाई जाती हैं।

विधि, डेटा और परीक्षण

पेपर के अनुसार, eDiffi मॉडल को ‘सार्वजनिक और प्रोप्राइटरी डेटासेट’ के संग्रह पर प्रशिक्षित किया गया था, जिसे एक पूर्व-प्रशिक्षित सीएलआईपी मॉडल द्वारा भारी रूप से फिल्टर किया गया था, ताकि आउटपुट के सामान्य सौंदर्य स्कोर को कम करने वाली छवियों को हटाया जा सके। अंतिम फिल्टर्ड छवि सेट में ‘लगभग एक अरब’ पाठ-छवि जोड़े शामिल हैं। प्रशिक्षित छवियों का आकार ‘लघु पक्ष 64 पिक्सेल से अधिक’ के रूप में वर्णित किया गया है।

प्रक्रिया के लिए कई मॉडल प्रशिक्षित किए गए थे, जिनमें से आधार और सुपर-रिज़ॉल्यूशन मॉडल दोनों को एडमडब्ल्यू ऑप्टिमाइज़र पर 0.0001 की लर्निंग दर और 0.01 के वजन क्षय के साथ प्रशिक्षित किया गया था, और 2048 के एक प्रभावशाली बैच आकार के साथ।

बेस मॉडल को 256 एनवीडिया ए100 जीपीयू पर प्रशिक्षित किया गया था, और दो सुपर-रिज़ॉल्यूशन मॉडल प्रत्येक मॉडल के लिए 128 एनवीडिया ए100 जीपीयू पर थे।

सिस्टम एनवीडिया के अपने इमेजिनेयर पायथन लाइब्रेरी पर आधारित था। सीओसीओ और विज़ुअल जेनोम डेटासेट का उपयोग मूल्यांकन के लिए किया गया था, हालांकि वे अंतिम मॉडल में शामिल नहीं थे, एमएस-सीओसीओ विशिष्ट वेरिएंट का उपयोग परीक्षण के लिए किया गया था।

प्रतिद्वंद्वी प्रणालियों में जीएलआईडीई, मेक-ए-सीन, डीएलएल-ई 2, स्टेबल डिफ्यूजन, और गूगल की दो इमेज सिंथेसिस सिस्टम, इमेजन और पार्टी शामिल थीं।

शून्य-शॉट एफआईडी-30के का उपयोग मूल्यांकन मीट्रिक के रूप में किया गया था, जो पिछले कार्य के अनुरूप था। एफआईडी-30के के तहत, सीओसीओ प

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai