Anderson का एंगल
स्टेबल डिफ्यूजन को मुख्यधारा के उपभोक्ता उत्पाद के रूप में विकसित करने की संभावना

विडंबना यह है कि, स्टेबल डिफ्यूजन, जो एक नया एआई इमेज सिंथेसिस फ्रेमवर्क है जिसने दुनिया को चकित कर दिया है, न तो वास्तव में स्थिर है और न ही वास्तव में ‘विस्तारित’ – कम से कम, अभी तक नहीं।
सिस्टम की पूरी श्रृंखला की क्षमताएं विभिन्न प्रकार के विकसित हो रहे प्रस्तावों में फैली हुई हैं जो कुछ विकासकर्ताओं द्वारा डिस्कोर्ड पर विभिन्न संवादों में नवीनतम जानकारी और सिद्धांतों को साझा करने के लिए तेजी से बदलते रहते हैं – और अधिकांश पैकेजों के लिए स्थापना प्रक्रियाएं बहुत दूर हैं ‘प्लग और प्ले’ से।
इसके बजाय, वे आमतौर पर कमांड-लाइन या बीएटी-संचालित स्थापना की आवश्यकता होती है जीआईटी, कोंडा, पाइथन, मिनिकोंडा और अन्य अत्याधुनिक विकास ढांचे के माध्यम से – सॉफ्टवेयर पैकेज जो सामान्य उपभोक्ताओं के बीच इतने दुर्लभ हैं कि उनकी स्थापना अक्सर एंटीवायरस और एंटी-मैलवेयर विक्रेताओं द्वारा समझौता किए गए होस्ट सिस्टम के प्रमाण के रूप में ध्वजांकित की जाती है।

स्टेबल डिफ्यूजन की मानक स्थापना के लिए आवश्यक चरणों का एक छोटा सा चयन। कई वितरणों को पाइथन के विशिष्ट संस्करणों की भी आवश्यकता होती है, जो उपयोगकर्ता की मशीन पर स्थापित मौजूदा संस्करणों के साथ टकरा सकते हैं – हालांकि यह डॉकर-आधारित स्थापनाओं और कोंडा वातावरणों के उपयोग के माध्यम से कुछ हद तक टाला जा सकता है।
स्टेबल डिफ्यूजन और एनएसएफडब्ल्यू स्टेबल डिफ्यूजन समुदायों के संदेश थ्रेड्स टिप्स और ट्रिक्स से भरे हुए हैं जो पाइथन स्क्रिप्ट और मानक इंस्टॉल को हैक करने से संबंधित हैं, ताकि बेहतर कार्यक्षमता को सक्षम किया जा सके या डिपेंडेंसी त्रुटियों और अन्य मुद्दों को हल किया जा सके।
यह औसत उपभोक्ता को छोड़ देता है, जो टेक्स्ट प्रॉम्प्ट से आश्चर्यजनक छवियों को बनाने में रुचि रखता है, ज्यादातर मोनेटाइज्ड एपीआई वेब इंटरफेस की कृपा पर, जिनमें से अधिकांश एक न्यूनतम संख्या में मुफ्त छवि पीढ़ी की पेशकश करते हैं trước कि वे टोकन की खरीद की आवश्यकता को मजबूर करें।
इसके अलावा, इनमें से लगभग सभी वेब-आधारित प्रस्ताव एनएसएफडब्ल्यू सामग्री (जो अक्सर गैर-पोर्न विषयों से संबंधित हो सकती है, जैसे ‘युद्ध’) को आउटपुट करने से इनकार करते हैं जो स्टेबल डिफ्यूजन को ओपनएआई की डीएएल-ई 2 सेवा से अलग करती है।
स्टेबल डिफ्यूजन के लिए फोटोशॉप
व्यापक दुनिया जो स्टेबल डिफ्यूजन की प्रतीक्षा कर रही है, वह है ‘स्टेबल डिफ्यूजन के लिए फोटोशॉप’ – एक क्रॉस-प्लेटफ़ॉर्म इंस्टॉल करने योग्य एप्लिकेशन जो स्टेबिलिटी.ai के आर्किटेक्चर की सबसे शक्तिशाली और सर्वोत्तम कार्यक्षमता को शामिल करता है, साथ ही साथ उभरते एसडी विकास समुदाय की विभिन्न उत्कृष्ट नवाचारों को भी, बिना किसी फ्लोटिंग सीएलआई विंडोज, अस्पष्ट और बदलते इंस्टॉल और अपडेट दिनचर्या, या लापता सुविधाओं के।
हमारे पास वर्तमान में अधिकांश क्षमता वाले स्थापनाओं में क्या है, वह एक विविध रूप से सुंदर वेब पेज है जो एक अविचलित कमांड-लाइन विंडो द्वारा पार किया जाता है, और जिसका यूआरएल एक स्थानीय होस्ट पोर्ट है:

फेसस्वैप और बीएटी-सेंट्रिक डीपफेसलैब जैसे सीएलआई-संचालित सिंथेसिस ऐप के समान, स्टेबल डिफ्यूजन का ‘प्रीपैक’ इंस्टॉल अपने कमांड-लाइन मूल को दिखाता है, जिसमें इंटरफ़ेस एक स्थानीय होस्ट पोर्ट (ऊपर दिए गए चित्र के शीर्ष पर देखें) के माध्यम से एक्सेस किया जाता है जो सीएलआई-आधारित स्टेबल डिफ्यूजन कार्यक्षमता के साथ संवाद करता है।
निस्संदेह, एक अधिक सुव्यवस्थित अनुप्रयोग आ रहा है। पहले से ही कई पेट्रोन-आधारित एकीकृत अनुप्रयोग हैं जिन्हें डाउनलोड किया जा सकता है, जैसे जीआरिस्क और एनएमकेडी (नीचे दिए गए चित्र देखें) – लेकिन अभी तक कोई ऐसा नहीं है जो उन उन्नत और कम सुलभ स्टेबल डिफ्यूजन कार्यान्वयन की पूरी श्रृंखला को एकीकृत करता है जो कुछ पेशकश कर सकते हैं।

स्टेबल डिफ्यूजन के शुरुआती पेट्रोन-आधारित पैकेज, हल्के से ‘एपी-आइज्ड’। एनएमकेडी का यह पहला है जो सीएलआई आउटपुट को सीधे जीयूआई में एकीकृत करता है।
आइए देखें कि एक अधिक पॉलिश और एकीकृत स्टेबल डिफ्यूजन कार्यान्वयन क्या दिख सकता है – और यह किन चुनौतियों का सामना कर सकता है।
पूरी तरह से वित्तपोषित व्यावसायिक स्टेबल डिफ्यूजन अनुप्रयोग के लिए कानूनी विचार
एनएसएफडब्ल्यू कारक
स्टेबल डिफ्यूजन स्रोत कोड को एक बहुत ही अनुमति देने वाले लाइसेंस के तहत जारी किया गया है जो व्यावसायिक पुनरावृत्ति और व्युत्पन्न कार्यों को प्रतिबंधित नहीं करता है जो स्रोत कोड से व्यापक रूप से निर्मित होते हैं।
उपरोक्त उल्लिखित पेट्रोन-आधारित स्टेबल डिफ्यूजन निर्माणों के अलावा, साथ ही फिग्मा, क्रिटा, फोटोशॉप, जीआईएमपी, और ब्लेंडर (सहित) के लिए विभिन्न अनुप्रयोग प्लग-इन विकसित किए जा रहे हैं, कोई व्यावहारिक कारण नहीं है कि एक अच्छी तरह से वित्तपोषित सॉफ्टवेयर विकास घराने एक बहुत अधिक परिष्कृत और क्षमता वाले स्टेबल डिफ्यूजन अनुप्रयोग विकसित नहीं कर सकता है। बाजार के दृष्टिकोण से, यह मानने का हर कारण है कि कई ऐसी पहलें पहले से ही अच्छी तरह से चल रही हैं।
यहाँ, ऐसे प्रयास तुरंत इस दुविधा का सामना करते हैं कि क्या वे अधिकांश वेब एपीआई की तरह स्टेबल डिफ्यूजन के लिए होंगे या नहीं, जो स्टेबल डिफ्यूजन के मूल एनएसएफडब्ल्यू फिल्टर (एक कोड का टुकड़ा) को बंद करने की अनुमति देगा।
एनएसएफडब्ल्यू स्विच को ‘दफनाना’
हालांकि स्टेबिलिटी.ai के स्टेबल डिफ्यूजन के लिए खुला स्रोत लाइसेंस में एक व्यापक रूप से व्याख्या योग्य अनुप्रयोगों की सूची शामिल है जिसके लिए यह नहीं किया जा सकता है (जिसमें पोर्नोग्राफिक सामग्री और डीपफेक शामिल हो सकते हैं), एकमात्र तरीका यह होगा कि विक्रेता एनएसएफडब्ल्यू फिल्टर को एक अपारदर्शी कार्यक्रम में संकलित करे न कि एक पाइथन फ़ाइल में एक पैरामीटर के रूप में, या एनएसएफडब्ल्यू निर्देश को शामिल करने वाली पाइथन फ़ाइल या डीएलएल पर चेकसम तुलना लागू करे, ताकि रेंडर तब तक नहीं हो सकें जब तक कि उपयोगकर्ता इस सेटिंग को बदल न दें।
यह विक्रेता को डीएल-ई 2 की तरह ही ‘नपुंसक’ छोड़ देगा, जो इसकी व्यावसायिक अपील को कम कर देगा। इसके अलावा, निश्चित रूप से, डीकंपाइल ‘डॉक्टर्ड’ संस्करण इन घटकों (मूल पाइथन रनटाइम तत्वों या संकलित डीएलएल फ़ाइलों के रूप में) के उभरने की संभावना है जो इन प्रतिबंधों को अनलॉक करने के लिए, बस प्रतिबंधक तत्वों को प्रतिस्थापित करके और किसी भी चेकसम आवश्यकता को निरस्त करके होगी।
अंत में, विक्रेता शायद स्टेबल डिफ्यूजन के अधिकांश वर्तमान वितरण की विशेषता वाली पहली रन के दौरान दुरुपयोग के खिलाफ स्टेबिलिटी.ai की चेतावनी को दोहराने का विकल्प चुन सकता है।
हालांकि, जो छोटे खुले स्रोत विकासकर्ता इस तरह के असावधानी से चेतावनी देते हैं, उनकी तुलना में बहुत कम खोने के लिए है, एक सॉफ्टवेयर कंपनी की तुलना में जिसने स्टेबल डिफ्यूजन को पूरी तरह से विकसित और सुलभ बनाने में महत्वपूर्ण समय और पैसा लगाया है – जो गहराई से विचार करने के लिए आमंत्रित करता है।
डीपफेक देयता
जैसा कि हम हाल ही में उल्लेख किया है, लेआयन-एस्थेटिक्स डेटाबेस, जिस पर स्टेबल डिफ्यूजन के चल रहे मॉडल के लिए 4.2 बिलियन छवियों में से एक है, में कई सेलिब्रिटी छवियों की संख्या है, जो उपयोगकर्ताओं को प्रभावी रूप से डीपफेक बनाने में सक्षम बनाती है, जिसमें डीपफेक सेलिब्रिटी पोर्न शामिल है।

हमारे हाल के लेख से, जेनिफर कॉनेली के चार दशकों के उनके करियर में स्टेबल डिफ्यूजन से अनुमानित चार चरण।
यह डीपफेक पोर्नोग्राफी की तुलना में एक अलग और अधिक विवादास्पद मुद्दा है जो ‘अमूर्त’ है (जो आमतौर पर ‘वास्तविक’ लोगों को चित्रित नहीं करता है, हालांकि ऐसी छवियां प्रशिक्षण सामग्री में कई वास्तविक फोटो से अनुमानित होती हैं)।
चूंकि संयुक्त राज्य अमेरिका के कई राज्य और देश डीपफेक पोर्नोग्राफी के खिलाफ कानून विकसित कर रहे हैं या स्थापित कर चुके हैं, स्टेबल डिफ्यूजन की सेलिब्रिटी पोर्न बनाने की क्षमता यह सुझाव दे सकती है कि एक व्यावसायिक अनुप्रयोग जो पूरी तरह से सेंसर नहीं किया गया है (यानी, जो पोर्नोग्राफिक सामग्री बना सकता है) को सेलिब्रिटी चेहरों को फिल्टर करने की कुछ क्षमता की आवश्यकता हो सकती है।
एक तरीका यह होगा कि उपयोगकर्ता प्रॉम्प्ट में स्वीकार किए जाने वाले शब्दों की एक ‘ब्लैकलिस्ट’ प्रदान की जाए, जो सेलिब्रिटी नामों और उन पात्रों से संबंधित हों जिनसे वे जुड़े हो सकते हैं। संभवतः ऐसे सेटिंग्स को कई भाषाओं में संस्थापित करने की आवश्यकता होगी, क्योंकि मूल डेटा में अन्य भाषाओं की विशेषता है। एक और दृष्टिकोण यह हो सकता है कि सेलिब्रिटी पहचान प्रणालियों को शामिल किया जाए, जैसे कि क्लारिफाई द्वारा विकसित किया गया है।
यह संभव हो सकता है कि सॉफ्टवेयर निर्माताओं के लिए ऐसे तरीकों को शामिल करने की आवश्यकता होगी, शायद शुरू में बंद, जो डीपफेक चेहरों को पूरी तरह से स्टैंडअलोन स्टेबल डिफ्यूजन अनुप्रयोग से रोकने में मदद कर सकते हैं, नए कानूनी कार्रवाई की संभावना के लिए प्रतीक्षा कर रहे हैं जो इस तरह की कार्यक्षमता को अवैध बना सकती है।
एक बार फिर, हालांकि, ऐसी कार्यक्षमता को अनिवार्य रूप से डिकंपाइल और उलटा किया जा सकता है; हालांकि, सॉफ्टवेयर निर्माता दावा कर सकता है कि यह वास्तव में अनधिकृत वandalism है – जब तक कि इस तरह की रिवर्स इंजीनियरिंग को अत्यधिक आसान नहीं बनाया जाता है।
जो सुविधाएं शामिल की जा सकती हैं
किसी भी स्टेबल डिफ्यूजन वितरण की मूल कार्यक्षमता को किसी भी अच्छी तरह से वित्तपोषित व्यावसायिक अनुप्रयोग में शामिल किया जाना चाहिए। इनमें टेक्स्ट प्रॉम्प्ट का उपयोग करके उपयुक्त छवियों को उत्पन्न करने की क्षमता ( टेक्स्ट-टू-इमेज ); स्केच या अन्य चित्रों का उपयोग नए उत्पन्न छवियों के लिए मार्गदर्शक के रूप में ( इमेज-टू-इमेज ); प्रणाली को निर्देश देने के लिए कि यह कितना ‘कल्पनाशील’ होना चाहिए; रेंडर समय के खिलाफ गुणवत्ता का व्यापार करने का एक तरीका; और अन्य ‘मूलभूत’ जैसे वैकल्पिक स्वचालित छवि / प्रॉम्प्ट संग्रह, और नियमित वैकल्पिक अपस्केलिंग के माध्यम से रियल-ईएसआरजीएन, और कम से कम बुनियादी ‘चेहरा ठीक करने’ के साथ जीएफपीजीएन या कोडफॉर्मर के साथ।
यह एक बहुत ही ‘वैनिला इंस्टॉल’ है। आइए कुछ अधिक उन्नत सुविधाओं पर एक नज़र डालें जो वर्तमान में विकसित की जा रही हैं या विस्तारित की जा रही हैं, जो एक पूर्ण ‘पारंपरिक’ स्टेबल डिफ्यूजन अनुप्रयोग में शामिल की जा सकती हैं।
स्टोकास्टिक फ्रीजिंग
यहां तक कि अगर आप पिछले सफल रेंडर से बीज का पुन: उपयोग करते हैं, तो यह स्टेबल डिफ्यूजन को सटीक रूप से एक परिवर्तन को दोहराने के लिए बहुत मुश्किल है अगर किसी भी हिस्से को प्रॉम्प्ट या स्रोत छवि (या दोनों) में बदल दिया जाता है एक बाद के रेंडर के लिए।
यह एक समस्या है यदि आप एब्सिंथ का उपयोग करके वास्तविक वीडियो पर स्टेबल डिफ्यूजन के परिवर्तनों को एक समय-समय पर संगत तरीके से लागू करना चाहते हैं – हालांकि यह तकनीक सरल सिर और कंधे के शॉट्स के लिए बहुत प्रभावी हो सकती है:

सीमित आंदोलन एब्सिंथ को वास्तविक वीडियो में स्टेबल डिफ्यूजन परिवर्तनों को बदलने के लिए एक प्रभावी माध्यम बना सकता है। स्रोत: https://streamable.com/u0pgzd
एब्सिंथ एक छोटे से चयन के ‘संशोधित’ कीफ्रेम्स को एक वीडियो में विस्तारित करने के लिए एक्सट्रापोलेट करता है जो एक श्रृंखला में छवि फ़ाइलों के रूप में रेंडर किया गया है (और जिसे बाद में वीडियो में फिर से असेंबल किया जा सकता है)।

इस उदाहरण में एब्सिंथ साइट से, एक वीडियो के एक छोटे हाथ के फ्रेम को एक कलात्मक तरीके से चित्रित किया गया है। एब्सिंथ इन फ्रेमों का उपयोग शैली मार्गदर्शक के रूप में करता है ताकि पूरे वीडियो को उसी शैली में बदल दिया जा सके जिसमें उन्हें चित्रित किया गया था। स्रोत: https://www.youtube.com/embed/eghGQtQhY38
नीचे दिए गए उदाहरण में, जिसमें वास्तविक ब्लोंड योग प्रशिक्षक के बाईं ओर से लगभग कोई आंदोलन नहीं है, स्टेबल डिफ्यूजन अभी भी एक सुसंगत चेहरा बनाए रखने में कठिनाई होती है, क्योंकि तीन चित्र जो ‘कीफ्रेम’ के रूप में परिवर्तित किए जा रहे हैं, पूरी तरह से समान नहीं हैं, भले ही वे सभी एक ही संख्यात्मक बीज साझा करते हैं।

यहां, यहां तक कि एक ही प्रॉम्प्ट और बीज के साथ, और स्रोत फ्रेम के बीच बहुत कम परिवर्तन के साथ, मांसपेशियां आकार और आकार में भिन्न होती हैं, लेकिन अधिक महत्वपूर्ण बात यह है कि चेहरा असंगत है, जो एक संभावित एब्सिंथ रेंडर में समय-समय पर संगतता को बाधित करता है।
हालांकि उपयोगकर्ता द्वारा बनाई गई यह वीडियो बहुत ही आविष्कारशील है, जहां आदमी की उंगलियां एक चलने वाले पैंट के पैर और एक बतख में बदल जाती हैं, असंगत पैंट की विशेषता यह समस्या है जिसका सामना स्टेबल डिफ्यूजन को विभिन्न कीफ्रेम में सुसंगतता बनाए रखने में होता है, भले ही स्रोत फ्रेम एक दूसरे के समान हों और बीज सुसंगत हो।

एक आदमी की उंगलियां एक चलने वाले आदमी और एक बतख में बदल जाती हैं, स्टेबल डिफ्यूजन और एब्सिंथ के माध्यम से। स्रोत: https://old.reddit.com/r/StableDiffusion/comments/x92itm/proof_of_concept_using_img2img_ebsynth_to_animate/
उपयोगकर्ता जिसने यह वीडियो बनाया था टिप्पणी की कि बतख परिवर्तन, जो शायद दो में से अधिक प्रभावी है, के लिए केवल एक ही परिवर्तित कीफ्रेम की आवश्यकता थी, जबकि चलने वाले पैंट के लिए 50 स्टेबल डिफ्यूजन छवियों को बनाने की आवश्यकता थी, जो अधिक समय-समय पर असंगतता प्रदर्शित करते हैं। उपयोगकर्ता ने यह भी उल्लेख किया कि प्रत्येक कीफ्रेम के लिए सुसंगतता प्राप्त करने के लिए पांच प्रयासों की आवश्यकता थी।
अतः, एक वास्तविक रूप से व्यापक स्टेबल डिफ्यूजन अनुप्रयोग में कार्यक्षमता प्रदान करना एक महान लाभ होगा जो कीफ्रेम में विशेषताओं को यथासंभव बनाए रखता है।
एक संभावना यह है कि अनुप्रयोग उपयोगकर्ता को प्रत्येक फ्रेम के लिए परिवर्तन के लिए स्टोकास्टिक एन्कोड को ‘फ्रीज’ करने की अनुमति देता है, जो वर्तमान में केवल मैन्युअल रूप से स्रोत कोड को संशोधित करके ही प्राप्त किया जा सकता है। जैसा कि नीचे दिए गए उदाहरण में दिखाया गया है, यह समय-समय पर सुसंगतता में सहायता करता है, हालांकि यह निश्चित रूप से इसे हल नहीं करता है:

एक रेडिट उपयोगकर्ता ने वेबकैम फुटेज को विभिन्न प्रसिद्ध लोगों में बदल दिया न केवल बीज को बनाए रखने से (जो किसी भी स्टेबल डिफ्यूजन कार्यान्वयन कर सकता है), बल्कि यह सुनिश्चित करके कि प्रत्येक परिवर्तन में स्टोकास्टिक_एनकोड() पैरामीटर समान था। यह कोड को संशोधित करके प्राप्त किया गया था, लेकिन यह आसानी से एक उपयोगकर्ता-सुलभ स्विच बन सकता है। स्पष्ट रूप से, हालांकि, यह सभी समय-समय पर मुद्दों का समाधान नहीं करता है। स्रोत: https://old.reddit.com/r/StableDiffusion/comments/wyeoqq/turning_img2img_into_vid2vid/
क्लाउड-आधारित पाठक अवरोहण
सुसंगत पात्रों और वस्तुओं को उत्पन्न करने के लिए एक बेहतर समाधान एक पाठक अवरोहण में ‘बेक’ करना है – एक 5केबी फ़ाइल जिसे केवल पांच टिप्पणी वाली छवियों पर आधारित कुछ घंटों में प्रशिक्षित की जा सकती है, जो तब एक विशेष ‘*’ प्रॉम्प्ट द्वारा उत्पन्न की जा सकती है, जो एक कथा में शामिल करने के लिए नए पात्रों की स्थिर उपस्थिति की अनुमति देती है।

छवियों को संबंधित टैग के साथ जोड़ा जा सकता है और पाठक अवरोहण के माध्यम से विशिष्ट इकाइयों में परिवर्तित किया जा सकता है, और विशेष टोकन शब्दों द्वारा बिना किसी अस्पष्टता के और सही संदर्भ और शैली में बुलाया जा सकता है। स्रोत: https://huggingface.co/docs/diffusers/training/text_inversion
पाठक अवरोहण स्टेबल डिफ्यूजन द्वारा उपयोग किए जाने वाले बहुत बड़े और पूरी तरह से प्रशिक्षित मॉडल के लिए सहायक फ़ाइलें हैं, और वास्तव में ‘स्लिपस्ट्रीम’ हैं जो प्रेरक / प्रॉम्प्ट प्रक्रिया में भाग लेती हैं, ताकि वे मॉडल के विशाल ज्ञान का लाभ उठा सकें वस्तुओं, शैलियों, वातावरणों और परस्पर क्रियाओं के बारे में।
हालांकि, एक पाठक अवरोहण को प्रशिक्षित करने में बहुत अधिक समय नहीं लगता है, यह एक उच्च मात्रा में वीआरएएम की आवश्यकता होती है; विभिन्न वर्तमान वॉकथ्रू के अनुसार, कहीं 12, 20 और यहां तक कि 40GB के बीच।
चूंकि अधिकांश आकस्मिक उपयोगकर्ताओं के पास अपने निपटान में इतनी ग्राफिक्स प्रसंस्करण इकाई (जीपीयू) की ताकत नहीं है, क्लाउड सेवाएं पहले से ही उभर रही हैं जो इस ऑपरेशन को संभालेंगी, जिसमें हगिंग फेस संस्करण भी शामिल है। हालांकि गूगल कोलाब कार्यान्वयन हैं जो स्टेबल डिफ्यूजन के लिए पाठक अवरोहण बना सकते हैं, आवश्यक वीआरएएम और समय आवश्यकताएं मुफ्त-टियर कोलाब उपयोगकर्ताओं के लिए चुनौतीपूर्ण हो सकती हैं।
एक संभावित पूर्ण विकसित और अच्छी तरह से निवेश किए गए स्टेबल डिफ्यूजन (स्थापित) अनुप्रयोग के लिए, इस भारी कार्य को कंपनी के क्लाउड सर्वर पर पारित करना एक स्पष्ट मोनेटाइजेशन रणनीति लगती है (यह मानकर कि एक कम या नि:शुल्क स्टेबल डिफ्यूजन अनुप्रयोग में ऐसी गैर-मुफ्त कार्यक्षमता है जो संभवतः कई अनुप्रयोगों में शामिल हो सकती है जो इस प्रौद्योगिकी से अगले 6-9 महीनों में उभरेंगी)।
इसके अलावा, प्रस्तुत और पाठ की फ़ाइलों को स्वचालित करने में मदद मिल सकती है जो जमा की जा रही हैं और पाठक अवरोहण के लिए प्रारूपित की जा रही हैं। विशिष्ट तत्व बनाने की ‘नशे की लत’ जो स्टेबल डिफ्यूजन की विशाल दुनियाओं का अन्वेषण कर सकती है और बातचीत कर सकती है, सामान्य उत्साही और युवा उपयोगकर्ताओं के लिए समान रूप से नशे की लत हो सकती है।
विविध प्रॉम्प्ट वजन
वर्तमान में कई कार्यान्वयन हैं जो उपयोगकर्ता को एक लंबे पाठ प्रॉम्प्ट के एक खंड पर अधिक जोर देने की अनुमति देते हैं, लेकिन इसका साधन बहुत भिन्न होता है, और अक्सर असहज या अस्पष्ट होता है।
स्टेबल डिफ्यूजन का बहुत लोकप्रिय फोर्क ऑटोमैटिक1111 द्वारा, उदाहरण के लिए, प्रॉम्प्ट शब्द को कम या बढ़ाने के लिए एकल या कई ब्रैकेट (कम जोर देने के लिए) या वर्ग ब्रैकेट (अधिक जोर देने के लिए) में शब्द को समाहित करने की अनुमति देता है।

वर्ग ब्रैकेट और/या पैरेंथेसिस आपके नाश्ते को इस स्टेबल डिफ्यूजन प्रॉम्प्ट वजन संस्करण में बदल सकते हैं, लेकिन यह दोनों तरह से एक कोलेस्ट्रॉल का सपना है।
स्टेबल डिफ्यूजन के अन्य संस्करण जोर देने के लिए विस्मयादिबोधक चिह्न का उपयोग करते हैं, जबकि सबसे लचीले उपयोगकर्ताओं को प्रॉम्प्ट में प्रत्येक शब्द को जीयूआई के माध्यम से वजन सौंपने की अनुमति देते हैं।
प्रणाली को नकारात्मक प्रॉम्प्ट वजन की भी अनुमति देनी चाहिए – न केवल अत्यधिक प्रशंसकों के लिए, बल्कि क्योंकि स्टेबल डिफ्यूजन के लेटेंट स्पेस में हमारी भाषा की सीमित उपयोगिता से अधिक रहस्यमय और अधिक सूचित करने वाले रहस्य हो सकते हैं।
आउटपेंटिंग
स्टेबल डिफ्यूजन के खुले स्रोत के तुरंत बाद, ओपनएआई ने – मुख्य रूप से – ‘आउटपेंटिंग’ की घोषणा की की, जो उपयोगकर्ता को एक छवि को उसकी सीमाओं से परे विस्तारित करने की अनुमति देता है सेमेंटिक तर्क और दृश्य संगति के साथ।
स्वाभाविक रूप से, यह तब से स्टेबल डिफ्यूजन के लिए विभिन्न रूपों में लागू किया गया है, साथ ही क्रिटा में, और निश्चित रूप से एक व्यापक, फोटोशॉप-शैली के स्टेबल डिफ्यूजन संस्करण में शामिल किया जाना चाहिए।

टाइल-आधारित विस्तार एक मानक 512×512 रेंडर को लगभग अनंत तक बढ़ा सकता है, जब तक कि प्रॉम्प्ट, मौजूदा छवि और सेमेंटिक तर्क इसकी अनुमति देते हैं। स्रोत: https://github.com/lkwq007/stablediffusion-infinity
स्टेबल डिफ्यूजन 512x512px छवियों (और विभिन्न अन्य कारणों से) पर प्रशिक्षित किया गया है, यह अक्सर मानव विषयों के सिर (या अन्य आवश्यक शरीर के अंग) को काट देता है, यहां तक कि जब प्रॉम्प्ट स्पष्ट रूप से ‘सिर पर जोर’ देने का संकेत देता है, आदि।

स्टेबल डिफ्यूजन ‘सिर काटने’ के विशिष्ट उदाहरण; लेकिन आउटपेंटिंग जॉर्ज को फिर से चित्र में ला सकती है।
आउटपेंटिंग कार्यान्वयन को इस तरह से टूल किया जाना चाहिए कि यह एकमुश्त उपाय के रूप में ‘काटे हुए’ चित्रण के लिए एकमुश्त उपाय के रूप में कार्य करे, जो नीचे दिए गए एनिमेटेड छवि में दिखाया गया है (जो विशेष रूप से यूनिक्स लाइब्रेरी पर आधारित है, लेकिन विंडोज पर प्रतिकृत किया जाना चाहिए):
संदर्भ को समझने वाली प्रभावी मास्किंग
मास्किंग स्टेबल डिफ्यूजन में एक बहुत ही हिट-और-मिस मामला हो सकता है, जो संस्करण या फोर्क पर निर्भर करता है। अक्सर, जहां यह एक सुसंगत मास्क खींचना संभव है, निर्दिष्ट क्षेत्र को इन-पेंट किया जाता है जो पूरी तरह से छवि के संदर्भ को ध्यान में नहीं रखता है।
मैंने एक बार एक चेहरे की छवि से कॉर्निया को मास्क आउट किया और प्रॉम्प्ट ‘नीली आंखें’ को मास्क इनपेंट के रूप में प्रदान किया – केवल यह पाते हुए कि मैं दो मानव आंखों के माध्यम से एक दूरस्थ चित्र में एक अलौकिक दिखने वाले भेड़िये को देख रहा था। मुझे लगता है कि मैं भाग्यशाली हूं कि यह फ्रैंक सिनात्रा नहीं था।
सेमेंटिक संपादन भी प्रारंभिक छवि को बनाने वाले शोर की पहचान द्वारा संभव है, जो उपयोगकर्ता को छवि के विशिष्ट संरचनात्मक तत्वों को संबोधित करने की अनुमति देता है बिना बाकी छवि को बाधित किए:

पारंपरिक मास्किंग और बिना आसपास की सामग्री को बदले छवि के एक तत्व को बदलना, शोर की पहचान करके जो पहली बार छवि को उत्पन्न किया था और लक्ष्य क्षेत्र में योगदान देने वाले हिस्सों को संबोधित करके। स्रोत: https://old.reddit.com/r/StableDiffusion/comments/xboy90/a_better_way_of_doing_img2img_by_finding_the/
यह विधि के-डिफ्यूजन सैंपलर पर आधारित है।
शारीरिक गड़बड़ियों के लिए सेमेंटिक फिल्टर
जैसा कि हम पहले उल्लेख किया है, स्टेबल ड्यूजन अक्सर अंग जोड़ या घटा सकता है, जो मुख्य रूप से डेटा मुद्दों और प्रशिक्षण छवियों के साथ आने वाली टिप्पणियों में कमियों के कारण होता है।

स्टेबल डिफ्यूजन की जैविक आतंकवादी कृतियां हमेशा तुरंत स्पष्ट नहीं होती हैं, और आप अपने नवीनतम एआई महाकाव्य को इंस्टाग्राम पर पोस्ट कर सकते हैं इससे पहले कि आप अतिरिक्त हाथ या पिघली हुई अंगों को नोटिस करते हैं।
इन प्रकार की त्रुटियों को ठीक करना इतना मुश्किल है कि एक पूर्ण स्टेबल डिफ्यूजन अनुप्रयोग में एक प्रकार की शारीरिक मान्यता प्रणाली शामिल होनी चाहिए जो सेमेंटिक सेगमेंटेशन का उपयोग करके यह गणना करे कि आगामी छवि में गंभीर शारीरिक कमियां हैं (जैसा कि ऊपर दी गई छवि में), और इसे एक नए रेंडर के लिए पसंद करते हुए उपयोगकर्ता को प्रस्तुत करने से पहले इसे छोड़ देता है।

बेशक, आप देवी काली या डॉक्टर ऑक्टोपस को प्रस्तुत करना चाह सकते हैं, या एक अंग-प्रभावित चित्र के एक अप्रभावित हिस्से को बचा सकते हैं, इसलिए यह सुविधा एक वैकल्पिक टॉगल होनी चाहिए।
यदि उपयोगकर्ता टेलीमेट्री पहलू को सहन कर सकते हैं, तो ऐसी मिसफायर को एक संघीय सीखने के प्रयास में नाममात्र रूप से प्रसारित किया जा सकता है जो भविष्य के मॉडलों को उनकी शारीरिक तर्क की समझ में सुधार करने में मदद कर सकता है।
लेआयन-आधारित स्वचालित चेहरा सुधार
जैसा कि मैंने अपने पिछले लेख में स्टेबल डिफ्यूजन के भविष्य में तीन चीजों पर प्रकाश डाला था, यह नहीं छोड़ा जाना चाहिए कि केवल जीएफपीजीएन को पहली बार रेंडर की गई छवियों में चेहरों में ‘सुधार’ करने का प्रयास करना चाहिए।
जीएफपीजीएन के ‘सुधार’ बहुत ही सामान्य हैं, अक्सर व्यक्ति की पहचान को कमजोर करते हैं, और आमतौर पर छवि के किसी भी अन्य हिस्से की तुलना में कम प्रसंस्करण समय या ध्यान प्राप्त करते हैं।
इसलिए, एक पेशेवर-मानक कार्यक्रम स्टेबल डिफ्यूजन के लिए चेहरे को पहचान सकता है (एक मानक और अपेक्षाकृत हल्के पुस्तकालय जैसे योलो के साथ), उपलब्ध जीपीयू शक्ति का पूरा वजन चेहरे को फिर से रेंडर करने के लिए लागू कर सकता है, और फिर मूल पूर्ण-संदर्भ रेंडर में सुधारित चेहरे को मिला सकता है, या इसे अलग से बचा सकता है मैनुअल पुनर्संयोजन के लिए।

जब स्टेबल डिफ्यूजन को एक सेलिब्रिटी की पर्याप्त संख्या में छवियों पर प्रशिक्षित किया जाता है, तो संभव है कि प्रस्तुत छवि के चेहरे पर पूरी जीपीयू क्षमता को केंद्रित किया जा सकता है, जो आमतौर पर एक उल्लेखनीय सुधार है। – और जीएफपीजीएन के विपरीत, एलएआईओएन-प्रशिक्षित डेटा से जानकारी का उपयोग करता है, न कि केवल प्रस्तुत पिक्सल को समायोजित करता है।
इन-एप लेआयन खोज
जैसे ही उपयोगकर्ता यह महसूस करने लगे कि लेआयन डेटाबेस में खोज करना स्टेबल डिफ्यूजन का बेहतर उपयोग करने में मदद कर सकता है, कई ऑनलाइन लेआयन एक्सप्लोरर बनाए गए हैं, जिनमें हैवइबीनट्रेन्ड.कॉम शामिल हैं।

हैवइबीनट्रेन्ड.कॉम पर खोज फ़ंक्शन उपयोगकर्ताओं को स्टेबल डिफ्यूजन को शक्ति देने वाली छवियों का अन्वेषण करने और खोजने की अनुमति देता है कि क्या वे प्रॉम्प्ट देना चाहते हैं जो प्रणाली में प्रशिक्षित हो सकती है। ऐसी प्रणालियां संबंधित इकाइयों की खोज के लिए भी उपयोगी हैं, जैसे कि सेलिब्रिटी कैसे समूहीकृत हैं, या वर्तमान एक से आगे की ‘अगली अवधारणा’। स्रोत: https://haveibeentrained.com/?search_text=bowl%20of%20fruit
हालांकि ऐसे वेब-आधारित डेटाबेस अक्सर छवियों के साथ आने वाले टैग का खुलासा करते हैं, मॉडल प्रशिक्षण के दौरान होने वाली सामान्यीकरण की प्रक्रिया यह सुनिश्चित करती है कि कोई विशिष्ट छवि टैग का उपयोग करके बुलाई जा सकती है।
इसके अलावा, ‘स्टॉप शब्द’ को हटाने और प्राकृतिक भाषा प्रसंस्करण में स्टेमिंग और लेम्मेटाइजेशन का अभ्यास यह सुनिश्चित करता है कि कई वाक्यांश प्रदर्शित होने से पहले विभाजित या हटा दिए जाते हैं।
फिर भी, लेआयन में बंधे हुए सौंदर्य समूह इन इंटरफेस में कैसे बंधे हुए हैं, यह अंतिम उपयोगकर्ता को स्टेबल डिफ्यूजन के तर्क (या ‘व्यक्तित्व’) के बारे में बहुत कुछ सिखा सकता है, और बेहतर छवि उत्पादन में मदद कर सकता है।
निष्कर्ष
स्टेबल डिफ्यूजन के लिए एक पूर्ण मूल डेस्कटॉप कार्यान्वयन में मैं जिन अन्य सुविधाओं को देखना चाहूंगा, उनमें मूल स्टेबल डिफ्यूजन प्रक्रिया को उल्टा करने वाली सीएलआईपी-आधारित छवि विश्लेषण शामिल है, जो उपयोगकर्ता को स्रोत छवि से जुड़ी शब्दों और वाक्यांशों को प्राप्त करने की अनुमति देता है जो प्रणाली स्वाभाविक रूप से स्रोत छवि से जोड़ेगी।
इसके अलावा, वास्तविक टाइल-आधारित स्केलिंग एक स्वागत योग्य अतिरिक्त होगी, क्योंकि ईएसआरजीएन लगभग जीएफपीजीएन के रूप में एक ही ब्लंट उपकरण है। सौभाग्य से, जीओबीआईजी के कार्यान्वयन को एकीकृत करने की योजनाएं टेक्स्ट2इमघड तेजी से वितरण में वास्तविकता बना रही हैं, और यह एक डेस्कटॉप पुनरावृत्ति के लिए एक स्पष्ट विकल्प लगता है।
कुछ अन्य लोकप्रिय अनुरोध जो डिस्कोर्ड समुदायों में मुझे कम रुचिकर लगते हैं, उनमें एकीकृत प्रॉम्प्ट शब्दकोश और लागू कलाकारों और शैलियों की सूची शामिल हैं, हालांकि एक इन-एप नोटबुक या वाक्यांशों की अनुकूलन योग्य शब्दकोश जोड़ना एक तार्किक अतिरिक्त लगता है।
मानव-केंद्रित एनिमेशन में स्टेबल डिफ्यूजन की वर्तमान सीमाएं, हालांकि कोगवीडियो और विभिन्न अन्य परियोजनाओं द्वारा शुरू की गई हैं, अभी भी बहुत ही प्रारंभिक हैं, और मानव आंदोलन से संबंधित अस्थायी प्राथमिकताओं में आगामी शोध के लिए कमजोर हैं।
वर्तमान में, स्टेबल डिफ्यूजन वीडियो सख्ती से मनोवैज्ञानिक है, हालांकि यह एब्सिंथ और अन्य अपेक्षाकृत नए पाठ-से-वीडियो पहलों के माध्यम से गहरे प्रतिरूपण पुतली में एक उज्ज्वल भविष्य हो सकता है (और यह ध्यान देने योग्य है कि रनवे के 最新 प्रचार वीडियो में संशोधित लोगों की कमी है)।
एक और मूल्यवान कार्यक्षमता पारदर्शी फोटोशॉप पास-थ्रू होगी, जो सिनेमा 4डी के टेक्सचर एडिटर में पहले से ही स्थापित है, जो उपयोगकर्ता को छवियों को आसानी से अनुप्रयोगों के बीच स्थानांतरित करने की अनुमति देता है और प्रत्येक अनुप्रयोग को उन परिवर्तनों को करने देता है जिनमें यह उत्कृष्टता प्राप्त करता है।
अंत में, और शायद सबसे महत्वपूर्ण बात यह है कि एक पूर्ण डेस्कटॉप स्टेबल डिफ्यूजन प्रोग्राम में सक्षम होना चाहिए न केवल चेकपॉइंट (यानी, सिस्टम को शक्ति देने वाले मॉडल के संस्करण) के बीच आसानी से स्विच करने में सक्षम होना चाहिए, बल्कि पिछले आधिकारिक मॉडल रिलीज़ के साथ काम करने वाले कस्टम-निर्मित टेक्स्टुअल इनवर्जन को अपडेट करने में सक्षम होना चाहिए, जो बाद के मॉडल संस्करणों द्वारा तोड़ा जा सकता है (जैसा कि आधिकारिक डिस्कोर्ड में विकासकर्ताओं द्वारा संकेत दिया गया है)।
विडंबना यह है कि, स्टेबल डिफ्यूजन के लिए ऐसे शक्तिशाली और एकीकृत उपकरणों के मैट्रिक्स को बनाने के लिए स्थिति में सबसे अच्छा संगठन, एडोबे, ने खुद को कंटेंट ऑथेंटिकिटी इनिशिएटिव के साथ इतनी मजबूती से जोड़ लिया है कि यह कंपनी के लिए एक प्रतिगामी पीआर मिसस्टेप लग सकता है – जब तक कि यह स्टेबल डिफ्यूजन की उत्पन्न करने वाली शक्तियों को उतनी ही अच्छी तरह से अक्षम न कर दे जितना कि ओपनएआई ने डीएल-ई 2 के साथ किया है, और इसे इसके स्टॉक फोटोग्राफी में अपने व्यापक होल्डिंग्स के प्राकृतिक विकास के रूप में स्थिति में लाए।
15 सितंबर 2022 को पहली बार प्रकाशित।












