एआई मॉडल और प्लेटफ़ॉर्म
इंस्टेंटआईडी: ज़ीरो-शॉट पहचान-संरक्षण छवि पीढ़ी सेकंड में
एआई-संचालित छवि पीढ़ी प्रौद्योगिकी ने पिछले कुछ वर्षों में उल्लेखनीय विकास देखा है, जब से बड़े पाठ से छवि डिफ्यूजन मॉडल जैसे डीएलएल-ई, जीएलआईडीई, स्टेबल डिफ्यूजन, इमेजन और अधिक दृश्य में आए हैं। हालांकि छवि पीढ़ी एआई मॉडल में अद्वितीय वास्तुकला और प्रशिक्षण विधियाँ होती हैं, वे सभी एक सामान्य फोकस बिंदु साझा करते हैं: अनुकूलित और व्यक्तिगत छवि पीढ़ी, जो संदर्भ छवियों के आधार पर सुसंगत पात्र आईडी, विषय और शैली के साथ छवियों का निर्माण करने का लक्ष्य रखती है। अपनी उल्लेखनीय उत्पादक क्षमताओं के कारण, आधुनिक छवि पीढ़ी एआई फ्रेमवर्क ने छवि एनिमेशन, वर्चुअल रियलिटी, ई-कॉमर्स, एआई पोर्ट्रेट और अधिक जैसे क्षेत्रों में अनुप्रयोग पाए हैं। हालांकि, अपनी उल्लेखनीय उत्पादक क्षमताओं के बावजूद, इन फ्रेमवर्क में से अधिकांश एक सामान्य बाधा साझा करते हैं: वे अक्सर मानव विषयों की सूक्ष्म विवरणों को संरक्षित करते हुए अनुकूलित छवियों का निर्माण करने में असमर्थ होते हैं।
सूक्ष्म विवरणों के साथ अनुकूलित छवियों का निर्माण करना विशेष रूप से मानव चेहरे पहचान कार्यों में महत्वपूर्ण है, जिनमें उच्च विश्वासता और विवरण का उच्च मानक आवश्यक होता है, और सामान्य वस्तु छवि पीढ़ी कार्यों की तुलना में अधिक उन्नत अर्थव्यवस्था और सूक्ष्म विवरण की आवश्यकता होती है। इसके अलावा, हाल के वर्षों में व्यक्तिगत छवि संश्लेषण फ्रेमवर्क जैसे लोरा, ड्रीमबूथ, टेक्स्टुअल इनवर्जन और अधिक में काफी प्रगति हुई है। हालांकि, व्यक्तिगत छवि उत्पादक एआई मॉडल अभी भी वास्तविक दुनिया के दृश्यों में तैनाती के लिए परिपूर्ण नहीं हैं, क्योंकि उन्हें उच्च भंडारण आवश्यकता होती है, उन्हें कई संदर्भ छवियों की आवश्यकता होती है, और उनमें अक्सर एक लंबी फाइन-ट्यूनिंग प्रक्रिया होती है। दूसरी ओर, हालांकि मौजूदा आईडी-एम्बेडिंग आधारित विधियों को केवल एक ही आगे संदर्भ की आवश्यकता होती है, वे या तो सार्वजनिक रूप से उपलब्ध पूर्व-प्रशिक्षित मॉडल के साथ संगतता की कमी होती है, या उन्हें कई पैरामीटरों में एक अत्यधिक फाइन-ट्यूनिंग प्रक्रिया की आवश्यकता होती है, या वे उच्च चेहरे की विश्वासता को बनाए रखने में विफल रहते हैं।
इन चुनौतियों का सामना करने के लिए, और छवि पीढ़ी क्षमताओं को और बढ़ाने के लिए, इस लेख में, हम इंस्टेंटआईडी के बारे में बात करेंगे, जो एक डिफ्यूजन मॉडल आधारित समाधान है जो छवि पीढ़ी के लिए है। इंस्टेंटआईडी एक प्लग और प्ले मॉड्यूल है जो विभिन्न शैलियों में छवि पीढ़ी और व्यक्तिगतकरण को कुशलता से संभालता है, केवल एक ही संदर्भ छवि के साथ, और उच्च विश्वासता भी सुनिश्चित करता है। इस लेख का प्राथमिक उद्देश्य पाठकों को इंस्टेंटआईडी फ्रेमवर्क के तकनीकी आधार और घटकों की एक विस्तृत समझ प्रदान करना है, क्योंकि हम मॉडल की वास्तुकला, प्रशिक्षण प्रक्रिया और अनुप्रयोग दृश्यों का एक विस्तृत अवलोकन करेंगे। तो आइए शुरू करें।
इंस्टेंटआईडी: ज़ीरो-शॉट पहचान-संरक्षण छवि पीढ़ी
पाठ से छवि डिफ्यूजन मॉडल के उद्भव ने छवि पीढ़ी प्रौद्योगिकी के विकास में महत्वपूर्ण योगदान दिया है। इन मॉडलों का प्राथमिक उद्देश्य अनुकूलित और व्यक्तिगत पीढ़ी है, और एक या अधिक संदर्भ छवियों का उपयोग करके सुसंगत विषय, शैली और पात्र आईडी के साथ छवियों का निर्माण करना है। इन फ्रेमवर्क की सुसंगत छवियों का निर्माण करने की क्षमता ने विभिन्न उद्योगों में संभावित अनुप्रयोग पैदा किए हैं, जिनमें छवि एनिमेशन, एआई पोर्ट्रेट पीढ़ी, ई-कॉमर्स, वर्चुअल और ऑगमेंटेड रियलिटी और बहुत कुछ शामिल हैं।
हालांकि, अपनी उल्लेखनीय क्षमताओं के बावजूद, इन फ्रेमवर्क का सामना एक मूलभूत चुनौती से होता है: वे अक्सर मानव विषयों की सूक्ष्म विवरणों को संरक्षित करते हुए अनुकूलित छवियों का निर्माण करने में असमर्थ होते हैं। यह ध्यान रखना उचित है कि सूक्ष्म विवरणों के साथ अनुकूलित छवियों का निर्माण करना एक चुनौतीपूर्ण कार्य है, क्योंकि मानव चेहरे पहचान को उच्च विश्वासता और विवरण की उच्च डिग्री की आवश्यकता होती है, साथ ही सामान्य वस्तुओं या शैलियों की तुलना में अधिक उन्नत अर्थव्यवस्था की आवश्यकता होती है जो मुख्य रूप से रंगों या खुरदरे दाने वाले बनावट पर केंद्रित होती हैं। मौजूदा पाठ से छवि मॉडल विस्तृत पाठ विवरण पर निर्भर करते हैं, और वे अनुकूलित छवि पीढ़ी के लिए मजबूत अर्थव्यवस्था प्राप्त करने में संघर्ष करते हैं। इसके अलावा, कुछ बड़े पूर्व-प्रशिक्षित पाठ से छवि फ्रेमवर्क स्थानिक नियंत्रण नियंत्रण जोड़ते हैं ताकि नियंत्रणीयता में सुधार हो, जो शरीर की मुद्रा, गहराई मानचित्र, उपयोगकर्ता-ड्रॉइन स्केच, सेमांटिक सेगमेंटेशन मानचित्र और अधिक जैसे तत्वों का उपयोग करके सूक्ष्म संरचनात्मक नियंत्रण की सुविधा प्रदान करे। हालांकि, इन जोड़ों और सुधारों के बावजूद, इन फ्रेमवर्क को केवल आंशिक विश्वासता प्राप्त करने में सक्षम होते हैं जो उत्पन्न छवि को संदर्भ छवि से मेल खाती है।
इन बाधाओं को पार करने के लिए, इंस्टेंटआईडी फ्रेमवर्क तात्कालिक पहचान-संरक्षण छवि संश्लेषण पर केंद्रित है, और एक सरल प्लग और प्ले मॉड्यूल पेश करता है जो फ्रेमवर्क को केवल एक ही चेहरे की छवि का उपयोग करके छवि व्यक्तिगतकरण को संभालने की अनुमति देता है, जबकि उच्च विश्वासता बनाए रखता है। इसके अलावा, संदर्भ छवि से चेहरे की पहचान को संरक्षित करने के लिए, इंस्टेंटआईडी फ्रेमवर्क एक नई चेहरे के एनकोडर को लागू करता है जो छवि पीढ़ी प्रक्रिया को मार्गदर्शन करने के लिए पाठ प्रॉम्प्ट, लैंडमार्क छवि और चेहरे की छवि को एकीकृत करके छवि के सूक्ष्म विवरणों को बनाए रखने के लिए कमजोर स्थानिक और मजबूत अर्थव्यवस्था की स्थिति जोड़ता है।
इंस्टेंटआईडी फ्रेमवर्क की तीन विशिष्ट विशेषताएं हैं जो इसे मौजूदा पाठ से छवि पीढ़ी फ्रेमवर्क से अलग करती हैं:
- संगतता और प्लगबिलिटी: यूएनेट फ्रेमवर्क के पूर्ण पैरामीटरों पर प्रशिक्षण के बजाय, इंस्टेंटआईडी फ्रेमवर्क एक हल्के एडेप्टर पर प्रशिक्षण पर केंद्रित है। इसके परिणामस्वरूप, इंस्टेंटआईडी फ्रेमवर्क मौजूदा पूर्व-प्रशिक्षित मॉडल के साथ संगत और प्लगबिल है।
- ट्यूनिंग-मुक्त: इंस्टेंटआईडी फ्रेमवर्क की विधि फाइन-ट्यूनिंग की आवश्यकता को समाप्त करती है, क्योंकि यह केवल एक ही आगे प्रसार के लिए आवश्यक है, जिससे मॉडल उच्च व्यावहारिक और आर्थिक रूप से फाइन-ट्यूनिंग के लिए उपयुक्त हो जाता है।
- उच्च प्रदर्शन: इंस्टेंटआईडी फ्रेमवर्क उच्च लचीलापन और विश्वासता प्रदर्शित करता है, क्योंकि यह केवल एक ही संदर्भ छवि का उपयोग करके राज्य-कला प्रदर्शन प्रदान करने में सक्षम है, जो प्रशिक्षण-आधारित विधियों के समान है जो कई संदर्भ छवियों पर निर्भर करती हैं।
कुल मिलाकर, इंस्टेंटआईडी फ्रेमवर्क के योगदान निम्नलिखित बिंदुओं में वर्गीकृत किए जा सकते हैं:
- इंस्टेंटआईडी फ्रेमवर्क एक नवाचारी पहचान-संरक्षण अनुकूलन विधि है जो पूर्व-प्रशिक्षित पाठ से छवि डिफ्यूजन मॉडल के लिए है, जिसका उद्देश्य दक्षता और विश्वासता के बीच की खाई को पाटना है।
- इंस्टेंटआईडी फ्रेमवर्क मौजूदा पूर्व-प्रशिक्षित मॉडल के साथ संगत और प्लगबिल है, जो पहचान संरक्षण को सुनिश्चित करता है बिना किसी अतिरिक्त लागत के।
इंस्टेंटआईडी: विधि और वास्तुकला
जैसा कि पहले उल्लेख किया गया है, इंस्टेंटआईडी फ्रेमवर्क एक कुशल हल्के एडेप्टर है जो पूर्व-प्रशिक्षित पाठ से छवि डिफ्यूजन मॉडल को पहचान संरक्षण क्षमताओं से सुसज्जित करता है।
वास्तुकला के बारे में बात करते हुए, इंस्टेंटआईडी फ्रेमवर्क स्टेबल डिफ्यूजन मॉडल पर बनाया गया है, जो अपनी कम्प्यूटेशनल दक्षता के लिए जाना जाता है जो एक कम-आयामी लेटेंट स्पेस में डिफ्यूजन प्रक्रिया को पूरा करता है, न कि पिक्सेल स्पेस में एक ऑटो-एनकोडर के साथ। एक इनपुट छवि के लिए, एनकोडर पहले छवि को एक लेटेंट प्रतिनिधित्व में मैप करता है जिसमें डाउनसैम्पलिंग कारक और लेटेंट आयाम होते हैं। इसके अलावा, एक सामान्य रूप से वितरित शोर को शोरयुक्त लेटेंट, स्थिति और वर्तमान टाइमस्टेप के साथ डीनोइज़ करने के लिए, डिफ्यूजन प्रक्रिया एक डीनोइज़िंग यूएनेट घटक को अपनाती है। स्थिति एक पूर्व-प्रशिक्षित सीएलआईपी पाठ एनकोडर घटक द्वारा उत्पन्न पाठ प्रॉम्प्ट का एक एम्बेडिंग है।
इसके अलावा, इंस्टेंटआईडी फ्रेमवर्क एक कंट्रोलनेट घटक का भी उपयोग करता है जो एक पूर्व-प्रशिक्षित डिफ्यूजन मॉडल में स्थानिक नियंत्रण जोड़ने में सक्षम है, जो पारंपरिक पाठ प्रॉम्प्ट की क्षमताओं से परे है। कंट्रोलनेट घटक स्टेबल डिफ्यूजन फ्रेमवर्क से यूएनेट वास्तुकला को एक प्रशिक्षित प्रतिलिपि का उपयोग करके एकीकृत करता है। प्रतिलिपि यूएनेट घटक में मध्य ब्लॉक और एनकोडर ब्लॉक में शून्य कन्वोल्यूशनल परतें होती हैं। हालांकि वे समान हैं, कंट्रोलनेट घटक और स्टेबल डिफ्यूजन मॉडल में अंतर है, जो बाद के शेष आइटम में है। कंट्रोलनेट घटक स्थानिक स्थिति जानकारी जैसे मुद्रा, गहराई मानचित्र, स्केच और अधिक को यूएनेट ब्लॉक में शेष जोड़कर एन्कोड करता है, और फिर इन शेष को मूल नेटवर्क में एम्बेड करता है।
इंस्टेंटआईडी फ्रेमवर्क आईपी-एडेप्टर या इमेज प्रॉम्प्ट एडेप्टर से भी प्रेरणा लेता है, जो छवि प्रॉम्प्ट क्षमताओं को प्राप्त करने के लिए एक नई दृष्टिकोण पेश करता है जो पाठ प्रॉम्प्ट के साथ समानांतर चलती है, बिना मूल पाठ से छवि मॉडल को संशोधित किए। आईपी-एडेप्टर घटक एक अनोखी डिकपल्ड क्रॉस-एटेंशन रणनीति का उपयोग करता है जो अतिरिक्त क्रॉस-एटेंशन परतों का उपयोग करके छवि विशेषताओं को एम्बेड करता है, जबकि अन्य पैरामीटर अपरिवर्तित रहते हैं।
विधि
एक संक्षिप्त अवलोकन देने के लिए, इंस्टेंटआईडी फ्रेमवर्क का उद्देश्य एक ही संदर्भ आईडी छवि का उपयोग करके विभिन्न शैलियों या मुद्राओं में अनुकूलित छवियों का निर्माण करना है, उच्च विश्वासता के साथ। निम्नलिखित चित्र इंस्टेंटआईडी फ्रेमवर्क का एक संक्षिप्त अवलोकन प्रदान करता है:

जैसा कि देखा जा सकता है, इंस्टेंटआईडी फ्रेमवर्क में तीन मुख्य घटक हैं:
- एक आईडी एम्बेडिंग घटक जो छवि में चेहरे की विशेषताओं की मजबूत अर्थव्यवस्था जानकारी को पकड़ता है।
- एक हल्के एडेप्टेड मॉड्यूल जो एक डिकपल्ड क्रॉस-एटेंशन घटक के साथ छवि का उपयोग एक दृश्य प्रॉम्प्ट के रूप में सुविधा प्रदान करता है।
- एक आइडेंटिटीनेट घटक जो संदर्भ छवि से विस्तृत विशेषताओं को एन्कोड करता है, अतिरिक्त स्थानिक नियंत्रण का उपयोग करता है।
आईडी एम्बेडिंग
मौजूदा विधियों के विपरीत, जैसे कि फेसस्टूडियो, फोटोमेकर, आईपी-एडेप्टर और अधिक, जो एक पूर्व-प्रशिक्षित सीएलआईपी छवि एनकोडर पर निर्भर करते हैं ताकि दृश्य प्रॉम्प्ट निकाले जा सकें, इंस्टेंटआईडी फ्रेमवर्क पहचान संरक्षण कार्य में बढ़ी हुई विश्वासता और मजबूत अर्थव्यवस्था विवरण पर केंद्रित है। यह ध्यान रखना उचित है कि सीएलआईपी घटक की अंतर्निहित सीमाएं मुख्य रूप से इसकी प्रशिक्षण प्रक्रिया में कमजोर रूप से संरेखित डेटा पर होती हैं, जिसका अर्थ है कि सीएलआईपी एनकोडर द्वारा एन्कोड की गई विशेषताएं मुख्य रूप से व्यापक और अस्पष्ट अर्थव्यवस्था जानकारी जैसे रंग, शैली और संरचना को पकड़ती हैं। हालांकि ये विशेषताएं पाठ एम्बेडिंग के लिए सामान्य पूरक के रूप में कार्य कर सकती हैं, वे सटीक पहचान संरक्षण कार्यों के लिए उपयुक्त नहीं हैं जो मजबूत अर्थव्यवस्था और उच्च विश्वासता पर जोर देते हैं। इसके अलावा, हाल के शोधों ने चेहरे के प्रतिनिधित्व मॉडल की प्रभावशीलता को चेहरे की पहचान और पुनर्निर्माण जैसे जटिल कार्यों में प्रदर्शित किया है। इसी पर आधारित, इंस्टेंटआईडी फ्रेमवर्क एक पूर्व-प्रशिक्षित चेहरे मॉडल का लाभ उठाने का प्रयास करता है ताकि संदर्भ छवि से चेहरे की पहचान एम्बेडिंग का पता लगाया जा सके और निकाला जा सके, जो छवि पीढ़ी के लिए मॉडल को मार्गदर्शन करने में मदद करता है।
इमेज एडेप्टर
पूर्व-प्रशिक्षित पाठ से छवि डिफ्यूजन मॉडल की छवि प्रॉम्प्ट कार्यों में क्षमता पाठ प्रॉम्प्ट को बढ़ाती है, विशेष रूप से उन दृश्यों में जहां पाठ प्रॉम्प्ट द्वारा पर्याप्त रूप से वर्णित नहीं किया जा सकता है। इंस्टेंटआईडी फ्रेमवर्क आईपी-एडेप्टर मॉडल द्वारा उपयोग की जाने वाली रणनीति को अपनाता है, जो छवि प्रॉम्प्ट क्षमताओं को प्राप्त करने के लिए एक हल्के अनुकूली मॉड्यूल को पेश करता है, जो एक डिकपल्ड क्रॉस-एटेंशन घटक के साथ जुड़ा होता है ताकि छवियों को इनपुट प्रॉम्प्ट के रूप में समर्थन मिल सके। हालांकि, सीएलआईपी एम्बेडिंग के विपरीत, इंस्टेंटआईडी फ्रेमवर्क आईडी एम्बेडिंग को छवि प्रॉम्प्ट के रूप में उपयोग करने से विचलित होता है, जो एक अधिक अर्थव्यवस्था और सूक्ष्म प्रॉम्प्ट एकीकरण का प्रयास करता है।
आइडेंटिटीनेट
हालांकि मौजूदा विधियां छवि प्रॉम्प्ट को पाठ प्रॉम्प्ट के साथ एकीकृत करने में सक्षम हैं, इंस्टेंटआईडी फ्रेमवर्क का तर्क है कि ये विधियां केवल खुरदरे दाने वाली विशेषताओं को बढ़ाती हैं, जो पहचान संरक्षण छवि पीढ़ी के लिए पर्याप्त एकीकरण स्तर प्रदान नहीं करती हैं। इसके अलावा, पाठ टोकन और छवि टोकन को सीधे क्रॉस-एटेंशन परतों में जोड़ने से पाठ टोकन के नियंत्रण को कमजोर कर सकता है, और छवि टोकन की ताकत को बढ़ाने का प्रयास करने से पाठ टोकन की संपादन क्षमताओं को बाधित किया जा सकता है। इन चुनौतियों का सामना करने के लिए, इंस्टेंटआईडी फ्रेमवर्क कंट्रोलनेट का विकल्प चुनता है, जो एक विशेष सुविधा एम्बेडिंग विधि है जो स्थानिक जानकारी को इनपुट के रूप में उपयोग करती है, जो यूएनेट सेटिंग्स के साथ संगतता बनाए रखने की अनुमति देती है।
इंस्टेंटआईडी फ्रेमवर्क पारंपरिक कंट्रोलनेट वास्तुकला में दो परिवर्तन करता है: स्थितिगत इनपुट के लिए, इंस्टेंटआईडी फ्रेमवर्क 5 चेहरे की कुंजी बिंदुओं का उपयोग करता है, न कि खुरदरे दाने वाले ओपनपोज़ चेहरे की कुंजी बिंदुओं का। दूसरा, इंस्टेंटआईडी फ्रेमवर्क कंट्रोलनेट वास्तुकला में क्रॉस-एटेंशन परतों के लिए स्थितियों के रूप में आईडी एम्बेडिंग का उपयोग करता है, न कि पाठ प्रॉम्प्ट।
प्रशिक्षण और अनुमान
प्रशिक्षण चरण के दौरान, इंस्टेंटआईडी फ्रेमवर्क आइडेंटिटीनेट और इमेज एडेप्टर के पैरामीटर को अनुकूलित करता है, जबकि पूर्व-प्रशिक्षित डिफ्यूजन मॉडल के पैरामीटर को जमा देता है। पूरा इंस्टेंटआईडी पाइपलाइन मानव विषयों वाले छवि-पाठ जोड़ों पर प्रशिक्षित होता है और स्टेबल डिफ्यूजन फ्रेमवर्क में उपयोग किए जाने वाले कार्य-विशिष्ट छवि स्थितियों के साथ एक प्रशिक्षण उद्देश्य को नियोजित करता है। इंस्टेंटआईडी प्रशिक्षण विधि का मुख्य आकर्षण छवि और पाठ क्रॉस-एटेंशन परतों के बीच पृथक्करण है, जो इंस्टेंटआईडी फ्रेमवर्क को छवि स्थितियों के वजन को लचीले और स्वतंत्र रूप से समायोजित करने की अनुमति देता है, जिससे अधिक लक्षित और नियंत्रित प्रशिक्षण और अनुमान प्रक्रिया सुनिश्चित होती है।
इंस्टेंटआईडी: प्रयोग और परिणाम
इंस्टेंटआईडी फ्रेमवर्क स्टेबल डिफ्यूजन और लायोन-फेस पर प्रशिक्षित होता है, जो 50 मिलियन से अधिक छवि-पाठ जोड़ों वाला एक बड़ा खुला स्रोत डेटासेट है। इसके अलावा, इंस्टेंटआईडी फ्रेमवर्क बीएलआईपी2 मॉडल द्वारा स्वचालित रूप से उत्पन्न 10 मिलियन से अधिक मानव छवियों को एकत्र करता है ताकि छवि पीढ़ी की गुणवत्ता में सुधार किया जा सके। इंस्टेंटआईडी फ्रेमवर्क मुख्य रूप से एकल-व्यक्ति छवियों पर केंद्रित है, और एक पूर्व-प्रशिक्षित चेहरे मॉडल का उपयोग करके मानव छवियों से चेहरे की पहचान एम्बेडिंग का पता लगाने और निकालने के लिए उपयोग किया जाता है, और प्रशिक्षण के दौरान, इंस्टेंटआईडी फ्रेमवर्क पूर्व-प्रशिक्षित पाठ से छवि मॉडल को जमा देता है और केवल आइडेंटिटीनेट और इमेज एडेप्टर के पैरामीटर को अद्यतन करता है।
केवल छवि पीढ़ी
इंस्टेंटआईडी मॉडल एक खाली प्रॉम्प्ट का उपयोग करके छवि पीढ़ी प्रक्रिया को निर्देशित करता है, केवल संदर्भ छवि का उपयोग करके, और निम्नलिखित छवि में परिणामों को प्रदर्शित किया जाता है:

खाली प्रॉम्प्ट के साथ पीढ़ी के रूप में ऊपर दिखाया गया है, इंस्टेंटआईडी फ्रेमवर्क की क्षमता को दर्शाता है जो समृद्ध अर्थव्यवस्था चेहरे की विशेषताओं जैसे पहचान, आयु और अभिव्यक्ति को मजबूती से बनाए रखने में सक्षम है। हालांकि, यह ध्यान रखना उचित है कि खाली प्रॉम्प्ट का उपयोग करने से लिंग जैसी अन्य अर्थव्यवस्था को सटीक रूप से पुनरुत्पादित नहीं किया जा सकता है। इसके अलावा, ऊपर दिखाए गए छवि में, स्तंभ 2 से 4 एक छवि और एक प्रॉम्प्ट का उपयोग करते हैं, और जैसा कि देखा जा सकता है, उत्पन्न छवि में पाठ नियंत्रण क्षमताओं में कोई गिरावट नहीं है, और पहचान संगति भी सुनिश्चित करती है। अंत में, स्तंभ 5 से 9 एक छवि, एक प्रॉम्प्ट और स्थानिक नियंत्रण का उपयोग करते हैं, जो मॉडल की पूर्व-प्रशिक्षित स्थानिक नियंत्रण मॉडल के साथ संगतता को प्रदर्शित करते हैं, जो इंस्टेंटआईडी मॉडल को एक पूर्व-प्रशिक्षित कंट्रोलनेट घटक का उपयोग करके स्थानिक नियंत्रण को लचीले रूप से पेश करने की अनुमति देता है।

यह भी ध्यान रखना उचित है कि संदर्भ छवियों की संख्या उत्पन्न छवि पर महत्वपूर्ण प्रभाव डालती है, जैसा कि ऊपर दिखाया गया है। हालांकि इंस्टेंटआईडी फ्रेमवर्क एक ही संदर्भ छवि का उपयोग करके अच्छे परिणाम प्रदान करने में सक्षम है, कई संदर्भ छवियों का उपयोग करने से उच्च गुणवत्ता वाली छवि उत्पन्न होती है, क्योंकि इंस्टेंटआईडी फ्रेमवर्क आईडी एम्बेडिंग के औसत मान को छवि प्रॉम्प्ट के रूप में उपयोग करता है। आगे बढ़ते हुए, यह आवश्यक है कि इंस्टेंटआईडी फ्रेमवर्क की तुलना पिछली विधियों से की जाए जो एक ही संदर्भ छवि का उपयोग करके व्यक्तिगत छवियों का निर्माण करती हैं। निम्नलिखित छवि इंस्टेंटआईडी फ्रेमवर्क और मौजूदा राज्य-कला मॉडल के बीच एकल संदर्भ अनुकूलित छवि पीढ़ी के लिए परिणामों की तुलना करती है:

जैसा कि देखा जा सकता है, इंस्टेंटआईडी फ्रेमवर्क चेहरे की विशेषताओं को संरक्षित करने में सक्षम है, क्योंकि आईडी एम्बेडिंग में समृद्ध अर्थव्यवस्था जानकारी होती है, जैसे पहचान, आयु और लिंग। यह कहा जा सकता है कि इंस्टेंटआईडी फ्रेमवर्क अनुकूलित छवि पीढ़ी में मौजूदा फ्रेमवर्क से बेहतर प्रदर्शन करता है, क्योंकि यह मानव पहचान को संरक्षित करते हुए नियंत्रण और शैली लचीलापन बनाए रखने में सक्षम है।

अंतिम विचार
इस लेख में, हमने इंस्टेंटआईडी के बारे में बात की है, जो एक डिफ्यूजन मॉडल आधारित समाधान है जो छवि पीढ़ी के लिए है। इंस्टेंटआईडी एक प्लग और प्ले मॉड्यूल है जो विभिन्न शैलियों में छवि पीढ़ी और व्यक्तिगतकरण को कुशलता से संभालता है, केवल एक ही संदर्भ छवि का उपयोग करके, और उच्च विश्वासता भी सुनिश्चित करता है। इंस्टेंटआईडी फ्रेमवर्क तात्कालिक पहचान-संरक्षण छवि संश्लेषण पर केंद्रित है, और एक सरल प्लग और प्ले मॉड्यूल पेश करता है जो फ्रेमवर्क को केवल एक ही चेहरे की छवि का उपयोग करके छवि व्यक्तिगतकरण को संभालने की अनुमति देता है, जबकि उच्च विश्वासता बनाए रखता है।












