एआई मॉडल और प्लेटफ़ॉर्म
ज़ीरो123++: एक एकल छवि से सुसंगत बहुस्तरीय विसर्जन आधार मॉडल

पिछले कुछ वर्षों में, हमने उभरते हुए नए एआई जनरेटिव मॉडल के प्रदर्शन, दक्षता और जनरेटिव क्षमताओं में तेजी से प्रगति देखी है, जो व्यापक डेटासेट और 2डी विसर्जन पीढ़ी के अभ्यासों का लाभ उठाते हैं। आजकल, जनरेटिव एआई मॉडल 2डी, और कुछ हद तक, 3डी मीडिया सामग्री सहित विभिन्न प्रकार के पाठ, छवियों, वीडियो, जीआईएफ और अधिक का उत्पादन करने में अत्यधिक सक्षम हैं।
इस लेख में, हम ज़ीरो123++ फ्रेमवर्क के बारे में चर्चा करेंगे, जो एक छवि-स्थित विसर्जन जनरेटिव एआई मॉडल है जिसका उद्देश्य एक एकल दृश्य इनपुट का उपयोग करके 3डी-सुसंगत बहुस्तरीय छवियों का उत्पादन करना है। पूर्व-प्रशिक्षित जनरेटिव मॉडल से लाभ प्राप्त करने के लिए, ज़ीरो123++ फ्रेमवर्क विभिन्न प्रशिक्षण और स्थिति योजनाओं को लागू करता है ताकि ऑफ-द-शेल्फ विसर्जन छवि मॉडल से फाइन-ट्यूनिंग के लिए आवश्यक प्रयास को कम किया जा सके। हम ज़ीरो123++ फ्रेमवर्क की वास्तुकला, कार्य और परिणामों का गहन विश्लेषण करेंगे, और इसकी क्षमताओं का विश्लेषण करेंगे कि यह एक एकल छवि से उच्च गुणवत्ता वाली सुसंगत बहुस्तरीय छवियों का उत्पादन कर सकता है या नहीं। तो आइए शुरू करें।
ज़ीरो123 और ज़ीरो123++: एक परिचय
ज़ीरो123++ फ्रेमवर्क एक छवि-स्थित विसर्जन जनरेटिव एआई मॉडल है जिसका उद्देश्य एक एकल दृश्य इनपुट का उपयोग करके 3डी-सुसंगत बहुस्तरीय छवियों का उत्पादन करना है। ज़ीरो123++ फ्रेमवर्क ज़ीरो123 या ज़ीरो-1-टू-3 फ्रेमवर्क का विस्तार है, जो शून्य-शॉट नई दृश्य छवि संश्लेषण तकनीक का लाभ उठाता है ताकि खुला स्रोत एकल-छवि-से-3डी रूपांतरण का पioneering किया जा सके। हालांकि ज़ीरो123++ फ्रेमवर्क आशाजनक प्रदर्शन प्रदान करता है, फ्रेमवर्क द्वारा उत्पादित छवियों में दृश्य ज्यामितीय असंगतियां देखी जा सकती हैं, और यही कारण है कि 3डी दृश्यों और बहुस्तरीय छवियों के बीच अंतर अभी भी मौजूद है।
ज़ीरो-1-टू-3 फ्रेमवर्क कई अन्य फ्रेमवर्क के लिए आधार के रूप में कार्य करता है, जिनमें सिंकड्रीमर, वन-2-3-45, कंसिस्टेंट123 और अधिक शामिल हैं, जो ज़ीरो123 फ्रेमवर्क में अतिरिक्त परतें जोड़ते हैं ताकि 3डी छवियों के उत्पादन के दौरान अधिक सुसंगत परिणाम प्राप्त किए जा सकें। अन्य फ्रेमवर्क जैसे प्रोलिफिकड्रीमर, ड्रीमफ्यूजन, ड्रीमगॉसियन और अधिक एक अनुकूलन-आधारित दृष्टिकोण का पालन करते हैं ताकि विभिन्न असंगत मॉडल से 3डी छवियों को प्राप्त किया जा सके। हालांकि ये तकनीकें प्रभावी हैं और वे संतोषजनक 3डी छवियों का उत्पादन करती हैं, परिणामों में सुधार के लिए एक आधार विसर्जन मॉडल की आवश्यकता है जो सुसंगत बहुस्तरीय छवियों का उत्पादन कर सकता है। तदनुसार, ज़ीरो123++ फ्रेमवर्क ज़ीरो-1-टू-3 और स्टेबल विसर्जन से एक नया बहुस्तरीय आधार विसर्जन मॉडल को फाइन-ट्यून करता है।
ज़ीरो-1-टू-3 फ्रेमवर्क में, प्रत्येक नई दृश्य स्वतंत्र रूप से उत्पादित की जाती है, और यह दृष्टिकोण दृश्यों के बीच असंगतियों की ओर ले जाता है क्योंकि विसर्जन मॉडल में एक नमूना स्वभाव होता है। इस समस्या को हल करने के लिए, ज़ीरो123++ फ्रेमवर्क एक टाइलिंग लेआउट दृष्टिकोण को अपनाता है, जिसमें वस्तु को छह दृश्यों के साथ एक छवि में घेरा जाता है, और वस्तु की बहुस्तरीय छवियों के संयुक्त वितरण के लिए सही मॉडलिंग सुनिश्चित की जाती है।
ज़ीरो-1-टू-3 फ्रेमवर्क पर काम करने वाले डेवलपर्स के सामने एक और बड़ी चुनौती यह है कि यह स्टेबल विसर्जन द्वारा प्रदान की जाने वाली क्षमताओं का उपयोग कम करता है, जिससे अक्षमता और अतिरिक्त लागतें बढ़ जाती हैं। ज़ीरो-1-टू-3 फ्रेमवर्क स्टेबल विसर्जन की क्षमताओं का अधिकतम उपयोग नहीं कर पाता है, इसके दो मुख्य कारण हैं:
- जब छवि स्थितियों के साथ प्रशिक्षण दिया जाता है, तो ज़ीरो-1-टू-3 फ्रेमवर्क स्टेबल विसर्जन द्वारा प्रदान की जाने वाली स्थानीय या वैश्विक स्थिति तंत्र को प्रभावी ढंग से शामिल नहीं करता है।
- प्रशिक्षण के दौरान, ज़ीरो-1-टू-3 फ्रेमवर्क कम रिज़ॉल्यूशन का उपयोग करता है, जिसमें आउटपुट रिज़ॉल्यूशन को प्रशिक्षण रिज़ॉल्यूशन से नीचे कम किया जाता है, जिससे स्टेबल विसर्जन मॉडल के लिए छवि पीढ़ी की गुणवत्ता कम हो सकती है।
इन समस्याओं को हल करने के लिए, ज़ीरो123++ फ्रेमवर्क स्टेबल विसर्जन द्वारा प्रदान की जाने वाली संसाधनों का उपयोग अधिकतम करने और स्टेबल विसर्जन मॉडल के लिए छवि पीढ़ी की गुणवत्ता को बनाए रखने के लिए विभिन्न स्थिति तकनीकों को लागू करता है।
स्थिति और सुसंगतता में सुधार
छवि स्थिति और बहुस्तरीय छवि सुसंगतता में सुधार करने के प्रयास में, ज़ीरो123++ फ्रेमवर्क ने विभिन्न तकनीकों को लागू किया है, जिसका प्राथमिक उद्देश्य पूर्व-प्रशिक्षित स्टेबल विसर्जन मॉडल से पूर्व तकनीकों का पुन: उपयोग करना है।
बहुस्तरीय पीढ़ी
सुसंगत बहुस्तरीय छवियों का उत्पादन करने की अपरिहार्य गुणवत्ता बहुस्तरीय छवियों के संयुक्त वितरण को सही ढंग से मॉडलिंग करने में निहित है। ज़ीरो-1-टू-3 फ्रेमवर्क में, बहुस्तरीय छवियों के बीच संबंध को नजरअंदाज किया जाता है क्योंकि प्रत्येक छवि के लिए फ्रेमवर्क स्वतंत्र रूप से और अलग से सशर्त मार्जिनल वितरण को मॉडल करता है। हालांकि, ज़ीरो123++ फ्रेमवर्क में, डेवलपर्स ने एक टाइलिंग लेआउट दृष्टिकोण का चयन किया है जो 6 छवियों को एक फ्रेम/छवि में टाइल करता है ताकि सुसंगत बहुस्तरीय पीढ़ी की जा सके, और यह प्रक्रिया निम्नलिखित छवि में प्रदर्शित की जाती है।

इसके अलावा, यह देखा गया है कि वस्तु दिशाएं प्रशिक्षण मॉडल को कैमरा पोज़ पर प्रशिक्षित करने के दौरान अस्पष्ट हो जाती हैं, और इस अस्पष्टता को रोकने के लिए, ज़ीरो-1-टू-3 फ्रेमवर्क कैमरा पोज़ के साथ प्रशिक्षित किया जाता है जिसमें उन्नति कोण और सापेक्ष अजीमुथ इनपुट दृश्य के लिए होता है। इस दृष्टिकोण को लागू करने के लिए, यह जानना आवश्यक है कि इनपुट दृश्य का उन्नति कोण क्या है, जो तब नोवेल इनपुट दृश्यों के बीच सापेक्ष मुद्रा को निर्धारित करने के लिए उपयोग किया जाता है। एक उन्नति अनुमान मॉड्यूल जोड़कर इस उन्नति कोण को जानने का प्रयास किया जाता है, और यह दृष्टिकोण अक्सर पाइपलाइन में अतिरिक्त त्रुटियों के साथ आता है।
शोर अनुसूची
स्केल्ड-लीनियर अनुसूची, स्टेबल विसर्जन के लिए मूल शोर अनुसूची, मुख्य रूप से स्थानीय विवरण पर केंद्रित है, लेकिन जैसा कि निम्नलिखित छवि में देखा जा सकता है, इसमें कम एसएनआर या सिग्नल-टू-शोर अनुपात के साथ बहुत कम कदम हैं।

इन कम सिग्नल-टू-शोर अनुपात के साथ कदम देनोइज़िंग चरण के दौरान होते हैं, जो वैश्विक निम्न-आवृत्ति संरचना को निर्धारित करने के लिए महत्वपूर्ण है। देनोइज़िंग चरण के दौरान, हस्तक्षेप या प्रशिक्षण के दौरान कदमों की संख्या को कम करने से संरचनात्मक भिन्नता में वृद्धि हो सकती है। हालांकि यह सेटअप एकल-छवि पीढ़ी के लिए आदर्श है, यह फ्रेमवर्क की क्षमता को सीमित करता है ताकि विभिन्न दृश्यों के बीच वैश्विक सुसंगतता सुनिश्चित की जा सके। इस बाधा को पार करने के लिए, ज़ीरो123++ फ्रेमवर्क स्टेबल विसर्जन 2 वी-पूर्वानुमान फ्रेमवर्क पर एक लोरा मॉडल को फाइन-ट्यून करता है ताकि एक खिलौना कार्य को पूरा किया जा सके, और परिणाम निम्नलिखित में प्रदर्शित किए जाते हैं।

स्केल्ड-लीनियर शोर अनुसूची के साथ, लोरा मॉडल ओवरफिट नहीं होता है, लेकिन केवल छवि को थोड़ा सफेद करता है। इसके विपरीत, जब रैखिक शोर अनुसूची के साथ काम किया जाता है, तो लोरा फ्रेमवर्क एक खाली छवि को सफलतापूर्वक उत्पन्न करता है, जो कि इनपुट प्रॉम्प्ट की परवाह किए बिना होता है, जो वैश्विक रूप से नए आवश्यकताओं के अनुकूल होने की फ्रेमवर्क की क्षमता पर प्रभाव को दर्शाता है।
स्थानीय स्थितियों के लिए स्केल्ड रेफरेंस ध्यान
ज़ीरो-1-टू-3 फ्रेमवर्क में, एकल दृश्य इनपुट या स्थिति छवियों को विशेषता आयाम में शोर इनपुट के साथ जोड़कर शोर के लिए छवि स्थिति की जाती है।
यह जोड़ लक्ष्य छवि और इनपुट के बीच पिक्सेल-वार स्थानिक संबंध को गलत बनाता है। स्थानीय स्थिति इनपुट प्रदान करने के लिए, ज़ीरो123++ फ्रेमवर्क एक स्केल्ड रेफरेंस ध्यान दृष्टिकोण का उपयोग करता है, जिसमें एक अतिरिक्त रेफरेंस छवि पर एक देनोइज़िंग यूनेट मॉडल चलाया जाता है, और फिर मूल्य मैट्रिक्स और स्व-ध्यान कुंजी को रेफरेंस छवि से संबंधित ध्यान परतों में जोड़ा जाता है जब मॉडल इनपुट को देनोइज़ किया जाता है, और यह प्रक्रिया निम्नलिखित आकृति में प्रदर्शित की जाती है।

रेफरेंस ध्यान दृष्टिकोण छवि पीढ़ी मॉडल को रेफरेंस छवि के साथ समान बनावट और सेमेंटिक सामग्री वाली छवियों का उत्पादन करने के लिए मार्गदर्शन करने में सक्षम है। फाइन-ट्यूनिंग के साथ, रेफरेंस ध्यान दृष्टिकोण उत्कृष्ट परिणाम प्रदान करता है जब लेटेंट स्केल्ड होता है।

वैश्विक स्थिति: फ्लेक्सडिफ्यूज
मूल स्टेबल विसर्जन दृष्टिकोण में, टेक्स्ट एम्बेडिंग वैश्विक एम्बेडिंग का एकमात्र स्रोत है, और दृष्टिकोण सीएलआईपी फ्रेमवर्क का उपयोग टेक्स्ट एम्बेडिंग और मॉडल लेटेंट के बीच क्रॉस-परीक्षण करने के लिए करता है। परिणामस्वरूप, डेवलपर्स टेक्स्ट स्पेस और परिणामी सीएलआईपी छवियों के बीच संरेखण का उपयोग वैश्विक छवि स्थिति के लिए करने के लिए स्वतंत्र हैं।
ज़ीरो123++ फ्रेमवर्क एक प्रशिक्षित रूपांतरणीय रूपांतरण तंत्र का उपयोग करने का प्रस्ताव करता है ताकि वैश्विक छवि स्थिति को फ्रेमवर्क में शामिल किया जा सके जिसमें न्यूनतम फाइन-ट्यूनिंग की आवश्यकता होती है, और परिणाम निम्नलिखित छवि में प्रदर्शित किए जाते हैं। जैसा कि देखा जा सकता है, वैश्विक छवि स्थिति की अनुपस्थिति में, फ्रेमवर्क द्वारा उत्पादित सामग्री की गुणवत्ता संतोषजनक है जो इनपुट छवि के दृश्य क्षेत्रों से मेल खाती है। हालांकि, दृश्य क्षेत्रों की गुणवत्ता जो इनपुट छवि द्वारा देखी नहीं जा सकती है, में काफी गिरावट आती है, जो मुख्य रूप से मॉडल की वस्तु की वैश्विक सेमेंटिक्स का अनुमान लगाने में असमर्थता के कारण है।

मॉडल वास्तुकला
ज़ीरो123++ फ्रेमवर्क स्टेबल विसर्जन 2वी-मॉडल के साथ प्रशिक्षित किया जाता है जो लेख में उल्लिखित विभिन्न दृष्टिकोणों और तकनीकों का उपयोग करता है। ज़ीरो123++ फ्रेमवर्क ऑब्जवर्स डेटासेट पर पूर्व-प्रशिक्षित किया जाता है जो यादृच्छिक एचडीआरआई प्रकाश व्यवस्था के साथ रेंडर किया जाता है। फ्रेमवर्क स्टेबल विसर्जन इमेज वेरिएशन फ्रेमवर्क में उपयोग किए जाने वाले चरणबद्ध प्रशिक्षण अनुसूची दृष्टिकोण को भी अपनाता है ताकि पूर्व स्टेबल विसर्जन में से अधिक से अधिक को बनाए रखने और फाइन-ट्यूनिंग की मात्रा को कम करने का प्रयास किया जा सके।
ज़ीरो123++ फ्रेमवर्क का कार्य या वास्तुकला को चरणबद्ध चरणों या चरणों में विभाजित किया जा सकता है। पहले चरण में, फ्रेमवर्क स्टेबल विसर्जन के क्रॉस-ध्यान परतों और स्व-ध्यान परतों के केवी मैट्रिक्स को एडमडब्ल्यू के साथ प्रशिक्षित करता है, 1000 वार्म-अप चरण और कोसाइन लर्निंग दर अनुसूची 7×10^-5 पर अधिकतम होता है। दूसरे चरण में, फ्रेमवर्क एक अत्यधिक रूढ़िवादी स्थिर लर्निंग दर का उपयोग करता है, 2000 वार्म-अप सेट, और मिन-एसएनआर दृष्टिकोण का उपयोग करके प्रशिक्षण के दौरान दक्षता को अधिकतम करने का प्रयास करता है।
ज़ीरो123++: परिणाम और प्रदर्शन तुलना
गुणात्मक प्रदर्शन
ज़ीरो123++ फ्रेमवर्क के प्रदर्शन का मूल्यांकन करने के लिए, इसे सिंकड्रीमर और ज़ीरो-1-टू-3-एक्सएल, दो राज्य-ऑफ-द-आर्ट फ्रेमवर्क के खिलाफ तुलना की जाती है, जो सामग्री पीढ़ी के लिए हैं। फ्रेमवर्क की तुलना चार इनपुट छवियों के साथ की जाती है, जिनमें विभिन्न दृश्य होते हैं। पहली छवि एक इलेक्ट्रिक खिलौना बिल्ली है, जो सीधे ऑब्जवर्स डेटासेट से ली जाती है, और इसमें वस्तु के पीछे के हिस्से में एक बड़ा अनिश्चितता है। दूसरी छवि एक फायर एक्सटिंग्विशर की है, और तीसरी छवि एक कुत्ते की है जो एक रॉकेट पर बैठा है, जो एसडीएक्सएल मॉडल द्वारा उत्पादित किया गया है। अंतिम छवि एक एनीमे चित्रण है। आवश्यक उन्नति कदमों को प्राप्त करने के लिए फ्रेमवर्क वन-2-3-4-5 फ्रेमवर्क के उन्नति अनुमान विधि का उपयोग करते हैं, और पृष्ठभूमि हटाने के लिए एसएएम फ्रेमवर्क का उपयोग किया जाता है। जैसा कि देखा जा सकता है, ज़ीरो123++ फ्रेमवर्क उच्च गुणवत्ता वाली बहुस्तरीय छवियों का उत्पादन करता है, और यह बाहरी-डोमेन 2डी चित्रण और एआई-उत्पादित छवियों के लिए भी अच्छी तरह से सामान्यीकृत है।


मात्रात्मक विश्लेषण
ज़ीरो123++ फ्रेमवर्क की तुलना राज्य-ऑफ-द-आर्ट ज़ीरो-1-टू-3 और ज़ीरो-1-टू-3-एक्सएल फ्रेमवर्क के साथ मात्रात्मक रूप से करने के लिए, डेवलपर्स ऑब्जवर्स डेटासेट के सत्यापन विभाजन डेटा पर इन मॉडलों के लर्न्ड परसेप्टुअल इमेज पैच समानता (एलपीआईपीएस) स्कोर का मूल्यांकन करते हैं, जो एक उपसेट है। बहुस्तरीय छवि पीढ़ी के मॉडल के प्रदर्शन का मूल्यांकन करने के लिए, डेवलपर्स ग्राउंड ट्रुथ रेफरेंस छवियों और 6 उत्पादित छवियों को क्रमबद्ध करते हैं, और फिर एलपीआईपीएस स्कोर की गणना करते हैं। परिणाम निम्नलिखित में प्रदर्शित किए जाते हैं और जैसा कि स्पष्ट रूप से देखा जा सकता है, ज़ीरो123++ फ्रेमवर्क सत्यापन विभाजन सेट पर सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है।

पाठ से बहुस्तरीय मूल्यांकन
ज़ीरो123++ फ्रेमवर्क की पाठ से बहुस्तरीय सामग्री पीढ़ी क्षमता का मूल्यांकन करने के लिए, डेवलपर्स पहले एसडीएक्सएल फ्रेमवर्क का उपयोग करके टेक्स्ट प्रॉम्प्ट के साथ एक छवि का उत्पादन करते हैं, और फिर ज़ीरो123++ फ्रेमवर्क को उत्पादित छवि पर लागू करते हैं। परिणाम निम्नलिखित छवि में प्रदर्शित किए जाते हैं और जैसा कि देखा जा सकता है, ज़ीरो-1-टू-3 फ्रेमवर्क की तुलना में जो सुसंगत बहुस्तरीय पीढ़ी की गारंटी नहीं दे सकता है, ज़ीरो123++ फ्रेमवर्क वास्तविक और विस्तृत बहुस्तरीय छवियों का उत्पादन करता है जो पाठ-टू-इमेज-टू-बहुस्तरीय दृष्टिकोण या पाइपलाइन को लागू करता है।

ज़ीरो123++ गहराई नियंत्रण नेट
ज़ीरो123++ फ्रेमवर्क के अलावा, डेवलपर्स ने ज़ीरो123++ गहराई नियंत्रण नेट को भी जारी किया है, जो मूल फ्रेमवर्क का एक गहराई-नियंत्रित संस्करण है जो नियंत्रण नेट आर्किटेक्चर का उपयोग करके निर्मित किया गया है। सामान्यीकृत रैखिक छवियों को बाद की आरजीबी छवियों के संबंध में रेंडर किया जाता है, और एक नियंत्रण नेट फ्रेमवर्क को ज़ीरो123++ फ्रेमवर्क की ज्यामिति को गहराई धारणा का उपयोग करके नियंत्रित करने के लिए प्रशिक्षित किया जाता है।

निष्कर्ष
इस लेख में, हमने ज़ीरो123++ के बारे में चर्चा की, जो एक छवि-स्थित विसर्जन जनरेटिव एआई मॉडल है जिसका उद्देश्य एक एकल दृश्य इनपुट का उपयोग करके 3डी-सुसंगत बहुस्तरीय छवियों का उत्पादन करना है। पूर्व-प्रशिक्षित जनरेटिव मॉडल से लाभ प्राप्त करने के लिए, ज़ीरो123++ फ्रेमवर्क विभिन्न प्रशिक्षण और स्थिति योजनाओं को लागू करता है ताकि ऑफ-द-शेल्फ विसर्जन छवि मॉडल से फाइन-ट्यूनिंग के लिए आवश्यक प्रयास को कम किया जा सके। हमने ज़ीरो123++ फ्रेमवर्क की वास्तुकला, कार्य और परिणामों का गहन विश्लेषण किया है, और इसकी क्षमताओं का विश्लेषण किया है कि यह एक एकल छवि से उच्च गुणवत्ता वाली सुसंगत बहुस्तरीय छवियों का उत्पादन कर सकता है या नहीं।
हालांकि, इसकी दक्षता और उच्च गुणवत्ता वाली बहुस्तरीय छवियों का उत्पादन करने की क्षमता के बावजूद, ज़ीरो123++ फ्रेमवर्क में अभी भी सुधार की गुंजाइश है, और संभावित अनुसंधान क्षेत्रों में शामिल हैं:
- दो-चरण रिफाइनर मॉडल जो ज़ीरो123++ की वैश्विक सुसंगतता की आवश्यकताओं को पूरा नहीं करने की अक्षमता को हल कर सकता है।
- अतिरिक्त स्केल-अप जो ज़ीरो123++ की उच्च गुणवत्ता वाली छवियों का उत्पादन करने की क्षमता को और बढ़ा सकते हैं।












