एआई मॉडल और प्लेटफ़ॉर्म
AnimateLCM: व्यक्तिगत प्रसार मॉडल्स की एनिमेशन में तेजी
पिछले कुछ वर्षों में, प्रसार मॉडल्स ने छवि और वीडियो जनरेशन कार्यों के लिए बड़ी सफलता और मान्यता प्राप्त की है। विशेष रूप से, वीडियो प्रसार मॉडल्स ने उच्च संगति और विश्वास्यता के साथ वीडियो उत्पन्न करने की उनकी क्षमता के कारण महत्वपूर्ण ध्यान आकर्षित किया है। ये मॉडल उच्च गुणवत्ता वाले वीडियो उत्पन्न करते हैं जो अपनी वास्तुकला में एक पुनरावृत्ति शोर-मुक्त प्रक्रिया का उपयोग करके उच्च-आयामी गाउसीय शोर को वास्तविक डेटा में परिवर्तित करते हैं।
स्टेबल प्रसार एक छवि उत्पन्न करने वाले कार्यों के लिए सबसे प्रतिनिधि मॉडल्स में से एक है, जो वास्तविक छवि और नमूना-आधारित लेटेंट विशेषताओं के बीच मैप करने के लिए एक वैरिएशनल ऑटोएन्कोडर (VAE) पर निर्भर करता है। यह मॉडल उत्पन्न लागत को कम करने की अनुमति देता है, जबकि इसकी वास्तुकला में क्रॉस-ध्यान तंत्र पाठ-शर्त छवि उत्पन्न करने की सुविधा प्रदान करता है। हाल ही में, स्टेबल प्रसार फ्रेमवर्क ने कई प्लग-एंड-प्ले एडाप्टर्स के लिए आधार बनाया है जो छवि या वीडियो उत्पन्न करने के लिए अधिक नवाचारी और प्रभावी हैं। हालांकि, अधिकांश वीडियो प्रसार मॉडल्स द्वारा नियोजित पुनरावृत्ति उत्पन्न प्रक्रिया छवि उत्पन्न करने की प्रक्रिया को समय लेने वाला और तुलनात्मक रूप से महंगा बनाती है, जो इसके अनुप्रयोगों को सीमित करती है।
इस लेख में, हम AnimateLCM के बारे में बात करेंगे, जो एक व्यक्तिगत प्रसार मॉडल है जो उच्च-विश्वास्यता वाले वीडियो को न्यूनतम चरणों और गणनात्मक लागत के साथ उत्पन्न करने के लिए डिज़ाइन किया गया है। AnimateLCM फ्रेमवर्क संगति मॉडल से प्रेरित है, जो पूर्व-प्रशिक्षित छवि प्रसार मॉडल्स को शुद्ध करके नमूने को तेज करता है। इसके अलावा, संगति मॉडल का सफल विस्तार, लेटेंट संगति मॉडल (LCM), शर्तीय छवि उत्पन्न करने की सुविधा प्रदान करता है। सीधे कच्चे वीडियो डेटासेट पर संगति सीखने के बजाय, AnimateLCM फ्रेमवर्क एक विच्छिन्न संगति सीखने की रणनीति का प्रस्ताव करता है। यह रणनीति गति उत्पन्न करने वाले पूर्वज्ञान और छवि उत्पन्न करने वाले पूर्वज्ञान को विच्छिन्न करती है, जिससे मॉडल उत्पन्न सामग्री की दृश्य गुणवत्ता में सुधार कर सकता है और प्रशिक्षण की दक्षता में सुधार कर सकता है।
AnimateLCM: व्यक्तिगत प्रसार मॉडल्स की एनिमेशन
प्रसार मॉडल्स छवि और वीडियो उत्पन्न करने के कार्यों के लिए एक लोकप्रिय फ्रेमवर्क बन गए हैं क्योंकि वे उत्पन्न कार्यों में कुशल और सक्षम हैं। अधिकांश प्रसार मॉडल्स एक पुनरावृत्ति शोर-मुक्त प्रक्रिया पर निर्भर करते हैं जो उच्च-आयामी गाउसीय शोर को वास्तविक डेटा में परिवर्तित करती है। हालांकि, यह प्रक्रिया उत्पन्न प्रक्रिया को धीमा और अधिक गणनात्मक बनाती है, जो इसे अन्य उत्पन्न फ्रेमवर्क्स जैसे GAN या जनरेटिव एडवर्सेरियल नेटवर्क्स की तुलना में कम कुशल बनाती है।
हाल के वर्षों में, संगति मॉडल्स को प्रसार मॉडल्स के विकल्प के रूप में प्रस्तावित किया गया है जो उत्पन्न प्रक्रिया को तेज करने में मदद कर सकते हैं। संगति मॉडल्स संगति मैपिंग सीखते हैं जो पूर्व-प्रशिक्षित प्रसार मॉडल्स द्वारा पेश की गई ट्रेजेक्टरी की स्व-संगति को बनाए रखते हैं। संगति मॉडल्स की सीखने की प्रक्रिया उन्हें न्यूनतम चरणों के साथ उच्च-गुणवत्ता वाली छवियों को उत्पन्न करने और गणनात्मक रूप से महंगी पुनरावृत्तियों की आवश्यकता को समाप्त करने में मदद करती है। इसके अलावा, लेटेंट संगति मॉडल (LCM) स्टेबल प्रसार फ्रेमवर्क पर आधारित है और वास्तविक समय में छवि से छवि अनुवाद जैसी अतिरिक्त कार्यक्षमता प्राप्त करने के लिए मौजूदा एडाप्टर्स के साथ एकीकृत किया जा सकता है।
AnimateLCM फ्रेमवर्क लेटेंट संगति मॉडल का अनुसरण करता है और वीडियो उत्पन्न करने के लिए एक न्यूनतम संख्या में चरणों की आवश्यकता वाले एक उच्च-विश्वास्यता वाले वीडियो उत्पन्न करने वाले फ्रेमवर्क के रूप में कार्य करता है। AnimateLCM फ्रेमवर्क प्रसार प्रक्रिया को एक वर्गमूल-मुक्त मार्गदर्शन ऑगमेंटेड संभावना प्रवाह के रूप में मानता है और मॉडल को सीधे लेटेंट स्थान में इस तरह के प्रवाह के समाधान की भविष्यवाणी करने के लिए प्रशिक्षित करता है। हालांकि, कच्चे वीडियो डेटा पर सीधे संगति सीखने के बजाय, जो उच्च प्रशिक्षण और गणनात्मक संसाधनों की आवश्यकता होती है और अक्सर खराब गुणवत्ता वाले परिणामों की ओर ले जाती है, AnimateLCM फ्रेमवर्क एक विच्छिन्न संगति सीखने की रणनीति का प्रस्ताव करता है।
AnimateLCM फ्रेमवर्क पहले छवि आधार प्रसार मॉडल को छवि संगति मॉडल में अनुकूलित करने के लिए संगति शुद्धिकरण करता है, और फिर छवि संगति और छवि प्रसार मॉडल्स दोनों को 3D सुविधाओं को समायोजित करने के लिए 3D इन्फ्लेशन करता है। अंत में, AnimateLCM फ्रेमवर्क वीडियो संगति मॉडल प्राप्त करने के लिए वीडियो डेटा पर संगति शुद्धिकरण करता है। इसके अलावा, प्रसार प्रक्रिया के परिणामस्वरूप संभावित विशेषता भ्रष्टाचार को कम करने के लिए, AnimateLCM फ्रेमवर्क एक प्रारंभिकरण रणनीति का प्रस्ताव करता है। चूंकि AnimateLCM फ्रेमवर्क स्टेबल प्रसार फ्रेमवर्क पर आधारित है, यह अपने प्रशिक्षित वीडियो संगति मॉडल के स्थानीय भारों को सार्वजनिक रूप से उपलब्ध व्यक्तिगत छवि प्रसार भारों से बदलकर नवाचारी उत्पन्न परिणाम प्राप्त कर सकता है।

इसके अलावा, विशिष्ट एडाप्टर्स को शून्य से प्रशिक्षित करने या सार्वजनिक रूप से उपलब्ध एडाप्टर्स को बेहतर ढंग से अनुकूल बनाने के लिए, AnimateLCM फ्रेमवर्क एडाप्टर्स के लिए एक प्रभावी त्वरण रणनीति का प्रस्ताव करता है जो विशिष्ट शिक्षक मॉडल्स को प्रशिक्षित करने की आवश्यकता नहीं है।
AnimateLCM फ्रेमवर्क के योगदान इस प्रकार हैं: प्रस्तावित AnimateLCM फ्रेमवर्क उच्च गुणवत्ता, तेज और उच्च विश्वास्यता वाले वीडियो उत्पन्न करने के लिए डिज़ाइन किया गया है, और इसे प्राप्त करने के लिए, AnimateLCM फ्रेमवर्क गति और छवि उत्पन्न करने वाले पूर्वज्ञान को विच्छिन्न करने वाली एक विच्छिन्न शुद्धिकरण रणनीति का प्रस्ताव करता है, जिससे उत्पन्न गुणवत्ता में सुधार होता है और प्रशिक्षण की दक्षता में वृद्धि होती है।
InstantID: विधि और वास्तुकला
InstantID फ्रेमवर्क का मूल प्रसार मॉडल्स और नमूने की गति रणनीतियों से भारी प्रेरणा लेता है। प्रसार मॉडल्स, जिन्हें स्कोर-आधारित जनरेटिव मॉडल्स के रूप में भी जाना जाता है, ने छवि उत्पन्न करने में उल्लेखनीय क्षमता प्रदर्शित की है। स्कोर दिशा के मार्गदर्शन में, प्रसार मॉडल्स द्वारा लागू की गई पुनरावृत्ति नमूने की रणनीति धीरे-धीरे शोर-दूषित डेटा को शुद्ध करती है। प्रसार मॉडल्स की दक्षता एक प्रमुख कारण है कि वे अधिकांश वीडियो प्रसार मॉडल्स द्वारा नियोजित किए जाते हैं जो जोड़े गए समय परतों पर प्रशिक्षित होते हैं। दूसरी ओर, नमूने की गति और नमूने की त्वरण रणनीतियों प्रसार मॉडल्स में धीमी उत्पन्न गति को संबोधित करने में मदद करती हैं।
InstantID फ्रेमवर्क स्टेबल प्रसार मॉडल पर आधारित है जो InstantID को प्रासंगिक धारणाओं को लागू करने की अनुमति देता है। मॉडल विविधता-संरक्षित स्टोकास्टिक डिफरेंशियल समीकरण (SDE) के रूप में विपरीत आगमन प्रक्रिया का इलाज करता है। इसके अलावा, स्टेबल प्रसार मॉडल डेनोइसिंग डिफ्यूजन प्रोबेबिलिस्टिक मॉडल (DDPM) का एक विस्तार है, जिसमें प्रशिक्षण डेटा बिंदु को धीरे-धीरे एक पертURबेशन केर्नेल के साथ एक विविधता-संरक्षित मार्कोव श्रृंखला द्वारा परेशान किया जाता है, जो विभिन्न समय चरणों पर शोर-दूषित डेटा के वितरण को वितरण का पालन करने की अनुमति देता है।
AnimateLCM फ्रेमवर्क को उच्च-विश्वास्यता वाले वीडियो उत्पन्न करने के लिए न्यूनतम चरणों के साथ तैयार किया गया है। AnimateLCM फ्रेमवर्क स्टेबल प्रसार-आधारित वीडियो मॉडल्स को स्व-संगति गुण का पालन करने के लिए तैयार करता है। AnimateLCM फ्रेमवर्क की समग्र प्रशिक्षण संरचना में एक विच्छिन्न संगति सीखने की रणनीति शामिल है जो शिक्षक-मुक्त अनुकूलन और प्रभावी संगति सीखने के लिए है।

प्रसार मॉडल्स से संगति मॉडल्स तक संक्रमण
AnimateLCM फ्रेमवर्क स्टेबल प्रसार मॉडल (DM) को संगति मॉडल (CM) में अपनी वास्तुकला के अनुसार लेटेंट संगति मॉडल (LCM) के डिज़ाइन का अनुसरण करता है। यह ध्यान देने योग्य है कि स्टेबल प्रसार मॉडल्स आमतौर पर नमूनों में जोड़े गए शोर की भविष्यवाणी करते हैं, वे आवश्यक रूप से सिग्मा-प्रसार मॉडल्स हैं। यह संगति मॉडल्स के विपरीत है, जो सीधे पीएफ-ओडीई ट्रेजेक्टरी के समाधान की भविष्यवाणी करने का लक्ष्य रखते हैं। इसके अलावा, स्टेबल प्रसार मॉडल्स में कुछ पैरामीटरों के साथ, यह आवश्यक है कि मॉडल उच्च-गुणवत्ता वाली छवियों को उत्पन्न करने के लिए एक वर्गमूल-मुक्त मार्गदर्शन रणनीति का उपयोग करे। AnimateLCM फ्रेमवर्क, हालांकि, एक वर्गमूल-मुक्त मार्गदर्शन ऑगमेंटेड ओडीई सॉल्वर का उपयोग करता है जो एक ही ट्रेजेक्टरी में संलग्न जोड़ों को नमूना लेता है, जिससे बेहतर दक्षता और गुणवत्ता में सुधार होता है।
विच्छिन्न संगति सीखना
संगति शुद्धिकरण की प्रक्रिया के लिए, यह देखा गया है कि प्रशिक्षण के लिए उपयोग किए जाने वाले डेटा का गुणवत्ता संगति मॉडल्स के अंतिम उत्पन्न परिणामों पर बहुत प्रभाव पड़ता है। हालांकि, वर्तमान में उपलब्ध डेटासेट्स के साथ एक प्रमुख समस्या यह है कि वे अक्सर वॉटरमार्क डेटा होते हैं, या उनकी गुणवत्ता कम होती है, और उनके कैप्शन अक्सर बहुत छोटे या अस्पष्ट होते हैं। इसके अलावा, बड़े-रिज़ॉल्यूशन वाले वीडियो पर सीधे मॉडल को प्रशिक्षित करना गणनात्मक रूप से महंगा और समय लेने वाला होता है, जो अधिकांश शोधकर्ताओं के लिए एक व्यावहारिक विकल्प नहीं है।
फिल्टर्ड उच्च-गुणवत्ता वाले डेटासेट्स की उपलब्धता को देखते हुए, AnimateLCM फ्रेमवर्क गति उत्पन्न करने वाले पूर्वज्ञान और छवि उत्पन्न करने वाले पूर्वज्ञान को विच्छिन्न करने का प्रस्ताव करता है। विशेष रूप से, AnimateLCM फ्रेमवर्क पहले फिल्टर्ड उच्च-गुणवत्ता वाले छवि-पाठ डेटासेट्स के साथ छवि आधार प्रसार मॉडल्स को छवि संगति मॉडल्स में शुद्ध करता है। फ्रेमवर्क तब स्टेबल प्रसार मॉडल की परतों पर हल्के LoRA भारों को प्रशिक्षित करता है, जिससे स्टेबल प्रसार मॉडल के भारों को जम जाता है। एक बार जब मॉडल LoRA भारों को ट्यून करता है, तो यह एक बहुमुखी त्वरण मॉड्यूल के रूप में कार्य करता है और स्टेबल प्रसार समुदाय में अन्य व्यक्तिगत मॉडल्स के साथ इसकी संगतता का प्रदर्शन किया है। अनुमान के लिए, AnimateLCM फ्रेमवर्क मूल भारों के साथ LoRA भारों को मिलाता है बिना अनुमान गति को भ्रष्ट किए।
शिक्षक-मुक्त अनुकूलन
स्टेबल प्रसार मॉडल्स और प्लग-एंड-प्ले एडाप्टर्स अक्सर एक साथ जुड़े होते हैं। हालांकि, यह देखा गया है कि हालांकि प्लग-एंड-प्ले एडाप्टर्स कुछ हद तक काम करते हैं, वे विवरणों में नियंत्रण खो देते हैं जब अधिकांश एडाप्टर्स छवि प्रसार मॉडल्स के साथ प्रशिक्षित होते हैं। इस समस्या को दूर करने के लिए, AnimateLCM फ्रेमवर्क शिक्षक-मुक्त अनुकूलन का विकल्प चुनता है, जो एक सरल लेकिन प्रभावी रणनीति है जो मौजूदा एडाप्टर्स को बेहतर संगतता के लिए अनुकूलित करती है या उन्हें शून्य से प्रशिक्षित करती है। यह दृष्टिकोण AnimateLCM फ्रेमवर्क को न्यूनतम चरणों के साथ नियंत्रित वीडियो उत्पन्न करने और छवि से वीडियो उत्पन्न करने में मदद करता है बिना शिक्षक मॉडल्स की आवश्यकता के।

AnimateLCM: प्रयोग और परिणाम
AnimateLCM फ्रेमवर्क स्टेबल प्रसार v1-5 को आधार मॉडल के रूप में नियोजित करता है और प्रशिक्षण के उद्देश्यों के लिए DDIM ODE सॉल्वर लागू करता है। फ्रेमवर्क खुले स्रोत वीडियो प्रसार मॉडल्स के साथ स्टेबल प्रसार v1-5 का उपयोग शिक्षक वीडियो प्रसार मॉडल के रूप में करता है, और प्रयोग WebVid2M डेटासेट पर किए जाते हैं बिना किसी अतिरिक्त या ऑगमेंटेड डेटा के। इसके अलावा, फ्रेमवर्क टिक्टोक डेटासेट का उपयोग BLIP-कैप्शन्ड संक्षिप्त पाठ प्रोम्प्ट्स के साथ नियंत्रित वीडियो उत्पन्न करने के लिए करता है।
गुणात्मक परिणाम
निम्नलिखित चित्र AnimateLCM फ्रेमवर्क द्वारा लागू की गई चार-चरण उत्पन्न विधि के परिणामों को प्रदर्शित करता है, जो पाठ से वीडियो, छवि से वीडियो, और नियंत्रित वीडियो उत्पन्न करने में सक्षम है।

जैसा कि देखा जा सकता है, प्रत्येक परिणाम संतोषजनक है, और उत्पन्न परिणाम AnimateLCM फ्रेमवर्क की क्षमता को प्रदर्शित करते हैं कि यह संगति गुण का पालन करता है, भले ही अनुमान चरणों में भिन्नता हो।


मात्रात्मक परिणाम
निम्नलिखित चित्र AnimateLCM फ्रेमवर्क के मात्रात्मक परिणामों और राज्य-कला DDIM और DPM++ विधियों के साथ तुलना को प्रदर्शित करता है।

जैसा कि देखा जा सकता है, AnimateLCM फ्रेमवर्क मौजूदा विधियों को एक महत्वपूर्ण अंतर से पार करता है, विशेष रूप से निम्न-चरण शासन में 1 से 4 चरणों के बीच। इसके अलावा, AnimateLCM मेट्रिक्स इस तुलना में प्रदर्शित किए गए हैं जो वर्गमूल-मुक्त मार्गदर्शन (CFG) का उपयोग किए बिना मूल्यांकित किए गए हैं, जो फ्रेमवर्क को लगभग 50% अनुमान समय और अनुमान शिखर मेमोरी लागत को बचाने की अनुमति देता है। इसके अलावा, अपने प्रदर्शन को और पुष्ट करने के लिए, AnimateLCM फ्रेमवर्क के भीतर स्थानीय भारों को एक सार्वजनिक रूप से उपलब्ध वास्तविक मॉडल से बदल दिया जाता है जो विश्वास्यता और विविधता के बीच एक अच्छा संतुलन बनाता है, जो इसके प्रदर्शन में और सुधार करता है।
अंतिम विचार
इस लेख में, हमने AnimateLCM के बारे में बात की है, जो एक व्यक्तिगत प्रसार मॉडल है जो न्यूनतम चरणों और गणनात्मक लागत के साथ उच्च-विश्वास्यता वाले वीडियो उत्पन्न करने के लिए डिज़ाइन किया गया है। AnimateLCM फ्रेमवर्क संगति मॉडल से प्रेरित है, जो पूर्व-प्रशिक्षित छवि प्रसार मॉडल्स को शुद्ध करके नमूने को तेज करता है, और संगति मॉडल का सफल विस्तार, लेटेंट संगति मॉडल (LCM), जो शर्तीय छवि उत्पन्न करने की सुविधा प्रदान करता है। कच्चे वीडियो डेटासेट पर सीधे संगति सीखने के बजाय, AnimateLCM फ्रेमवर्क एक विच्छिन्न संगति सीखने की रणनीति का प्रस्ताव करता है जो गति उत्पन्न करने वाले पूर्वज्ञान और छवि उत्पन्न करने वाले पूर्वज्ञान को विच्छिन्न करती है, जिससे मॉडल उत्पन्न सामग्री की दृश्य गुणवत्ता में सुधार कर सकता है और प्रशिक्षण की दक्षता में सुधार कर सकता है।












