Anderson का एंगल
एआई वीडियो जनरेशन में कुल नियंत्रण की ओर

वीडियो फाउंडेशन मॉडल जैसे हुन्युआन और वान 2.1, जबकि शक्तिशाली हैं, वे उपयोगकर्ताओं को वह सूक्ष्म नियंत्रण प्रदान नहीं करते हैं जो फिल्म और टीवी उत्पादन (विशेष रूप से वीएफएक्स उत्पादन) की मांग करता है।
पेशेवर विजुअल इफेक्ट्स स्टूडियो में, खुले स्रोत मॉडल जैसे कि स्टेबल डिफ्यूजन, कैंडिंस्की और फ्लक्स का उपयोग विभिन्न समर्थन उपकरणों के साथ किया जाता है जो उनके कच्चे आउटपुट को विशिष्ट रचनात्मक आवश्यकताओं को पूरा करने के लिए अनुकूलित करते हैं। जब एक निर्देशक कहता है, “यह दिखता है, लेकिन क्या हम इसे थोड़ा और [n] बना सकते हैं?” तो आप यह नहीं कह सकते कि मॉडल पर्याप्त सटीक नहीं है ताकि ऐसे अनुरोधों को संभाल सके।
इसके बजाय, एक एआई वीएफएक्स टीम विभिन्न पारंपरिक सीजीआइ और संरचनात्मक तकनीकों का उपयोग करेगी, जो कस्टम प्रक्रियाओं और कार्य प्रवाहों के साथ जुड़ी हुई हैं जो समय के साथ विकसित की जाती हैं, ताकि वीडियो संश्लेषण की सीमाओं को थोड़ा और आगे बढ़ाने का प्रयास किया जा सके।
इस प्रकार, एक फाउंडेशन वीडियो मॉडल एक वेब ब्राउज़र जैसे क्रोम की डिफ़ॉल्ट स्थापना के समान है; यह बॉक्स से बहुत कुछ करता है, लेकिन यदि आप चाहते हैं कि यह आपकी आवश्यकताओं के अनुसार अनुकूलित हो, इसके बजाय इसके विपरीत, तो आपको कुछ प्लगイン्स की आवश्यकता होगी।
नियंत्रण फ्रीक्स
डिफ्यूजन-आधारित छवि संश्लेषण की दुनिया में, सबसे महत्वपूर्ण ऐसी तृतीय-पक्ष प्रणाली ControlNet है।
ControlNet एक तकनीक है जो डिफ्यूजन-आधारित उत्पन्न मॉडल में संरचित नियंत्रण जोड़ने के लिए, जो उपयोगकर्ताओं को अतिरिक्त इनपुट जैसे एज मैप्स, गहराई मैप्स, या मुद्रा जानकारी के साथ छवि या वीडियो उत्पादन को निर्देशित करने की अनुमति देती है।
केवल पाठ प्रेरक पर निर्भर रहने के बजाय, ControlNet अलग तंत्रिका नेटवर्क शाखाएं, या एडाप्टर्स, पेश करता है जो इन स्थिति संकेतों को संसाधित करते हुए आधार मॉडल की उत्पन्न क्षमताओं को बनाए रखते हैं।
यह उपयोगकर्ता विनिर्देशों के अनुरूप अधिक बारीक आउटपुट की अनुमति देता है, जो सटीक संरचना, संरचना या गति नियंत्रण की आवश्यकता वाले अनुप्रयोगों में विशेष रूप से उपयोगी है।
FullDiT
चीन से एक नई पेशकश में, एक प्रणाली का प्रस्ताव किया गया है जहां ControlNet-शैली के उपायों को सीधे एक उत्पन्न वीडियो मॉडल में प्रशिक्षण समय पर बेक किया जाता है, इसके बजाय एक बाद के विचार के रूप में नहीं।
शीर्षक FullDiT, इस नए दृष्टिकोण में, बहु-कार्य स्थितियों जैसे पहचान स्थानांतरण, गहराई मानचित्रण और कैमरा आंदोलन को एक एकीकृत भाग के रूप में एक प्रशिक्षित उत्पन्न वीडियो मॉडल में मिलाया जाता है, जिसके लिए लेखकों ने एक प्रोटोटाइप प्रशिक्षित मॉडल और साथ ही एक परियोजना साइट पर वीडियो क्लिप तैयार की है।
नीचे दिए गए उदाहरण में, हम कैमरा आंदोलन, पहचान जानकारी और पाठ जानकारी (यानी, मार्गदर्शन उपयोगकर्ता पाठ प्रेरक) को शामिल करने वाले पीढ़ियों को देखते हैं:
प्ले करने के लिए क्लिक करें। ControlNet-शैली के उपयोगकर्ता आरोपण के उदाहरण केवल एक मूल प्रशिक्षित फाउंडेशन मॉडल के साथ। स्रोत: https://fulldit.github.io/
यह ध्यान दिया जाना चाहिए कि लेखक अपने प्रायोगिक प्रशिक्षित मॉडल को एक कार्यात्मक फाउंडेशन मॉडल के रूप में प्रस्तावित नहीं करते हैं, बल्कि मूल रूप से पाठ-से-वीडियो (टी2वी) और छवि-से-वीडियो (आई2वी) मॉडल के लिए एक प्रूफ-ऑफ-кон्सेप्ट के रूप में जो उपयोगकर्ताओं को केवल एक छवि प्रेरक या पाठ प्रेरक की तुलना में अधिक नियंत्रण प्रदान करते हैं।
विधि
लेखकों का तर्क है कि FullDiT का एकीकृत ध्यान तंत्र मजबूत क्रॉस-मॉडल प्रतिनिधित्व सीखने को सक्षम बनाता है जो स्थितियों के साथ स्थानिक और कालिक संबंधों को दोनों को पकड़ता है:
FullDiT की वास्तुकला में, सभी स्थिति इनपुट – जैसे पाठ, कैमरा आंदोलन, पहचान, और गहराई – पहले एक एकीकृत टोकन प्रारूप में परिवर्तित किए जाते हैं। ये टोकन तब एक एकल लंबी श्रृंखला में जोड़े जाते हैं, जो पूर्ण स्व-ध्यान का उपयोग करके एक स्टैक के माध्यम से संसाधित किया जाता है ट्रांसफॉर्मर परतें।
तीन की शक्ति
FullDiT प्रत्येक नियंत्रण संकेत को एक मानकीकृत टोकन प्रारूप में परिवर्तित करता है ताकि सभी स्थितियों को एक एकीकृत ध्यान फ्रेमवर्क में एक साथ संसाधित किया जा सके।
डेटा और परीक्षण
FullDiT के प्रशिक्षण दृष्टिकोण ने प्रत्येक स्थिति प्रकार के लिए चयनात्मक रूप से एनोटेट किए गए डेटासेट पर निर्भर किया, न कि सभी स्थितियों को एक साथ मौजूद होने की आवश्यकता थी।
डेटा-ऑर्डरिंग के माध्यम से अनुकूलन
लेखकों ने एक प्रगतिशील प्रशिक्षण कार्यक्रम भी लागू किया, जिसमें प्रशिक्षण के शुरू में अधिक चुनौतीपूर्ण स्थितियों को पेश किया गया, ताकि मॉडल को सरल कार्यों से पहले मजबूत प्रतिनिधित्व प्राप्त हो सके।
मीट्रिक
लेखकों ने FullDiT का मूल्यांकन दस मीट्रिक का उपयोग करके किया जो प्रदर्शन के पांच मुख्य पहलुओं को कवर करते हैं: पाठ संरेखण, कैमरा नियंत्रण, पहचान समानता, गहराई सटीकता, और सामान्य वीडियो गुणवत्ता।
प्रशिक्षण
लेखकों ने FullDiT को एक आंतरिक (अनुलेखित) पाठ-से-वीडियो डिफ्यूजन मॉडल का उपयोग करके प्रशिक्षित किया जिसमें लगभग एक अरब पैरामीटर थे।
पिछले तरीके
कैमरा-से-वीडियो मूल्यांकन के लिए, लेखकों ने FullDiT की तुलना मोशनकंट्रोल, कैमराकंट्रोल, और कैमआई2वी से की, सभी मॉडलों को रियलएस्टेट10के डेटासेट का उपयोग करके प्रशिक्षित किया गया ताकि संगति और न्यायसंगतता सुनिश्चित की जा सके।
निष्कर्ष
हालांकि FullDiT एक अधिक विशेषता से भरपूर वीडियो फाउंडेशन मॉडल की दिशा में एक रोमांचक प्रयास है, यह सोचने का कारण है कि क्या ControlNet-शैली की सुविधाओं की मांग कभी भी इतनी बड़ी होगी कि वे बड़े पैमाने पर लागू की जा सकें, कम से कम फॉस्स परियोजनाओं के लिए, जो व्यावसायिक समर्थन के बिना इतनी बड़ी मात्रा में जीपीयू प्रसंस्करण शक्ति प्राप्त करने के लिए संघर्ष करेंगे।
प्राथमिक चुनौती यह है कि गहराई और मुद्रा जैसी प्रणालियों का उपयोग करने के लिए आमतौर पर जटिल उपयोगकर्ता इंटरफेस जैसे कि कॉम्फ्यूआई के साथ पर्याप्त परिचितता की आवश्यकता होती है। इसलिए, ऐसा लगता है कि एक कार्यात्मक फॉस्स मॉडल इस प्रकार का सबसे अधिक संभावना है कि छोटी वीएफएक्स कंपनियों द्वारा विकसित किया जाएगा जो ऐसा मॉडल प्रशिक्षित और प्रशिक्षित करने के लिए पैसे या इच्छाशक्ति की कमी है।
प्ले करने के लिए क्लिक करें। FullDiT का उपयोग करके वीडियो पीढ़ी पर लगाए गए गहराई+पाठ नियंत्रण।
* लेखक किसी ज्ञात आधार मॉडल (यानी, एसडीएक्सएल, आदि) को निर्दिष्ट नहीं करते हैं
पहली बार गुरुवार, 27 मार्च, 2025 को प्रकाशित












