एआई मॉडल और प्लेटफ़ॉर्म
लंबी वीडियो पीढ़ी के लिए कथा निरंतरता के लिए नुस्खा

हाल ही में हुन्युआन वीडियो जेनरेटिव एआई मॉडल की सार्वजनिक रिलीज़ ने बड़े बहुमोडल दृष्टि-भाषा मॉडलों की संभावना के बारे में चल रही चर्चाओं को तेज कर दिया है कि वे एक दिन पूरी फिल्में बना सकते हैं।
हालांकि, जैसा कि हमने देखा है, यह एक बहुत दूर की संभावना है, कई कारणों से। एक कारण यह है कि अधिकांश एआई वीडियो जनरेटरों की बहुत कम ध्यान अवधि है, जो एक छोटे से एकल शॉट में भी निरंतरता बनाए रखने के लिए संघर्ष करते हैं, एक श्रृंखला के शॉट के बारे में बात नहीं करते हैं।
एक अन्य कारण यह है कि वीडियो सामग्री (जैसे अन्वेषणीय वातावरण, जो यादृच्छिक रूप से नहीं बदलना चाहिए यदि आप उन्हें पुनः प्राप्त करते हैं) के लिए सुसंगत संदर्भ केवल प्रसार मॉडल में अनुकूलन तकनीकों जैसे निम्न-रैंक अनुकूलन (लोरा) द्वारा प्राप्त किए जा सकते हैं, जो मूल मॉडलों की बॉक्स क्षमताओं को सीमित करता है।
इस प्रकार, जनरेटिव वीडियो का विकास नए कथा निरंतरता दृष्टिकोणों के विकास तक रुकने के लिए तैयार लगता है।
निरंतरता के लिए नुस्खा
इस बात को ध्यान में रखते हुए, अमेरिका और चीन के बीच एक नई साझेदारी ने भविष्य की कथा निरंतरता प्रणालियों के लिए संभावित टेम्पलेट के रूप में निर्देशात्मक खाना पकाने वाले वीडियो का उपयोग करने का प्रस्ताव दिया है।
प्ले करने के लिए क्लिक करें। वीडियोआट्योर परियोजना खाना पकाने की प्रक्रिया के हिस्सों के विश्लेषण को सिस्टमेटाइज़ करती है, जिससे एक नए डेटासेट और वीडियो पीढ़ी के लिए एक ऑर्केस्ट्रेशन विधि का उत्पादन होता है। स्रोत साइट के लिए बेहतर रिज़ॉल्यूशन के लिए संदर्भ दें। स्रोत: https://videoauteur.github.io/
वीडियोआट्योर नामक इस कार्य में, एक दो-चरण पाइपलाइन का प्रस्ताव किया गया है जो सही राज्यों को जोड़कर कुंजी फ्रेम और कैप्शन का उपयोग करके निर्देशात्मक खाना पकाने वाले वीडियो को जनरेट करने के लिए – स्वीकारोक्ति में, एक कम-आवृत्ति स्थान में राज्य-कला परिणाम प्राप्त करता है।
वीडियोआट्योर के परियोजना पृष्ठ पर कुछ और ध्यान देने वाले वीडियो भी शामिल हैं जो इसी तकनीक का उपयोग करते हैं, जैसे कि एक प्रस्तावित ट्रेलर के लिए एक (गैर-मौजूद) मार्वल/डीसी क्रॉसओवर:
प्ले करने के लिए क्लिक करें। दो सुपरहीरो अलग-अलग ब्रह्मांडों से एक नकली ट्रेलर में आमने-सामने आते हैं। स्रोत साइट के लिए बेहतर रिज़ॉल्यूशन के लिए संदर्भ दें।
पेज पर समान रूप से स्टाइल किए गए प्रमो वीडियो भी हैं जो एक गैर-मौजूद नेटफ्लिक्स जानवर श्रृंखला और एक टेस्ला कार विज्ञापन के लिए हैं।
वीडियोआट्योर विकसित करते समय, लेखकों ने विविध नुकसान कार्यों और अन्य नए दृष्टिकोणों के साथ प्रयोग किया। एक नुस्खा कैसे जनरेट करने के लिए कार्य प्रवाह विकसित करने के लिए, उन्होंने कुकजेन को भी क्यूरेट किया, जो खाना पकाने के डोमेन पर केंद्रित सबसे बड़ा डेटासेट है, जिसमें 200,000 वीडियो क्लिप हैं जिनकी औसत अवधि 9.5 सेकंड है।
(TSLA )प्रति वीडियो 768.3 शब्दों के औसत के साथ, कुकजेन अपनी तरह का सबसे व्यापक रूप से एनोटेटेड डेटासेट है। विविध दृष्टि-भाषा मॉडलों का उपयोग किया गया, अन्य दृष्टिकोणों के बीच, यह सुनिश्चित करने के लिए कि विवरण विस्तृत, प्रासंगिक और सटीक थे।
खाना पकाने वाले वीडियो का चयन इसलिए किया गया क्योंकि खाना पकाने के निर्देश पास-थ्रू में एक संरचित और अस्पष्ट कथा है, जो एनोटेशन और मूल्यांकन को एक आसान कार्य बनाती है। शायद ही कोई अन्य शैली इतनी दृश्य और कथात्मक रूप से ‘सूत्र’ है।
लेखक कहते हैं:
‘हमारा प्रस्तावित दो-चरण स्व-रिग्रेसिव पाइपलाइन, जिसमें एक लंबी कथा निदेशक और दृश्य-सशर्त वीडियो पीढ़ी शामिल है, सेमेंटिक संगति और दृश्य विश्वसनीयता में उत्साहजनक सुधार का प्रदर्शन करती है।
हमारे डेटासेट पर प्रयोगों के माध्यम से, हम वीडियो अनुक्रम में स्थानिक और कालानुक्रमिक सुसंगतता में सुधार का अवलोकन करते हैं।
‘हमें उम्मीद है कि हमारा काम लंबी कथा वीडियो पीढ़ी में आगे के शोध को सुविधाजनक बना सकता है।’
यह नया कार्य वीडियोआट्योर: लंबी कथा वीडियो पीढ़ी की ओर शीर्षक से है, और जॉन्स हॉपकिन्स विश्वविद्यालय, बाइटडांस और बाइटडांस सीड से आठ लेखकों द्वारा किया गया है।
डेटासेट क्यूरेशन
कुकजेन विकसित करने के लिए, जो एक दो-चरण जनरेटिव प्रणाली को शक्ति प्रदान करता है जो एआई खाना पकाने वाले वीडियो का उत्पादन करता है, लेखकों ने यूकुक और हाउटो100एम संग्रह से सामग्री का उपयोग किया।
लेखक कुकजेन के पैमाने की तुलना कथा विकास में जनरेटिव वीडियो पर केंद्रित पिछले डेटासेट से करते हैं, जैसे कि फ्लिंटस्टोन्स डेटासेट, पोरोरो कार्टून डेटासेट, स्टोरीजेन, टेंसेंट का स्टोरीस्ट्रीम, और विस्ट।

कुकजेन और सबसे अधिक आबादी वाले समान डेटासेट के बीच छवियों और पाठ की लंबाई की तुलना। स्रोत: https://arxiv.org/pdf/2501.06173
कुकजेन वास्तविक दुनिया की कथाओं पर केंद्रित है, विशेष रूप से प्रक्रियात्मक गतिविधियों जैसे खाना पकाने पर, जो छवि-आधारित कॉमिक डेटासेट की तुलना में स्पष्ट और आसानी से एनोटेट करने योग्य कथाएं प्रदान करता है। यह मौजूदा सबसे बड़े डेटासेट, स्टोरीस्ट्रीम से 150 गुना अधिक फ्रेम और 5 गुना घने पाठ विवरण प्रदान करता है।
शोधकर्ताओं ने एक कैप्शनिंग मॉडल को फाइन-ट्यून किया एलएवीए-नेक्स्ट की विधि का उपयोग करके एक आधार के रूप में एलएवीए-नेक्स्ट का। हाउटो100एम के लिए प्राप्त ऑटोमैटिक स्पीच रिकग्निशन (एएसआर) प्सेवдо-लेबल्स का उपयोग प्रत्येक वीडियो के लिए ‘क्रियाओं’ के रूप में किया गया था, और फिर बड़े भाषा मॉडल (एलएलएम) द्वारा आगे परिष्कृत किया गया था।
उदाहरण के लिए, चैटजीपीटी-4ओ का उपयोग एक कैप्शन डेटासेट का उत्पादन करने के लिए किया गया था, और विषय-वस्तु इंटरैक्शन (जैसे हाथ बर्तन और खाद्य पदार्थों को संभालते हुए), वस्तु विशेषताओं और कालानुक्रमिक गतिविधियों पर ध्यान केंद्रित करने के लिए कहा गया था।
चूंकि एएसआर स्क्रिप्ट में अक्षरधारा और सामान्य रूप से ‘शोर’ होने की संभावना है, इंटरसेक्शन-ओवर-यूनियन (आईओयू) का उपयोग यह मापने के लिए एक मेट्रिक के रूप में किया गया था कि कैप्शन वीडियो के जिस खंड से संबंधित थे उसके कितने करीब थे। लेखकों का यह मत है कि कथा निरंतरता के निर्माण के लिए यह महत्वपूर्ण था।
क्यूरेटेड क्लिप का मूल्यांकन फ्रेचेट वीडियो दूरी (एफवीडी) का उपयोग करके किया गया था, जो वास्तविक दुनिया (वास्तविक दुनिया) के उदाहरणों और उत्पन्न उदाहरणों के बीच की खाई को मापता है, दोनों के साथ और बिना मूल कुंजी फ्रेम के।

नमूना वीडियो से प्राप्त कुंजी फ्रेम का उपयोग किए बिना और के साथ नए कैप्शन के साथ उत्पन्न वीडियो के बीच दूरी का मूल्यांकन करने के लिए एफवीडी का उपयोग।[/em>
इसके अतिरिक्त, क्लिप को जीपीटी-4ओ और छह मानव अनुवर्ती द्वारा दर्जा दिया गया था, एलएवीए-हाउंड के ‘हॉलुसिनेशन’ की परिभाषा का पालन करते हुए, अर्थात् एक मॉडल की क्षमता जो भ्रामक सामग्री का आविष्कार कर सकती है।
शोधकर्ताओं ने कैप्शन की गुणवत्ता की तुलना क्वेन2-वीएल-72बी संग्रह से की और थोड़ा बेहतर स्कोर प्राप्त किया।

क्वेन2-वीएल-72बी और लेखकों के संग्रह के बीच एफवीडी और मानव मूल्यांकन स्कोर की तुलना।[/em>
विधि
वीडियोआट्योर के जनरेटिव चरण को लंबी कथा निदेशक (एलएनडी) और दृश्य-सशर्त वीडियो पीढ़ी मॉडल (वीसीवीजीएम) के बीच विभाजित किया गया है।
एलएनडी एक दृश्य एम्बेडिंग या कुंजी फ्रेम की एक श्रृंखला उत्पन्न करता है जो कथा प्रवाह की विशेषता है, ‘महत्वपूर्ण हाइलाइट्स’ के समान। वीसीवीजीएम इन विकल्पों के आधार पर वीडियो क्लिप उत्पन्न करता है।

वीडियोआट्योर प्रोसेसिंग पाइपलाइन के लिए स्कीमा। लंबी कथा वीडियो निदेशक सीड-एक्स-पावर्ड जनरेटिव मॉड्यूल को खिलाने के लिए उपयुक्त चयन करता है।[/em>
लेखक विभिन्न छवि-पाठ निदेशक और भाषा-केंद्रित कुंजी फ्रेम निदेशक के अलग-अलग मेरिट पर व्यापक रूप से चर्चा करते हैं, और निष्कर्ष निकालते हैं कि पूर्व दृष्टिकोण अधिक प्रभावी है।
इंटरलीव्ड इमेज-टेक्स्ट निदेशक एक अनुक्रम को टेक्स्ट टोकन और दृश्य एम्बेडिंग को इंटरलीविंग करके उत्पन्न करता है, एक स्व-रिग्रेसिव मॉडल का उपयोग करके अगले टोकन की भविष्यवाणी करने के लिए, दोनों छवियों और पाठ के संयुक्त संदर्भ का उपयोग करता है। यह दृश्यों और पाठ के बीच एक तंग संरेखण सुनिश्चित करता है।
इसके विपरीत, भाषा-केंद्रित कुंजी फ्रेम निदेशक केवल कैप्शन के आधार पर एक पाठ-सशर्त प्रसार मॉडल का उपयोग करके कुंजी फ्रेम का संश्लेषण करता है, दृश्य एम्बेडिंग को पीढ़ी प्रक्रिया में शामिल नहीं करता है।
शोधकर्ताओं ने पाया कि जबकि भाषा-केंद्रित विधि दृश्य रूप से आकर्षक कुंजी फ्रेम उत्पन्न करती है, यह फ्रेम के माध्यम से निरंतरता की कमी है। उन्होंने तर्क दिया कि इंटरलीव्ड विधि वास्तविकता और दृश्य सुसंगतता में उच्च स्कोर प्राप्त करती है। उन्होंने यह भी पाया कि यह विधि प्रशिक्षण के माध्यम से एक वास्तविक दृश्य शैली सीखने में बेहतर थी, हालांकि कभी-कभी कुछ पुनरावृत्ति या शोर तत्वों के साथ।
असामान्य रूप से, स्टेबल डिफ्यूजन और फ्लक्स को कार्य प्रवाह में शामिल करने वाले शोध के एक धागे के बावजूद, लेखकों ने अपने जनरेटिव पाइपलाइन के लिए टेंसेंट के सीड-एक्स 7बी-पैरामीटर बहुमोडल एलएलएम फाउंडेशन मॉडल का उपयोग किया (हालांकि यह मॉडल स्थिरता के एसडीएक्सएल रिलीज का लाभ उठाता है स्थिर प्रसार के लिए अपने आर्किटेक्चर के एक सीमित हिस्से के लिए)।
लेखक कहते हैं:
‘क्लासिक इमेज-टू-वीडियो (आई2वी) पाइपलाइन के विपरीत, जो एक छवि को प्रारंभिक फ्रेम के रूप में उपयोग करती है, हमारा दृष्टिकोण [पुनर्गठित दृश्य लेटेंट] को निरंतर स्थितियों के रूप में क्रम में उपयोग करता है।
‘इसके अलावा, हम दृश्य एम्बेडिंग में शोर को संभालने के लिए मॉडल को अनुकूलित करके उत्पन्न वीडियो की विश्वसनीयता और गुणवत्ता में सुधार करते हैं, क्योंकि पुनर्गठित दृश्य लेटेंट पुनरावृत्ति त्रुटियों के कारण पूर्ण नहीं हो सकते हैं। ‘
परीक्षण
सीडस्टोरी के तरीकों के अनुसार, शोधकर्ताओं ने अपने कथा डेटासेट पर सीड-एक्स पर लोरा फाइन-ट्यूनिंग लागू की, जिसे वे एक ‘सोरा-जैसे मॉडल’ के रूप में वर्णित करते हैं, जो बड़े पैमाने पर वीडियो/पाठ जोड़ों पर पूर्व-प्रशिक्षित है, और दोनों दृश्य और पाठ प्रॉम्प्ट और स्थितियों को स्वीकार करने में सक्षम है।
मॉडल विकास के लिए 32,000 कथा वीडियो का उपयोग किया गया था, जिनमें से 1,000 को वैधीकरण नमूने के रूप में अलग रखा गया था। वीडियो को 448 पिक्सेल पर छोटी तरफ क्रॉप किया गया और फिर 448x448px पर केंद्र क्रॉप किया गया।
प्रशिक्षण के लिए, कथा पीढ़ी का मूल्यांकन मुख्य रूप से यूकुक2 सत्यापन सेट पर किया गया था। हाउटो100एम सेट का उपयोग डेटा गुणवत्ता मूल्यांकन और छवि से वीडियो पीढ़ी के लिए किया गया था।
दृश्य-सशर्त हानि के लिए, लेखकों ने डीआईटी से प्रसार हानि और 2024 के एक कार्य का उपयोग किया, जो स्थिर प्रसार के आसपास केंद्रित है।
उनके दावे की पुष्टि करने के लिए कि इंटरलीविंग एक बेहतर दृष्टिकोण है, लेखकों ने वीडियोआट्योर को कुछ तरीकों के खिलाफ खड़ा किया जो केवल पाठ-आधारित इनपुट पर निर्भर करते हैं: ईएमयू-2, सीड-एक्स, एसडीएक्सएल और फ्लक्स.1-श्नेल (फ्लक्स.1-एस)।

एक वैश्विक प्रॉम्प्ट दिए जाने पर, ‘मैपो टोफू पकाने के लिए चरण-दर-चरण गाइड’, इंटरलीव्ड निदेशक क्रियाओं, कैप्शन और छवि एम्बेडिंग को क्रमिक रूप से उत्पन्न करता है ताकि प्रक्रिया को वर्णित किया जा सके। पहली दो पंक्तियां ईएमयू-2 और सीड-एक्स लेटेंट स्थान से डिकोड की गई कुंजी फ्रेम दिखाती हैं। ये छवियां वास्तविक और सुसंगत हैं लेकिन एसडीएक्सएल और फ्लक्स जैसे उन्नत मॉडलों की तुलना में कम पॉलिश हैं।[/em>
लेखक कहते हैं:
‘भाषा-केंद्रित दृष्टिकोण टेक्स्ट-टू-इमेज मॉडल का उपयोग करके दृश्य रूप से आकर्षक कुंजी फ्रेम का उत्पादन करता है, लेकिन सीमित पारस्परिक जानकारी के कारण फ्रेम के माध्यम से निरंतरता की कमी से पीड़ित है। दूसरी ओर, इंटरलीव्ड पीढ़ी विधि भाषा-संरेखित दृश्य लेटेंट का लाभ उठाती है, प्रशिक्षण के माध्यम से एक वास्तविक दृश्य शैली प्राप्त करती है।
‘हालांकि, यह कभी-कभी पुनरावृत्ति या शोर तत्वों वाली छवियां उत्पन्न करता है, क्योंकि स्व-रिग्रेसिव मॉडल एक ही पास में सटीक एम्बेडिंग बनाने के लिए संघर्ष करता है। ‘
मानव मूल्यांकन आगे भी लेखकों के दावे की पुष्टि करता है कि इंटरलीव्ड दृष्टिकोण में सुधार किए गए प्रदर्शन की पुष्टि करता है, इंटरलीव्ड तरीकों ने एक सर्वेक्षण में उच्चतम स्कोर प्राप्त किए।

कागज़ के लिए आयोजित एक मानव अध्ययन से दृष्टिकोणों की तुलना।[/em>
हालांकि, हम यह ध्यान देते हैं कि भाषा-केंद्रित दृष्टिकोण सौंदर्य स्कोर में सर्वश्रेष्ठ प्राप्त करता है। लेखकों का तर्क है, हालांकि, कि यह लंबी कथा वीडियो पीढ़ी में मुख्य मुद्दा नहीं है।
प्ले करने के लिए क्लिक करें।वीडियोआट्योर द्वारा एक पिज्जा निर्माण वीडियो के लिए उत्पन्न खंड।
निष्कर्ष
लंबी वीडियो पीढ़ी में कथा निरंतरता की चुनौती से संबंधित शोध की सबसे लोकप्रिय धारा एकल छवियों से संबंधित है। इस तरह की परियोजनाओं में ड्रीमस्टोरी, स्टोरीडिफ्यूजन, थिएटरजेन और एनवीडिया का कॉन्सिस्टोरी शामिल हैं।
एक अर्थ में, वीडियोआट्योर भी इस ‘स्थिर’ श्रेणी में आता है, क्योंकि यह क्लिप अनुभागों को उत्पन्न करने के लिए बीज छवियों का उपयोग करता है। हालांकि, वीडियो और सेमेंटिक सामग्री का इंटरलीविंग प्रक्रिया को एक व्यावहारिक पाइपलाइन के करीब ले जाता है।
पहली बार गुरुवार, 16 जनवरी 2025 को प्रकाशित।












