एआई मॉडल और प्लेटफ़ॉर्म

लंबी वीडियो पीढ़ी के लिए कथा निरंतरता के लिए नुस्खा

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

हाल ही में हुन्युआन वीडियो जेनरेटिव एआई मॉडल की सार्वजनिक रिलीज़ ने बड़े बहुमोडल दृष्टि-भाषा मॉडलों की संभावना के बारे में चल रही चर्चाओं को तेज कर दिया है कि वे एक दिन पूरी फिल्में बना सकते हैं।

हालांकि, जैसा कि हमने देखा है, यह एक बहुत दूर की संभावना है, कई कारणों से। एक कारण यह है कि अधिकांश एआई वीडियो जनरेटरों की बहुत कम ध्यान अवधि है, जो एक छोटे से एकल शॉट में भी निरंतरता बनाए रखने के लिए संघर्ष करते हैं, एक श्रृंखला के शॉट के बारे में बात नहीं करते हैं।

एक अन्य कारण यह है कि वीडियो सामग्री (जैसे अन्वेषणीय वातावरण, जो यादृच्छिक रूप से नहीं बदलना चाहिए यदि आप उन्हें पुनः प्राप्त करते हैं) के लिए सुसंगत संदर्भ केवल प्रसार मॉडल में अनुकूलन तकनीकों जैसे निम्न-रैंक अनुकूलन (लोरा) द्वारा प्राप्त किए जा सकते हैं, जो मूल मॉडलों की बॉक्स क्षमताओं को सीमित करता है।

इस प्रकार, जनरेटिव वीडियो का विकास नए कथा निरंतरता दृष्टिकोणों के विकास तक रुकने के लिए तैयार लगता है।

निरंतरता के लिए नुस्खा

इस बात को ध्यान में रखते हुए, अमेरिका और चीन के बीच एक नई साझेदारी ने भविष्य की कथा निरंतरता प्रणालियों के लिए संभावित टेम्पलेट के रूप में निर्देशात्मक खाना पकाने वाले वीडियो का उपयोग करने का प्रस्ताव दिया है।

प्ले करने के लिए क्लिक करें। वीडियोआट्योर परियोजना खाना पकाने की प्रक्रिया के हिस्सों के विश्लेषण को सिस्टमेटाइज़ करती है, जिससे एक नए डेटासेट और वीडियो पीढ़ी के लिए एक ऑर्केस्ट्रेशन विधि का उत्पादन होता है। स्रोत साइट के लिए बेहतर रिज़ॉल्यूशन के लिए संदर्भ दें। स्रोत: https://videoauteur.github.io/

वीडियोआट्योर नामक इस कार्य में, एक दो-चरण पाइपलाइन का प्रस्ताव किया गया है जो सही राज्यों को जोड़कर कुंजी फ्रेम और कैप्शन का उपयोग करके निर्देशात्मक खाना पकाने वाले वीडियो को जनरेट करने के लिए – स्वीकारोक्ति में, एक कम-आवृत्ति स्थान में राज्य-कला परिणाम प्राप्त करता है।

वीडियोआट्योर के परियोजना पृष्ठ पर कुछ और ध्यान देने वाले वीडियो भी शामिल हैं जो इसी तकनीक का उपयोग करते हैं, जैसे कि एक प्रस्तावित ट्रेलर के लिए एक (गैर-मौजूद) मार्वल/डीसी क्रॉसओवर:

प्ले करने के लिए क्लिक करें। दो सुपरहीरो अलग-अलग ब्रह्मांडों से एक नकली ट्रेलर में आमने-सामने आते हैं। स्रोत साइट के लिए बेहतर रिज़ॉल्यूशन के लिए संदर्भ दें।

पेज पर समान रूप से स्टाइल किए गए प्रमो वीडियो भी हैं जो एक गैर-मौजूद नेटफ्लिक्स जानवर श्रृंखला और एक टेस्ला कार विज्ञापन के लिए हैं।

वीडियोआट्योर विकसित करते समय, लेखकों ने विविध नुकसान कार्यों और अन्य नए दृष्टिकोणों के साथ प्रयोग किया। एक नुस्खा कैसे जनरेट करने के लिए कार्य प्रवाह विकसित करने के लिए, उन्होंने कुकजेन को भी क्यूरेट किया, जो खाना पकाने के डोमेन पर केंद्रित सबसे बड़ा डेटासेट है, जिसमें 200,000 वीडियो क्लिप हैं जिनकी औसत अवधि 9.5 सेकंड है।

(TSLA )

प्रति वीडियो 768.3 शब्दों के औसत के साथ, कुकजेन अपनी तरह का सबसे व्यापक रूप से एनोटेटेड डेटासेट है। विविध दृष्टि-भाषा मॉडलों का उपयोग किया गया, अन्य दृष्टिकोणों के बीच, यह सुनिश्चित करने के लिए कि विवरण विस्तृत, प्रासंगिक और सटीक थे।

खाना पकाने वाले वीडियो का चयन इसलिए किया गया क्योंकि खाना पकाने के निर्देश पास-थ्रू में एक संरचित और अस्पष्ट कथा है, जो एनोटेशन और मूल्यांकन को एक आसान कार्य बनाती है। शायद ही कोई अन्य शैली इतनी दृश्य और कथात्मक रूप से ‘सूत्र’ है।

लेखक कहते हैं:

‘हमारा प्रस्तावित दो-चरण स्व-रिग्रेसिव पाइपलाइन, जिसमें एक लंबी कथा निदेशक और दृश्य-सशर्त वीडियो पीढ़ी शामिल है, सेमेंटिक संगति और दृश्य विश्वसनीयता में उत्साहजनक सुधार का प्रदर्शन करती है।

हमारे डेटासेट पर प्रयोगों के माध्यम से, हम वीडियो अनुक्रम में स्थानिक और कालानुक्रमिक सुसंगतता में सुधार का अवलोकन करते हैं।

‘हमें उम्मीद है कि हमारा काम लंबी कथा वीडियो पीढ़ी में आगे के शोध को सुविधाजनक बना सकता है।’

यह नया कार्य वीडियोआट्योर: लंबी कथा वीडियो पीढ़ी की ओर शीर्षक से है, और जॉन्स हॉपकिन्स विश्वविद्यालय, बाइटडांस और बाइटडांस सीड से आठ लेखकों द्वारा किया गया है।

डेटासेट क्यूरेशन

कुकजेन विकसित करने के लिए, जो एक दो-चरण जनरेटिव प्रणाली को शक्ति प्रदान करता है जो एआई खाना पकाने वाले वीडियो का उत्पादन करता है, लेखकों ने यूकुक और हाउटो100एम संग्रह से सामग्री का उपयोग किया।

लेखक कुकजेन के पैमाने की तुलना कथा विकास में जनरेटिव वीडियो पर केंद्रित पिछले डेटासेट से करते हैं, जैसे कि फ्लिंटस्टोन्स डेटासेट, पोरोरो कार्टून डेटासेट, स्टोरीजेन, टेंसेंट का स्टोरीस्ट्रीम, और विस्ट

कुकजेन और सबसे अधिक आबादी वाले समान डेटासेट के बीच छवियों और पाठ की लंबाई की तुलना। स्रोत: https://arxiv.org/pdf/2501.06173

कुकजेन और सबसे अधिक आबादी वाले समान डेटासेट के बीच छवियों और पाठ की लंबाई की तुलना। स्रोत: https://arxiv.org/pdf/2501.06173

कुकजेन वास्तविक दुनिया की कथाओं पर केंद्रित है, विशेष रूप से प्रक्रियात्मक गतिविधियों जैसे खाना पकाने पर, जो छवि-आधारित कॉमिक डेटासेट की तुलना में स्पष्ट और आसानी से एनोटेट करने योग्य कथाएं प्रदान करता है। यह मौजूदा सबसे बड़े डेटासेट, स्टोरीस्ट्रीम से 150 गुना अधिक फ्रेम और 5 गुना घने पाठ विवरण प्रदान करता है।

शोधकर्ताओं ने एक कैप्शनिंग मॉडल को फाइन-ट्यून किया एलएवीए-नेक्स्ट की विधि का उपयोग करके एक आधार के रूप में एलएवीए-नेक्स्ट का। हाउटो100एम के लिए प्राप्त ऑटोमैटिक स्पीच रिकग्निशन (एएसआर) प्सेवдо-लेबल्स का उपयोग प्रत्येक वीडियो के लिए ‘क्रियाओं’ के रूप में किया गया था, और फिर बड़े भाषा मॉडल (एलएलएम) द्वारा आगे परिष्कृत किया गया था।

उदाहरण के लिए, चैटजीपीटी-4ओ का उपयोग एक कैप्शन डेटासेट का उत्पादन करने के लिए किया गया था, और विषय-वस्तु इंटरैक्शन (जैसे हाथ बर्तन और खाद्य पदार्थों को संभालते हुए), वस्तु विशेषताओं और कालानुक्रमिक गतिविधियों पर ध्यान केंद्रित करने के लिए कहा गया था।

चूंकि एएसआर स्क्रिप्ट में अक्षरधारा और सामान्य रूप से ‘शोर’ होने की संभावना है, इंटरसेक्शन-ओवर-यूनियन (आईओयू) का उपयोग यह मापने के लिए एक मेट्रिक के रूप में किया गया था कि कैप्शन वीडियो के जिस खंड से संबंधित थे उसके कितने करीब थे। लेखकों का यह मत है कि कथा निरंतरता के निर्माण के लिए यह महत्वपूर्ण था।

क्यूरेटेड क्लिप का मूल्यांकन फ्रेचेट वीडियो दूरी (एफवीडी) का उपयोग करके किया गया था, जो वास्तविक दुनिया (वास्तविक दुनिया) के उदाहरणों और उत्पन्न उदाहरणों के बीच की खाई को मापता है, दोनों के साथ और बिना मूल कुंजी फ्रेम के।

नमूना वीडियो से प्राप्त कुंजी फ्रेम का उपयोग किए बिना और के साथ नए कैप्शन के साथ उत्पन्न वीडियो के बीच दूरी का मूल्यांकन करने के लिए एफवीडी का उपयोग।

नमूना वीडियो से प्राप्त कुंजी फ्रेम का उपयोग किए बिना और के साथ नए कैप्शन के साथ उत्पन्न वीडियो के बीच दूरी का मूल्यांकन करने के लिए एफवीडी का उपयोग।[/em>

इसके अतिरिक्त, क्लिप को जीपीटी-4ओ और छह मानव अनुवर्ती द्वारा दर्जा दिया गया था, एलएवीए-हाउंड के ‘हॉलुसिनेशन’ की परिभाषा का पालन करते हुए, अर्थात् एक मॉडल की क्षमता जो भ्रामक सामग्री का आविष्कार कर सकती है।

शोधकर्ताओं ने कैप्शन की गुणवत्ता की तुलना क्वेन2-वीएल-72बी संग्रह से की और थोड़ा बेहतर स्कोर प्राप्त किया।

क्वेन2-वीएल-72बी और लेखकों के संग्रह के बीच एफवीडी और मानव मूल्यांकन स्कोर की तुलना।

क्वेन2-वीएल-72बी और लेखकों के संग्रह के बीच एफवीडी और मानव मूल्यांकन स्कोर की तुलना।[/em>

विधि

वीडियोआट्योर के जनरेटिव चरण को लंबी कथा निदेशक (एलएनडी) और दृश्य-सशर्त वीडियो पीढ़ी मॉडल (वीसीवीजीएम) के बीच विभाजित किया गया है।

एलएनडी एक दृश्य एम्बेडिंग या कुंजी फ्रेम की एक श्रृंखला उत्पन्न करता है जो कथा प्रवाह की विशेषता है, ‘महत्वपूर्ण हाइलाइट्स’ के समान। वीसीवीजीएम इन विकल्पों के आधार पर वीडियो क्लिप उत्पन्न करता है।

वीडियोआट्योर प्रोसेसिंग पाइपलाइन के लिए स्कीमा। लंबी कथा वीडियो निदेशक सीड-एक्स-पावर्ड जनरेटिव मॉड्यूल को खिलाने के लिए उपयुक्त चयन करता है।

वीडियोआट्योर प्रोसेसिंग पाइपलाइन के लिए स्कीमा। लंबी कथा वीडियो निदेशक सीड-एक्स-पावर्ड जनरेटिव मॉड्यूल को खिलाने के लिए उपयुक्त चयन करता है।[/em>

लेखक विभिन्न छवि-पाठ निदेशक और भाषा-केंद्रित कुंजी फ्रेम निदेशक के अलग-अलग मेरिट पर व्यापक रूप से चर्चा करते हैं, और निष्कर्ष निकालते हैं कि पूर्व दृष्टिकोण अधिक प्रभावी है।

इंटरलीव्ड इमेज-टेक्स्ट निदेशक एक अनुक्रम को टेक्स्ट टोकन और दृश्य एम्बेडिंग को इंटरलीविंग करके उत्पन्न करता है, एक स्व-रिग्रेसिव मॉडल का उपयोग करके अगले टोकन की भविष्यवाणी करने के लिए, दोनों छवियों और पाठ के संयुक्त संदर्भ का उपयोग करता है। यह दृश्यों और पाठ के बीच एक तंग संरेखण सुनिश्चित करता है।

इसके विपरीत, भाषा-केंद्रित कुंजी फ्रेम निदेशक केवल कैप्शन के आधार पर एक पाठ-सशर्त प्रसार मॉडल का उपयोग करके कुंजी फ्रेम का संश्लेषण करता है, दृश्य एम्बेडिंग को पीढ़ी प्रक्रिया में शामिल नहीं करता है।

शोधकर्ताओं ने पाया कि जबकि भाषा-केंद्रित विधि दृश्य रूप से आकर्षक कुंजी फ्रेम उत्पन्न करती है, यह फ्रेम के माध्यम से निरंतरता की कमी है। उन्होंने तर्क दिया कि इंटरलीव्ड विधि वास्तविकता और दृश्य सुसंगतता में उच्च स्कोर प्राप्त करती है। उन्होंने यह भी पाया कि यह विधि प्रशिक्षण के माध्यम से एक वास्तविक दृश्य शैली सीखने में बेहतर थी, हालांकि कभी-कभी कुछ पुनरावृत्ति या शोर तत्वों के साथ।

असामान्य रूप से, स्टेबल डिफ्यूजन और फ्लक्स को कार्य प्रवाह में शामिल करने वाले शोध के एक धागे के बावजूद, लेखकों ने अपने जनरेटिव पाइपलाइन के लिए टेंसेंट के सीड-एक्स 7बी-पैरामीटर बहुमोडल एलएलएम फाउंडेशन मॉडल का उपयोग किया (हालांकि यह मॉडल स्थिरता के एसडीएक्सएल रिलीज का लाभ उठाता है स्थिर प्रसार के लिए अपने आर्किटेक्चर के एक सीमित हिस्से के लिए)।

लेखक कहते हैं:

‘क्लासिक इमेज-टू-वीडियो (आई2वी) पाइपलाइन के विपरीत, जो एक छवि को प्रारंभिक फ्रेम के रूप में उपयोग करती है, हमारा दृष्टिकोण [पुनर्गठित दृश्य लेटेंट] को निरंतर स्थितियों के रूप में क्रम में उपयोग करता है।

‘इसके अलावा, हम दृश्य एम्बेडिंग में शोर को संभालने के लिए मॉडल को अनुकूलित करके उत्पन्न वीडियो की विश्वसनीयता और गुणवत्ता में सुधार करते हैं, क्योंकि पुनर्गठित दृश्य लेटेंट पुनरावृत्ति त्रुटियों के कारण पूर्ण नहीं हो सकते हैं। ‘

परीक्षण

सीडस्टोरी के तरीकों के अनुसार, शोधकर्ताओं ने अपने कथा डेटासेट पर सीड-एक्स पर लोरा फाइन-ट्यूनिंग लागू की, जिसे वे एक ‘सोरा-जैसे मॉडल’ के रूप में वर्णित करते हैं, जो बड़े पैमाने पर वीडियो/पाठ जोड़ों पर पूर्व-प्रशिक्षित है, और दोनों दृश्य और पाठ प्रॉम्प्ट और स्थितियों को स्वीकार करने में सक्षम है।

मॉडल विकास के लिए 32,000 कथा वीडियो का उपयोग किया गया था, जिनमें से 1,000 को वैधीकरण नमूने के रूप में अलग रखा गया था। वीडियो को 448 पिक्सेल पर छोटी तरफ क्रॉप किया गया और फिर 448x448px पर केंद्र क्रॉप किया गया।

प्रशिक्षण के लिए, कथा पीढ़ी का मूल्यांकन मुख्य रूप से यूकुक2 सत्यापन सेट पर किया गया था। हाउटो100एम सेट का उपयोग डेटा गुणवत्ता मूल्यांकन और छवि से वीडियो पीढ़ी के लिए किया गया था।

दृश्य-सशर्त हानि के लिए, लेखकों ने डीआईटी से प्रसार हानि और 2024 के एक कार्य का उपयोग किया, जो स्थिर प्रसार के आसपास केंद्रित है।

उनके दावे की पुष्टि करने के लिए कि इंटरलीविंग एक बेहतर दृष्टिकोण है, लेखकों ने वीडियोआट्योर को कुछ तरीकों के खिलाफ खड़ा किया जो केवल पाठ-आधारित इनपुट पर निर्भर करते हैं: ईएमयू-2, सीड-एक्स, एसडीएक्सएल और फ्लक्स.1-श्नेल (फ्लक्स.1-एस)।

एक वैश्विक प्रॉम्प्ट दिए जाने पर, 'मैपो टोफू पकाने के लिए चरण-दर-चरण गाइड', इंटरलीव्ड निदेशक क्रियाओं, कैप्शन और छवि एम्बेडिंग को क्रमिक रूप से उत्पन्न करता है ताकि प्रक्रिया को वर्णित किया जा सके। पहली दो पंक्तियां ईएमयू-2 और सीड-एक्स लेटेंट स्थान से डिकोड की गई कुंजी फ्रेम दिखाती हैं। ये छवियां वास्तविक और सुसंगत हैं लेकिन एसडीएक्सएल और फ्लक्स जैसे उन्नत मॉडलों की तुलना में कम पॉलिश हैं।

एक वैश्विक प्रॉम्प्ट दिए जाने पर, ‘मैपो टोफू पकाने के लिए चरण-दर-चरण गाइड’, इंटरलीव्ड निदेशक क्रियाओं, कैप्शन और छवि एम्बेडिंग को क्रमिक रूप से उत्पन्न करता है ताकि प्रक्रिया को वर्णित किया जा सके। पहली दो पंक्तियां ईएमयू-2 और सीड-एक्स लेटेंट स्थान से डिकोड की गई कुंजी फ्रेम दिखाती हैं। ये छवियां वास्तविक और सुसंगत हैं लेकिन एसडीएक्सएल और फ्लक्स जैसे उन्नत मॉडलों की तुलना में कम पॉलिश हैं।[/em>

लेखक कहते हैं:

‘भाषा-केंद्रित दृष्टिकोण टेक्स्ट-टू-इमेज मॉडल का उपयोग करके दृश्य रूप से आकर्षक कुंजी फ्रेम का उत्पादन करता है, लेकिन सीमित पारस्परिक जानकारी के कारण फ्रेम के माध्यम से निरंतरता की कमी से पीड़ित है। दूसरी ओर, इंटरलीव्ड पीढ़ी विधि भाषा-संरेखित दृश्य लेटेंट का लाभ उठाती है, प्रशिक्षण के माध्यम से एक वास्तविक दृश्य शैली प्राप्त करती है।

‘हालांकि, यह कभी-कभी पुनरावृत्ति या शोर तत्वों वाली छवियां उत्पन्न करता है, क्योंकि स्व-रिग्रेसिव मॉडल एक ही पास में सटीक एम्बेडिंग बनाने के लिए संघर्ष करता है। ‘

मानव मूल्यांकन आगे भी लेखकों के दावे की पुष्टि करता है कि इंटरलीव्ड दृष्टिकोण में सुधार किए गए प्रदर्शन की पुष्टि करता है, इंटरलीव्ड तरीकों ने एक सर्वेक्षण में उच्चतम स्कोर प्राप्त किए।

कागज़ के लिए आयोजित एक मानव अध्ययन से दृष्टिकोणों की तुलना।

कागज़ के लिए आयोजित एक मानव अध्ययन से दृष्टिकोणों की तुलना।[/em>

हालांकि, हम यह ध्यान देते हैं कि भाषा-केंद्रित दृष्टिकोण सौंदर्य स्कोर में सर्वश्रेष्ठ प्राप्त करता है। लेखकों का तर्क है, हालांकि, कि यह लंबी कथा वीडियो पीढ़ी में मुख्य मुद्दा नहीं है।

प्ले करने के लिए क्लिक करें।वीडियोआट्योर द्वारा एक पिज्जा निर्माण वीडियो के लिए उत्पन्न खंड।

निष्कर्ष

लंबी वीडियो पीढ़ी में कथा निरंतरता की चुनौती से संबंधित शोध की सबसे लोकप्रिय धारा एकल छवियों से संबंधित है। इस तरह की परियोजनाओं में ड्रीमस्टोरी, स्टोरीडिफ्यूजन, थिएटरजेन और एनवीडिया का कॉन्सिस्टोरी शामिल हैं।

एक अर्थ में, वीडियोआट्योर भी इस ‘स्थिर’ श्रेणी में आता है, क्योंकि यह क्लिप अनुभागों को उत्पन्न करने के लिए बीज छवियों का उपयोग करता है। हालांकि, वीडियो और सेमेंटिक सामग्री का इंटरलीविंग प्रक्रिया को एक व्यावहारिक पाइपलाइन के करीब ले जाता है।

 

पहली बार गुरुवार, 16 जनवरी 2025 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai