एआई मॉडल और प्लेटफ़ॉर्म
जनरेटिव वीडियो में ‘स्पेस बीच’ को पुल करना

चीन से नए शोध ने दो समय-स्थानिक रूप से दूरस्थ वीडियो फ्रेम के बीच के अंतर को भरने के लिए एक सुधारित विधि प्रदान की है – यह जनरेटिव एआई वीडियो के लिए वास्तविकता की दौड़ में सबसे महत्वपूर्ण चुनौतियों में से एक है, साथ ही वीडियो कोडेक संपीड़न के लिए भी।
नीचे दिए गए उदाहरण वीडियो में, हम बाएं से दाएं कॉलम में एक ‘प्रारंभ’ (ऊपर बाएं) और ‘अंत’ (नीचे बाएं) फ्रेम देखते हैं। प्रतिस्पर्धी प्रणालियों को जो कार्य करना है, वह यह अनुमान लगाना है कि दो चित्रों में विषय कैसे फ्रेम ए से फ्रेम बी तक पहुंचेगा। एनिमेशन में, इस प्रक्रिया को ट्वीनिंग कहा जाता है, और यह मूक फिल्म निर्माण के युग से संबंधित है।
प्ले करने के लिए क्लिक करें। पहले कॉलम में, हम प्रस्तावित प्रारंभ और अंत फ्रेम देखते हैं। मध्य कॉलम में, और तीसरे (दाएं) कॉलम के शीर्ष पर, हम तीन पिछले दृष्टिकोण देखते हैं इस चुनौती के लिए। नीचे दाएं, हम देखते हैं कि नई विधि अधिक आश्वस्त परिणाम प्राप्त करती है अंतराल फ्रेम प्रदान करने में. स्रोत: https://fcvg-inbetween.github.io/
चीनी शोधकर्ताओं द्वारा प्रस्तावित नई विधि को फ्रेम-वार स्थितियों-चालित वीडियो जेनरेशन (FCVG) कहा जाता है, और इसके परिणाम ऊपर दिए गए वीडियो के निचले दाएं हिस्से में देखे जा सकते हैं, जो एक स्मूथ और तार्किक संक्रमण प्रदान करता है एक स्थिर फ्रेम से दूसरे तक।
इसके विपरीत, हम देख सकते हैं कि वीडियो इंटरपोलेशन के लिए सबसे प्रसिद्ध फ्रेमवर्क में से एक, गूगल का फ्रेम इंटरपोलेशन फॉर लार्ज मोशन (FILM) परियोजना, बड़े और बोल्ड मोशन की व्याख्या करने में संघर्ष करता है, जैसा कि अन्य समान प्रयासों के साथ होता है।
वीडियो में दिखाए गए अन्य दो प्रतिद्वंद्वी फ्रेमवर्क, टाइम रिवर्सल फ्यूजन (TRF) और जेनरेटिव इनबीट्वीनिंग (GI), एक कम विकृत व्याख्या प्रदान करते हैं, लेकिन उन्होंने फ्रेनेटिक और यहां तक कि कॉमिक नृत्य की चालें बनाई हैं, जिनमें से कोई भी दो आपूर्ति किए गए फ्रेम के स्पष्ट तर्क का सम्मान नहीं करता है।
प्ले करने के लिए क्लिक करें। ट्वीनिंग समस्या के दो अपरिपूर्ण समाधान। बाएं, FILM दो फ्रेम को सरल मॉर्फ लक्ष्य के रूप में मानता है। दाएं, TRF को पता चलता है कि कुछ प्रकार की नृत्य की चालें डालने की आवश्यकता है, लेकिन यह एक अव्यावहारिक समाधान के साथ आता है जो शारीरिक विसंगतियों को प्रदर्शित करता है।
ऊपर-बाएं, हम FILM के दृष्टिकोण को करीब से देख सकते हैं। हालांकि FILM को बड़े मोशन को संभालने में सक्षम होने के लिए डिज़ाइन किया गया था, पिछले दृष्टिकोणों की तुलना में जो ऑप्टिकल फ्लो पर आधारित थे, यह अभी भी दो आपूर्ति किए गए कीफ्रेम के बीच क्या होना चाहिए, इसकी सेमेंटिक समझ की कमी है, और यह केवल फ्रेम के बीच एक 1980/90 के दशक की शैली का मॉर्फ करता है। FILM में कोई सेमेंटिक आर्किटेक्चर नहीं है, जैसे कि लेटेंट डिफ्यूजन मॉडल जैसे स्टेबल डिफ्यूजन, फ्रेम के बीच एक उपयुक्त पुल बनाने में मदद करने के लिए।
दाएं, ऊपर दिए गए वीडियो में, हम TRF के प्रयास को देखते हैं, जहां स्टेबल वीडियो डिफ्यूजन (SVD) का उपयोग अधिक बुद्धिमानी से ‘अनुमान’ लगाने के लिए किया जाता है कि दो उपयोगकर्ता-आपूर्ति किए गए फ्रेम के लिए एक नृत्य गति कैसे हो सकती है – लेकिन यह एक बोल्ड और अव्यावहारिक अनुमान लगाता है।
FCVG, नीचे दिखाया गया है, फ्रेम के बीच आंदोलन और सामग्री का अनुमान लगाने का एक अधिक विश्वसनीय काम करता है:
प्ले करने के लिए क्लिक करें। FCVG पिछले दृष्टिकोणों में सुधार करता है, लेकिन यह अभी भी परिपूर्ण नहीं है।
हाथों और चेहरे की पहचान के अवांछित मॉर्फिंग जैसे अभी भी कुछ कलाकृतियां हैं, लेकिन यह संस्करण सतही तौर पर सबसे अधिक प्लॉसिबल है – और राज्य की कला में किसी भी सुधार को बड़ी कठिनाई के खिलाफ माना जाना चाहिए जो कि यह कार्य प्रस्तुत करता है; और भविष्य के लिए एआई-जनरेटेड वीडियो के लिए महान बाधा जो कि यह चुनौती प्रस्तुत करती है।
इंटरपोलेशन क्यों मायने रखता है
जैसा कि हमने पहले बताया, दो उपयोगकर्ता-आपूर्ति किए गए फ्रेम के बीच वीडियो सामग्री को भरने की क्षमता जनरेटिव वीडियो में कालिक स्थिरता बनाए रखने के लिए सबसे अच्छे तरीकों में से एक है, क्योंकि एक ही व्यक्ति की दो वास्तविक और समान फ्रेम स्वाभाविक रूप से स्थिर तत्वों जैसे कि कपड़े, बाल और पर्यावरण को शामिल करते हैं।
जब केवल एक एकल प्रारंभ फ्रेम का उपयोग किया जाता है, तो जनरेटिव सिस्टम की सीमित ध्यान खिड़की, जो अक्सर केवल निकटवर्ती फ्रेम पर विचार करती है, विषय वस्तु के तत्वों को धीरे-धीरे ‘विकसित’ करने की प्रवृत्ति होगी, जब तक कि (उदाहरण के लिए) एक आदमी दूसरे आदमी (या एक औरत) बन जाता है, या यह साबित करता है कि ‘मॉर्फिंग’ कपड़े हैं – साथ ही साथ खुले स्रोत T2V सिस्टम में सामान्य रूप से उत्पन्न होने वाले कई अन्य विकृतियां, और अधिकांश भुगतान वाले समाधानों में, जैसे कि क्लिंग:
प्ले करने के लिए क्लिक करें। नए शोध पत्र के दो (वास्तविक) स्रोत फ्रेम को क्लिंग में डालना, ‘एक आदमी छत पर नृत्य’ प्रॉम्प्ट के साथ, एक आदर्श समाधान में परिणत नहीं हुआ। हालांकि क्लिंग 1.6 उस समय उपलब्ध था जब यह बनाया गया था, वी1.5 ही नवीनतम संस्करण है जो उपयोगकर्ता-इनपुट प्रारंभ और अंत फ्रेम का समर्थन करता है। स्रोत: https://klingai.com/
क्या समस्या पहले से ही हल हो गई है?
इसके विपरीत, कुछ व्यावसायिक, बंद-स्रोत और प्रोप्राइटरी सिस्टम इस समस्या को बेहतर तरीके से हल करने के लिए प्रतीत होते हैं – विशेष रूप से RunwayML, जो दो स्रोत फ्रेम के बीच बहुत प्लॉसिबल इनबीट्वीनिंग बनाने में सक्षम था:
प्ले करने के लिए क्लिक करें। RunwayML का डिफ्यूजन-आधारित इंटरपोलेशन बहुत प्रभावी है। स्रोत: https://app.runwayml.com/
अभ्यास को दोहराते हुए, RunwayML ने एक दूसरा परिणाम उत्पन्न किया, जो समान रूप से विश्वसनीय था:
प्ले करने के लिए क्लिक करें। RunwayML अनुक्रम का दूसरा रन।
एक समस्या यह है कि हम इस समस्या से जुड़ी चुनौतियों के बारे में कुछ भी नहीं सीख सकते हैं, न ही हम खुले स्रोत राज्य की कला को आगे बढ़ा सकते हैं, एक प्रोप्राइटरी सिस्टम से। हम यह नहीं जान सकते कि यह बेहतर रेंडरिंग विशिष्ट वास्तुकला दृष्टिकोणों द्वारा प्राप्त की गई है, डेटा (या डेटा क्यूरेशन विधियों जैसे फिल्टरिंग और एनोटेशन), या इनमें से किसी भी संभावित अनुसंधान नवाचारों के संयोजन से।
दूसरा, छोटे आउटफिट, जैसे कि विजुअल इफेक्ट्स कंपनियां, लंबे समय तक बी2बी एपीआई-चालित सेवाओं पर निर्भर नहीं रह सकती हैं जो एक मूल्य वृद्धि के साथ उनकी लॉजिस्टिक योजना को कमजोर कर सकती हैं – विशेष रूप से यदि एक सेवा बाजार पर हावी हो जाती है और इसलिए मूल्य वृद्धि के लिए अधिक प्रवण होती है।
जब अधिकार गलत होते हैं
बहुत अधिक महत्वपूर्ण बात यह है कि यदि एक अच्छी तरह से प्रदर्शन करने वाला व्यावसायिक मॉडल अनलाइसेंस्ड डेटा पर प्रशिक्षित है, जैसा कि RunwayML के मामले में लगता है, तो किसी भी कंपनी जो ऐसी सेवाओं का उपयोग करती है, वह डाउनस्ट्रीम कानूनी जोखिम का सामना कर सकती है।
चूंकि कानून (और कुछ मुकदमे) राष्ट्रपतियों से अधिक समय तक रहते हैं, और चूंकि संयुक्त राज्य अमेरिका बाजार दुनिया में सबसे अधिक मुकदमेबाजी वाले बाजारों में से एक है, एआई प्रशिक्षण डेटा के लिए बढ़ती विधायी निगरानी की वर्तमान प्रवृत्ति संभवतः डोनाल्ड ट्रम्प के अगले राष्ट्रपति पद के ‘लाइट टच’ से बच जाएगी।
अतः, कंप्यूटर विजन अनुसंधान क्षेत्र को इस समस्या का सामना करना होगा कठिन तरीके से, ताकि कोई भी उभरने वाले समाधान लंबे समय तक चल सकें।
FCVG
चीन से नई विधि एक पत्र में प्रस्तुत की गई है जिसका शीर्षक फ्रेम-वार स्थितियों-चालित वीडियो जेनरेशन के माध्यम से जेनरेटिव इनबीट्वीनिंग है, और यह हार्बिन इंस्टीट्यूट ऑफ टेक्नोलॉजी और तियानजिन विश्वविद्यालय के पांच शोधकर्ताओं के बीच से आता है।
FCVG इंटरपोलेशन कार्य में अस्पष्टता को दूर करने के लिए फ्रेम-वार स्थितियों का उपयोग करता है, साथ ही एक फ्रेमवर्क जो उपयोगकर्ता-आपूर्ति किए गए प्रारंभ और अंत फ्रेम में किनारों को परिभाषित करता है, जो प्रक्रिया को व्यक्तिगत फ्रेम के बीच संक्रमण को अधिक सुसंगत रूप से ट्रैक करने में मदद करता है, साथ ही साथ समग्र प्रभाव को भी।
फ्रेम-वार स्थितियों में इंटरपोलेशन फ्रेम के निर्माण को उप-कार्यों में तोड़ना शामिल है, न कि दो फ्रेम (और अनुरोधित वीडियो आउटपुट के लिए लंबा अनुरोधित वीडियो आउटपुट होने पर बड़ा सेमेंटिक शून्य) के बीच बहुत बड़े सेमेंटिक शून्य को भरने का प्रयास करना।
नीचे दी गई ग्राफिक में, पत्र से, लेखक समय-विपरीत (TRF) विधि की तुलना अपनी विधि से करते हैं। TRF एक पूर्व-प्रशिक्षित छवि-से-वीडियो मॉडल (SVD) का उपयोग करके दो वीडियो जेनरेशन पथ बनाता है। एक ‘आगे’ पथ प्रारंभ फ्रेम पर सशर्त है, और दूसरा ‘पीछे’ पथ अंत फ्रेम पर सशर्त है। दोनों पथ एक ही यादृच्छिक शोर से शुरू होते हैं। यह नीचे दी गई छवि के बाएं हिस्से में दिखाया गया है:

प्रIOR विधियों की तुलना FCVG के साथ। स्रोत: https://arxiv.org/pdf/2412.11755
लेखकों का दावा है कि FCVG समय-विपरीत विधियों पर सुधार है क्योंकि यह वीडियो जेनरेशन में अस्पष्टता को कम करता है, प्रत्येक फ्रेम के लिए एक स्पष्ट स्थिति प्रदान करके, जिससे अधिक स्थिर और सुसंगत आउटपुट मिलता है।
समय-विपरीत विधियों, जैसे TRF, पत्र में दावा किया जाता है, अस्पष्टता का कारण बन सकती हैं, क्योंकि आगे और पीछे की पीढ़ी के मार्ग विचलित हो सकते हैं, जिससे मिसालिंगमेंट या असंगति हो सकती है। FCVG इसे फ्रेम-वार स्थितियों का उपयोग करके संबोधित करता है जो प्रारंभ और अंत फ्रेम के बीच मेल खाती रेखाओं से प्राप्त की जाती हैं (ऊपर दी गई छवि के निचले दाएं हिस्से में), जो पीढ़ी प्रक्रिया को निर्देशित करती हैं।
प्ले करने के लिए क्लिक करें। FCVG परियोजना पृष्ठ से एक और तुलना।
समय-विपरीत विधि वीडियो जेनरेशन मॉडल के लिए पूर्व-प्रशिक्षित वीडियो जेनरेशन मॉडल का उपयोग करने की अनुमति देती है, लेकिन इसके कुछ नुकसान हैं। I2V मॉडल द्वारा उत्पन्न मोशन विविध है rather than स्थिर। जबकि यह शुद्ध छवि-से-वीडियो (I2V) कार्यों के लिए उपयोगी है, यह अस्पष्टता पैदा करता है और मिसालिंगमेंट या असंगत वीडियो पथ पैदा करता है।
समय-विपरीत भी हाइपरपैरामीटर जैसे प्रत्येक उत्पन्न वीडियो के लिए फ्रेम दर जैसे हाइपरपैरामीटर को समायोजित करने की आवश्यकता होती है। इसके अलावा, समय-विपरीत में शामिल कुछ तकनीकें अस्पष्टता को कम करने के लिए बहुत धीमी हो जाती हैं, जो प्रसंस्करण समय को बढ़ाती हैं।
विधि
लेखकों का निरीक्षण है कि यदि इनमें से पहली समस्या (विविधता बनाम स्थिरता) का समाधान किया जा सकता है, तो अन्य समस्याएं स्वयं ही हल हो जाएंगी। यह पहले के प्रस्तावों में प्रयास किया गया है, जैसे कि ऊपर उल्लिखित जीआई, और ViBiDSampler।
पत्र में कहा गया है:
‘हालांकि, इन पथों के बीच अभी भी काफी स्टोकास्टिक है, जो इन विधियों को बड़े मोशन जैसे मानव मुद्राओं में तेजी से परिवर्तन शामिल करने वाले दृश्यों में प्रभावी ढंग से संभालने से रोकता है। इंटरपोलेशन पथ में अस्पष्टता मुख्य रूप से मध्यवर्ती फ्रेम के लिए पर्याप्त स्थितियों की कमी से उत्पन्न होती है, क्योंकि दो इनपुट छवियां केवल प्रारंभ और अंत फ्रेम के लिए स्थितियां प्रदान करती हैं। ‘
‘अतः, हम प्रत्येक फ्रेम के लिए एक स्पष्ट स्थिति प्रदान करने का सुझाव देते हैं, जो इंटरपोलेशन पथ की अस्पष्टता को काफी हद तक कम कर देता है।’
हम FCVG के मूल अवधारणाओं को नीचे दी गई योजना में काम करते हुए देख सकते हैं। FCVG एक वीडियो फ्रेम की श्रृंखला उत्पन्न करता है जो दो इनपुट फ्रेम के साथ शुरू और समाप्त होती है। यह फ्रेम को कालिक रूप से स्थिर बनाने के लिए वीडियो जेनरेशन प्रक्रिया के लिए फ्रेम-विशिष्ट स्थितियां प्रदान करके सुनिश्चित करता है।

FCVG के लिए अनुमान योजना।
इस समय-विपरीत दृष्टिकोण के पुनर्विचार में, विधि आगे और पीछे की दिशा से जानकारी को जोड़ती है, जो स्मूथ संक्रमण बनाने के लिए मिलकर काम करती है। एक पुनरावृत्त प्रक्रिया के माध्यम से, मॉडल धीरे-धीरे शोरदार इनपुट को परिष्कृत करता है जब तक कि अंतिम सेट ऑफ इनबीट्वीनिंग फ्रेम नहीं बन जाता।
अगले चरण में पूर्व-प्रशिक्षित ग्लूस्टिक लाइन-मिलान मॉडल का उपयोग शामिल है, जो प्रारंभ और अंत फ्रेम के बीच संबंध बनाता है, साथ ही साथ स्टेबल वीडियो डिफ्यूजन मॉडल के माध्यम से मॉडल को मार्गदर्शन करने के लिए वैकल्पिक रूप से कंकाल मुद्राएं प्रदान करता है।

ग्लूस्टिक व्याख्या की गई आकारों से लाइनें निकालता है। ये लाइनें FCVG में प्रारंभ और अंत फ्रेम के बीच मेल खाते एंकर प्रदान करती हैं।
लेखकों का निरीक्षण है:
‘हमने अनुभवजन्य रूप से पाया कि अधिकांश मामलों में रैखिक इंटरपोलेशन पर्याप्त है ताकि इनबीट्वीनिंग वीडियो में कालिक स्थिरता सुनिश्चित की जा सके, और हमारी विधि उपयोगकर्ताओं को वांछित [वीडियो] का उत्पादन करने के लिए गैर-रैखिक इंटरपोलेशन पथ निर्दिष्ट करने की अनुमति देती है।’

आगे और पीछे की फ्रेम-वार स्थितियों की स्थापना के लिए कार्य प्रवाह। हम देख सकते हैं कि मेल खाते रंग जो सामग्री को सुसंगत बनाए रखने में मदद करते हैं क्योंकि एनिमेशन विकसित होता है।
FCVG में प्राप्त फ्रेम-वार स्थितियों को SVD में इंजेक्ट करने के लिए, FCVG 2024 कंट्रोलनेक्स्ट पहल के लिए विकसित विधि का उपयोग करता है। इस प्रक्रिया में, नियंत्रण स्थितियों को पहले कई रेसनेट ब्लॉक द्वारा एन्कोड किया जाता है, इससे पहले कि स्थिति और SVD शाखाओं के बीच क्रॉस-नॉर्मलाइजेशन हो।
एक छोटा सेट वीडियो SVD मॉडल को फाइन-ट्यून करने के लिए उपयोग किया जाता है, मॉडल के अधिकांश पैरामीटर जमे हुए होते हैं।
‘[उपरोक्त सीमाएं] FCVG में बड़े पैमाने पर हल हो गई हैं: (i) प्रत्येक फ्रेम के लिए स्थिति को स्पष्ट रूप से निर्दिष्ट करके, आगे और पीछे के मार्गों के बीच अस्पष्टता काफी हद तक कम हो जाती है; (ii) केवल एक ट्यूनेबल [पैरामीटर] पेश किया जाता है, जबकि SVD में हाइपरपैरामीटर को डिफ़ॉल्ट रूप से रखते हुए, अधिकांश दृश्यों में अनुकूल परिणाम प्राप्त होते हैं; (iii) एक सरल औसत फ्यूजन, बिना शोर पुनः इंजेक्शन के, FCVG में पर्याप्त है, और अनुमान चरणों को GI की तुलना में 50% तक कम किया जा सकता है।’

FCVG के लिए स्टेबल वीडियो डिफ्यूजन में फ्रेम-वार स्थितियों को इंजेक्ट करने के लिए व्यापक योजना।
डेटा और परीक्षण
प्रणाली का परीक्षण करने के लिए, शोधकर्ताओं ने विभिन्न दृश्यों को शामिल करने वाला एक डेटासेट बनाया, जिसमें बाहरी वातावरण, मानव मुद्राएं, और आंतरिक स्थान शामिल हैं, साथ ही साथ कैमरा मूवमेंट, नृत्य क्रियाएं, और चेहरे के भाव जैसी गतियां शामिल हैं। 524 क्लिप का चयन DAVIS और RealEstate10k डेटासेट से किया गया था। इस संग्रह को पेक्सल्स से प्राप्त उच्च फ्रेम-रेट वीडियो के साथ पूरक किया गया था। क्यूरेटेड सेट को विभाजित किया गया था फाइन-ट्यूनिंग और परीक्षण के बीच 4:1 के अनुपात में।
मेट्रिक्स का उपयोग किया गया था सीखा हुआ संवेदी समानता मेट्रिक्स (LPIPS); फ्रेचेट इन्सेप्शन दूरी (FID); फ्रेचेट वीडियो दूरी (FVD); VBench; और फ्रेचेट वीडियो मोशन दूरी.
लेखकों का निरीक्षण है कि इनमें से कोई भी मेट्रिक्स कालिक स्थिरता का अनुमान लगाने के लिए अच्छी तरह से अनुकूल नहीं है, और हमें FCVG के परियोजना पृष्ठ पर वीडियो के लिए संदर्भित करते हैं।
इसके अलावा, ग्लूस्टिक के लिए लाइन-मिलान के लिए DWPose का उपयोग मानव मुद्राओं का अनुमान लगाने के लिए किया गया था।
फाइन-ट्यूनिंग 70,000 पुनरावृत्तियों के लिए एडमडब्ल्यू ऑप्टिमाइज़र पर एक NVIDIA A800 GPU पर किया गया था, 1×10^-6 की सीखने की दर पर, 512×320 पैच में फ्रेम को क्रॉप किया गया था।
प्रतिद्वंद्वी पूर्व फ्रेमवर्क जो परीक्षण किए गए थे वे FILM, GI, TRF, और DynamiCrafter थे।
मात्रात्मक मूल्यांकन के लिए, संबोधित फ्रेम अंतर 12 और 23 के बीच थे।

पूर्व फ्रेमवर्क के खिलाफ मात्रात्मक परिणाम।
इन परिणामों के संबंध में, पत्र में कहा गया है:
‘[हमारी] विधि चार जेनरेटिव दृष्टिकोणों में सभी मेट्रिक्स में सर्वोत्तम प्रदर्शन प्राप्त करती है। FILM के साथ LPIPS तुलना के संबंध में, हमारा FCVG थोड़ा हीन है, जबकि अन्य मेट्रिक्स में बेहतर प्रदर्शन प्रदर्शित करता है। LPIPS में कालिक जानकारी की अनुपस्थिति को देखते हुए, अन्य मेट्रिक्स और दृश्य अवलोकन को प्राथमिकता देना अधिक उपयुक्त हो सकता है। ‘
‘इसके अलावा, विभिन्न फ्रेम अंतराल के तहत परिणामों की तुलना करके, FILM छोटे अंतराल के लिए अच्छा काम करता है, जबकि जेनरेटिव विधियां बड़े अंतराल के लिए अधिक उपयुक्त होती हैं। इन जेनरेटिव विधियों में, हमारा FCVG अपनी स्पष्ट फ्रेम-वार स्थितियों के कारण महत्वपूर्ण श्रेष्ठता प्रदर्शित करता है।’
गुणात्मक परीक्षण के लिए, लेखकों ने परियोजना पृष्ठ (कुछ इस लेख में एम्बेडेड) पर दिखाए गए वीडियो का उत्पादन किया, और पीडीएफ पत्र में स्थिर और एनिमेटेड† परिणाम,

पत्र से स्थिर परिणाम। स्रोत पीडीएफ के लिए बेहतर रिज़ॉल्यूशन के लिए कृपया संदर्भ लें, और ध्यान दें कि पीडीएफ में एनिमेशन शामिल हैं जो इस सुविधा का समर्थन करने वाले अनुप्रयोगों में खेले जा सकते हैं।
लेखकों का निरीक्षण है:
‘जबकि FILM छोटे मोशन दृश्यों के लिए चिकनी इंटरपोलेशन परिणाम उत्पन्न करता है, यह बड़े पैमाने पर मोशन के साथ संघर्ष करता है जो ऑप्टिकल फ्लो की सीमाओं के कारण होता है, जिससे पृष्ठभूमि और हाथ की गति जैसे कलाकृतियां दिखाई देती हैं (पहले मामले में)। ‘
‘जेनरेटिव मॉडल जैसे TRF और GI फ्यूजन पथ में अस्पष्टता से पीड़ित हैं, जो जटिल दृश्यों में अस्थिर मध्यवर्ती मोशन का कारण बनता है, जिसमें मानव और वस्तु मोशन शामिल है। ‘
‘इसके विपरीत, हमारी विधि विभिन्न दृश्यों में लगातार संतोषजनक परिणाम प्रदान करती है। जब महत्वपूर्ण ओक्लूजन मौजूद होता है (दूसरे मामले में और छठे मामले में), हमारी विधि अभी भी उचित मोशन को पकड़ सकती है। इसके अलावा, हमारा दृष्टिकोण जटिल मानव क्रियाओं (अंतिम मामले में) के लिए लचीला है।’
लेखकों ने यह भी पाया कि FCVG असामान्य रूप से अच्छी तरह से एनिमेशन-शैली के वीडियो को सामान्यीकृत करता है:
प्ले करने के लिए क्लिक करें। FCVG कार्टून-शैली एनिमेशन के लिए बहुत आश्वस्त परिणाम उत्पन्न करता है।
निष्कर्ष
FCVG गैर-व्यावसायिक संदर्भ में फ्रेम इंटरपोलेशन में राज्य की कला में कम से कम एक सुधार का प्रतिनिधित्व करता है। लेखकों ने काम के लिए कोड गिटहब पर उपलब्ध कराया है, हालांकि संबंधित डेटासेट लेखन के समय जारी नहीं किया गया था।
यदि व्यावसायिक, बंद-स्रोत और प्रोप्राइटरी समाधान वेब-स्क्रैप्ड, अनलाइसेंस्ड डेटा का उपयोग करके खुले स्रोत प्रयासों से आगे निकल रहे हैं, तो ऐसे दृष्टिकोण में व्यावसायिक उपयोग के लिए सीमित या कोई भविष्य नहीं है; जोखिम बहुत बड़े हैं।
अतः, भले ही खुले स्रोत दृश्य वर्तमान बाजार के नेताओं के प्रभावशाली प्रदर्शन से पिछड़ जाए, यह धीमी और स्थिर जीत हासिल करने वाला हो सकता है।
* स्रोत: https://openaccess.thecvf.com/content/ICCV2023/papers/Pautrat_GlueStick_Robust_Image_Matching_by_Sticking_Points_and_Lines_Together_ICCV_2023_paper.pdf
† एक्रोबैट रीडर, ओकुलर, या किसी अन्य पीडीएफ रीडर की आवश्यकता होती है जो एम्बेडेड पीडीएफ एनिमेशन को पुनरुत्पादित कर सकता है।
पहली बार शुक्रवार, 20 दिसंबर, 2024 को प्रकाशित।












