Anderson का एंगल
पूर्ण शरीर गहरे नकली वीडियो पीढ़ी की ओर

एक ऐसे क्षेत्र में जहां धैर्य की आवश्यकता है, एक नया सिस्टम हमें थोड़ा और लाइव-स्ट्रीम्ड मानव सिमुलेशन की ओर ले जाता है, जिसमें निराशाजनक रेंडरिंग राउंड नहीं होते हैं।
पूर्ण-शरीर मानव सिमुलेशन के क्षेत्र में राज्य-ऑफ-द-आर्ट ने 2022 में पहली बार पूर्ण-शरीर गहरे नकली की संभावना के बाद से बहुत तरक्की की है। अब हम खुले स्रोत प्रणालियों जैसे वान-एनिमेट और बंद स्रोत प्रणालियों जैसे ग्रोक की क्षमता के अभ्यस्त हो गए हैं, जो एकल या एकाधिक छवियों को एक सुसंगत और अक्सर परिवर्तनकारी वीडियो प्रदर्शन में परिवर्तित कर सकते हैं:
बजाने के लिए क्लिक करें. वानएनिमेट-2.2 के साथ व्यक्ति प्रतिस्थापन के उदाहरण। बेहतर रिज़ॉल्यूशन के लिए स्रोत पर जाएं। स्रोत
इसके अलावा, पुराने ऑटोएनकोडर-आधारित लाइव चेहरे की गहरी नकली फ्रेमवर्क डीपफेसलाइव को अधिक परिष्कृत फ्रेमवर्क जैसे डीप-लाइव-कैम द्वारा पार किया गया है, जो लाइवपोर्ट्रेट पुनरावृत्तियों के एक संगीत का लाभ उठाता है, साथ ही साथ विरासत जीएन और इनसाइटफेस मॉड्यूल, एक प्रभावी वास्तविक समय उत्तराधिकारी बनाने के लिए डीएफलाइव परियोजना के लिए:
बजाने के लिए क्लिक करें: इलॉन मस्क को डीप-लाइव-कैम के माध्यम से लाइव वीडियो सत्र में गहरा नकली बनाया गया। बेहतर रिज़ॉल्यूशन के लिए स्रोत पर जाएं। स्रोत
हालांकि, जबकि डीप-लाइव-कैम जैसे फ्रेमवर्क हमेशा के लिए चल सकते हैं और हमेशा के लिए नकली बना सकते हैं, और हालांकि वे कठिन चेहरे के कोणों को उत्पन्न करने में पहले से बेहतर हैं, परिणाम अभी भी संकल्प और क्षमता के संदर्भ में सीमित हैं: आप एक विशिष्ट चेहरे/पहचान प्राप्त कर सकते हैं, और यह बहुत कुछ कर सकता है, जैसे कि समझदार चेहरे के भाव और होंठ-सिंक – लेकिन यह मूल रूप से एक ट्रिक पोनी है।
ब्रेक…
वर्तमान मानव नकली प्रणालियों का अधिकांश हिस्सा भी इसी तरह से सीमित और/या ‘विशेषज्ञ’ है। एक विशेष, पुनरावृत्ति सीमा यह है कि सर्वोत्तम मानव सिमुलेशन/नकली प्रणालियां ऑफलाइन हैं – जिसक अर्थ है कि वे वास्तविक समय में संचालित करने के लिए बहुत संसाधन-GPU हैं, और इसके बजाय उपयोगकर्ता को बाद में परिणाम प्रस्तुत करने के लिए दूर जाने और गणना करने की आवश्यकता है:
स्पष्ट रूप से, ऐसी प्रणालियां लाइव एआई ट्रांस्म्यूटेशन के लिए उपयुक्त नहीं हैं, जैसे कि नृत्य जैसे पूरे शरीर की गति को लाइव स्ट्रीम में बदलना।
हाल के वर्षों में एक उदाहरण खुले वजन वान2.2. एनिमेट है, जो शौकिया समुदाय और प्रो रीसेलर्स के साथ हिट साबित हुआ – लेकिन फिर से, यह एक ‘जेनरेट और प्रतीक्षा’ परिदृश्य है:
बजाने के लिए क्लिक करें. 2025 से, वान2.2-एनिमेट की प्रभावशाली क्षमताओं के उदाहरण – यदि आप थोड़ा धैर्य रख सकते हैं। बेहतर रिज़ॉल्यूशन के लिए स्रोत पर जाएं। स्रोत
इस तरह, आप इसे महान बना सकते हैं, इसे बहुमुखी बना सकते हैं, या इसे अब बना सकते हैं – दो चुनें।
लाइवएनिमेट
इस मेक्सिकन स्टैंड-ऑफ में चीन से एक नई पेशकश आती है, जो प्रभावी रूप से वान2.2 एनिमेट को एक लाइव-ड्राइवेन एनिमेशन फ्रेमवर्क में बदल देती है, जो वर्तमान में लगभग 20 एफपीएस पर संचालित होती है, और विभिन्न परिदृश्यों में प्रभावशाली परिणामों के साथ:
बजाने के लिए क्लिक करें: परियोजना साइट से, लाइवएनिमेट स्टेज-नृत्य, आउटडोर पूर्ण-शरीर और क्लोज़-अप पोर्ट्रेट परिदृश्यों में ड्राइविंग मुद्रा को स्थानांतरित करता है, पूरे शरीर, हाथ और चेहरे की गति को पुनरुत्पादित करता है. बेहतर रिज़ॉल्यूशन के लिए स्रोत पर जाएं। स्रोत
नई कार्य मूल प्रणाली को एक लाइव-क्षमता संस्करण में विस्तारित करता है जो वीडियो कैसे उत्पन्न किया जाता है उसे बदलकर: इसके बजाय पिछले और भविष्य के फ्रेमों को एक साथ संसाधित करने के, लाइवएनिमेट प्रत्येक नए खंड को क्रिया के अनुसार उत्पन्न करता है, केवल कुछ चरणों का उपयोग करते हुए, जबकि चुनिंदा पहले की मुद्रा को लंबे समय तक सत्र में विषय की उपस्थिति को सुसंगत रखने के लिए बनाए रखा जाता है.
प्रभावी रूप से, प्रणाली पिछले फ्रेमों को एक तरीके के रूप में रखती है जिसे स्मृति के रूप में ड्रा किया जा सकता है क्योंकि वीडियो विकसित होता है, ताकि पहचान सुसंगत रहे – पुराने सीजीआई प्रणालियों के समान जो टेक्सचर मैप्स को संदर्भित करते हैं।
हालांकि एक लोरा प्रसंस्करण चरण में शामिल है, लाइवएनिमेट केवल एक और लोरा प्रणाली नहीं है – इसकी स्ट्रीमिंग पीढ़ी, मुद्रा-पुनर्प्राप्ति/कैश प्रणाली, तीन-चरण अनुमान और जीपीयू अनुकूलन अतिरिक्त तंत्र हैं, जो इसके प्रतिष्ठान में विभिन्न अन्य प्रौद्योगिकियों (कुछ आश्चर्यजनक रूप से पुराने) के शीर्ष पर हैं।
नई प्रणाली न केवल पूर्ण-शरीर ड्राइविंग परिदृश्यों के साथ सामना कर सकती है, जैसा कि ऊपर दिए गए उदाहरणों में, बल्कि ऊपरी शरीर की गति के साथ भी सामना कर सकती है, जैसे कि साक्षात्कार परिदृश्यों में:
बजाने के लिए क्लिक करें ‘स्थिर कार्यालय दृश्य पर सूक्ष्म सिर और हाथ गति’।
न्यायसंगत होने के लिए, नई पत्र में स्वीकार किया जाता है कि लाइवएनिमेट के खिलाफ परीक्षण किए गए दो प्रतिद्वंद्वी फ्रेमवर्क विशिष्ट परिस्थितियों में पहचान को थोड़ा बेहतर बनाए रखने में सक्षम थे; उस ने कहा, कोई भी प्रतिद्वंद्वी प्रणाली एक ऑफलाइन नहीं है, और लेखक नए कार्य के लेखक स्पष्ट रूप से एक विश्वसनीय और आशावादी दिशा में लिफाफे को धक्का दे रहे हैं।
इसके अलावा, यह ध्यान देने योग्य है कि अनुमान के लिए दो एच100 एनवीडिया जीपीयू की आवश्यकता होती है, कुल 160GB वीआरएएम के लिए*।
पत्र में कहा गया है:
‘लाइवएनिमेट पहले 30 सेकंड से अंतिम [मिनट] तक लगभग स्थिर संवेदी गुणवत्ता और पहचान बनाए रखता है, जबकि पिछली प्रणालियां काफी हद तक बिगड़ जाती हैं या समान रोलआउट के लिए घंटों की ऑफलाइन गणना की आवश्यकता होती है। ‘
‘इन परिणामों से गुणवत्ता, विलंबता और अवधि के लिए एक नया संचालन बिंदु स्थापित किया जाता है इंटरैक्टिव पूर्ण-शरीर एनिमेशन के लिए।’
नई पत्र शीर्षक है लाइवएनिमेट: वास्तविक समय में स्थिर लंबे समय तक मानव एनिमेशन, और चीनी विश्वविद्यालय हांगकांग, अलीबाबा के क्यूवेन एप्लिकेशन बिजनेस ग्रुप, और लिबलिब एआई से नौ लेखकों के माध्यम से आता है। एक परियोजना साइट, जिसमें इस लेख में भी वीडियो शामिल हैं, भी उपलब्ध है, जबकि कोड ‘आगामी है ‘, और वजन… कौन जानता है?
विधि
लाइवएनिमेट एक दो-चरण प्रशिक्षण प्रक्रिया का गठन करता है जो वान2.2-एनिमेट को निरंतर और तेजी से उत्पन्न करने के लिए डिज़ाइन किया गया है, इसके बाद एक स्मृति प्रणाली है जो प्रत्येक नए वीडियो ब्लॉक के उत्पादन के रूप में उपयोगी पिछले मुद्रा को पुनर्प्राप्त करती है:
लाइवएनिमेट पाइपलाइन का अवलोकन, जिसमें बाएं तरफ दो-चरण प्रशिक्षण प्रक्रिया और दाएं तरफ लाइव पीढ़ी दिखाई गई है, जहां आगमन मुद्रा को संग्रहीत पिछले मुद्रा के खिलाफ मेल खाता है और हाल के फ्रेम के साथ जोड़कर प्रत्येक नए वीडियो ब्लॉक को तीन चरणों में उत्पन्न किया जाता है। स्रोत
मूल वान2.2-एनिमेट को एक पूरे अनुक्रम पर विचार करने के लिए डिज़ाइन किया गया है, न कि एक अनिश्चित रूप से विस्तारित वीडियो उत्पन्न करने के लिए। इसलिए, लेखकों ने प्रशिक्षण वीडियो को连续 ब्लॉक में विभाजित किया, प्रत्येक को पिछले ब्लॉक के रूप में संदर्भ/मैदान के रूप में उत्पन्न किया गया। यह पहले मॉडल को विश्वसनीय पिछले सामग्री से जारी रखने के लिए सिखाता है, इससे पहले कि यह अपने स्वयं के आउटपुट से जमा त्रुटियों से निपटने के लिए हो।
भूलना मत
इस प्रक्रिया के दौरान, मूल संदर्भ छवि को ‘रेफ सिंक’ के माध्यम से स्थायी रूप से उपलब्ध रखा जाता है, जो व्यक्ति की पहचान और उपस्थिति की एक निश्चित याद दिलाता है। एक बार ब्लॉक पूरा हो जाने के बाद, ‘क्लीन केवी अपडेट’ से प्राप्त जानकारी को बाद के ब्लॉक के लिए ऐतिहासिक संदर्भ में परिवर्तित किया जाता है (हालांकि यह मौजूदा त्रुटियों को नहीं ठीक करता है)।
यह पहला प्रशिक्षण चरण अभी भी प्रति ब्लॉक 50 शोर-मुक्त करने वाले चरण की आवश्यकता है, जो लाइव संचालन को व्यावहारिक बनाता है। दूसरे चरण में इसलिए प्रक्रिया को तीन चरणों में कम कर दिया जाता है, मॉडल को अपने स्वयं के उत्पन्न इतिहास के संपर्क में लाते हुए, क्योंकि तैनाती के लिए प्रत्येक नए खंड को असंपूर्ण पिछले आउटपुट पर निर्भर करने की आवश्यकता होती है:
लाइवएनिमेट को तैनाती के लिए तैयार करने के लिए उपयोग किए जाने वाले दो प्रशिक्षण चरण†, पहले साफ पिछले वीडियो ब्लॉक से सीखना – फिर पीढ़ी को तीन चरणों में कम करना, जबकि मॉडल के अपने असंपूर्ण आउटपुट पर प्रशिक्षण।
स्व-उत्पन्न क्रमों पर प्रशिक्षण एक और समस्या प्रस्तुत करता है, क्योंकि पूरे वीडियो के गणनात्मक इतिहास को बनाए रखना बहुत महंगा होगा। इसके बजाय, एक पूर्ण अभ्यास रन बनाया जाता है, फिर एक बार में एक ब्लॉक के लिए पुनः प्रशिक्षित किया जाता है। प्रत्येक ब्लॉक को इसलिए एक अद्यतन पूरे अनुक्रम को संगणनात्मक रूप से ‘जीवित’ रखने की आवश्यकता के बिना प्राप्त किया जा सकता है।
लोरा अनुकूलन के साथ संयुक्त, यह 14-बिलियन-पैरामीटर मॉडल को एकल नोड पर आठ 80GB H100 जीपीयू (नोटिंग कि यह क्लस्टर प्रशिक्षण के लिए है, न कि रनटाइम अनुमान के लिए) पर जिलाने की अनुमति देता है।
अब रुकना नहीं
अनिश्चितकालीन पीढ़ी के लिए, लाइवएनिमेट को यह भी तय करना होगा कि क्या याद रखने योग्य है। सब कुछ रखने से प्रसंस्करण आवश्यकताएं बाहर निकल जाएंगी; लेकिन केवल हाल के फ्रेम को बनाए रखने से भी उपयोगी पिछले दृश्यों को छोड़ दिया जा सकता है।
इसलिए मुद्रा-पुनर्प्राप्ति-सिंक ध्यान (पीआर-सिंक) इसे संबोधित करता है, पहले उत्पन्न ब्लॉक को एक स्थिर सिंक के रूप में रखते हुए – एक प्रासंगिक पिछली मुद्रा, एक प्रतिस्थापन योग्य ‘डायनामिक सिंक’ के रूप में कार्य करता है, और एक रोलिंग विंडो जिसमें वर्तमान और दो पिछले ब्लॉक शामिल हैं। संदर्भ छवि अभी भी रेफ सिंक के माध्यम से अलग से उपलब्ध है, जबकि निश्चित संग्रहण आकार लागत को बढ़ने से रोकते हैं क्योंकि वीडियो लंबाई बढ़ जाती है।
ब्लॉक युद्ध
पुरानी मुद्रा को इस सीमित स्मृति के लिए चुनने के लिए, विटीपोज तीन फ्रेम में शरीर और हाथ की स्थिति को एक कompact प्रतिनिधित्व में कम कर देता है। मेमोरी-बैंक में ऐसे पांच प्रतिनिधि मुद्रा होते हैं, और पहले 20 ब्लॉक के दौरान आबादी की जाती है, विविध मुद्रा को निकट-डुप्लिकेट के ऊपर पसंद करते हैं।
उत्पादन के दौरान, आगमन मुद्रा की तुलना इन प्रतिनिधियों से की जाती है और सबसे करीबी मेल खाता है, जो एक समान स्थिति में व्यक्ति के दिखने के तरीके के पिछले प्रमाण को प्रदान करता है। हालांकि, तुरंत-पिछले ब्लॉक बाहर रखा गया है, क्योंकि यह पहले से ही रोलिंग विंडो में मौजूद है, डायनामिक सिंक को दूर से जानकारी पुनर्प्राप्त करने के लिए स्वतंत्र छोड़ देता है।
अंत में, रनटाइम खुद को गति के लिए अनुकूलित किया जाता है जो दो एच100 जीपीयू पर ध्यान प्रसंस्करण को वितरित करके, संचार को गणना के साथ ओवरलैप करके, और जहां भी संभव हो कैश की जानकारी को पुनः उपयोग करके है।
डेटा और परीक्षण
लाइवएनिमेट को 40,000 बात करने वाले वीडियो से एवीएस्पीच और 20,000 मानव-गति वीडियो से टिक्टॉक डेटासेट और ह्यूमनविड पर प्रशिक्षित किया गया था, प्रशिक्षण और अनुमान 480×480; 384×672; और 672×384 पिक्सेल के संकल्प का समर्थन करते हैं।
प्रशिक्षण वान2.2-एनिमेट-14बी बेस चेकपॉइंट से शुरू हुआ, लोरा के साथ रैंक 128 का उपयोग किया, और आठ एनवीडिया एच100 जीपीयू पर 10,000 चरणों में पहले चरण में और 20,000 में दूसरे चरण में आगे बढ़ा।
वीडियो तीन लेटेंट फ्रेम (मॉडल के संकुचित आंतरिक प्रतिनिधित्व) के ब्लॉक में उत्पन्न किया गया था, जो 12 आरजीबी फ्रेम के अनुरूप था, जबकि अनुमान दो एच100 पर किया गया था।
मूल्यांकन ने लाइवएनिमेट की तुलना मौजूदा मुद्रा-निर्देशित मानव-एनिमेशन विधियों के साथ की थी, दोनों लघु और लंबी अनुक्रमों में सुसंगत सेटिंग्स के तहत संदर्भ छवियों और ड्राइविंग मुद्रा का उपयोग करके। लंबे समय तक परीक्षण पीढ़ी को तीन मिनट तक बढ़ाया गया था ताकि यह देखा जा सके कि क्या गुणवत्ता और पहचान लंबे समय तक स्थिर रहती है।
परीक्षण किए गए फ्रेमवर्क में एवरएनिमेट; वन-टू-ऑल; एससीएआईएल††; यूनियनिमेट-डीआईटी; और वान2.2-एनिमेट शामिल थे।
मेट्रिक्स ने दृश्य गुणवत्ता, पहचान सुसंगतता, वितरण गुणवत्ता और समय संबंधी प्रतिनिधित्व त्रुटि को कवर किया। सौंदर्य स्कोर (एएसई) और नो-रेफरेंस इमेज-गुणवत्ता मूल्यांकन (आईक्यूए) ने फ्रेम-स्तरीय दृश्य गुणवत्ता को मापा; डीआईएनओ, समानता (डीआईएनओ-एस), और संदर्भ पहचान के साथ उपस्थिति सुसंगतता; फ्रेचेट इन्सेप्शन दूरी (एफआईडी), वितरण गुणवत्ता; और वीडियोमए फीचर दूरी (वी-एमएई), यह कितनी अच्छी तरह से उत्पन्न वीडियो ने समय के साथ गति को संरक्षित किया:
तीन मिनट की निरंतर पीढ़ी के साथ गुणवत्ता और पहचान के साथ परीक्षण परिणाम, लाइवएनिमेट को सभी पांच मेट्रिक्स में तुलनात्मक रूप से स्थिर बनाए रखने के साथ, जबकि कई प्रतिद्वंद्वी विधियों में समय के साथ अधिक क्षय दिखाई देता है। उच्च पढ़ाई आईक्यूए, एएसई, और डीआईएनओ-एस के लिए बेहतर है, जबकि एफआईडी और वी-एमएई के लिए कम पढ़ाई बेहतर है।
जैसा कि ऊपर दिए गए प्रारंभिक परिणाम ग्राफ में दिखाया गया है, लाइवएनिमेट ने पहले 30 सेकंड में 2.823 का उच्चतम प्रारंभिक एएसई और 4.047 का आईक्यूए हासिल किया। लेखकों का तर्क है कि यह सुझाव देता है कि तीन-चरण जिलाने संवेदी गुणवत्ता को बनाए रखता है, कम अनुमान बजट के बावजूद।
अधिक महत्वपूर्ण बात यह है कि लाइवएनिमेट ने तीन मिनट की निरंतर पीढ़ी के दौरान गुणवत्ता और पहचान के स्कोर में बहुत कम गिरावट दिखाई।
इसके विपरीत, वन-टू-ऑल ने समय के साथ काफी गिरावट दिखाई, कम दृश्य गुणवत्ता और पहचान सुसंगतता और उच्च वितरण त्रुटि के साथ; और आधार वान2.2-एनिमेट ने भी पहचान सुसंगतता में कुछ हानि दिखाई।
लेखकों का कहना है:
‘इन रुझानों हमारे केंद्रीय दावे का समर्थन करते हैं कि लंबी दूरी के संदर्भ को स्पष्ट रूप से प्रबंधित करना स्ट्रीमिंग एनिमेशन के लिए महत्वपूर्ण है।’
लाइवएनिमेट की स्केलिंग दक्षता का भी जीपीयू पर परीक्षण किया गया था। नीचे दिखाया गया है, 12.41 एफपीएस एक एच100 के साथ प्राप्त किया गया; 19.63 एफपीएस दो के साथ; और 22.13 एफपीएस चार के साथ, लाभ धीरे-धीरे संचार ओवरहेड द्वारा सीमित हो गए। दो एच100 को इसलिए पसंदीदा कॉन्फ़िगरेशन के रूप में चुना गया था:
480×480 रिज़ॉल्यूशन पर एक, दो और चार एच100 जीपीयू पर स्केलिंग दक्षता, दिखा रहा है कि दो जीपीयू ने 19.63 एफपीएस हासिल किया, जबकि चार पर आगे स्केलिंग ने केवल 22.13 एफपीएस तक मामूली वृद्धि की।
19.63 एफपीएस पर, प्रत्येक 12-फ्रेम ब्लॉक 0.611 सेकंड में उत्पन्न किया गया था। तुलना में, प्रतिस्पर्धी प्रणालियों द्वारा तीन मिनट के समान अनुक्रम को उत्पन्न करने में लगभग 2–5 घंटे लगे।
गुणात्मक परीक्षणों ने समान अंतरों को उजागर किया: पूर्ण-शरीर परीक्षण में दिखाया गया है, वन-टू-ऑल में गंभीर गिरावट देखी गई; यूनियनिमेट-डीआईटी और एससीएआईएल द्वारा फ्लिकरिंग उत्पन्न की गई; और वान-एनिमेट और एवरएनिमेट के साथ बाद में रंग या पृष्ठभूमि ड्रिफ्ट स्पष्ट हो गई:
तीन मिनट की पूर्ण-शरीर एनिमेशन की तुलना करने वाले परीक्षण परिणाम, 20 सेकंड के अंतराल पर नमूनाकरण किए गए फ्रेम के साथ, लाल अनोटेशन प्रतिद्वंद्वी विधियों में दीर्घकालिक गिरावट को उजागर करते हैं। बेसलाइन्स ने अनुक्रम को उत्पन्न करने में लगभग 2–5 घंटे लिए, लाइवएनिमेट के लिए लगभग चार मिनट की तुलना में। कृपया बेहतर रिज़ॉल्यूशन के लिए स्रोत पत्र पर जाएं।
लाइवएनिमेट ने तीन मिनट के अनुक्रम के दौरान विषय की उपस्थिति और आसपास के दृश्य को बनाए रखा। कम मांग वाले ऊपरी शरीर के परीक्षण में, तुलनात्मक दीर्घकालिक स्थिरता एवरएनिमेट और लाइवएनिमेट (हालांकि वास्तविक समय पीढ़ी केवल लाइवएनिमेट द्वारा प्रदान की गई थी) द्वारा प्राप्त की गई थी:
तीन मिनट की ऊपरी शरीर एनिमेशन की तुलना करने वाले परीक्षण परिणाम, 20 सेकंड के अंतराल पर नमूनाकरण किए गए फ्रेम दिखाते हैं कि लाइवएनिमेट ने प्रतिद्वंद्वी विधियों की तुलना में विषय की पहचान, कपड़े और गहरे पृष्ठभूमि को अधिक सुसंगत रूप से बनाए रखा।
लेखकों का निष्कर्ष है:
‘तीन मिनट के बेंचमार्क पर, लाइवएनिमेट दो एच100 जीपीयू पर 19.63 एफपीएस पर लगभग स्थिर संवेदी गुणवत्ता और पहचान बनाए रखता है, स्मृति और विलंबता स्ट्रीम अवधि से स्वतंत्र है, जबकि ऑफलाइन बेसलाइन्स दृश्य रूप से गिरावट या घंटों की गणना की आवश्यकता होती है। ‘
‘इन परिणामों से इंटरैक्टिव अनुप्रयोगों जैसे लाइव स्ट्रीमिंग, टेलीप्रेसेंस और वर्चुअल अवतार के लिए अरब-पैमाने पर वीडियो डिफ्यूजन मॉडल को प्राप्त करने में मदद मिलती है।’
निष्कर्ष
यह देखना प्रोत्साहित करने वाला है कि एक उत्पादन-निर्देशित फ्रेमवर्क मेमोरी और पहचान की समस्याओं के लिए एक नई दृष्टिकोण का उपयोग करता है जो उत्पादन वीडियो को प्रभावित करता है। कई उत्पादन फ्रेमवर्क हैं जो उपयोगकर्ता द्वारा आपूर्ति की गई निश्चित छवियों का संदर्भ दे सकते हैं, बिना आवश्यकता के ‘पेस्ट’ संदर्भ छवि को आवश्यक छवि-से-वीडियो सामग्री में डाले बिना।
हालांकि, यह केवल एक ही वीडियो-क्लिप को उत्पन्न करने की समस्याओं को हल करता है, जैसे कि व्यक्ति की पहचान (包括 कपड़े और हेयरस्टाइल) को बनाए रखना जो फ्रेम में पुनः प्रवेश करता है, या जो अस्थायी रूप से अवरुद्ध हो जाता है और फिर से देखा जाता है। अब तक, केवल भारी-शुल्क और परेशानी से भरा लोरा दृष्टिकोण ने इन मुद्दों पर कुछ प्रगति की है, हालांकि सीमित और अस्थायी।
वीडियो के लिए, और वास्तव में वर्तमान एआई क्रांति के लिए, प्रभावी स्मृति का विकास एक महत्वपूर्ण, अस्तित्व संबंधी मुद्दा है – एक जो एएजीआई के आगमन, या तीसरे एआई सर्दियों के बीच के अंतर को परिभाषित करेगा।
* यह अब एक ‘गोट्चा’ है? वर्तमान सोच यह है कि छोटे विशेष मॉडल अंततः स्थानीय रूप से चलेंगे, किराए के बिना, जबकि उच्च-अंत आवश्यकताओं को एक प्रतिस्पर्धी और आशावादी रूप से विभाजित जीपीयू किराए के बाजार द्वारा परोसा जाएगा। यह मानते हुए कि फ्रंटियर कंपनियां प्रतिस्पर्धा को ईईई नहीं करेंगी, और कि महत्वपूर्ण जीपीयू कंप्यूटे उपलब्ध रहेगा, चाहे जो भी हो। इस आधार पर, मैं अब जीपीयू आवश्यकताओं को एक दोष के रूप में नहीं मानता, लेकिन आशा करता हूं कि पहुंच अधिक लोकतांत्रिक हो जाएगी, और बाद के अनुकूलन प्रारंभिक संसाधन मांग को कम करेंगे।
† स्वयं द्वारा उत्पन्न और जांच की गई।
†† लंबे वीडियो परीक्षण के लिए, एससीएआईएल और यूनियनिमेट-डीआईटी को उसी प्रशिक्षण-मुक्त स्लाइडिंग-विंडो प्रक्रिया के साथ विस्तारित किया गया था क्योंकि न तो लंबे रूप में स्वाभाविक रूप से समर्थन करता है। एवरएनिमेट और वन-टू-ऑल का मूल्यांकन उनके स्वयं के लंबे वीडियो पीढ़ी विधियों का उपयोग करके किया गया था।
पहली बार गुरुवार, 13 अगस्त, 2026 को प्रकाशित












