Anderson का एंगल
मानव-निर्देशित एआई वीडियो में एक उल्लेखनीय प्रगति

नोट: इस कार्य के लिए परियोजना पृष्ठ में 33 ऑटोप्ले उच्च-रिज़ॉल्यूशन वीडियो हैं, जो कुल आधा गिगाबाइट है, जो लोड होने पर मेरे सिस्टम को अस्थिर कर देते हैं। इस कारण से, मैं इसे सीधे लिंक नहीं करूंगा। पाठक पेपर के सारांश या पीडीएफ में यूआरएल पा सकते हैं यदि वे चुनते हैं।
वर्तमान वीडियो सिंथेसिस अनुसंधान में प्राथमिक उद्देश्यों में से एक एकल छवि से पूर्ण एआई-संचालित वीडियो प्रदर्शन उत्पन्न करना है। इस सप्ताह बाइटडांस इंटेलिजेंट क्रिएशन से एक नए शोध पत्र में इस प्रकार की सबसे व्यापक प्रणाली का विवरण दिया गया है, जो पूर्ण- और अर्ध-शरीर एनिमेशन उत्पन्न करने में सक्षम है जो व्यक्तिपरक चेहरे की विविधता को बड़े पैमाने पर गति के साथ जोड़ती है, साथ ही साथ पहचान संगति में सुधार भी करती है – एक क्षेत्र जहां यहां तक कि प्रमुख व्यावसायिक प्रणाली अक्सर कम पड़ जाती हैं।
नीचे दिए गए उदाहरण में, हम एक अभिनेता (बाएं ऊपर) और एक एकल छवि (दाएं ऊपर) से व्युत्पन्न प्रदर्शन देखते हैं, जो एक उल्लेखनीय रूप से लचीला और चपलता से रेंडरिंग प्रदान करता है, जिसमें बड़े आंदोलनों के निर्माण या ‘अनुमान’ के बारे में सामान्य मुद्दों का अभाव है।
ऑडियो सामग्री। क्लिक करें और चलाएं. एक प्रदर्शन दो स्रोतों से उत्पन्न होता है, जिसमें लिप-सिंक भी शामिल है, जो आमतौर पर समर्पित सहायक प्रणालियों का अधिकार क्षेत्र है। यह स्रोत साइट (लेख की शुरुआत में दिए गए नोट के अनुसार – यहां दिए गए अन्य सभी एम्बेडेड वीडियो पर लागू होता है) से कम किया गया संस्करण है।
हालांकि हम पहचान की स्थिरता के संबंध में कुछ शेष चुनौतियों को देख सकते हैं क्योंकि प्रत्येक क्लिप आगे बढ़ती है, यह पहली प्रणाली है जिसे मैंने देखा है जो आम तौर पर (हालांकि हमेशा नहीं) लोरा का उपयोग किए बिना एक निरंतर अवधि में पहचान बनाए रखने में उत्कृष्टता प्राप्त करती है:
ऑडियो सामग्री। क्लिक करें और चलाएं. ड्रीमएक्टर परियोजना से और उदाहरण।
नयी प्रणाली, जिसे ड्रीमएक्टर कहा जाता है, एक तीन-भाग वाली हाइब्रिड नियंत्रण प्रणाली का उपयोग करती है जो चेहरे की अभिव्यक्ति, सिर की घूर्णन और मुख्य कंकाल डिज़ाइन पर विशेष ध्यान देती है, जिससे एआई-संचालित प्रदर्शन संभव हो जाता है जहां न तो चेहरे और न ही शरीर की ओर ध्यान दिया जाता है – एक दुर्लभ, विवादास्पद क्षमता जो समान प्रणालियों में से किसी में भी नहीं है।
नीचे हम इनमें से एक पहलू, सिर की घूर्णन, को कार्रवाई में देखते हैं। प्रत्येक थंबनेल के कोने में रंगीन गेंद एक प्रकार का वर्चुअल जिम्बल को परिभाषित करती है जो सिर की दिशा को स्वतंत्र रूप से चेहरे की गति और अभिव्यक्ति से परिभाषित करती है, जो यहां एक अभिनेता (नीचे बाएं) द्वारा संचालित होती है।
क्लिक करें और चलाएं. यहां दिखाई गई रंगीन गेंद अवतार के सिर की घूर्णन की धुरी का प्रतिनिधित्व करती है, जबकि अभिव्यक्ति एक अलग मॉड्यूल द्वारा संचालित होती है और एक अभिनेता के प्रदर्शन (नीचे बाएं) से सूचित होती है।
परियोजना की सबसे दिलचस्प कार्यक्षमता में से एक, जो कि पेपर के परीक्षणों में ठीक से शामिल नहीं है, यह अपनी क्षमता है कि यह ऑडियो से सीधे होंठ की गति को प्राप्त कर सकता है – एक क्षमता जो असामान्य रूप से अच्छी तरह से काम करती है, यहां तक कि एक अभिनेता के वीडियो के बिना भी।
शोधकर्ताओं ने इस पीछा में सर्वश्रेष्ठ प्रतिद्वंद्वियों को अपनाया है, जिनमें बहुत प्रशंसित रनवे एक्ट-वन और लाइवपोर्ट्रेट शामिल हैं, और बताया कि ड्रीमएक्टर ने बेहतर मात्रात्मक परिणाम हासिल किए।
चूंकि शोधकर्ता अपने मानदंड स्वयं निर्धारित कर सकते हैं, मात्रात्मक परिणाम आवश्यक रूप से एक सांविधिक मानक नहीं हैं; लेकिन साथ आने वाले गुणात्मक परीक्षण लेखकों के निष्कर्षों का समर्थन करते लगते हैं।
दुर्भाग्य से, यह प्रणाली सार्वजनिक रिलीज के लिए नहीं है, और समुदाय को केवल इस काम से मिलने वाला एकमात्र मूल्य यह हो सकता है कि वे पेपर में वर्णित विधियों को संभावित रूप से पुन: उत्पन्न कर सकते हैं (जैसा कि 2022 में समान रूप से बंद-स्रोत गूगल ड्रीमबूथ के लिए किया गया था)।
पेपर में कहा गया है*:
‘मानव छवि एनिमेशन में संभावित सामाजिक जोखिम हैं, जैसे कि नकली वीडियो बनाने के लिए इसका दुरुपयोग किया जा सकता है। प्रस्तावित प्रौद्योगिकी का उपयोग व्यक्तियों के नकली वीडियो बनाने के लिए किया जा सकता है, लेकिन मौजूदा पता लगाने वाले उपकरण [डेमाम्बा, डॉरमेंट] इन नकली वीडियो का पता लगा सकते हैं।
‘इन जोखिमों को कम करने के लिए, स्पष्ट नैतिक नियम और जिम्मेदार उपयोग दिशानिर्देश आवश्यक हैं। हम अपने मूल मॉडल और कोड तक पहुंच को सख्ती से प्रतिबंधित करेंगे ताकि इसका दुरुपयोग न हो।’
स्वाभाविक रूप से, इस प्रकार के नैतिक विचार व्यावसायिक दृष्टिकोण से सुविधाजनक हैं, क्योंकि यह मॉडल तक पहुंच को एपीआई-केवल तक सीमित करने के लिए एक तर्क प्रदान करता है, जिसे तब मोनेटाइज किया जा सकता है। बाइटडांस ने पहले ही 2025 में ऐसा किया है, जब उन्होंने बहुत प्रशंसित ओम्निह्यूमन को ड्रीमिना वेबसाइट पर भुगतान क्रेडिट के लिए उपलब्ध कराया था। इसलिए, चूंकि ड्रीमएक्टर संभावित रूप से एक और मजबूत उत्पाद है, यह परिणाम सबसे अधिक संभावना है; जो देखना बाकी है वह यह है कि पेपर में वर्णित सिद्धांतों का कितना हिस्सा खुले स्रोत समुदाय की मदद कर सकता है।
नया पेपर ड्रीमएक्टर-एम1: होलिस्टिक, एक्सप्रेसिव और रोबस्ट ह्यूमन इमेज एनिमेशन के साथ हाइब्रिड गाइडेंस है, और बाइटडांस के छह शोधकर्ताओं से आया है।
विधि
पेपर में प्रस्तावित ड्रीमएक्टर प्रणाली का उद्देश्य एक संदर्भ छवि और एक नियंत्रित वीडियो से मानव एनिमेशन उत्पन्न करना है, एक डिफ्यूजन ट्रांसफॉर्मर (DiT) फ्रेमवर्क का उपयोग करके जो लेटेंट स्पेस (स्टेबल डिफ्यूजन का कुछ स्वाद, हालांकि पेपर केवल 2022 के लैंडमार्क प्रकाशन का हवाला देता है) के लिए अनुकूलित किया गया है।
बाहरी मॉड्यूल पर निर्भर करने के बजाय संदर्भ स्थितियों को संभालने के लिए, लेखक डिफ्यूजन ट्रांसफॉर्मर के भीतर सीधे उपस्थिति और गति सुविधाओं को मिलाते हैं, जो अंतरिक्ष और समय में ध्यान के माध्यम से परस्पर क्रिया की अनुमति देता है:

नई प्रणाली के लिए स्कीमा: ड्रीमएक्टर पोज, चेहरे की गति, और उपस्थिति को अलग लेटेंट में एन्कोड करता है, जिन्हें 3डी वीएई द्वारा उत्पन्न नोइज़ वीडियो लेटेंट के साथ जोड़ा जाता है। इन संकेतों को स्व- और क्रॉस-ध्यान का उपयोग करके एक डिफ्यूजन ट्रांसफॉर्मर के भीतर जोड़ा जाता है, जिसमें शाखाओं में साझा वजन होता है। मॉडल को साफ वीडियो लेटेंट की तुलना में शोर-मुक्त आउटपुट की तुलना करके पर्यवेक्षित किया जाता है। स्रोत: https://arxiv.org/pdf/2504.01724
इसे करने के लिए, मॉडल एक पूर्व-प्रशिक्षित 3डी वेरिएशनल ऑटोएन्कोडर का उपयोग करता है ताकि यह दोनों इनपुट वीडियो और संदर्भ छवि को एन्कोड कर सके। इन लेटेंट को पैचिफाइड किया जाता है, जोड़ा जाता है और डीआईटी में खिलाया जाता है, जो उन्हें संयुक्त रूप से संसाधित करता है।
यह वास्तुकला सामान्य अभ्यास से विचलित होती है जिसमें संदर्भ इंजेक्शन के लिए एक माध्यमिक नेटवर्क जोड़ा जाता है, जो एनिमेट एनी और एनिमेट एनी 2 परियोजनाओं के लिए दृष्टिकोण था।
इसके बजाय, ड्रीमएक्टर मुख्य मॉडल में संलयन का निर्माण करता है, जो डिजाइन को सरल बनाता है जबकि उपस्थिति और गति संकेतों के बीच जानकारी के प्रवाह को बढ़ाता है। मॉडल तब फ्लो मैचिंग का उपयोग करके प्रशिक्षित किया जाता है, मानक डिफ्यूजन उद्देश्य (फ्लो मैचिंग डिफ्यूजन मॉडल को सीधे डेटा और शोर के बीच वेग क्षेत्रों का अनुमान लगाने के लिए प्रशिक्षित करती है, स्कोर अनुमान को छोड़कर) के बजाय।
हाइब्रिड मोशन गाइडेंस
हाइब्रिड मोशन गाइडेंस विधि जो न्यूरल रेंडरिंग को सूचित करती है वह 3डी बॉडी स्केलेटन और सिर गोले से व्युत्पन्न पोज़ टोकन को जोड़ती है; एक पूर्व-प्रशिक्षित चेहरा एन्कोडर द्वारा निकाले गए चेहरे की अभिव्यक्ति का संकेत देती है; और संदर्भ छवि से नमूने लिए गए संदर्भ उपस्थिति टोकन।
इन तत्वों को डिफ्यूजन ट्रांसफॉर्मर के भीतर विभिन्न ध्यान तंत्र का उपयोग करके एकीकृत किया जाता है, जो प्रणाली को वैश्विक गति, चेहरे की अभिव्यक्ति और दृश्य पहचान के बीच समन्वय करने की अनुमति देता है।
इनमें से पहले के लिए, चेहरे की भूमिका के बजाय, ड्रीमएक्टर चेहरे की अभिव्यक्ति को निर्देशित करने के लिए अंतर्निहित चेहरे की अभिव्यक्ति का उपयोग करता है, जो चेहरे की गतिविधि पर अधिक बारीक नियंत्रण को सक्षम करता है और अभिव्यक्ति को पहचान और सिर की स्थिति से अलग करता है।
इन प्रतिनिधित्वों का निर्माण करने के लिए, पाइपलाइन पहले ड्राइविंग वीडियो के प्रत्येक फ्रेम में चेहरे के क्षेत्र का पता लगाती है और इसे 224×224 तक बदल देती है। फसल वाले चेहरे को एक चेहरे की गति एन्कोडर द्वारा संसाधित किया जाता है जो पीडी-एफजीसी डेटासेट पर पूर्व-प्रशिक्षित है।

पीडी-एफजीसी, ड्रीमएक्टर में नियोजित, एक संदर्भ छवि से एक बोलता हुआ सिर उत्पन्न करता है, जिसमें ऑडियो (अलग वीडियो से) से होंठ-सिंक, सिर की स्थिति, आंख की गति और अभिव्यक्ति (अलग वीडियो से) का विच्छिन्न नियंत्रण होता है, जो प्रत्येक का स्वतंत्र हेरफेर करने की अनुमति देता है। स्रोत: https://arxiv.org/pdf/2211.14506
परिणाम एक चेहरे की गति टोकन की एक श्रृंखला है, जो एक क्रॉस-ध्यान परत के माध्यम से डिफ्यूजन ट्रांसफॉर्मर में इंजेक्ट किया जाता है।
इसी फ्रेमवर्क में एक ऑडियो-निर्देशित संस्करण भी समर्थित है, जिसमें एक अलग एन्कोडर होता है जो सीधे भाषण इनपुट को चेहरे की गति टोकन में मैप करता है। यह सिंक्रोनाइज़ चेहरे की एनिमेशन – होंठ की गति सहित – एक नियंत्रित वीडियो के बिना उत्पन्न करने की अनुमति देता है।
ऑडियो सामग्री। क्लिक करें और चलाएं. ऑडियो से प्राप्त होंठ-सिंक, अभिनेता के संदर्भ के बिना। एकमात्र पात्र इनपुट ऊपरी दाएं दिखाई दे रहा स्थिर फोटो है।
दूसरा, सिर की स्थिति को स्वतंत्र रूप से चेहरे की अभिव्यक्ति से नियंत्रित करने के लिए, प्रणाली एक 3डी सिर गोले का परिचय देती है (इस लेख में पहले एम्बेडेड वीडियो देखें), जो चेहरे की गतिविधि को वैश्विक सिर की गति से अलग करती है, जो एनिमेशन के दौरान सटीकता और लचीलापन में सुधार करती है।
सिर गोले का निर्माण फेसवर्स ट्रैकिंग विधि का उपयोग करके ड्राइविंग वीडियो से 3डी चेहरे के पैरामीटर को निकालने से किया जाता है।

फेसवर्स परियोजना के लिए स्कीमा। स्रोत: https://www.liuyebin.com/faceverse/faceverse.html
इन पैरामीटर का उपयोग 2डी छवि विमान पर परियोजना किए गए रंग के गोले को रेंडर करने के लिए किया जाता है, जो ड्राइविंग सिर के साथ स्थानिक रूप से संरेखित होता है। गोले का आकार संदर्भ सिर के आकार के अनुरूप होता है, और इसका रंग सिर की दिशा को प्रतिबिंबित करता है। यह स抽象 3डी सिर की गति को सीखने की जटिलता को कम करता है, जो कि स्टाइलाइज्ड या अतिरंजित सिर के आकार को पात्रों में संरक्षित करने में मदद करता है जो एनिमेशन से निकाले जाते हैं।

सिर की दिशा पर नियंत्रण गोले का दृश्यांतरण।
अंत में, पूर्ण शरीर की गति को निर्देशित करने के लिए, प्रणाली 3डी बॉडी स्केलेटन का उपयोग करती है जिसमें अनुकूली हड्डी की लंबाई सामान्यीकरण होता है। शरीर और हाथ के पैरामीटर 4डीह्यूमन और हाथ-केंद्रित हैमर द्वारा अनुमानित किए जाते हैं, जो दोनों एसएमपीएल-एक्स बॉडी मॉडल पर काम करते हैं।

एसएमपीएल-एक्स एक पूर्ण मानव शरीर के चित्र पर एक पैरामेट्रिक जाली लगाता है, जो अनुमानित मुद्रा और अभिव्यक्ति के साथ संरेखित होता है, जो मेश का उपयोग करके मुद्रा-जागरूक हेरफेर को सक्षम बनाता है। स्रोत: https://arxiv.org/pdf/1904.05866
इन आउटपुट से, कुंजी जोड़ का चयन किया जाता है, 2डी में प्रोजेक्ट किया जाता है और रेखा-आधारित स्केलेटन मैप में जोड़ा जाता है। चैंप जैसे तरीकों के विपरीत, जो पूर्ण-बॉडी जाली रेंडर करते हैं, यह दृष्टिकोण पूर्व-निर्धारित आकार प्राथमिकताओं को लागू करने से बचाता है, और केवल कंकाल संरचना पर भरोसा करके, मॉडल को संदर्भ छवियों से सीधे शरीर का आकार और उपस्थिति का अनुमान लगाने के लिए प्रोत्साहित किया जाता है, जो निश्चित शरीर के प्रकारों के प्रति पूर्वाग्रह को कम करता है और विभिन्न मुद्राओं और निर्माणों में सामान्यीकरण में सुधार करता है।
प्रशिक्षण के दौरान, 3डी बॉडी स्केलेटन को सिर गोले के साथ जोड़ा जाता है और एक मुद्रा एन्कोडर से गुजरता है, जो सुविधाओं का आउटपुट देता है जो बाद में नोइज़ वीडियो लेटेंट के साथ जोड़कर डिफ्यूजन ट्रांसफॉर्मर द्वारा उपयोग किए जाने वाले शोर टोकन का उत्पादन करता है।
अनुमान के समय, प्रणाली विषयों के बीच कंकाल अंतर के लिए अनुकूलन करने के लिए हड्डी की लंबाई को सामान्य करती है। सीडएडिट पूर्व-प्रशिक्षित छवि संपादन मॉडल दोनों संदर्भ और नियंत्रित छवियों को एक मानक मानक कॉन्फ़िगरेशन में परिवर्तित करता है। आरटीएमपोज का उपयोग तब कंकाल अनुपात को निकालने के लिए किया जाता है, जो नियंत्रित कंकाल को संदर्भ विषय की मानव शरीर रचना से मेल खाने के लिए समायोजित करने के लिए उपयोग किया जाता है।

अनुमान पाइपलाइन का अवलोकन। संदर्भ संकेतों को समृद्ध करने के लिए पseudo-रेफरेंस उत्पन्न किए जा सकते हैं, जबकि हाइब्रिड नियंत्रण संकेत – सिर गोले और बॉडी स्केलेटन से अंतर्निहित चेहरे की गति और स्पष्ट मुद्रा – नियंत्रित वीडियो से निकाले जाते हैं। इन्हें तब एक डीआईटी मॉडल में खिलाया जाता है ताकि एनिमेटेड आउटपुट का उत्पादन किया जा सके, जिसमें चेहरे की गति को शरीर की मुद्रा से अलग किया जा सके, जो ऑडियो को एक ड्राइवर के रूप में उपयोग करने की अनुमति देता है।
उपस्थिति मार्गदर्शन
उपस्थिति विश्वसनीयता को बढ़ाने के लिए, विशेष रूप से अवरोधित या दुर्लभ रूप से दिखाई देने वाले क्षेत्रों में, प्रणाली प्राथमिक संदर्भ छवि के साथ पseudo-रेफरेंस को जोड़ती है जो इनपुट वीडियो से नमूने लिए जाते हैं।
क्लिक करें और चलाएं. प्रणाली अवरोधित क्षेत्रों को सटीक और सुसंगत रूप से रेंडर करने की आवश्यकता का अनुमान लगाती है। यह एक ऐसी परियोजना के लिए मैंने देखा है जो लगभग सीजीआई-शैली के बिटमैप-टेक्सचर दृष्टिकोण के करीब है।
इन अतिरिक्त फ्रेमों का चयन आरटीएमपोज का उपयोग करके मुद्रा विविधता के लिए किया जाता है, और सीएलआईपी-आधारित समानता का उपयोग करके फिल्टर किया जाता है ताकि यह सुनिश्चित किया जा सके कि वे विषय की पहचान के साथ संगत बने रहें।
सभी संदर्भ फ्रेम (प्राथमिक और पseudo) एक ही दृश्य एन्कोडर द्वारा एन्कोड किए जाते हैं और एक स्व-ध्यान तंत्र के माध्यम से जोड़े जाते हैं, जो मॉडल को पूरक उपस्थिति संकेतों तक पहुंचने की अनुमति देता है। यह सेटअप विवरण जैसे प्रोफाइल दृश्य या अंगों के टेक्सचर को कवर करने में सुधार करता है। पseudo-रेफरेंस हमेशा प्रशिक्षण के दौरान और वैकल्पिक रूप से अनुमान के दौरान उपयोग किए जाते हैं।
प्रशिक्षण
ड्रीमएक्टर को तीन चरणों में प्रशिक्षित किया गया था ताकि जटिलता को धीरे-धीरे पेश किया जा सके और स्थिरता में सुधार किया जा सके।
पहले चरण में, केवल 3डी बॉडी स्केलेटन और 3डी सिर गोले का उपयोग नियंत्रण संकेत के रूप में किया गया था, चेहरे की अभिव्यक्ति को छोड़कर। यह बेस वीडियो जनरेशन मॉडल, एमएमडीआईटी से प्रारंभ किया गया, मानव एनिमेशन के लिए अनुकूलित करने की अनुमति दी без बारीक नियंत्रण से अभिभूत हुए।
दूसरे चरण में, अंतर्निहित चेहरे की अभिव्यक्ति जोड़ी गई, लेकिन अन्य सभी पैरामीटर जमे हुए थे। केवल चेहरे की गति एन्कोडर और चेहरे की ध्यान परतें इस बिंदु पर प्रशिक्षित की गईं, जो मॉडल को अलगाव में व्यक्तिपरक विवरण सीखने की अनुमति देती हैं।
अंतिम चरण में, सभी पैरामीटर को संयुक्त अनुकूलन के लिए अनजमे किया गया।
डेटा और परीक्षण
परीक्षण चरण के लिए, मॉडल को एक पूर्व-प्रशिक्षित छवि-से-वीडियो डीआईटी चेकपॉइंट से प्रारंभ किया जाता है और तीन चरणों में प्रशिक्षित किया जाता है: प्रत्येक के लिए 20,000 चरण पहले दो चरणों के लिए और तीसरे के लिए 30,000 चरण।
विभिन्न अवधियों और रिज़ॉल्यूशन में सामान्यीकरण में सुधार करने के लिए, वीडियो क्लिप को यादृच्छिक रूप से 25 और 121 फ्रेम की लंबाई के साथ नमूने लिए गए थे। इन्हें तब 960x640px तक बदल दिया गया, जबकि पहले के अनुपात को बनाए रखा।
प्रशिक्षण आठ (चीन-फोकस) एनवीडिया एच20 जीपीयू पर किया गया था, प्रत्येक में 96GB का वीआरएएम, एडमडब्ल्यू ऑप्टिमाइज़र का उपयोग करके, जिसमें 5e−6 का (सहनीय रूप से उच्च) लर्निंग दर था।
अनुमान में, प्रत्येक वीडियो सेगमेंट में 73 फ्रेम शामिल थे। खंडों में स्थिरता बनाए रखने के लिए, एक खंड का अंतिम लेटेंट को अगले खंड के लिए प्रारंभिक लेटेंट के रूप में पुन: उपयोग किया गया था, जो कार्य को क्रमिक छवि-से-वीडियो पीढ़ी के रूप में संदर्भित करता है।
वर्गीकारक-मुक्त मार्गदर्शन को 2.5 के वजन के साथ लागू किया गया था दोनों संदर्भ छवियों और गति नियंत्रण संकेतों के लिए।
लेखकों ने एक प्रशिक्षण डेटासेट (पेपर में कोई स्रोत नहीं दिए गए हैं) का निर्माण किया जिसमें विभिन्न डोमेन से 500 घंटे का वीडियो शामिल था, जिसमें नृत्य, खेल, फिल्म और सार्वजनिक बोलने जैसे उदाहरण शामिल थे। डेटासेट का उद्देश्य मानव गति और अभिव्यक्ति का एक व्यापक स्पेक्ट्रम कैप्चर करना था, जिसमें पूर्ण-शरीर और आधे-शरीर के शॉट्स के बीच एक समान वितरण था।
चेहरे की सिंथेसिस की गुणवत्ता में सुधार करने के लिए, नरसम्बल को डेटा तैयारी प्रक्रिया में शामिल किया गया था।

ड्रीमएक्टर के लिए डेटा को बढ़ाने के लिए उपयोग किए जाने वाले नरसम्बल डेटासेट के उदाहरण। स्रोत: https://www.youtube.com/watch?v=a-OAWqBzldU
मूल्यांकन के लिए, शोधकर्ताओं ने अपने डेटासेट का भी उपयोग एक बेंचमार्क के रूप में किया ताकि विभिन्न परिदृश्यों में सामान्यीकरण का आकलन किया जा सके।
मॉडल का प्रदर्शन मानक मेट्रिक्स का उपयोग करके मापा गया था जो पूर्व के कार्य में पाए गए थे: फ्रेचेट इन्सेप्शन डिस्टेंस (एफआईडी); संरचनात्मक समानता सूचकांक (एसएसआईएम); सीखा हुआ संवेदी समानता छवि पैच समानता (एलपीआईपीएस); और पीक सिग्नल-टू-शोर अनुपात (पीएसएनआर) फ्रेम-स्तरीय गुणवत्ता के लिए। फ्रेचेट वीडियो दूरी (एफवीडी) का उपयोग समयिक सुसंगतता और समग्र वीडियो विश्वसनीयता का आकलन करने के लिए किया गया था।
लेखकों ने शरीर एनिमेशन और पोर्ट्रेट एनिमेशन कार्यों पर प्रयोग किए, सभी एक ही (लक्ष्य) संदर्भ छवि का उपयोग करते हुए।
शरीर एनिमेशन के लिए, ड्रीमएक्टर-एम1 की तुलना एनिमेट एनी; चैंप; मिमिकमोशन, और डिस्पोज से की गई।

प्रतिद्वंद्वी फ्रेमवर्क के साथ मात्रात्मक तुलना।
हालांकि पीडीएफ एक स्थिर छवि को एक दृश्य तुलना के रूप में प्रदान करता है, परियोजना साइट से एक वीडियो इन अंतरों को अधिक स्पष्ट रूप से उजागर कर सकता है:
ऑडियो सामग्री। क्लिक करें और चलाएं. एक दृश्य तुलना प्रतिद्वंद्वी फ्रेमवर्क के साथ। नियंत्रित वीडियो ऊपरी बाएं दिखाई दे रहा है, और लेखकों का निष्कर्ष यह है कि ड्रीमएक्टर सबसे अच्छे परिणाम उत्पन्न करता है, जो तर्कसंगत लगता है।
पोर्ट्रेट एनिमेशन परीक्षणों के लिए, मॉडल का मूल्यांकन एक्स-पोर्ट्रेट; स्कायरील्स-ए1; और एक्ट-वन के खिलाफ किया गया था।

पोर्ट्रेट एनिमेशन के लिए मात्रात्मक तुलना।
लेखकों का उल्लेख है कि उनकी विधि मात्रात्मक परीक्षणों में जीतती है, और दावा करती है कि यह गुणात्मक रूप से भी श्रेष्ठ है।
ऑडियो सामग्री। क्लिक करें और चलाएं. पोर्ट्रेट एनिमेशन तुलना के उदाहरण।
संदेहास्पद रूप से, उपरोक्त वीडियो में दिखाए गए तीसरे और अंतिम क्लिप में प्रतिद्वंद्वी फ्रेमवर्क की तुलना में कम आकर्षक होंठ-सिंक प्रदर्शित करते हैं, हालांकि समग्र गुणवत्ता उल्लेखनीय रूप से उच्च है।
निष्कर्ष
ड्रीमएक्टर ने संभावित रूप से सबसे बड़ी चुनौतियों में से एक को संबोधित किया है जो डिफ्यूजन-आधारित वीडियो पीढ़ी का सामना करता है – सुसंगत, स्थायी टेक्सचर। इस दृष्टिकोण के बाद का तार्किक कदम एक प्रारंभिक उत्पन्न क्लिप से एक संदर्भ एटलस बनाना होगा जिसे बाद की पीढ़ियों में लागू किया जा सके, जो लोरा के बिना उपस्थिति बनाए रखने की अनुमति देगा। इस दृष्टिकोण को पारंपरिक सीजीआई तकनीकों में टेक्सचर मैपिंग के समान ही माना जा सकता है, और वास्तविकता और विश्वसनीयता की गुणवत्ता पुराने तरीकों से कहीं अधिक है।
हालांकि, ड्रीमएक्टर की सबसे प्रभावशाली विशेषता संयुक्त तीन-भाग नियंत्रण प्रणाली है, जो चेहरे पर केंद्रित मानव सिंथेसिस और शरीर पर केंद्रित मानव सिंथेसिस के बीच पारंपरिक विभाजन को एक巧 तरीके से पुल करती है।
यह केवल देखना बाकी है कि क्या इन सिद्धांतों के कुछ हिस्सों को अधिक सुलभ पेशकशों में लागू किया जा सकता है; जैसा कि यह खड़ा है, ड्रीमएक्टर सिंथेसिस-एज-ए-सर्विस ऑफरिंग बनने के लिए तैयार लगता है, जो उपयोग पर प्रतिबंधों से सख्ती से बंधा हुआ है, और व्यावसायिक वास्तुकला के साथ व्यापक प्रयोग करने की अव्यावहारिकता से।
* मेरा लेखकों के लिए हाइपरलिंक का प्रतिस्थापन; इनलाइन उद्धरण
† जैसा कि पहले उल्लेख किया गया है, यह स्पष्ट नहीं है कि इस परियोजना में स्टेबल डिफ्यूजन का कौन सा स्वाद उपयोग किया गया था।
पहली बार शुक्रवार, 4 अप्रैल, 2025 को प्रकाशित












