Anderson का एंगल

मानव-निर्देशित एआई वीडियो में एक उल्लेखनीय प्रगति

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Examples from the DreamActor project page.

नोट: इस कार्य के लिए परियोजना पृष्ठ में 33 ऑटोप्ले उच्च-रिज़ॉल्यूशन वीडियो हैं, जो कुल आधा गिगाबाइट है, जो लोड होने पर मेरे सिस्टम को अस्थिर कर देते हैं। इस कारण से, मैं इसे सीधे लिंक नहीं करूंगा। पाठक पेपर के सारांश या पीडीएफ में यूआरएल पा सकते हैं यदि वे चुनते हैं।

वर्तमान वीडियो सिंथेसिस अनुसंधान में प्राथमिक उद्देश्यों में से एक एकल छवि से पूर्ण एआई-संचालित वीडियो प्रदर्शन उत्पन्न करना है। इस सप्ताह बाइटडांस इंटेलिजेंट क्रिएशन से एक नए शोध पत्र में इस प्रकार की सबसे व्यापक प्रणाली का विवरण दिया गया है, जो पूर्ण- और अर्ध-शरीर एनिमेशन उत्पन्न करने में सक्षम है जो व्यक्तिपरक चेहरे की विविधता को बड़े पैमाने पर गति के साथ जोड़ती है, साथ ही साथ पहचान संगति में सुधार भी करती है – एक क्षेत्र जहां यहां तक कि प्रमुख व्यावसायिक प्रणाली अक्सर कम पड़ जाती हैं।

नीचे दिए गए उदाहरण में, हम एक अभिनेता (बाएं ऊपर) और एक एकल छवि (दाएं ऊपर) से व्युत्पन्न प्रदर्शन देखते हैं, जो एक उल्लेखनीय रूप से लचीला और चपलता से रेंडरिंग प्रदान करता है, जिसमें बड़े आंदोलनों के निर्माण या ‘अनुमान’ के बारे में सामान्य मुद्दों का अभाव है।

ऑडियो सामग्री। क्लिक करें और चलाएं. एक प्रदर्शन दो स्रोतों से उत्पन्न होता है, जिसमें लिप-सिंक भी शामिल है, जो आमतौर पर समर्पित सहायक प्रणालियों का अधिकार क्षेत्र है। यह स्रोत साइट (लेख की शुरुआत में दिए गए नोट के अनुसार – यहां दिए गए अन्य सभी एम्बेडेड वीडियो पर लागू होता है) से कम किया गया संस्करण है।

हालांकि हम पहचान की स्थिरता के संबंध में कुछ शेष चुनौतियों को देख सकते हैं क्योंकि प्रत्येक क्लिप आगे बढ़ती है, यह पहली प्रणाली है जिसे मैंने देखा है जो आम तौर पर (हालांकि हमेशा नहीं) लोरा का उपयोग किए बिना एक निरंतर अवधि में पहचान बनाए रखने में उत्कृष्टता प्राप्त करती है:

ऑडियो सामग्री। क्लिक करें और चलाएं. ड्रीमएक्टर परियोजना से और उदाहरण।

नयी प्रणाली, जिसे ड्रीमएक्टर कहा जाता है, एक तीन-भाग वाली हाइब्रिड नियंत्रण प्रणाली का उपयोग करती है जो चेहरे की अभिव्यक्ति, सिर की घूर्णन और मुख्य कंकाल डिज़ाइन पर विशेष ध्यान देती है, जिससे एआई-संचालित प्रदर्शन संभव हो जाता है जहां न तो चेहरे और न ही शरीर की ओर ध्यान दिया जाता है – एक दुर्लभ, विवादास्पद क्षमता जो समान प्रणालियों में से किसी में भी नहीं है।

नीचे हम इनमें से एक पहलू, सिर की घूर्णन, को कार्रवाई में देखते हैं। प्रत्येक थंबनेल के कोने में रंगीन गेंद एक प्रकार का वर्चुअल जिम्बल को परिभाषित करती है जो सिर की दिशा को स्वतंत्र रूप से चेहरे की गति और अभिव्यक्ति से परिभाषित करती है, जो यहां एक अभिनेता (नीचे बाएं) द्वारा संचालित होती है।

क्लिक करें और चलाएं. यहां दिखाई गई रंगीन गेंद अवतार के सिर की घूर्णन की धुरी का प्रतिनिधित्व करती है, जबकि अभिव्यक्ति एक अलग मॉड्यूल द्वारा संचालित होती है और एक अभिनेता के प्रदर्शन (नीचे बाएं) से सूचित होती है।

परियोजना की सबसे दिलचस्प कार्यक्षमता में से एक, जो कि पेपर के परीक्षणों में ठीक से शामिल नहीं है, यह अपनी क्षमता है कि यह ऑडियो से सीधे होंठ की गति को प्राप्त कर सकता है – एक क्षमता जो असामान्य रूप से अच्छी तरह से काम करती है, यहां तक कि एक अभिनेता के वीडियो के बिना भी।

शोधकर्ताओं ने इस पीछा में सर्वश्रेष्ठ प्रतिद्वंद्वियों को अपनाया है, जिनमें बहुत प्रशंसित रनवे एक्ट-वन और लाइवपोर्ट्रेट शामिल हैं, और बताया कि ड्रीमएक्टर ने बेहतर मात्रात्मक परिणाम हासिल किए।

चूंकि शोधकर्ता अपने मानदंड स्वयं निर्धारित कर सकते हैं, मात्रात्मक परिणाम आवश्यक रूप से एक सांविधिक मानक नहीं हैं; लेकिन साथ आने वाले गुणात्मक परीक्षण लेखकों के निष्कर्षों का समर्थन करते लगते हैं।

दुर्भाग्य से, यह प्रणाली सार्वजनिक रिलीज के लिए नहीं है, और समुदाय को केवल इस काम से मिलने वाला एकमात्र मूल्य यह हो सकता है कि वे पेपर में वर्णित विधियों को संभावित रूप से पुन: उत्पन्न कर सकते हैं (जैसा कि 2022 में समान रूप से बंद-स्रोत गूगल ड्रीमबूथ के लिए किया गया था)।

पेपर में कहा गया है*:

‘मानव छवि एनिमेशन में संभावित सामाजिक जोखिम हैं, जैसे कि नकली वीडियो बनाने के लिए इसका दुरुपयोग किया जा सकता है। प्रस्तावित प्रौद्योगिकी का उपयोग व्यक्तियों के नकली वीडियो बनाने के लिए किया जा सकता है, लेकिन मौजूदा पता लगाने वाले उपकरण [डेमाम्बा, डॉरमेंट] इन नकली वीडियो का पता लगा सकते हैं।

‘इन जोखिमों को कम करने के लिए, स्पष्ट नैतिक नियम और जिम्मेदार उपयोग दिशानिर्देश आवश्यक हैं। हम अपने मूल मॉडल और कोड तक पहुंच को सख्ती से प्रतिबंधित करेंगे ताकि इसका दुरुपयोग न हो।’

स्वाभाविक रूप से, इस प्रकार के नैतिक विचार व्यावसायिक दृष्टिकोण से सुविधाजनक हैं, क्योंकि यह मॉडल तक पहुंच को एपीआई-केवल तक सीमित करने के लिए एक तर्क प्रदान करता है, जिसे तब मोनेटाइज किया जा सकता है। बाइटडांस ने पहले ही 2025 में ऐसा किया है, जब उन्होंने बहुत प्रशंसित ओम्निह्यूमन को ड्रीमिना वेबसाइट पर भुगतान क्रेडिट के लिए उपलब्ध कराया था। इसलिए, चूंकि ड्रीमएक्टर संभावित रूप से एक और मजबूत उत्पाद है, यह परिणाम सबसे अधिक संभावना है; जो देखना बाकी है वह यह है कि पेपर में वर्णित सिद्धांतों का कितना हिस्सा खुले स्रोत समुदाय की मदद कर सकता है।

नया पेपर ड्रीमएक्टर-एम1: होलिस्टिक, एक्सप्रेसिव और रोबस्ट ह्यूमन इमेज एनिमेशन के साथ हाइब्रिड गाइडेंस है, और बाइटडांस के छह शोधकर्ताओं से आया है।

विधि

पेपर में प्रस्तावित ड्रीमएक्टर प्रणाली का उद्देश्य एक संदर्भ छवि और एक नियंत्रित वीडियो से मानव एनिमेशन उत्पन्न करना है, एक डिफ्यूजन ट्रांसफॉर्मर (DiT) फ्रेमवर्क का उपयोग करके जो लेटेंट स्पेस (स्टेबल डिफ्यूजन का कुछ स्वाद, हालांकि पेपर केवल 2022 के लैंडमार्क प्रकाशन का हवाला देता है) के लिए अनुकूलित किया गया है।

बाहरी मॉड्यूल पर निर्भर करने के बजाय संदर्भ स्थितियों को संभालने के लिए, लेखक डिफ्यूजन ट्रांसफॉर्मर के भीतर सीधे उपस्थिति और गति सुविधाओं को मिलाते हैं, जो अंतरिक्ष और समय में ध्यान के माध्यम से परस्पर क्रिया की अनुमति देता है:

नई प्रणाली के लिए स्कीमा: ड्रीमएक्टर पोज, चेहरे की गति, और उपस्थिति को अलग लेटेंट में एन्कोड करता है, जिन्हें 3डी वीएई द्वारा उत्पन्न नोइज़ वीडियो लेटेंट के साथ जोड़ा जाता है। इन संकेतों को स्व- और क्रॉस-ध्यान का उपयोग करके एक डिफ्यूजन ट्रांसफॉर्मर के भीतर जोड़ा जाता है, जिसमें शाखाओं में साझा वजन होता है। मॉडल को साफ वीडियो लेटेंट की तुलना में शोर-मुक्त आउटपुट की तुलना करके पर्यवेक्षित किया जाता है। स्रोत: https://arxiv.org/pdf/2504.01724

नई प्रणाली के लिए स्कीमा: ड्रीमएक्टर पोज, चेहरे की गति, और उपस्थिति को अलग लेटेंट में एन्कोड करता है, जिन्हें 3डी वीएई द्वारा उत्पन्न नोइज़ वीडियो लेटेंट के साथ जोड़ा जाता है। इन संकेतों को स्व- और क्रॉस-ध्यान का उपयोग करके एक डिफ्यूजन ट्रांसफॉर्मर के भीतर जोड़ा जाता है, जिसमें शाखाओं में साझा वजन होता है। मॉडल को साफ वीडियो लेटेंट की तुलना में शोर-मुक्त आउटपुट की तुलना करके पर्यवेक्षित किया जाता है। स्रोत: https://arxiv.org/pdf/2504.01724

इसे करने के लिए, मॉडल एक पूर्व-प्रशिक्षित 3डी वेरिएशनल ऑटोएन्कोडर का उपयोग करता है ताकि यह दोनों इनपुट वीडियो और संदर्भ छवि को एन्कोड कर सके। इन लेटेंट को पैचिफाइड किया जाता है, जोड़ा जाता है और डीआईटी में खिलाया जाता है, जो उन्हें संयुक्त रूप से संसाधित करता है।

यह वास्तुकला सामान्य अभ्यास से विचलित होती है जिसमें संदर्भ इंजेक्शन के लिए एक माध्यमिक नेटवर्क जोड़ा जाता है, जो एनिमेट एनी और एनिमेट एनी 2 परियोजनाओं के लिए दृष्टिकोण था।

इसके बजाय, ड्रीमएक्टर मुख्य मॉडल में संलयन का निर्माण करता है, जो डिजाइन को सरल बनाता है जबकि उपस्थिति और गति संकेतों के बीच जानकारी के प्रवाह को बढ़ाता है। मॉडल तब फ्लो मैचिंग का उपयोग करके प्रशिक्षित किया जाता है, मानक डिफ्यूजन उद्देश्य (फ्लो मैचिंग डिफ्यूजन मॉडल को सीधे डेटा और शोर के बीच वेग क्षेत्रों का अनुमान लगाने के लिए प्रशिक्षित करती है, स्कोर अनुमान को छोड़कर) के बजाय।

हाइब्रिड मोशन गाइडेंस

हाइब्रिड मोशन गाइडेंस विधि जो न्यूरल रेंडरिंग को सूचित करती है वह 3डी बॉडी स्केलेटन और सिर गोले से व्युत्पन्न पोज़ टोकन को जोड़ती है; एक पूर्व-प्रशिक्षित चेहरा एन्कोडर द्वारा निकाले गए चेहरे की अभिव्यक्ति का संकेत देती है; और संदर्भ छवि से नमूने लिए गए संदर्भ उपस्थिति टोकन।

इन तत्वों को डिफ्यूजन ट्रांसफॉर्मर के भीतर विभिन्न ध्यान तंत्र का उपयोग करके एकीकृत किया जाता है, जो प्रणाली को वैश्विक गति, चेहरे की अभिव्यक्ति और दृश्य पहचान के बीच समन्वय करने की अनुमति देता है।

इनमें से पहले के लिए, चेहरे की भूमिका के बजाय, ड्रीमएक्टर चेहरे की अभिव्यक्ति को निर्देशित करने के लिए अंतर्निहित चेहरे की अभिव्यक्ति का उपयोग करता है, जो चेहरे की गतिविधि पर अधिक बारीक नियंत्रण को सक्षम करता है और अभिव्यक्ति को पहचान और सिर की स्थिति से अलग करता है।

इन प्रतिनिधित्वों का निर्माण करने के लिए, पाइपलाइन पहले ड्राइविंग वीडियो के प्रत्येक फ्रेम में चेहरे के क्षेत्र का पता लगाती है और इसे 224×224 तक बदल देती है। फसल वाले चेहरे को एक चेहरे की गति एन्कोडर द्वारा संसाधित किया जाता है जो पीडी-एफजीसी डेटासेट पर पूर्व-प्रशिक्षित है।

पीडी-एफजीसी, ड्रीमएक्टर में नियोजित, एक संदर्भ छवि से एक बोलता हुआ सिर उत्पन्न करता है, जिसमें ऑडियो (अलग वीडियो से) से होंठ-सिंक, सिर की स्थिति, आंख की गति और अभिव्यक्ति (अलग वीडियो से) का विच्छिन्न नियंत्रण होता है, जो प्रत्येक का स्वतंत्र हेरफेर करने की अनुमति देता है। स्रोत: https://arxiv.org/pdf/2211.14506

पीडी-एफजीसी, ड्रीमएक्टर में नियोजित, एक संदर्भ छवि से एक बोलता हुआ सिर उत्पन्न करता है, जिसमें ऑडियो (अलग वीडियो से) से होंठ-सिंक, सिर की स्थिति, आंख की गति और अभिव्यक्ति (अलग वीडियो से) का विच्छिन्न नियंत्रण होता है, जो प्रत्येक का स्वतंत्र हेरफेर करने की अनुमति देता है। स्रोत: https://arxiv.org/pdf/2211.14506

परिणाम एक चेहरे की गति टोकन की एक श्रृंखला है, जो एक क्रॉस-ध्यान परत के माध्यम से डिफ्यूजन ट्रांसफॉर्मर में इंजेक्ट किया जाता है।

इसी फ्रेमवर्क में एक ऑडियो-निर्देशित संस्करण भी समर्थित है, जिसमें एक अलग एन्कोडर होता है जो सीधे भाषण इनपुट को चेहरे की गति टोकन में मैप करता है। यह सिंक्रोनाइज़ चेहरे की एनिमेशन – होंठ की गति सहित – एक नियंत्रित वीडियो के बिना उत्पन्न करने की अनुमति देता है।

ऑडियो सामग्री। क्लिक करें और चलाएं. ऑडियो से प्राप्त होंठ-सिंक, अभिनेता के संदर्भ के बिना। एकमात्र पात्र इनपुट ऊपरी दाएं दिखाई दे रहा स्थिर फोटो है।

दूसरा, सिर की स्थिति को स्वतंत्र रूप से चेहरे की अभिव्यक्ति से नियंत्रित करने के लिए, प्रणाली एक 3डी सिर गोले का परिचय देती है (इस लेख में पहले एम्बेडेड वीडियो देखें), जो चेहरे की गतिविधि को वैश्विक सिर की गति से अलग करती है, जो एनिमेशन के दौरान सटीकता और लचीलापन में सुधार करती है।

सिर गोले का निर्माण फेसवर्स ट्रैकिंग विधि का उपयोग करके ड्राइविंग वीडियो से 3डी चेहरे के पैरामीटर को निकालने से किया जाता है।

फेसवर्स परियोजना के लिए स्कीमा। स्रोत: https://www.liuyebin.com/faceverse/faceverse.html

फेसवर्स परियोजना के लिए स्कीमा। स्रोत: https://www.liuyebin.com/faceverse/faceverse.html

इन पैरामीटर का उपयोग 2डी छवि विमान पर परियोजना किए गए रंग के गोले को रेंडर करने के लिए किया जाता है, जो ड्राइविंग सिर के साथ स्थानिक रूप से संरेखित होता है। गोले का आकार संदर्भ सिर के आकार के अनुरूप होता है, और इसका रंग सिर की दिशा को प्रतिबिंबित करता है। यह स抽象 3डी सिर की गति को सीखने की जटिलता को कम करता है, जो कि स्टाइलाइज्ड या अतिरंजित सिर के आकार को पात्रों में संरक्षित करने में मदद करता है जो एनिमेशन से निकाले जाते हैं।

सिर की दिशा पर नियंत्रण गोले का दृश्यांतरण।

सिर की दिशा पर नियंत्रण गोले का दृश्यांतरण।

अंत में, पूर्ण शरीर की गति को निर्देशित करने के लिए, प्रणाली 3डी बॉडी स्केलेटन का उपयोग करती है जिसमें अनुकूली हड्डी की लंबाई सामान्यीकरण होता है। शरीर और हाथ के पैरामीटर 4डीह्यूमन और हाथ-केंद्रित हैमर द्वारा अनुमानित किए जाते हैं, जो दोनों एसएमपीएल-एक्स बॉडी मॉडल पर काम करते हैं।

एसएमपीएल-एक्स एक पूर्ण मानव शरीर के चित्र पर एक पैरामेट्रिक जाली लगाता है, जो अनुमानित मुद्रा और अभिव्यक्ति के साथ संरेखित होता है, जो मेश का उपयोग करके मुद्रा-जागरूक हेरफेर को सक्षम बनाता है। स्रोत: https://arxiv.org/pdf/1904.05866

एसएमपीएल-एक्स एक पूर्ण मानव शरीर के चित्र पर एक पैरामेट्रिक जाली लगाता है, जो अनुमानित मुद्रा और अभिव्यक्ति के साथ संरेखित होता है, जो मेश का उपयोग करके मुद्रा-जागरूक हेरफेर को सक्षम बनाता है। स्रोत: https://arxiv.org/pdf/1904.05866

इन आउटपुट से, कुंजी जोड़ का चयन किया जाता है, 2डी में प्रोजेक्ट किया जाता है और रेखा-आधारित स्केलेटन मैप में जोड़ा जाता है। चैंप जैसे तरीकों के विपरीत, जो पूर्ण-बॉडी जाली रेंडर करते हैं, यह दृष्टिकोण पूर्व-निर्धारित आकार प्राथमिकताओं को लागू करने से बचाता है, और केवल कंकाल संरचना पर भरोसा करके, मॉडल को संदर्भ छवियों से सीधे शरीर का आकार और उपस्थिति का अनुमान लगाने के लिए प्रोत्साहित किया जाता है, जो निश्चित शरीर के प्रकारों के प्रति पूर्वाग्रह को कम करता है और विभिन्न मुद्राओं और निर्माणों में सामान्यीकरण में सुधार करता है।

प्रशिक्षण के दौरान, 3डी बॉडी स्केलेटन को सिर गोले के साथ जोड़ा जाता है और एक मुद्रा एन्कोडर से गुजरता है, जो सुविधाओं का आउटपुट देता है जो बाद में नोइज़ वीडियो लेटेंट के साथ जोड़कर डिफ्यूजन ट्रांसफॉर्मर द्वारा उपयोग किए जाने वाले शोर टोकन का उत्पादन करता है।

अनुमान के समय, प्रणाली विषयों के बीच कंकाल अंतर के लिए अनुकूलन करने के लिए हड्डी की लंबाई को सामान्य करती है। सीडएडिट पूर्व-प्रशिक्षित छवि संपादन मॉडल दोनों संदर्भ और नियंत्रित छवियों को एक मानक मानक कॉन्फ़िगरेशन में परिवर्तित करता है। आरटीएमपोज का उपयोग तब कंकाल अनुपात को निकालने के लिए किया जाता है, जो नियंत्रित कंकाल को संदर्भ विषय की मानव शरीर रचना से मेल खाने के लिए समायोजित करने के लिए उपयोग किया जाता है।

अनुमान पाइपलाइन का अवलोकन। संदर्भ संकेतों को समृद्ध करने के लिए पseudo-रेफरेंस उत्पन्न किए जा सकते हैं, जबकि हाइब्रिड नियंत्रण संकेत - सिर गोले और बॉडी स्केलेटन से अंतर्निहित चेहरे की गति और स्पष्ट मुद्रा - नियंत्रित वीडियो से निकाले जाते हैं। इन्हें तब एक डीआईटी मॉडल में खिलाया जाता है ताकि एनिमेटेड आउटपुट का उत्पादन किया जा सके, जिसमें चेहरे की गति को शरीर की मुद्रा से अलग किया जा सके, जो ऑडियो को एक ड्राइवर के रूप में उपयोग करने की अनुमति देता है।

अनुमान पाइपलाइन का अवलोकन। संदर्भ संकेतों को समृद्ध करने के लिए पseudo-रेफरेंस उत्पन्न किए जा सकते हैं, जबकि हाइब्रिड नियंत्रण संकेत – सिर गोले और बॉडी स्केलेटन से अंतर्निहित चेहरे की गति और स्पष्ट मुद्रा – नियंत्रित वीडियो से निकाले जाते हैं। इन्हें तब एक डीआईटी मॉडल में खिलाया जाता है ताकि एनिमेटेड आउटपुट का उत्पादन किया जा सके, जिसमें चेहरे की गति को शरीर की मुद्रा से अलग किया जा सके, जो ऑडियो को एक ड्राइवर के रूप में उपयोग करने की अनुमति देता है।

उपस्थिति मार्गदर्शन

उपस्थिति विश्वसनीयता को बढ़ाने के लिए, विशेष रूप से अवरोधित या दुर्लभ रूप से दिखाई देने वाले क्षेत्रों में, प्रणाली प्राथमिक संदर्भ छवि के साथ पseudo-रेफरेंस को जोड़ती है जो इनपुट वीडियो से नमूने लिए जाते हैं।

क्लिक करें और चलाएं. प्रणाली अवरोधित क्षेत्रों को सटीक और सुसंगत रूप से रेंडर करने की आवश्यकता का अनुमान लगाती है। यह एक ऐसी परियोजना के लिए मैंने देखा है जो लगभग सीजीआई-शैली के बिटमैप-टेक्सचर दृष्टिकोण के करीब है।

इन अतिरिक्त फ्रेमों का चयन आरटीएमपोज का उपयोग करके मुद्रा विविधता के लिए किया जाता है, और सीएलआईपी-आधारित समानता का उपयोग करके फिल्टर किया जाता है ताकि यह सुनिश्चित किया जा सके कि वे विषय की पहचान के साथ संगत बने रहें।

सभी संदर्भ फ्रेम (प्राथमिक और पseudo) एक ही दृश्य एन्कोडर द्वारा एन्कोड किए जाते हैं और एक स्व-ध्यान तंत्र के माध्यम से जोड़े जाते हैं, जो मॉडल को पूरक उपस्थिति संकेतों तक पहुंचने की अनुमति देता है। यह सेटअप विवरण जैसे प्रोफाइल दृश्य या अंगों के टेक्सचर को कवर करने में सुधार करता है। पseudo-रेफरेंस हमेशा प्रशिक्षण के दौरान और वैकल्पिक रूप से अनुमान के दौरान उपयोग किए जाते हैं।

प्रशिक्षण

ड्रीमएक्टर को तीन चरणों में प्रशिक्षित किया गया था ताकि जटिलता को धीरे-धीरे पेश किया जा सके और स्थिरता में सुधार किया जा सके।

पहले चरण में, केवल 3डी बॉडी स्केलेटन और 3डी सिर गोले का उपयोग नियंत्रण संकेत के रूप में किया गया था, चेहरे की अभिव्यक्ति को छोड़कर। यह बेस वीडियो जनरेशन मॉडल, एमएमडीआईटी से प्रारंभ किया गया, मानव एनिमेशन के लिए अनुकूलित करने की अनुमति दी без बारीक नियंत्रण से अभिभूत हुए।

दूसरे चरण में, अंतर्निहित चेहरे की अभिव्यक्ति जोड़ी गई, लेकिन अन्य सभी पैरामीटर जमे हुए थे। केवल चेहरे की गति एन्कोडर और चेहरे की ध्यान परतें इस बिंदु पर प्रशिक्षित की गईं, जो मॉडल को अलगाव में व्यक्तिपरक विवरण सीखने की अनुमति देती हैं।

अंतिम चरण में, सभी पैरामीटर को संयुक्त अनुकूलन के लिए अनजमे किया गया।

डेटा और परीक्षण

परीक्षण चरण के लिए, मॉडल को एक पूर्व-प्रशिक्षित छवि-से-वीडियो डीआईटी चेकपॉइंट से प्रारंभ किया जाता है और तीन चरणों में प्रशिक्षित किया जाता है: प्रत्येक के लिए 20,000 चरण पहले दो चरणों के लिए और तीसरे के लिए 30,000 चरण।

विभिन्न अवधियों और रिज़ॉल्यूशन में सामान्यीकरण में सुधार करने के लिए, वीडियो क्लिप को यादृच्छिक रूप से 25 और 121 फ्रेम की लंबाई के साथ नमूने लिए गए थे। इन्हें तब 960x640px तक बदल दिया गया, जबकि पहले के अनुपात को बनाए रखा।

प्रशिक्षण आठ (चीन-फोकस) एनवीडिया एच20 जीपीयू पर किया गया था, प्रत्येक में 96GB का वीआरएएम, एडमडब्ल्यू ऑप्टिमाइज़र का उपयोग करके, जिसमें 5e−6 का (सहनीय रूप से उच्च) लर्निंग दर था।

अनुमान में, प्रत्येक वीडियो सेगमेंट में 73 फ्रेम शामिल थे। खंडों में स्थिरता बनाए रखने के लिए, एक खंड का अंतिम लेटेंट को अगले खंड के लिए प्रारंभिक लेटेंट के रूप में पुन: उपयोग किया गया था, जो कार्य को क्रमिक छवि-से-वीडियो पीढ़ी के रूप में संदर्भित करता है।

वर्गीकारक-मुक्त मार्गदर्शन को 2.5 के वजन के साथ लागू किया गया था दोनों संदर्भ छवियों और गति नियंत्रण संकेतों के लिए।

लेखकों ने एक प्रशिक्षण डेटासेट (पेपर में कोई स्रोत नहीं दिए गए हैं) का निर्माण किया जिसमें विभिन्न डोमेन से 500 घंटे का वीडियो शामिल था, जिसमें नृत्य, खेल, फिल्म और सार्वजनिक बोलने जैसे उदाहरण शामिल थे। डेटासेट का उद्देश्य मानव गति और अभिव्यक्ति का एक व्यापक स्पेक्ट्रम कैप्चर करना था, जिसमें पूर्ण-शरीर और आधे-शरीर के शॉट्स के बीच एक समान वितरण था।

चेहरे की सिंथेसिस की गुणवत्ता में सुधार करने के लिए, नरसम्बल को डेटा तैयारी प्रक्रिया में शामिल किया गया था।

ड्रीमएक्टर के लिए डेटा को बढ़ाने के लिए उपयोग किए जाने वाले नरसम्बल डेटासेट के उदाहरण। स्रोत: https://www.youtube.com/watch?v=a-OAWqBzldU

ड्रीमएक्टर के लिए डेटा को बढ़ाने के लिए उपयोग किए जाने वाले नरसम्बल डेटासेट के उदाहरण। स्रोत: https://www.youtube.com/watch?v=a-OAWqBzldU

मूल्यांकन के लिए, शोधकर्ताओं ने अपने डेटासेट का भी उपयोग एक बेंचमार्क के रूप में किया ताकि विभिन्न परिदृश्यों में सामान्यीकरण का आकलन किया जा सके।

मॉडल का प्रदर्शन मानक मेट्रिक्स का उपयोग करके मापा गया था जो पूर्व के कार्य में पाए गए थे: फ्रेचेट इन्सेप्शन डिस्टेंस (एफआईडी); संरचनात्मक समानता सूचकांक (एसएसआईएम); सीखा हुआ संवेदी समानता छवि पैच समानता (एलपीआईपीएस); और पीक सिग्नल-टू-शोर अनुपात (पीएसएनआर) फ्रेम-स्तरीय गुणवत्ता के लिए। फ्रेचेट वीडियो दूरी (एफवीडी) का उपयोग समयिक सुसंगतता और समग्र वीडियो विश्वसनीयता का आकलन करने के लिए किया गया था।

लेखकों ने शरीर एनिमेशन और पोर्ट्रेट एनिमेशन कार्यों पर प्रयोग किए, सभी एक ही (लक्ष्य) संदर्भ छवि का उपयोग करते हुए।

शरीर एनिमेशन के लिए, ड्रीमएक्टर-एम1 की तुलना एनिमेट एनी; चैंप; मिमिकमोशन, और डिस्पोज से की गई।

प्रतिद्वंद्वी फ्रेमवर्क के साथ मात्रात्मक तुलना।

प्रतिद्वंद्वी फ्रेमवर्क के साथ मात्रात्मक तुलना।

हालांकि पीडीएफ एक स्थिर छवि को एक दृश्य तुलना के रूप में प्रदान करता है, परियोजना साइट से एक वीडियो इन अंतरों को अधिक स्पष्ट रूप से उजागर कर सकता है:

ऑडियो सामग्री। क्लिक करें और चलाएं. एक दृश्य तुलना प्रतिद्वंद्वी फ्रेमवर्क के साथ। नियंत्रित वीडियो ऊपरी बाएं दिखाई दे रहा है, और लेखकों का निष्कर्ष यह है कि ड्रीमएक्टर सबसे अच्छे परिणाम उत्पन्न करता है, जो तर्कसंगत लगता है।

पोर्ट्रेट एनिमेशन परीक्षणों के लिए, मॉडल का मूल्यांकन एक्स-पोर्ट्रेट; स्कायरील्स-ए1; और एक्ट-वन के खिलाफ किया गया था।

पोर्ट्रेट एनिमेशन के लिए मात्रात्मक तुलना।

पोर्ट्रेट एनिमेशन के लिए मात्रात्मक तुलना।

लेखकों का उल्लेख है कि उनकी विधि मात्रात्मक परीक्षणों में जीतती है, और दावा करती है कि यह गुणात्मक रूप से भी श्रेष्ठ है।

ऑडियो सामग्री। क्लिक करें और चलाएं. पोर्ट्रेट एनिमेशन तुलना के उदाहरण।

संदेहास्पद रूप से, उपरोक्त वीडियो में दिखाए गए तीसरे और अंतिम क्लिप में प्रतिद्वंद्वी फ्रेमवर्क की तुलना में कम आकर्षक होंठ-सिंक प्रदर्शित करते हैं, हालांकि समग्र गुणवत्ता उल्लेखनीय रूप से उच्च है।

निष्कर्ष

ड्रीमएक्टर ने संभावित रूप से सबसे बड़ी चुनौतियों में से एक को संबोधित किया है जो डिफ्यूजन-आधारित वीडियो पीढ़ी का सामना करता है – सुसंगत, स्थायी टेक्सचर। इस दृष्टिकोण के बाद का तार्किक कदम एक प्रारंभिक उत्पन्न क्लिप से एक संदर्भ एटलस बनाना होगा जिसे बाद की पीढ़ियों में लागू किया जा सके, जो लोरा के बिना उपस्थिति बनाए रखने की अनुमति देगा। इस दृष्टिकोण को पारंपरिक सीजीआई तकनीकों में टेक्सचर मैपिंग के समान ही माना जा सकता है, और वास्तविकता और विश्वसनीयता की गुणवत्ता पुराने तरीकों से कहीं अधिक है।

हालांकि, ड्रीमएक्टर की सबसे प्रभावशाली विशेषता संयुक्त तीन-भाग नियंत्रण प्रणाली है, जो चेहरे पर केंद्रित मानव सिंथेसिस और शरीर पर केंद्रित मानव सिंथेसिस के बीच पारंपरिक विभाजन को एक巧 तरीके से पुल करती है।

यह केवल देखना बाकी है कि क्या इन सिद्धांतों के कुछ हिस्सों को अधिक सुलभ पेशकशों में लागू किया जा सकता है; जैसा कि यह खड़ा है, ड्रीमएक्टर सिंथेसिस-एज-ए-सर्विस ऑफरिंग बनने के लिए तैयार लगता है, जो उपयोग पर प्रतिबंधों से सख्ती से बंधा हुआ है, और व्यावसायिक वास्तुकला के साथ व्यापक प्रयोग करने की अव्यावहारिकता से।

 

* मेरा लेखकों के लिए हाइपरलिंक का प्रतिस्थापन; इनलाइन उद्धरण

जैसा कि पहले उल्लेख किया गया है, यह स्पष्ट नहीं है कि इस परियोजना में स्टेबल डिफ्यूजन का कौन सा स्वाद उपयोग किया गया था।

पहली बार शुक्रवार, 4 अप्रैल, 2025 को प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जिसे डीएनजीई के ब्रह्मा.ai में विलय कर दिया गया था।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]