Anderson का एंगल

एक नए प्रणाली के लिए अस्थायी रूप से स्थिर विस्तार वीडियो पात्र

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
A capture from the project page of MIMO (https://menyifang.github.io/projects/MIMO/index.html), depicting a motion-driven wolf creature.

अलीबाबा समूह से एक नई पहल मुझे जो देखा है वह स्थिर विस्तार-आधारित फाउंडेशन मॉडल से पूर्ण-शरीर मानव अवतार उत्पन्न करने के लिए सबसे अच्छे तरीकों में से एक है।

मिमो (मिमिकिंग विद ब्जेक्ट इंटरैक्शन) नामक इस प्रणाली में, विभिन्न लोकप्रिय प्रौद्योगिकियों और मॉड्यूलों का उपयोग किया जाता है, जिनमें सीजीआई-आधारित मानव मॉडल और एनिमेटेडिफ शामिल हैं, जो वीडियो में अस्थायी रूप से संगत पात्र प्रतिस्थापन को सक्षम बनाता है – या एक पात्र को एक उपयोगकर्ता-निर्धारित कंकाल मुद्रा से चलाने के लिए।

यहाँ हम एकल छवि स्रोत से अंतर्पोलेटेड पात्रों को देखते हैं, और एक पूर्वनिर्धारित गति द्वारा संचालित:

[नीचे दिए गए वीडियो को चलाने के लिए क्लिक करें]

एकल स्रोत छवियों से, तीन विविध पात्र एक 3डी मुद्रा अनुक्रम (दूर बाएं) का उपयोग करके मिमो प्रणाली द्वारा संचालित होते हैं। परियोजना वेबसाइट और इस लेख के अंत में एम्बेडेड यूट्यूब वीडियो के लिए अधिक उदाहरणों और बेहतर रिज़ॉल्यूशन के लिए देखें। स्रोत: https://menyifang.github.io/projects/MIMO/index.html

उत्पन्न पात्र, जो वीडियो फ्रेम और विभिन्न अन्य तरीकों से भी सourced हो सकते हैं, वास्तविक दुनिया की फुटेज में एकीकृत किए जा सकते हैं।

मिमो एक नई प्रणाली प्रदान करता है जो तीन विभिन्न एन्कोडिंग उत्पन्न करता है, प्रत्येक पात्र, दृश्य, और ऑक्लूजन (अर्थात, मैटिंग, जब कोई वस्तु या व्यक्ति पात्र के सामने से गुजरता है) के लिए। इन एन्कोडिंग्स को अनुमान समय पर एकीकृत किया जाता है।

[नीचे दिए गए वीडियो को चलाने के लिए क्लिक करें]

मिमो मूल पात्रों को फोटोरियलिस्टिक या स्टाइलाइज्ड पात्रों से बदल सकता है जो लक्ष्य वीडियो से गति का अनुसरण करते हैं। परियोजना वेबसाइट और इस लेख के अंत में एम्बेडेड यूट्यूब वीडियो के लिए अधिक उदाहरणों और बेहतर रिज़ॉल्यूशन के लिए देखें।

प्रणाली स्टेबल डिफ्यूजन वी1.5 मॉडल पर प्रशिक्षित है, जिसमें शोधकर्ताओं द्वारा क्यूरेटेड एक कस्टम डेटासेट का उपयोग किया जाता है, और वास्तविक दुनिया के वीडियो और सिम्युलेटेड वीडियो के बराबर भागों से बना होता है।

विस्तार-आधारित वीडियो का एक बड़ा समस्या अस्थायी स्थिरता है, जहां वीडियो की सामग्री या तो फ्लिकर होती है या ‘विकसित’ होती है जो संगत पात्र प्रतिनिधित्व के लिए वांछित नहीं है।

मिमो, इसके बजाय, एक एकल छवि का उपयोग एक संगत मार्गदर्शन के रूप में करता है, जो इंटरस्टीशियल एसएमपीएल सीजीआई मॉडल द्वारा समन्वित और सीमित किया जा सकता है।

चूंकि स्रोत संदर्भ संगत है, और आधार मॉडल जिस पर प्रणाली प्रशिक्षित है में पर्याप्त प्रतिनिधि गति उदाहरणों के साथ बढ़ाया गया है, प्रणाली की क्षमता अस्थायी रूप से संगत आउटपुट के लिए सामान्य मानक से ऊपर है।

[नीचे दिए गए वीडियो को चलाने के लिए क्लिक करें]

मिमो पात्रों के और उदाहरण। परियोजना वेबसाइट और इस लेख के अंत में एम्बेडेड यूट्यूब वीडियो के लिए अधिक उदाहरणों और बेहतर रिज़ॉल्यूशन के लिए देखें।

यह अधिक सामान्य होता जा रहा है कि एकल छवियों का उपयोग प्रभावी तंत्रिका प्रतिनिधित्व के स्रोत के रूप में किया जाता है, या तो स्वयं या बहुमodal तरीके से संयुक्त रूप से पाठ प्रॉम्प्ट के साथ। उदाहरण के लिए, लोकप्रिय लाइवपोर्ट्रेट चेहरा स्थानांतरण प्रणाली भी एकल चेहरे की छवियों से अत्यधिक विश्वसनीय डीपफेक चेहरे उत्पन्न कर सकती है।

शोधकर्ता मानते हैं कि मिमो प्रणाली में उपयोग किए गए सिद्धांतों को अन्य और नए प्रकार के उत्पन्न प्रणालियों और फ्रेमवर्क में विस्तारित किया जा सकता है।

नई कागज का शीर्षक मिमो: स्पेशियल डिकंपोज्ड मॉडलिंग के साथ नियंत्रित पात्र वीडियो सिंथेसिस है, और यह अलीबाबा समूह के इंस्टीट्यूट फॉर इंटेलिजेंट कंप्यूटिंग के चार शोधकर्ताओं से आता है। इस काम में एक वीडियो-युक्त परियोजना पृष्ठ और एक साथी यूट्यूब वीडियो है, जो इस लेख के नीचे भी एम्बेडेड है।

विधि

मिमो स्वचालित और अनुसंधान पृथक्करण प्राप्त करता है, जिसमें तीन स्थानीय घटकों का उपयोग किया जाता है, एक अंत-टू-अंत वास्तुकला में (अर्थात, सभी उप-प्रक्रियाएं प्रणाली में एकीकृत हैं, और उपयोगकर्ता को केवल इनपुट सामग्री प्रदान करने की आवश्यकता होती है)।

मिमो के लिए संकल्पनात्मक योजना। स्रोत: https://arxiv.org/pdf/2409.16160

मिमो के लिए संकल्पनात्मक योजना। स्रोत: https://arxiv.org/pdf/2409.16160

स्रोत वीडियो में वस्तुओं को 2डी से 3डी में अनुवादित किया जाता है, शुरू में डेप्थ एनीथिंग नामक एक मोनोक्युलर गहराई अनुमानित का उपयोग करके। फ्रेम में मानव तत्व को ट्यून-ए-वीडियो परियोजना से अनुकूलित तरीकों का उपयोग करके निकाला जाता है।

इन विशेषताओं को फिर वीडियो-आधारित वॉल्यूमेट्रिक फेसेट में अनुवादित किया जाता है फेसबुक रिसर्च के सेगमेंट एनीथिंग 2 वास्तुकला का उपयोग करके।

दृश्य परत स्वयं दूसरे दो परतों में वस्तुओं को हटाकर प्राप्त की जाती है, जो एक रोटोस्कोप-शैली के मास्क को स्वचालित रूप से प्रदान करती है।

गति के लिए, एक निकाले गए लेटेंट कोड का एक सेट मानव तत्व के लिए निकाला जाता है, जो एक डिफ़ॉल्ट मानव सीजीआई-आधारित एसएमपीएल मॉडल से जुड़ा होता है, जिसकी गति उत्पन्न मानव सामग्री के लिए संदर्भ प्रदान करती है।

मानव सामग्री के लिए एक 2डी फीचर मैप एक डिफरेंशियल रास्टराइज़र द्वारा प्राप्त किया जाता है, जो 2020 की एक पहल से निवीडिया से व्युत्पन्न है। एसएमपीएल से प्राप्त 3डी डेटा को एनवीडिया विधि द्वारा प्राप्त 2डी डेटा के साथ संयोजित करके, ‘न्यूरल व्यक्ति’ का प्रतिनिधित्व करने वाले लेटेंट कोडों में उनके अंतिम संदर्भ के साथ एक ठोस संबंध है।

इस बिंदु पर, यह आवश्यक है कि एसएमपीएल का उपयोग करने वाली वास्तुकला में एक सामान्य संदर्भ स्थापित किया जाए – एक मानक मुद्रा। यह लargely डा विंची के ‘विट्रुवियन मैन’ के समान है, जो एक शून्य-मुद्रा टेम्पलेट का प्रतिनिधित्व करता है जो सामग्री स्वीकार कर सकता है और फिर विकृत हो सकता है, प्रभावी रूप से टेक्सचर-मैप्ड सामग्री के साथ।

इन विकृतियों, या ‘सामान्य से विचलन’, मानव गति का प्रतिनिधित्व करते हैं, जबकि एसएमपीएल मॉडल लेटेंट कोडों को संरक्षित करता है जो निकाले गए मानव पहचान का गठन करते हैं, और इस प्रकार पात्र को मुद्रा और टेक्सचर के संदर्भ में सही ढंग से प्रस्तुत करता है।

एसएमपीएल आकृति में एक मानक मुद्रा का एक उदाहरण। स्रोत: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

एसएमपीएल आकृति में एक मानक मुद्रा का एक उदाहरण। स्रोत: https://www.researchgate.net/figure/Layout-of-23-joints-in-the-SMPL-models_fig2_351179264

अस्थायी रूप से संगत पात्रों को उत्पन्न करने में मिमो प्रणाली की क्षमता के बारे में लेखक कहते हैं:

‘पूरी तरह से दिखाई देने वाली वीडियो फ्रेम से मानव प्रतिनिधित्व को सीखने के लिए, एक आदर्श समाधान मोनोक्युलर वीडियो से गतिशील मानव प्रतिनिधित्व को सीखना है और इसे मुद्रा स्थान से मानक स्थान में परिवर्तित करना है।

‘कुशलता को ध्यान में रखते हुए, हम एक सरलीकृत विधि का उपयोग करते हैं जो सीधे मुद्रा मानव छवि को मानक ए-मुद्रा में परिवर्तित करती है, एक पूर्व-प्रशिक्षित मानव पुनर्स्थापना मॉडल का उपयोग करके। संश्लेषित मानक दिखाई देने वाली छवि को आईडी एन्कोडर में भेजा जाता है ताकि पहचान कोड प्राप्त किया जा सके।

‘यह सरल डिज़ाइन पहचान और गति विशेषताओं का पूर्ण विच्छेदन सक्षम बनाता है। एनिमेट एनी के बाद, आईडी एन्कोडर में एक सीएलआईपी छवि एन्कोडर और एक रेफरेंस-नेट आर्किटेक्चर शामिल होता है ताकि वैश्विक और स्थानीय विशेषता के लिए एम्बेड किया जा सके।’

दृश्य और ऑक्लूजन के लिए, एक साझा और निश्चित वेरिएशनल ऑटोएन्कोडर (वीएई – इस मामले में 2013 के प्रकाशन से व्युत्पन्न) का उपयोग दृश्य और ऑक्लूजन तत्वों को लेटेंट स्थान में एम्बेड करने के लिए किया जाता है। असंगतताओं को इनपेंटिंग विधि द्वारा संभाला जाता है, जो 2023 के प्रोपेंटर परियोजना से है।

एक बार जब यह एकत्रित और स्पर्श किया जाता है, तो दोनों पृष्ठभूमि और वीडियो में कोई भी ऑक्लूजन वस्तु मानव अवतार के लिए एक मैटे प्रदान करेगी।

इन विभाजित विशेषताओं को फिर स्टेबल डिफ्यूजन वी1.5 वास्तुकला पर आधारित एक यू-नेट बैकबोन में भेजा जाता है। पूर्ण दृश्य कोड को होस्ट सिस्टम के मूल लेटेंट शोर के साथ संकेत दिया जाता है। मानव घटक को स्व-ध्यान और क्रॉस-ध्यान परतों के माध्यम से एकीकृत किया जाता है।

फिर, शोर-मुक्त परिणाम वीएई डिकोडर के माध्यम से आउटपुट होता है।

डेटा और परीक्षण

प्रशिक्षण के लिए, शोधकर्ताओं ने ह्यूमन वीडियो डेटासेट का नाम दिया ह्यूडी-7के, जिसमें 5,000 वास्तविक पात्र वीडियो और 2,000 सिंथेटिक एनिमेशन शामिल थे, जो एन3डी प्रणाली द्वारा बनाए गए थे। वास्तविक वीडियो में कोई एनोटेशन की आवश्यकता नहीं थी, मिमो की वास्तुकला में आकृति निष्कर्षण प्रक्रियाओं की गैर-semantic प्रकृति के कारण। सिंथेटिक डेटा पूरी तरह से एनोटेट किया गया था।

मॉडल को आठ एनवीडिया ए100 जीपीयू (हालांकि पत्र यह निर्दिष्ट नहीं करता है कि वे 40GB या 80GB वीआरएएम मॉडल थे) पर प्रशिक्षित किया गया था, 50 पुनरावृत्तियों के लिए, 24 वीडियो फ्रेम और बैच आकार चार का उपयोग करके, संगमन तक।

प्रणाली के लिए गति मॉड्यूल को एनिमेटेडिफ के वजन पर प्रशिक्षित किया गया था। प्रशिक्षण प्रक्रिया के दौरान, वीएई एन्कोडर/डिकोडर और सीएलआईपी छवि एन्कोडर के वजन जमे हुए थे (पूर्ण फाइन-ट्यूनिंग के विपरीत, जिसका एक व्यापक प्रभाव होगा एक फाउंडेशन मॉडल पर)।

हालांकि मिमो का अन्य समान प्रणालियों के खिलाफ परीक्षण नहीं किया गया था, शोधकर्ताओं ने इसे एएमएएसएस और मिक्सामो से बाहरी वितरण गति अनुक्रम पर परीक्षण किया। इन गतियों में चढ़ाई, खेल और नृत्य शामिल थे।

उन्होंने इसे जंगली मानव वीडियो पर भी परीक्षण किया। दोनों मामलों में, पत्र ‘उच्च लचीलापन’ की रिपोर्ट करता है इन अनदेखी 3डी गतियों के लिए, विभिन्न दृष्टिकोण से।

हालांकि पत्र में कई स्थिर छवि परिणाम हैं जो प्रणाली की प्रभावशीलता को प्रदर्शित करते हैं, मिमो का वास्तविक प्रदर्शन परियोजना पृष्ठ पर प्रदान किए गए व्यापक वीडियो परिणामों और इस लेख के नीचे एम्बेडेड यूट्यूब वीडियो में सबसे अच्छी तरह से मूल्यांकित किया जा सकता है (जो इस लेख की शुरुआत में वीडियो से व्युत्पन्न होते हैं)।

लेखक निष्कर्ष निकालते हैं:

‘प्रायोगिक परिणाम [प्रदर्शित करते हैं] कि हमारी विधि न केवल लचीली पात्र, गति और दृश्य नियंत्रण को सक्षम बनाती है, बल्कि मनमाने पात्र, नए 3डी गतियों के लिए सामान्यता और इंटरैक्टिव दृश्यों के लिए उन्नत स्केलेबिलिटी को भी प्रदान करती है।

‘हम यह भी मानते हैं कि हमारा समाधान, जो अंतर्निहित 3डी प्रकृति को ध्यान में रखता है और स्वचालित रूप से 2डी वीडियो को स्तरीय स्थानीय घटकों में एन्कोड करता है, 3डी-जागरूक वीडियो सिंथेसिस के लिए भविष्य के शोध को प्रेरित कर सकता है।

‘इसके अलावा, हमारा फ्रेमवर्क न केवल पात्र वीडियो उत्पन्न करने के लिए उपयुक्त है, बल्कि अन्य नियंत्रित वीडियो सिंथेसिस कार्यों के लिए भी संभावित रूप से अनुकूलित किया जा सकता है।’

निष्कर्ष

यह देखना ताज़ा है कि स्टेबल डिफ्यूजन पर आधारित एक अवतार प्रणाली जो ऐसी अस्थायी स्थिरता प्रदान करती है – न केवल इसलिए कि गाउसियन अवतार इस शोध क्षेत्र में उच्च भूमि हासिल कर रहे हैं।

परिणामों में प्रस्तुत स्टाइलाइज्ड अवतार प्रभावी हैं, और जबकि मिमो द्वारा उत्पन्न फोटोरियलिज़म का स्तर वर्तमान में गाउसियन स्प्लैटिंग के बराबर नहीं है, अस्थायी रूप से संगत मानव बनाने के लिए एक सेमांटिक-आधारित लेटेंट डिफ्यूजन नेटवर्क (एलडीएम) में लाभ काफी हैं।

 

* मेरा लेखकों के इनलाइन उद्धरणों को हाइपरलिंक में परिवर्तित करना, और जहां आवश्यक हो, बाहरी व्याख्यात्मक हाइपरलिंक।

पहली बार बुधवार, 25 सितंबर, 2024 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]