एआई मॉडल और प्लेटफ़ॉर्म

AniPortrait: ऑडियो-ड्रिवन सिंथेसिस ऑफ फोटोरियलिस्टिक पोर्ट्रेट एनिमेशन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

वर्षों से, स्थिर छवियों और ऑडियो से वास्तविक और अभिव्यंजक पोर्ट्रेट एनिमेशन बनाने की प्रक्रिया ने गेमिंग, डिजिटल मीडिया, वर्चुअल रियलिटी और बहुत कुछ सहित विभिन्न अनुप्रयोगों को पाया है। इसके बावजूद, यह अभी भी डेवलपर्स के लिए उच्च-गुणवत्ता वाले एनिमेशन बनाने के लिए फ्रेमवर्क बनाना मुश्किल है जो समय-समय पर संगति बनाए रखते हैं और दृश्य रूप से आकर्षक हैं। जटिलता का एक प्रमुख कारण है होंठ की गति, सिर की स्थिति और चेहरे की अभिव्यक्ति के बीच सूक्ष्म समन्वय की आवश्यकता है जो एक दृश्य रूप से आकर्षक प्रभाव बनाने के लिए है।

इस लेख में, हम AniPortrait के बारे में बात करेंगे, एक नए फ्रेमवर्क के बारे में जो एक संदर्भ पोर्ट्रेट छवि और एक ऑडियो नमूने से उच्च-गुणवत्ता वाले एनिमेशन बनाने के लिए डिज़ाइन किया गया है। AniPortrait फ्रेमवर्क का काम दो चरणों में विभाजित है। पहले, AniPortrait फ्रेमवर्क ऑडियो नमूनों से मध्यवर्ती 3D प्रतिनिधित्व निकालता है और उन्हें 2D चेहरे के लैंडमार्क की एक श्रृंखला में परियोजना करता है। इसके बाद, फ्रेमवर्क एक मजबूत डिफ्यूजन मॉडल का उपयोग करता है जो लैंडमार्क अनुक्रम को समय-समय पर संगत और फोटोरियलिस्टिक एनिमेशन में परिवर्तित करता है। प्रयोगात्मक परिणाम AniPortrait फ्रेमवर्क की श्रेष्ठता और क्षमता को दर्शाते हैं जो उच्च-गुणवत्ता वाले एनिमेशन बनाने में सक्षम है जो असाधारण दृश्य गुणवत्ता, मुद्रा विविधता और चेहरे की प्राकृतिकता प्रदान करते हैं, जो एक बढ़ी हुई और समृद्ध अनुभूति प्रदान करते हैं। इसके अलावा, AniPortrait फ्रेमवर्क नियंत्रणीयता और लचीलेपन के मामले में उल्लेखनीय क्षमता रखता है और चेहरे के पुनर्निर्माण, चेहरे की गति संपादन और अधिक जैसे क्षेत्रों में प्रभावी ढंग से लागू किया जा सकता है।

AniPortrait: फोटोरियलिस्टिक पोर्ट्रेट एनिमेशन

वास्तविक और अभिव्यंजक पोर्ट्रेट एनिमेशन बनाने की प्रक्रिया को शोधकर्ताओं ने लंबे समय से ध्यान में रखा है क्योंकि इसकी अद्भुत क्षमता और अनुप्रयोग हैं जो डिजिटल मीडिया, वर्चुअल रियलिटी और गेमिंग से लेकर बहुत कुछ तक फैले हुए हैं। इसके बावजूद, उच्च-गुणवत्ता वाले एनिमेशन बनाने की प्रक्रिया जो समय-समय पर संगति बनाए रखते हैं और दृश्य रूप से आकर्षक हैं, अभी भी एक महत्वपूर्ण चुनौती पेश करती है। डेवलपर्स के लिए एक प्रमुख बाधा है सिर की स्थिति, दृश्य अभिव्यक्ति और होंठ की गति के बीच सूक्ष्म समन्वय की आवश्यकता है जो एक दृश्य रूप से आकर्षक प्रभाव बनाने के लिए है। मौजूदा तरीकों ने इन चुनौतियों का सामना करने में विफल रहे हैं, मुख्य रूप से क्योंकि अधिकांश NeRF, मोशन-आधारित डिकोडर और GAN जैसे सीमित क्षमता वाले जनरेटर पर निर्भर करते हैं। ये नेटवर्क सीमित सामान्यीकरण क्षमता प्रदर्शित करते हैं और उच्च-गुणवत्ता वाली सामग्री बनाने में अस्थिर हैं। हालांकि, डिफ्यूजन मॉडल के हालिया उद्भव ने उच्च-गुणवत्ता वाली छवियों के निर्माण को सुविधाजनक बनाया है, और कुछ फ्रेमवर्क जो डिफ्यूजन मॉडल और समयिक मॉड्यूल पर आधारित हैं, उन्होंने आकर्षक वीडियो बनाने की सुविधा प्रदान की है, जिससे डिफ्यूजन मॉडल को उत्कृष्ट बनाने में मदद मिली है।

डिफ्यूजन मॉडल की प्रगति पर आधारित, AniPortrait फ्रेमवर्क एक संदर्भ छवि और एक ऑडियो नमूने का उपयोग करके उच्च-गुणवत्ता वाले एनिमेटेड पोर्ट्रेट बनाने का लक्ष्य रखता है। AniPortrait फ्रेमवर्क का काम दो चरणों में विभाजित है। पहले चरण में, AniPortrait फ्रेमवर्क ट्रांसफॉर्मर-आधारित मॉडल का उपयोग करके ऑडियो इनपुट से 3D चेहरे की जाली और सिर की स्थिति की एक श्रृंखला निकालता है और उन्हें बाद में 2D चेहरे के लैंडमार्क में परियोजना करता है। पहले चरण में, AniPortrait फ्रेमवर्क ऑडियो से होंठ की गति और सूक्ष्म अभिव्यक्तियों को पकड़ने में सक्षम होता है, साथ ही सिर की स्थिति को भी सिंक्रोनाइज़ करता है जो ऑडियो नमूने के लय के साथ मेल खाता है। दूसरे चरण में, AniPortrait फ्रेमवर्क एक मजबूत डिफ्यूजन मॉडल का उपयोग करता है जो लैंडमार्क अनुक्रम को समय-समय पर संगत और फोटोरियलिस्टिक एनिमेशन में परिवर्तित करता है। विशेष रूप से, AniPortrait फ्रेमवर्क AnimateAnyone मॉडल से नेटवर्क आर्किटेक्चर का उपयोग करता है, जो Stable Diffusion 1.5 का उपयोग करता है, एक शक्तिशाली डिफ्यूजन मॉडल जो एक संदर्भ छवि और एक शरीर की गति अनुक्रम के आधार पर जीवन भरने वाले और तरल एनिमेशन बनाने में सक्षम है।

प्रयोगात्मक परिणाम AniPortrait फ्रेमवर्क की श्रेष्ठता को दर्शाते हैं जो उच्च-गुणवत्ता वाले एनिमेशन बनाने में सक्षम है जो असाधारण दृश्य गुणवत्ता, मुद्रा विविधता और चेहरे की प्राकृतिकता प्रदान करते हैं। AniPortrait फ्रेमवर्क की मध्यवर्ती 3D प्रतिनिधित्व का उपयोग करके, फ्रेमवर्क को आवश्यकतानुसार इन प्रतिनिधित्वों को संशोधित करने की लचीलापन मिलती है। यह अनुकूलन क्षमता AniPortrait फ्रेमवर्क को चेहरे के पुनर्निर्माण और चेहरे की गति संपादन जैसे क्षेत्रों में अधिक प्रभावी ढंग से लागू करने में मदद करती है।

AniPortrait: कार्य और विधि

प्रस्तावित AniPortrait फ्रेमवर्क में दो मॉड्यूल हैं, अर्थात् Lmk2Video और Audio2Lmk। Audio2Lmk मॉड्यूल ऑडियो इनपुट से होंठ की गति और चेहरे की अभिव्यक्ति को पकड़ने वाले लैंडमार्क की एक श्रृंखला निकालने का प्रयास करता है, जबकि Lmk2Video मॉड्यूल इस लैंडमार्क अनुक्रम का उपयोग करके समय-समय पर संगत और उच्च-गुणवत्ता वाले पोर्ट्रेट वीडियो बनाने में मदद करता है। निम्नलिखित चित्र AniPortrait फ्रेमवर्क के कार्य का एक अवलोकन प्रस्तुत करता है। जैसा कि देखा जा सकता है, AniPortrait फ्रेमवर्क पहले ऑडियो से 3D चेहरे की जाली और सिर की स्थिति निकालता है और उन्हें बाद में 2D कुंजी बिंदुओं में परियोजना करता है। दूसरे चरण में, फ्रेमवर्क एक डिफ्यूजन मॉडल का उपयोग करता है जो 2D कुंजी बिंदुओं को एक पोर्ट्रेट वीडियो में परिवर्तित करता है, जिसमें दोनों चरण एक ही नेटवर्क में साथ-साथ प्रशिक्षित होते हैं।

Audio2Lmk

एक दिए गए भाषण के टुकड़ों की श्रृंखला के लिए, AniPortrait फ्रेमवर्क का प्राथमिक लक्ष्य 3D चेहरे की जाली की एक श्रृंखला की भविष्यवाणी करना है जो अनुवाद और घूर्णन के वेक्टर प्रतिनिधित्व के साथ है। AniPortrait फ्रेमवर्क प्री-प्रशिक्षित wav2vec विधि का उपयोग करके ऑडियो विशेषताओं को निकालता है, और मॉडल उच्च स्तर की सामान्यीकरण क्षमता प्रदर्शित करता है और ऑडियो से स्वर और उच्चारण को सटीक रूप से पहचानने में सक्षम है, जो वास्तविक चेहरे की गति बनाने में एक महत्वपूर्ण भूमिका निभाता है। प्राप्त ऑडियो विशेषताओं का लाभ उठाकर, AniPortrait फ्रेमवर्क 3D चेहरे की जाली में इन विशेषताओं को परिवर्तित करने के लिए एक सरल वास्तुकला का उपयोग करता है जो दो fc परतों से बना है। AniPortrait फ्रेमवर्क यह देखता है कि यह सीधा डिज़ाइन न केवल अनुमान प्रक्रिया की कुशलता को बढ़ाता है, बल्कि सटीकता को भी सुनिश्चित करता है। जब ऑडियो से मुद्रा में परिवर्तन होता है, तो AniPortrait फ्रेमवर्क उसी wav2vec नेटवर्क का उपयोग करता है जो ऑडियो से जाली मॉड्यूल के रूप में है, हालांकि मॉडल ऑडियो से जाली मॉड्यूल के साथ वजन साझा नहीं करता है। यह मुख्य रूप से इसलिए है क्योंकि मुद्रा ऑडियो में मौजूद स्वर और लय से अधिक जुड़ी हुई है, जो ऑडियो से जाली कार्यों की तुलना में एक अलग जोर देती है। पिछले राज्यों के प्रभाव को ध्यान में रखने के लिए, AniPortrait फ्रेमवर्क एक ट्रांसफॉर्मर डिकोडर का उपयोग करता है जो मुद्रा अनुक्रम को डिकोड करता है। इस प्रक्रिया में, फ्रेमवर्क क्रॉस-ध्यान तंत्रिका का उपयोग करके डिकोडर में ऑडियो विशेषताओं को एकीकृत करता है, और दोनों मॉड्यूल को L1 हानि का उपयोग करके प्रशिक्षित किया जाता है। एक बार मॉडल मुद्रा और जाली अनुक्रम प्राप्त करता है, तो यह दृष्टिकोण परियोजना का उपयोग करके इन अनुक्रमों को 2D चेहरे के लैंडमार्क की एक श्रृंखला में परिवर्तित करता है जो बाद के चरण में इनपुट संकेत के रूप में उपयोग की जाती है।

Lmk2Video

एक दिए गए संदर्भ पोर्ट्रेट छवि और एक चेहरे के लैंडमार्क की श्रृंखला के लिए, प्रस्तावित Lmk2Video मॉड्यूल एक समय-समय पर संगत पोर्ट्रेट एनिमेशन बनाता है, जो लैंडमार्क अनुक्रम के साथ गति को सिंक्रोनाइज़ करता है और संदर्भ छवि के साथ सुसंगत दिखता है, और अंत में, फ्रेमवर्क पोर्ट्रेट एनिमेशन को पोर्ट्रेट फ्रेम की एक श्रृंखला के रूप में प्रस्तुत करता है। Lmk2Video के नेटवर्क संरचना का डिज़ाइन AnimateAnyone फ्रेमवर्क से प्रेरित है। AniPortrait फ्रेमवर्क Stable Diffusion 1.5 का उपयोग करता है, एक अत्यधिक शक्तिशाली डिफ्यूजन मॉडल, और एक समयिक मोशन मॉड्यूल को एकीकृत करता है जो बहु-फ्रेम शोर इनपुट को एक वीडियो फ्रेम की श्रृंखला में परिवर्तित करता है। 同 समय, एक ReferencenNet नेटवर्क घटक Stable Diffusion 1.5 की संरचना को दर्शाता है और संदर्भ छवि से दिखावे की जानकारी को निकालता है और इसे मुख्य मॉडल में एकीकृत करता है। रणनीतिक डिज़ाइन यह सुनिश्चित करता है कि चेहरे की पहचान पूरे आउटपुट वीडियो में स्थिर रहती है। AnimateAnyone फ्रेमवर्क से अलग, AniPortrait फ्रेमवर्क PoseGuider के डिज़ाइन की जटिलता को बढ़ाता है। मूल AnimateAnyone फ्रेमवर्क में केवल कुछ कॉन्वोल्यूशनल परतें हैं जो लैंडमार्क विशेषताओं को मुख्य मॉडल के इनपुट परत में मिलाती हैं। AniPortrait फ्रेमवर्क यह देखता है कि यह डिज़ाइन होंठ की सूक्ष्म गति को पकड़ने में कमी महसूस करता है, और इस समस्या को हल करने के लिए, फ्रेमवर्क ConvNet आर्किटेक्चर की बहु-स्तरीय रणनीति को अपनाता है और लैंडमार्क विशेषताओं को मुख्य मॉडल के विभिन्न ब्लॉकों में एकीकृत करता है। इसके अलावा, AniPortrait फ्रेमवर्क एक अतिरिक्त सुधार पेश करता है जो संदर्भ छवि के लैंडमार्क को एक अतिरिक्त इनपुट के रूप में शामिल करता है। PoseGuider घटक का क्रॉस-ध्यान मॉड्यूल प्रत्येक फ्रेम के लक्ष्य लैंडमार्क और संदर्भ लैंडमार्क के बीच परस्पर क्रिया को सुविधाजनक बनाता है। यह प्रक्रिया नेटवर्क को दिखावे और चेहरे के लैंडमार्क के बीच संबंध को समझने के लिए अतिरिक्त संकेत प्रदान करती है, जिससे अधिक सटीक गति वाले पोर्ट्रेट एनिमेशन का निर्माण होता है।

AniPortrait: कार्यान्वयन और परिणाम

Audio2Lmk चरण के लिए, AniPortrait फ्रेमवर्क wav2vec2.0 घटक का उपयोग करता है और MediaPipe आर्किटेक्चर का उपयोग 3D जाली और 6D मुद्रा के लिए एनोटेशन निकालने के लिए करता है। मॉडल Audio2Mesh घटक के लिए प्रशिक्षण डेटा को अपने आंतरिक डेटासेट से स्रोत करता है जिसमें लगभग 60 मिनट का उच्च-गुणवत्ता वाला भाषण डेटा एक ही वक्ता से स्रोत किया जाता है। 3D जाली को MediaPipe घटक द्वारा निकाले जाने की स्थिरता सुनिश्चित करने के लिए, वॉयस एक्टर को पूरे रिकॉर्डिंग प्रक्रिया के दौरान कैमरे का सामना करने और सिर की स्थिति को स्थिर रखने का निर्देश दिया जाता है। Lmk2Video मॉड्यूल के लिए, AniPortrait फ्रेमवर्क एक दो-चरण प्रशिक्षण दृष्टिकोण को लागू करता है। पहले चरण में, फ्रेमवर्क ReferenceNet और PoseGuider, मुख्य मॉडल के 2D घटक को प्रशिक्षित करने पर केंद्रित है, और मोशन मॉड्यूल को छोड़ देता है। दूसरे चरण में, AniPortrait फ्रेमवर्क अन्य सभी घटकों को जमा देता है और मोशन मॉड्यूल को प्रशिक्षित करने पर केंद्रित है। इस चरण के लिए, फ्रेमवर्क दो बड़े पैमाने पर उच्च-गुणवत्ता वाले चेहरे के वीडियो डेटासेट का उपयोग करता है और मॉडल को प्रशिक्षित करने के लिए डेटा को MediaPipe घटक का उपयोग करके 2D चेहरे के लैंडमार्क निकालने के लिए संसाधित करता है। इसके अलावा, लिप्स की गति के प्रति नेटवर्क की संवेदनशीलता को बढ़ाने के लिए, AniPortrait मॉडल 2D लैंडमार्क से पोज़ छवि रेंडर करते समय ऊपरी और निचले होंठ को विभिन्न रंगों में अलग करता है।

जैसा कि निम्नलिखित छवि में दिखाया गया है, AniPortrait फ्रेमवर्क उच्च-गुणवत्ता वाले एनिमेशन की एक श्रृंखला बनाता है जो उत्कृष्ट दृश्य गुणवत्ता और यथार्थवाद को प्रदर्शित करते हैं।

फ्रेमवर्क तब एक मध्यवर्ती 3D प्रतिनिधित्व का उपयोग करता है जिसे आउटपुट को आवश्यकतानुसार संशोधित करने के लिए संपादित किया जा सकता है। उदाहरण के लिए, उपयोगकर्ता एक स्रोत से लैंडमार्क निकाल सकते हैं और इसकी पहचान बदल सकते हैं, जिससे AniPortrait फ्रेमवर्क को चेहरे के पुनर्निर्माण प्रभाव बनाने में मदद मिलती है।

अंतिम विचार

इस लेख में, हमने AniPortrait के बारे में बात की है, एक नए फ्रेमवर्क के बारे में जो एक संदर्भ पोर्ट्रेट छवि और एक ऑडियो नमूने से उच्च-गुणवत्ता वाले एनिमेशन बनाने के लिए डिज़ाइन किया गया है। केवल एक संदर्भ छवि और एक ऑडियो क्लिप को इनपुट करके, AniPortrait फ्रेमवर्क एक पोर्ट्रेट वीडियो बनाने में सक्षम है जो सिर की प्राकृतिक गति और होंठ की चिकनी गति प्रदर्शित करता है। डिफ्यूजन मॉडल की मजबूत सामान्यीकरण क्षमता का लाभ उठाकर, AniPortrait फ्रेमवर्क एनिमेशन बनाता है जो उत्कृष्ट दृश्य गुणवत्ता और जीवन भरने वाली गति प्रदर्शित करते हैं। AniPortrait फ्रेमवर्क का काम दो चरणों में विभाजित है। पहले, AniPortrait फ्रेमवर्क ऑडियो नमूनों से मध्यवर्ती 3D प्रतिनिधित्व निकालता है और उन्हें 2D चेहरे के लैंडमार्क में परियोजना करता है। इसके बाद, फ्रेमवर्क एक मजबूत डिफ्यूजन मॉडल का उपयोग करता है जो लैंडमार्क अनुक्रम को समय-समय पर संगत और फोटोरियलिस्टिक एनिमेशन में परिवर्तित करता है। प्रयोगात्मक परिणाम AniPortrait फ्रेमवर्क की श्रेष्ठता और क्षमता को दर्शाते हैं जो उच्च-गुणवत्ता वाले एनिमेशन बनाने में सक्षम है जो असाधारण दृश्य गुणवत्ता, मुद्रा विविधता और चेहरे की प्राकृतिकता प्रदान करते हैं, जो एक बढ़ी हुई और समृद्ध अनुभूति प्रदान करते हैं। इसके अलावा, AniPortrait फ्रेमवर्क नियंत्रणीयता और लचीलेपन के मामले में उल्लेखनीय क्षमता रखता है और चेहरे के पुनर्निर्माण, चेहरे की गति संपादन और अधिक जैसे क्षेत्रों में प्रभावी ढंग से लागू किया जा सकता है।

एक इंजीनियर पेशे से, एक लेखक दिल से। कुनाल एक तकनीकी लेखक हैं जिन्हें एआई और एमएल के प्रति गहरा प्यार और समझ है, जो अपने आकर्षक और जानकारीपूर्ण दस्तावेज़ के माध्यम से इन क्षेत्रों में जटिल अवधारणाओं को सरल बनाने के लिए समर्पित हैं।