Anderson का एंगल

वीडियो में मशीन लर्निंग के साथ चेहरे को पुनर्गठित करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

चीन और यूके के बीच एक अनुसंधान सहयोग ने वीडियो में चेहरे को पुनर्गठित करने के लिए एक नया तरीका विकसित किया है। यह तकनीक चेहरे की संरचना को आश्वस्त करने और संकीर्ण करने की अनुमति देती है, जिसमें उच्च स्थिरता और किसी भी कलाकृति की अनुपस्थिति होती है।

एक यूट्यूब वीडियो से जो शोधकर्ताओं द्वारा स्रोत सामग्री के रूप में उपयोग किया गया था, जेनिफर लॉरेंस एक अधिक वुल्फिन व्यक्तित्व के रूप में दिखाई देती है (दाएं)। अधिक उदाहरणों के लिए लेख के नीचे एम्बेडेड वीडियो देखें। स्रोत: https://www.youtube.com/watch?v=tA2BxvrKvjE

एक यूट्यूब वीडियो से जो शोधकर्ताओं द्वारा स्रोत सामग्री के रूप में उपयोग किया गया था, जेनिफर लॉरेंस एक अधिक गाँठदार व्यक्तित्व के रूप में दिखाई देती है (दाएं)। अधिक उदाहरणों के लिए लेख के नीचे एम्बेडेड वीडियो देखें। स्रोत: https://www.youtube.com/watch?v=tA2BxvrKvjE

इस प्रकार का परिवर्तन आमतौर पर पारंपरिक सीजीआई तरीकों के माध्यम से संभव होता है जो चेहरे को विस्तृत और महंगी मोशन-कैप्चर, रिगिंग और टेक्सचरिंग प्रक्रियाओं के माध्यम से पूरी तरह से पुनर्निर्माण करने की आवश्यकता होती है।

इसके बजाय, इस तकनीक में जो सीजीआई है वह एक तंत्रिका पाइपलाइन में पैरामेट्रिक 3डी चेहरे की जानकारी के रूप में एकीकृत किया जाता है जो बाद में एक मशीन लर्निंग वर्कफ्लो के लिए आधार के रूप में उपयोग किया जाता है।

पारंपरिक पैरामेट्रिक चेहरे परिवर्तन प्रक्रियाओं के लिए मार्गदर्शक के रूप में उपयोग किए जाने वाले पैरामेट्रिक चेहरे का एक उदाहरण। स्रोत: https://arxiv.org/pdf/2205.02538.pdf

पारंपरिक पैरामेट्रिक चेहरे परिवर्तन प्रक्रियाओं के लिए मार्गदर्शक के रूप में उपयोग किए जाने वाले पैरामेट्रिक चेहरे का एक उदाहरण। स्रोत: https://arxiv.org/pdf/2205.02538.pdf

लेखकों का कहना है:

‘हमारा उद्देश्य प्राकृतिक चेहरे की विकृति के अनुसार पोर्ट्रेट चेहरों के समग्र आकार को संपादित करके उच्च गुणवत्ता वाले पोर्ट्रेट वीडियो पुनर्गठन परिणाम उत्पन्न करना है। यह सौंदर्यीकरण के लिए आकार चेहरे के निर्माण और दृश्य प्रभावों के लिए चेहरे के अतिरंजितकरण जैसे अनुप्रयोगों के लिए उपयोग किया जा सकता है।’

हालांकि 2डी चेहरे की विकृति और विकृति उपभोक्ताओं के लिए फोटोशॉप के आगमन के बाद से उपलब्ध है, यह वीडियो में इसका उपयोग करना एक कठिन काम है जिसमें सीजीआई का उपयोग नहीं किया जाता है।

चीनी-ब्रिटिश तकनीक द्वारा मार्क जुकरबर्ग के आयामों का विस्तार और संकीर्णता।

चीनी-ब्रिटिश तकनीक द्वारा मार्क जुकरबर्ग के चेहरे के आयामों का विस्तार और संकीर्णता।

शरीर को पुनर्गठित करना वर्तमान में कंप्यूटर दृष्टि क्षेत्र में एक तीव्र रुचि का क्षेत्र है, मुख्य रूप से फैशन ईकॉमर्स में इसकी संभावना के कारण, हालांकि किसी को लंबा या कंकाल विविधता बनाना वर्तमान में एक उल्लेखनीय चुनौती है।

इसी तरह, वीडियो फुटेज में सिर के आकार को एक सुसंगत और आश्वस्त तरीके से बदलना इस शोध के नए पत्र के शोधकर्ताओं के पिछले काम का विषय रहा है, हालांकि उस कार्यान्वयन में कलाकृतियों और अन्य सीमाओं का सामना करना पड़ा। यह नई पेशकश उस पिछले शोध से स्थिर से वीडियो आउटपुट तक क्षमता का विस्तार करती है।

नया सिस्टम एक डेस्कटॉप पीसी पर प्रशिक्षित किया गया था जिसमें एएमडी राइजेन 9 3950एक्स था जिसमें 32GB की मेमोरी थी, और यह ओपनसीवी से एक ऑप्टिकल फ्लो एल्गोरिदम का उपयोग करता है जो मोशन मैप के लिए है, जो स्ट्रक्चरफ्लो फ्रेमवर्क द्वारा स्मूद किया जाता है; चेहरे की संरेखण नेटवर्क (एफएएन) घटक भूमि चिह्न अनुमान के लिए, जो लोकप्रिय डीपफेक पैकेजों में भी उपयोग किया जाता है; और सेरेस सॉल्वर को अनुकूलन चुनौतियों को हल करने के लिए।

नई प्रणाली के साथ चेहरे की विस्तृत विकृति का एक अत्यधिक उदाहरण।

नई प्रणाली के साथ चेहरे की विस्तृत विकृति का एक अत्यधिक उदाहरण।

लेख पोर्ट्रेट्स इन वीडियो का पैरामेट्रिक पुनर्गठन शीर्षक से है, और यह तीन शोधकर्ताओं से है ज़ेजियांग विश्वविद्यालय से, और एक यूनिवर्सिटी ऑफ बाथ से।

चेहरे के बारे में

नई प्रणाली के तहत, वीडियो को एक छवि अनुक्रम में निकाला जाता है, और प्रत्येक चेहरे के लिए एक कठोर मुद्रा पहले अनुमानित किया जाता है। फिर एक प्रतिनिधि संख्या के बाद के फ्रेम एक साथ अनुमानित किए जाते हैं ताकि पूरे रन की छवियों (अर्थात वीडियो के फ्रेम) के साथ सुसंगत पहचान मापदंडों का निर्माण किया जा सके।

चेहरे की विकृति प्रणाली का वास्तुकला प्रवाह।

चेहरे की विकृति प्रणाली का वास्तुकला प्रवाह।

इसके बाद, अभिव्यक्ति का मूल्यांकन किया जाता है, जो एक पुनर्गठन मापदंड को लागू करता है जो रेखीय प्रतिगमन द्वारा किया जाता है। अगला एक नई साइन्ड डिस्टेंस फंक्शन (एसडीएफ) दृष्टिकोण चेहरे की रेखाओं का एक घना 2डी मैप बनाता है जो पुनर्गठन से पहले और बाद में होता है।

अंत में, आउटपुट वीडियो पर एक सामग्री-जागरूक विकृति अनुकूलन किया जाता है।

पैरामेट्रिक चेहरे

प्रक्रिया में एक 3डी मॉर्फेबल फेस मॉडल (3डीएमएम) का उपयोग किया जाता है, जो तंत्रिका और जीएन-आधारित चेहरे संश्लेषण प्रणालियों के लिए एक बढ़ती हुई लोकप्रिय सहायक है, साथ ही साथ गहरे नकली पता लगाने वाली प्रणालियों के लिए भी उपयुक्त है।

एक 3डी मॉर्फेबल फेस मॉडल (3डीएमएम) का एक उदाहरण - एक पैरामेट्रिक प्रोटोटाइप चेहरा जो नए परियोजना में उपयोग किया जाता है। ऊपरी बाएं, 3डीएमएम चेहरे पर भूमि चिह्न अनुप्रयोग। ऊपरी दाएं, एक आइसोमैप के 3डी मेश शीर्षलेख। नीचे बाएं, भूमि चिह्न फिटिंग दिखाता है; नीचे मध्य, निकाले गए चेहरे के टेक्सचर का एक आइसोमैप; और नीचे दाएं, एक परिणामी फिटिंग और आकार। स्रोत: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

एक 3डी मॉर्फेबल फेस मॉडल (3डीएमएम) का एक उदाहरण – एक पैरामेट्रिक प्रोटोटाइप चेहरा जो नए परियोजना में उपयोग किया जाता है। ऊपरी बाएं, 3डीएमएम चेहरे पर भूमि चिह्न अनुप्रयोग। ऊपरी दाएं, एक आइसोमैप के 3डी मेश शीर्षलेख। नीचे बाएं, भूमि चिह्न फिटिंग दिखाता है; नीचे मध्य, निकाले गए चेहरे के टेक्सचर का एक आइसोमैप; और नीचे दाएं, एक परिणामी फिटिंग और आकार। स्रोत: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf

नई प्रणाली का कार्यप्रवाह उन मामलों पर विचार करना होगा जहां विषय दूर देखता है। यह गहरे नकली सॉफ्टवेयर में सबसे बड़ी चुनौतियों में से एक है, क्योंकि एफएएन भूमि चिह्नों में इन मामलों के लिए बहुत कम क्षमता है, और चेहरा दूर जाने या ढका होने पर गुणवत्ता में कमी आती है।

नई प्रणाली इस जाल से बचने में सक्षम है क्योंकि यह 3डी चेहरे (3डीएमएम) और 2डी चेहरे (एफएएन भूमि चिह्नों द्वारा परिभाषित) के बीच की सीमा को मिलाने में सक्षम एक कंटूर ऊर्जा को परिभाषित करती है।

अनुकूलन

एक उपयोगी तैनाती ऐसी प्रणाली के लिए वास्तविक समय में विकृति को लागू करना होगा, जैसे कि वीडियो-चैट फिल्टर में। वर्तमान फ्रेमवर्क इसे सक्षम नहीं करता है, और आवश्यक कंप्यूटिंग संसाधनों को ‘लाइव’ विकृति एक उल्लेखनीय चुनौती बना देगा।

लेख के अनुसार, और 24fps वीडियो लक्ष्य को मानकर, पाइपलाइन में प्रति-फ्रेम ऑपरेशन 16.344 सेकंड की देरी का प्रतिनिधित्व करता है प्रति सेकंड फुटेज, और एक बार के हिट के साथ पहचान अनुमान और 3डी चेहरे की विकृति के लिए (क्रमशः 321ms और 160ms)।

अतः, अनुकूलन प्रगति करने और देरी को कम करने के लिए महत्वपूर्ण है। चूंकि सभी फ्रेमों पर संयुक्त अनुकूलन प्रक्रिया में गंभीर ओवरहेड जोड़ देगा, और init-शैली अनुकूलन (पहले फ्रेम से बाद की पहचान की सुसंगतता का अनुमान लगाना) विसंगतियों को जन्म दे सकता है, लेखकों ने व्यावहारिक अंतराल पर नमूने फ्रेम के गुणांक की गणना के लिए एक पतला योजना को अपनाया है।

फिर इस फ्रेम के उपसेट पर संयुक्त अनुकूलन किया जाता है, जो पुनर्निर्माण की एक पतली प्रक्रिया की ओर जाता है।

चेहरे की विकृति

परियोजना में उपयोग की जाने वाली विकृति तकनीक लेखकों के 2020 के कार्य गहरे पोर्ट्रेट (डीएसपी) का एक अनुकूलन है।

एक एसीएम मल्टीमीडिया के लिए 2020 की प्रस्तुति। लेख जेजू-टेंसेंट गेम और इंटेलिजेंट ग्राफिक्स इनोवेशन टेक्नोलॉजी जॉइंट लैब के शोधकर्ताओं द्वारा नेतृत्व किया जाता है। स्रोत: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

एक एसीएम मल्टीमीडिया के लिए 2020 की प्रस्तुति। लेख जेजू-टेंसेंट गेम और इंटेलिजेंट ग्राफिक्स इनोवेशन टेक्नोलॉजी जॉइंट लैब के शोधकर्ताओं द्वारा नेतृत्व किया जाता है। स्रोत: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4

लेखकों का कहना है ‘हम इस विधि को एक एकल मोनोकुलर छवि को पुनर्गठित करने से पूरे छवि अनुक्रम को पुनर्गठित करने तक बढ़ाते हैं। ‘

परीक्षण

लेख में कहा गया है कि नए तरीके का मूल्यांकन करने के लिए कोई तुलनात्मक पिछला सामग्री नहीं थी। इसलिए, लेखकों ने अपने विकृत वीडियो आउटपुट के फ्रेम की तुलना स्थिर डीएसपी आउटपुट से की।

नई प्रणाली का परीक्षण स्थिर छवियों के खिलाफ डीप शेपली पोर्ट्रेट्स से।

नई प्रणाली का परीक्षण स्थिर छवियों के खिलाफ डीप शेपली पोर्ट्रेट्स से।

लेखकों का कहना है कि डीएसपी विधि से कलाकृतियों का परिणाम होता है, जो इसके द्वारा उपयोग किए जाने वाले दुर्लभ मैपिंग के कारण होता है – एक समस्या जिसे नई फ्रेमवर्क द्वारा घने मैपिंग के साथ हल किया जाता है। इसके अलावा, लेख का तर्क है कि डीएसपी द्वारा उत्पादित वीडियो में चिकनाई और दृश्य सुसंगतता की कमी का प्रदर्शन होता है।

लेखकों का कहना है:

‘परिणाम दिखाते हैं कि हमारा दृष्टिकोण सुसंगत पुनर्गठित पोर्ट्रेट वीडियो का उत्पादन कर सकता है जबकि छवि-आधारित विधि आसानी से ध्यान देने योग्य फ्लिकरिंग कलाकृतियों का कारण बन सकती है।’

अधिक उदाहरणों के लिए नीचे दिए गए वीडियो को देखें:

 

पहली बार 9 मई 2022 को प्रकाशित। 6 बजे ईईटी में संशोधित, ‘क्षेत्र’ को एसडीएफ के लिए ‘कार्य’ से बदल दिया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai