Anderson का एंगल
वीडियो में मशीन लर्निंग के साथ चेहरे को पुनर्गठित करना

चीन और यूके के बीच एक अनुसंधान सहयोग ने वीडियो में चेहरे को पुनर्गठित करने के लिए एक नया तरीका विकसित किया है। यह तकनीक चेहरे की संरचना को आश्वस्त करने और संकीर्ण करने की अनुमति देती है, जिसमें उच्च स्थिरता और किसी भी कलाकृति की अनुपस्थिति होती है।

एक यूट्यूब वीडियो से जो शोधकर्ताओं द्वारा स्रोत सामग्री के रूप में उपयोग किया गया था, जेनिफर लॉरेंस एक अधिक गाँठदार व्यक्तित्व के रूप में दिखाई देती है (दाएं)। अधिक उदाहरणों के लिए लेख के नीचे एम्बेडेड वीडियो देखें। स्रोत: https://www.youtube.com/watch?v=tA2BxvrKvjE
इस प्रकार का परिवर्तन आमतौर पर पारंपरिक सीजीआई तरीकों के माध्यम से संभव होता है जो चेहरे को विस्तृत और महंगी मोशन-कैप्चर, रिगिंग और टेक्सचरिंग प्रक्रियाओं के माध्यम से पूरी तरह से पुनर्निर्माण करने की आवश्यकता होती है।
इसके बजाय, इस तकनीक में जो सीजीआई है वह एक तंत्रिका पाइपलाइन में पैरामेट्रिक 3डी चेहरे की जानकारी के रूप में एकीकृत किया जाता है जो बाद में एक मशीन लर्निंग वर्कफ्लो के लिए आधार के रूप में उपयोग किया जाता है।

पारंपरिक पैरामेट्रिक चेहरे परिवर्तन प्रक्रियाओं के लिए मार्गदर्शक के रूप में उपयोग किए जाने वाले पैरामेट्रिक चेहरे का एक उदाहरण। स्रोत: https://arxiv.org/pdf/2205.02538.pdf
लेखकों का कहना है:
‘हमारा उद्देश्य प्राकृतिक चेहरे की विकृति के अनुसार पोर्ट्रेट चेहरों के समग्र आकार को संपादित करके उच्च गुणवत्ता वाले पोर्ट्रेट वीडियो पुनर्गठन परिणाम उत्पन्न करना है। यह सौंदर्यीकरण के लिए आकार चेहरे के निर्माण और दृश्य प्रभावों के लिए चेहरे के अतिरंजितकरण जैसे अनुप्रयोगों के लिए उपयोग किया जा सकता है।’
हालांकि 2डी चेहरे की विकृति और विकृति उपभोक्ताओं के लिए फोटोशॉप के आगमन के बाद से उपलब्ध है, यह वीडियो में इसका उपयोग करना एक कठिन काम है जिसमें सीजीआई का उपयोग नहीं किया जाता है।

चीनी-ब्रिटिश तकनीक द्वारा मार्क जुकरबर्ग के चेहरे के आयामों का विस्तार और संकीर्णता।
शरीर को पुनर्गठित करना वर्तमान में कंप्यूटर दृष्टि क्षेत्र में एक तीव्र रुचि का क्षेत्र है, मुख्य रूप से फैशन ईकॉमर्स में इसकी संभावना के कारण, हालांकि किसी को लंबा या कंकाल विविधता बनाना वर्तमान में एक उल्लेखनीय चुनौती है।
इसी तरह, वीडियो फुटेज में सिर के आकार को एक सुसंगत और आश्वस्त तरीके से बदलना इस शोध के नए पत्र के शोधकर्ताओं के पिछले काम का विषय रहा है, हालांकि उस कार्यान्वयन में कलाकृतियों और अन्य सीमाओं का सामना करना पड़ा। यह नई पेशकश उस पिछले शोध से स्थिर से वीडियो आउटपुट तक क्षमता का विस्तार करती है।
नया सिस्टम एक डेस्कटॉप पीसी पर प्रशिक्षित किया गया था जिसमें एएमडी राइजेन 9 3950एक्स था जिसमें 32GB की मेमोरी थी, और यह ओपनसीवी से एक ऑप्टिकल फ्लो एल्गोरिदम का उपयोग करता है जो मोशन मैप के लिए है, जो स्ट्रक्चरफ्लो फ्रेमवर्क द्वारा स्मूद किया जाता है; चेहरे की संरेखण नेटवर्क (एफएएन) घटक भूमि चिह्न अनुमान के लिए, जो लोकप्रिय डीपफेक पैकेजों में भी उपयोग किया जाता है; और सेरेस सॉल्वर को अनुकूलन चुनौतियों को हल करने के लिए।

नई प्रणाली के साथ चेहरे की विस्तृत विकृति का एक अत्यधिक उदाहरण।
लेख पोर्ट्रेट्स इन वीडियो का पैरामेट्रिक पुनर्गठन शीर्षक से है, और यह तीन शोधकर्ताओं से है ज़ेजियांग विश्वविद्यालय से, और एक यूनिवर्सिटी ऑफ बाथ से।
चेहरे के बारे में
नई प्रणाली के तहत, वीडियो को एक छवि अनुक्रम में निकाला जाता है, और प्रत्येक चेहरे के लिए एक कठोर मुद्रा पहले अनुमानित किया जाता है। फिर एक प्रतिनिधि संख्या के बाद के फ्रेम एक साथ अनुमानित किए जाते हैं ताकि पूरे रन की छवियों (अर्थात वीडियो के फ्रेम) के साथ सुसंगत पहचान मापदंडों का निर्माण किया जा सके।

चेहरे की विकृति प्रणाली का वास्तुकला प्रवाह।
इसके बाद, अभिव्यक्ति का मूल्यांकन किया जाता है, जो एक पुनर्गठन मापदंड को लागू करता है जो रेखीय प्रतिगमन द्वारा किया जाता है। अगला एक नई साइन्ड डिस्टेंस फंक्शन (एसडीएफ) दृष्टिकोण चेहरे की रेखाओं का एक घना 2डी मैप बनाता है जो पुनर्गठन से पहले और बाद में होता है।
अंत में, आउटपुट वीडियो पर एक सामग्री-जागरूक विकृति अनुकूलन किया जाता है।
पैरामेट्रिक चेहरे
प्रक्रिया में एक 3डी मॉर्फेबल फेस मॉडल (3डीएमएम) का उपयोग किया जाता है, जो तंत्रिका और जीएन-आधारित चेहरे संश्लेषण प्रणालियों के लिए एक बढ़ती हुई लोकप्रिय सहायक है, साथ ही साथ गहरे नकली पता लगाने वाली प्रणालियों के लिए भी उपयुक्त है।

एक 3डी मॉर्फेबल फेस मॉडल (3डीएमएम) का एक उदाहरण – एक पैरामेट्रिक प्रोटोटाइप चेहरा जो नए परियोजना में उपयोग किया जाता है। ऊपरी बाएं, 3डीएमएम चेहरे पर भूमि चिह्न अनुप्रयोग। ऊपरी दाएं, एक आइसोमैप के 3डी मेश शीर्षलेख। नीचे बाएं, भूमि चिह्न फिटिंग दिखाता है; नीचे मध्य, निकाले गए चेहरे के टेक्सचर का एक आइसोमैप; और नीचे दाएं, एक परिणामी फिटिंग और आकार। स्रोत: http://www.ee.surrey.ac.uk/CVSSP/Publications/papers/Huber-VISAPP-2016.pdf
नई प्रणाली का कार्यप्रवाह उन मामलों पर विचार करना होगा जहां विषय दूर देखता है। यह गहरे नकली सॉफ्टवेयर में सबसे बड़ी चुनौतियों में से एक है, क्योंकि एफएएन भूमि चिह्नों में इन मामलों के लिए बहुत कम क्षमता है, और चेहरा दूर जाने या ढका होने पर गुणवत्ता में कमी आती है।
नई प्रणाली इस जाल से बचने में सक्षम है क्योंकि यह 3डी चेहरे (3डीएमएम) और 2डी चेहरे (एफएएन भूमि चिह्नों द्वारा परिभाषित) के बीच की सीमा को मिलाने में सक्षम एक कंटूर ऊर्जा को परिभाषित करती है।
अनुकूलन
एक उपयोगी तैनाती ऐसी प्रणाली के लिए वास्तविक समय में विकृति को लागू करना होगा, जैसे कि वीडियो-चैट फिल्टर में। वर्तमान फ्रेमवर्क इसे सक्षम नहीं करता है, और आवश्यक कंप्यूटिंग संसाधनों को ‘लाइव’ विकृति एक उल्लेखनीय चुनौती बना देगा।
लेख के अनुसार, और 24fps वीडियो लक्ष्य को मानकर, पाइपलाइन में प्रति-फ्रेम ऑपरेशन 16.344 सेकंड की देरी का प्रतिनिधित्व करता है प्रति सेकंड फुटेज, और एक बार के हिट के साथ पहचान अनुमान और 3डी चेहरे की विकृति के लिए (क्रमशः 321ms और 160ms)।
अतः, अनुकूलन प्रगति करने और देरी को कम करने के लिए महत्वपूर्ण है। चूंकि सभी फ्रेमों पर संयुक्त अनुकूलन प्रक्रिया में गंभीर ओवरहेड जोड़ देगा, और init-शैली अनुकूलन (पहले फ्रेम से बाद की पहचान की सुसंगतता का अनुमान लगाना) विसंगतियों को जन्म दे सकता है, लेखकों ने व्यावहारिक अंतराल पर नमूने फ्रेम के गुणांक की गणना के लिए एक पतला योजना को अपनाया है।
फिर इस फ्रेम के उपसेट पर संयुक्त अनुकूलन किया जाता है, जो पुनर्निर्माण की एक पतली प्रक्रिया की ओर जाता है।
चेहरे की विकृति
परियोजना में उपयोग की जाने वाली विकृति तकनीक लेखकों के 2020 के कार्य गहरे पोर्ट्रेट (डीएसपी) का एक अनुकूलन है।

एक एसीएम मल्टीमीडिया के लिए 2020 की प्रस्तुति। लेख जेजू-टेंसेंट गेम और इंटेलिजेंट ग्राफिक्स इनोवेशन टेक्नोलॉजी जॉइंट लैब के शोधकर्ताओं द्वारा नेतृत्व किया जाता है। स्रोत: http://www.cad.zju.edu.cn/home/jin/mm2020/demo.mp4
लेखकों का कहना है ‘हम इस विधि को एक एकल मोनोकुलर छवि को पुनर्गठित करने से पूरे छवि अनुक्रम को पुनर्गठित करने तक बढ़ाते हैं। ‘
परीक्षण
लेख में कहा गया है कि नए तरीके का मूल्यांकन करने के लिए कोई तुलनात्मक पिछला सामग्री नहीं थी। इसलिए, लेखकों ने अपने विकृत वीडियो आउटपुट के फ्रेम की तुलना स्थिर डीएसपी आउटपुट से की।

नई प्रणाली का परीक्षण स्थिर छवियों के खिलाफ डीप शेपली पोर्ट्रेट्स से।
लेखकों का कहना है कि डीएसपी विधि से कलाकृतियों का परिणाम होता है, जो इसके द्वारा उपयोग किए जाने वाले दुर्लभ मैपिंग के कारण होता है – एक समस्या जिसे नई फ्रेमवर्क द्वारा घने मैपिंग के साथ हल किया जाता है। इसके अलावा, लेख का तर्क है कि डीएसपी द्वारा उत्पादित वीडियो में चिकनाई और दृश्य सुसंगतता की कमी का प्रदर्शन होता है।
लेखकों का कहना है:
‘परिणाम दिखाते हैं कि हमारा दृष्टिकोण सुसंगत पुनर्गठित पोर्ट्रेट वीडियो का उत्पादन कर सकता है जबकि छवि-आधारित विधि आसानी से ध्यान देने योग्य फ्लिकरिंग कलाकृतियों का कारण बन सकती है।’
अधिक उदाहरणों के लिए नीचे दिए गए वीडियो को देखें:
पहली बार 9 मई 2022 को प्रकाशित। 6 बजे ईईटी में संशोधित, ‘क्षेत्र’ को एसडीएफ के लिए ‘कार्य’ से बदल दिया गया।












