Anderson का एंगल

नई डीपफेक विधि ‘फेस होस्ट’ समस्या का समाधान करती है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मीडिया में डीपफेक छवियों की संभावना के बारे में कई वर्षों के अतिशयोक्तिपूर्ण दावों के बावजूद, सभी वर्तमान लोकप्रिय तरीके ‘फेस होस्ट’ खोजने पर निर्भर करते हैं जो लक्ष्य चेहरे के आकार में लगभग समान होते हैं।

जहां मूल फुटेज में एक चौड़ा चेहरा है, लेकिन लक्ष्य विषय का चेहरा संकरा है, परिणाम हमेशा समस्याग्रस्त रहे हैं, क्योंकि ऐसा स्थानांतरण मूल चेहरे का एक हिस्सा काटने और अब उजागर पृष्ठभूमि का पुनर्निर्माण करने में शामिल है। वर्तमान पैकेज जैसे कि डीपफेसलैब और फेसस्वैप व्यापक परिणाम उत्पन्न कर सकते हैं जब कॉन्फ़िगरेशन उलटा होता है (संकरा>चौड़ा), लेकिन इस परिदृश्य से निपटने के लिए कोई सुविधा नहीं है।

अब, टेंसेंट और चीन के शियामेन विश्वविद्यालय के बीच एक सहयोग ने एक नई दृष्टिकोण विकसित की है, जिसे हिफीफेस नाम दिया गया है, जो इस कमी को दूर करने के लिए डिज़ाइन किया गया है।

दो हिफीफेस डीपफेक, पहला एन हैथवे, जहां असंगत होस्ट चेहरे के आकार के बावजूद एक अच्छा समानता प्राप्त किया जाता है। हिफीफेस चश्मे वाले लक्ष्यों पर भी अच्छा प्रदर्शन करता है, जो पारंपरिक रूप से डीपफेक में एक समस्या रही है। स्रोत: https://arxiv.org/pdf/2106.09965.pdf

दो हिफीफेस डीपफेक, पहला एन हैथवे, जहां असंगत होस्ट चेहरे के आकार के बावजूद एक अच्छा समानता प्राप्त किया जाता है। हिफीफेस चश्मे वाले लक्ष्यों पर भी अच्छा प्रदर्शन करता है, जो पारंपरिक रूप से डीपफेक में एक समस्या रही है। स्रोत: https://arxiv.org/pdf/2106.09965.pdf

डीपफेक चेहरे का पुनर्निर्माण

पिछले दृष्टिकोण, जैसे कि 2019 के विषय अज्ञेय चेहरा स्वैपिंग और रीनैक्टमेंट (एफएसजीएन), 3डीएमएम फिटिंग (3डी मॉर्फेबल मॉडल) या चेहरे की भूमिका को मान्यता देने या परिवर्तन पर आधारित अन्य विधियों पर निर्भर करते हैं, जहां चेहरे की विशेषताओं को ‘ओवरराइट’ करने के लिए चेहरे की सीमाएं स्वैप की सीमा को निर्धारित करती हैं:

स्रोत: https://github.com/Yinghao-Li/3DMM-fitting

3डीएमएम चेहरे की भूमिका की पहचान। स्रोत: https://github.com/Yinghao-Li/3DMM-fitting

हालांकि प्रतिस्पर्धी तरीकों ने चेहरे की पहचान नेटवर्क से विशेषताओं का उपयोग किया है, वे मुख्य रूप से बनावट को पुनर्निर्माण करने के लिए हैं, और इसी तरह एक ‘मास्क जैसा’ प्रभाव उत्पन्न करते हैं जब होस्ट चेहरा पूरी तरह से संगत नहीं होता है (अर्थात, बालों की रेखा, जावलाइन और गाल की सीमाएं)।

इन मुद्दों को संबोधित करने के लिए, चीनी शोधकर्ताओं ने विश्वविद्यालय के कृत्रिम बुद्धिमत्ता विभाग में मीडिया विश्लेषण और कंप्यूटिंग प्रयोगशाला में एक एंड-टू-एंड नेटवर्क विकसित किया है, जो लक्ष्य और स्रोत चेहरे के गुणांक को 3डी पुनर्निर्माण मॉडल का उपयोग करके पुनरावृत्ति करता है, जिसे फिर आकार के रूप में पुनः संयोजित किया जाता है और चेहरे की पहचान नेटवर्क से पहचान वेक्टर जानकारी के साथ जोड़ा जाता है।

यह ज्यामितीय डेटा फिर एक एनकोडर-डिकोडर मॉडल में संरचनात्मक जानकारी के रूप में खिलाया जाता है, जो लक्ष्य चेहरे की अभिव्यक्ति और विन्यास के साथ मिलकर सटीक स्थानांतरण के लिए सहायक स्रोतों के रूप में उपयोग किया जाता है।

सेमेंटिक चेहरे का संलयन

इसके अलावा, हिफीफेस में एक सेमेंटिक फेशियल फ्यूजन (एसएफएफ) घटक शामिल है, जो एनकोडर में एक कम-स्तरीय विशेषता का उपयोग करता है ताकि स्थानिक और बनावट जानकारी को संरक्षित किया जा सके, लक्ष्य छवि की पहचान को त्यागने के बिना। एनकोडर और डिकोडर से विशेषताएं एक सीखे हुए अनुकूल मास्क में एकीकृत की जाती हैं, और पृष्ठभूमि जानकारी सीखे हुए चेहरे के मास्क के माध्यम से आउटपुट में मिलाई जाती है।

हिफीफेस कार्रवाई में। स्रोत: https://johann.wang/HifiFace/

हिफीफेस कार्रवाई में। स्रोत: https://johann.wang/HifiFace/

इस तरह, हिफीफेस मूल सामग्री की चेहरे की सीमाओं का उपयोग करके एक कठोर सीमा के रूप में नहीं करता है, बल्कि फेस सेमेंटिक सेगमेंटेशन का उपयोग करता है, जिसमें मॉडल चेहरे की सीमाओं पर बेहतर अनुकूल संलयन कर सकता है।

दो पूर्व दृष्टिकोण (बाएं और नीचे), और नई हिफीफेस वास्तुकला, जिसमें एक एनकोडर, डिकोडर, 3डी आकार-जागरूक पहचान निकालने वाला, और एसएफएफ मॉड्यूल शामिल है।

दो पूर्व दृष्टिकोण (बाएं और नीचे), और नई हिफीफेस वास्तुकला, जिसमें एक एनकोडर, डिकोडर, 3डी आकार-जागरूक पहचान निकालने वाला, और एसएफएफ मॉड्यूल शामिल है।

पूर्व विधियों फएसजीएन, सिमस्वैप और फेसशिफ्टर के साथ तुलना में, हिफीफेस चेहरे के आकार का एक बेहतर पुनर्निर्माण प्रदर्शित करता है, क्योंकि यह ‘भूत’ तत्वों का अनुमान नहीं लगा रहा है जहां चेहरे की सीमाएं पहचान>पहचान मैपिंग को भ्रमित करती हैं, बल्कि उन्हें निश्चित रूप से पुनर्निर्माण कर रहा है।

परीक्षण

शोधकर्ताओं ने वीजीजीफेस2 और डीपग्लिंट एशियन-सेलिब डेटासेट का उपयोग करके प्रणाली को लागू किया। चेहरे 5 बाहरी लैंडमार्क के माध्यम से संरेखित किए गए और 256×256 पिक्सेल तक फिर से काटे गए। एक पोर्ट्रेट एन्हांसमेंट नेटवर्क का भी उपयोग किया गया था ताकि 512×512 पिक्सेल का एक अतिरिक्त उच्च-रिज़ॉल्यूशन मॉडल उत्पन्न किया जा सके। मॉडल को एडम के तहत प्रशिक्षित किया गया था।

हालांकि फेसशिफ्टर पहचान को अच्छी तरह से संरक्षित करता है, यह अभिव्यक्ति, रंग और ऑक्लूजन जैसे मुद्दों को हिफीफेस की तरह प्रभावी ढंग से संबोधित नहीं कर सकता है, और इसकी एक जटिल नेटवर्क संरचना है। एफएसजीएन में स्रोत से लक्ष्य तक प्रकाश को स्थानांतरित करने में समस्याएं हैं।

शोधकर्ताओं ने फेसफोरेंसिक्स++ का उपयोग करके मात्रात्मक तुलना की है, जिसमें प्रतिस्पर्धी विधियों के साथ परिवर्तित वीडियो के एक बैच में प्रत्येक 10 फ्रेम का नमूना लिया जाता है, और पाया जाता है कि हिफीफेस ने एक बेहतर आईडी पुनर्प्राप्ति स्कोर हासिल किया है। अन्य कारकों जैसे कि छवि गुणवत्ता का परीक्षण करते समय, शोधकर्ताओं ने यह भी पाया कि उनकी विधि प्रतिद्वंद्वी विधियों से बेहतर प्रदर्शन करती है।

बेनेडिक्ट कंबरबैच की चेहरे की विशेषताएं विश्वासपूर्वक पुनरुत्पादित की जाती हैं।

बेनेडिक्ट कंबरबैच की चेहरे की विशेषताएं विश्वासपूर्वक पुनरुत्पादित की जाती हैं।

यह काम स्रोत सामग्री को एक खुरदरे टेम्पलेट में परिवर्तित करने की दिशा में एक और कदम है जिसमें सटीक पहचान को स्थानांतरित किया जा सकता है। वर्तमान में उपलब्ध कुछ फॉस पैकेज, जिनमें डीपफेसलैब शामिल है, पूरे सिर के प्रतिस्थापन के लिए एक प्रारंभिक कार्यक्षमता प्रदान करते हैं, लेकिन हिफीफेस की तरह, वे बालों के लिए खाते नहीं हैं, और वे एक चेहरे का निर्माण करने में अधिक प्रभावी होते हैं बजाय इसके कि एक वांछित लक्ष्य स्रोत के साथ मेल खाने के लिए इसे दूर कर दें।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai