Anderson का एंगल
एक नया और सरल डीपफ़ेक मेथड जो पिछले तरीकों से बेहतर है

चीनी एआई रिसर्च ग्रुप और यूएस-आधारित शोधकर्ताओं के बीच एक सहयोग ने डीपफ़ेक्स तकनीक में चार साल पहले इसके उदय के बाद से पहली वास्तविक नवाचार विकसित किया है।
नई विधि मानक अनुभूति परीक्षणों पर सभी मौजूदा फ्रेमवर्क से बेहतर प्रदर्शन करने वाले फेसस्वैप करने में सक्षम है, बिना बड़े समर्पित डेटासेट को इकट्ठा और क्यूरेट करने और उन्हें एक सप्ताह तक प्रशिक्षित करने की आवश्यकता के, केवल एक ही पहचान के लिए। नए पेपर में प्रस्तुत उदाहरणों के लिए, मॉडल दो लोकप्रिय सेलिब्रिटी डेटासेट के पूरे हिस्से पर प्रशिक्षित किए गए थे, एक NVIDIA Tesla P40 GPU पर लगभग तीन दिनों के लिए।

पूरा वीडियो इस लेख के अंत में उपलब्ध है। इस वीडियो के सैंपल में स्कारलेट जोहानसन का चेहरा स्रोत वीडियो पर स्थानांतरित किया गया है। CihaNet स्वैप करते समय एज-मास्किंग की समस्या को दूर करता है, स्रोत और लक्ष्य पहचान के बीच गहरे संबंध बनाकर और लागू करके, जिसका अर्थ है ‘स्पष्ट सीमाओं’ और पारंपरिक डीपफ़ेक दृष्टिकोण में होने वाली अन्य सुपरइम्पोज़िशन ग्लिचेस का अंत। स्रोत: https://mitchellx.github.io/#video
नई दृष्टिकोण में प्रत्यारोपित पहचान को क्रूडली लक्ष्य वीडियो में ‘पेस्ट’ करने की आवश्यकता नहीं है, जो अक्सर बताने वाले आर्टिफैक्ट्स का कारण बनता है जो नकली चेहरे के अंत और वास्तविक, अंतर्निहित चेहरे की शुरुआत में दिखाई देते हैं। इसके बजाय, ‘हॉलुसिनेशन मैप्स’ का उपयोग गहरे दृश्य पहलुओं के मिश्रण को करने के लिए किया जाता है, क्योंकि प्रणाली पहचान को संदर्भ से अधिक प्रभावी ढंग से अलग करती है, और इसलिए लक्ष्य पहचान को अधिक गहरे स्तर पर मिला सकती है।

पेपर से। CihaNet रूपांतरण हॉलुसिनेशन मैप्स (नीचे की पंक्ति) के माध्यम से सुविधाजनक हैं। प्रणाली उस छवि से संदर्भ जानकारी का उपयोग करती है जिसमें नई पहचान सुपरइम्पोज़ की जाने वाली है, और चेहरे की दिशा, बाल, चश्मे और अन्य अवरोधों जैसी जानकारी का उपयोग करती है। यह चेहरे को संदर्भ से अलग करने की क्षमता प्रणाली की सफलता के लिए महत्वपूर्ण है। स्रोत: https://dl.acm.org/doi/pdf/10.1145/3474085.3475257
प्रभावी रूप से, नई हॉलुसिनेशन मैप स्वैप के लिए एक अधिक पूर्ण संदर्भ प्रदान करती है, जो अक्सर व्यापक क्यूरेशन (और डीपफेसलैब के मामले में, अलग प्रशिक्षण) की आवश्यकता वाले कठोर मास्क के विपरीत है।

पूरक सामग्री में प्रदान किए गए नमूनों से, दोनों FFHQ और Celeb-A HQ डेटासेट का उपयोग करके, VGGFace और Forensics++ पर। पहले दो कॉलम उन वास्तविक छवियों को दिखाते हैं जिन्हें स्वैप किया जाना है। अगले चार कॉलम स्वैप के परिणाम दिखाते हैं जो वर्तमान में उपलब्ध चार सबसे प्रभावी तरीकों का उपयोग करके प्राप्त किए गए हैं, जबकि अंतिम कॉलम CihaNet से परिणाम दिखाता है। FaceSwap रिपॉजिटरी का उपयोग DeepFaceLab के बजाय किया गया है, क्योंकि दोनों परियोजनाएं मूल 2017 डीपफ़ेक्स कोड के फोर्क हैं। हालांकि प्रत्येक परियोजना ने बाद में मॉडल, तकनीक, विविध यूआई और पूरक उपकरण जोड़े हैं, डीपफ़ेक्स को संभव बनाने वाला अंतर्निहित कोड कभी नहीं बदला है और दोनों में सामान्य रहता है। स्रोत: https://dl.acm.org/action/downloadSupplement?doi=10.1145%2F3474085.3475257&file=mfp0519aux.zip
लेख, पेपर शीर्षक वन-स्टेज कॉन्टेक्स्ट और आइडेंटिटी हॉलुसिनेशन नेटवर्क, जेडी एआई रिसर्च और यूनिवर्सिटी ऑफ मैसाचुसेट्स अमहर्स्ट के शोधकर्ताओं से संबंधित है, और राष्ट्रीय की रिसर्च एंड डेवलपमेंट प्रोग्राम ऑफ चाइना द्वारा समर्थित है। ग्रांट नं। 2020AAA0103800। यह 29वें ACM इंटरनेशनल कॉन्फ्रेंस ऑन मल्टीमीडिया में पेश किया गया था, 20-24 अक्टूबर को, चेंगDU, चीन में।
‘फेस-ऑन’ समानता की कोई जरूरत नहीं
वर्तमान में सबसे लोकप्रिय डीपफ़ेक सॉफ़्टवेयर, डीपफेसलैब, और प्रतिद्वंद्वी फोर्क फेसस्वैप, स्वैप के लिए एक जटिल और अक्सर हाथ से क्यूरेटेड वर्कफ़्लो का प्रदर्शन करते हैं, जिसमें यह पहचानना शामिल है कि चेहरा किस दिशा में है, कौन से बाधाएं हैं जिन्हें ध्यान में रखा जाना चाहिए (फिर से, मैनुअल रूप से), और कई अन्य परेशान करने वाली बाधाओं (जिनमें प्रकाश भी शामिल है) को संभालना जो उनके उपयोग को ‘पॉइंट-एंड-क्लिक’ अनुभव से दूर बनाता है जो मीडिया में डीपफ़ेक्स के उदय के बाद से गलत तरीके से चित्रित किया गया है।
इसके विपरीत, CihaNet को दो छवियों को सीधे कैमरे की ओर मुख करने की आवश्यकता नहीं होती है ताकि एक छवि से उपयोगी पहचान जानकारी निकाली और शोषित की जा सके।
<img class="size-full wp-image-178605" src="https://www.unite.ai/wp-content/uploads/2021/11/cihanet-angles.jpg" alt="इन उदाहरणों में, डीपफ़ेक सॉफ़्टवेयर प्रतिद्वंद्वियों का एक सूट उन छवियों को स्वैप करने के कार्य के साथ चुनौतित किया जाता है जो न केवल पहचान में भिन्न हैं, बल्कि जो एक ही दिशा में नहीं हैं। मूल डीपफ़ेक्स रिपॉजिटरी (जैसे कि बहुत लोकप्रिय डीपफेसलैब और फेसस्वैप, ऊपर दिखाया गया है) दो छवियों के बीच कोणों में अंतर को संभाल नहीं सकता है (तीसरे कॉलम में देखें)। इसके बीच, CihaNet पहचान को सही ढंग से स abstract कर सकता है, क्योंकि चेहरे का 'मुद्रा' पहचान जानकारी का एक आंतरिक हिस्सा नहीं है।इन उदाहरणों में, डीपफ़ेक सॉफ़्टवेयर प्रतिद्वंद्वियों का एक सूट उन छवियों को स्वैप करने के कार्य के साथ चुनौतित किया जाता है जो न केवल पहचान में भिन्न हैं, बल्कि जो एक ही दिशा में नहीं हैं। मूल डीपफ़ेक्स रिपॉजिटरी (जैसे कि बहुत लोकप्रिय डीपफेसलैब और फेसस्वैप, ऊपर दिखाया गया है) दो छवियों के बीच कोणों में अंतर को संभाल नहीं सकता है (तीसरे कॉलम में देखें)। इसके बीच, CihaNet पहचान को सही ढंग से स abstract कर सकता है, क्योंकि चेहरे का ‘मुद्रा’ पहचान जानकारी का एक आंतरिक हिस्सा नहीं है।आर्किटेक्चर
CihaNet परियोजना, लेखकों के अनुसार, 2019 में माइक्रोसॉफ्ट रिसर्च और पेकिंग यूनिवर्सिटी के बीच सहयोग से प्रेरित थी, जिसे फेसशिफ्टर कहा जाता है, हालांकि यह पुराने तरीके की मूल वास्तुकला में कुछ उल्लेखनीय और महत्वपूर्ण परिवर्तन करता है।
फेसशिफ्टर दो एडाप्टिव इंस्टेंस नॉर्मलाइजेशन (एडीएन) नेटवर्क का उपयोग पहचान जानकारी को संभालने के लिए करता है, जो डेटा को तब मास्क के माध्यम से लक्ष्य छवि में ट्रांसपोज़ किया जाता है, जो वर्तमान लोकप्रिय डीपफ़ेक सॉफ़्टवेयर (और इसकी संबंधित सीमाओं) के समान है, एक अतिरिक्त हियर-नेट (जिसमें एक अलग से प्रशिक्षित सब-नेट शामिल है जो ऑक्लूजन बाधाओं पर प्रशिक्षित है, एक अतिरिक्त परत की जटिलता) का उपयोग करता है।
इसके बजाय, नई वास्तुकला सीधे इस ‘संदर्भ’ जानकारी का उपयोग रूपांतरण प्रक्रिया के लिए करती है, एक दो-चरण एक कैस्केडिंग एडाप्टिव इंस्टेंस नॉर्मलाइजेशन (सी-एडीएन) ऑपरेशन के माध्यम से, जो आईडी-संबंधित क्षेत्रों के संदर्भ की निरंतरता प्रदान करता है।
सिस्टम के लिए महत्वपूर्ण दूसरा सब-नेट स्वैपिंग ब्लॉक (स्वैपब्लक) कहलाता है, जो संदर्भ छवि और स्रोत छवि से एम्बेडेड ‘पहचान’ जानकारी के संदर्भ से एक एकीकृत विशेषता उत्पन्न करता है, पारंपरिक वर्तमान साधनों द्वारा इसे पूरा करने के लिए आवश्यक कई चरणों को दरकिनार करता है।
संदर्भ और पहचान के बीच अंतर करने में मदद के लिए, प्रत्येक स्तर के लिए एक हॉलुसिनेशन मैप उत्पन्न किया जाता है, जो एक सॉफ्ट-सेगमेंटेशन मास्क के लिए खड़ा है, और इस महत्वपूर्ण डीपफ़ेक प्रक्रिया के हिस्से के लिए विशेषताओं की एक विस्तृत श्रृंखला पर कार्य करता है।

जैसे ही हॉलुसिनेशन मैप (नीचे दाईं ओर दिखाया गया है) का मूल्य बढ़ता है, पहचान के बीच एक स्पष्ट पथ उभरता है।
इस तरह, पूरी स्वैप प्रक्रिया एक ही चरण में और पोस्ट-प्रोसेसिंग के बिना पूरी की जाती है।
डेटा और परीक्षण
सिस्टम को आजमाने के लिए, शोधकर्ताओं ने दो लोकप्रिय और विविध खुले छवि डेटासेट – सेलेब-ए-एचक्यू और एनवीडिया के फ्लिकर-फेस-एचक्यू डेटासेट (एफएफएचक्यू) पर चार मॉडल प्रशिक्षित किए, प्रत्येक में क्रमशः 30,000 और 70,000 छवियां हैं।
इन आधार डेटासेट पर कोई प्रूनिंग या फिल्टरिंग नहीं की गई थी। प्रत्येक मामले में, शोधकर्ताओं ने प्रत्येक डेटासेट को एक ही टेस्ला जीपीयू पर तीन दिनों के लिए प्रशिक्षित किया, एडम ऑप्टिमाइजेशन पर 0.0002 की लर्निंग दर के साथ।
उन्होंने तब डेटासेट में प्रदर्शित हजारों व्यक्तियों के बीच यादृच्छिक स्वैप की एक श्रृंखला रेंडर की, चाहे उनके चेहरे समान हों या लिंग-मेल खाते हों या नहीं, और CihaNet के परिणामों की तुलना चार प्रमुख डीपफ़ेक फ्रेमवर्क के आउटपुट से की: फेसस्वैप (जो अधिक लोकप्रिय डीपफेसलैब के लिए खड़ा है, क्योंकि यह मूल 2017 रिपॉजिटरी में एक रूट कोडबेस साझा करता है जिसने डीपफ़ेक्स को दुनिया में लाया); उपरोक्त फेसशिफ्टर; एफएसजीएन; और सिमस्वैप।
परिणामों की तुलना वीजीजी-फेस, एफएफएचक्यू, सेलेब-ए-एचक्यू और फेसफोरेंसिक्स++ के माध्यम से की गई, लेखकों ने पाया कि उनका नया मॉडल सभी पूर्व मॉडलों से बेहतर प्रदर्शन करता है, जैसा कि नीचे दी गई तालिका में दिखाया गया है।

परिणामों का मूल्यांकन करने के लिए उपयोग किए गए तीन मेट्रिक्स स्ट्रक्चरल समानता (एसएसआईएम) थे, मुद्रा अनुमान त्रुटि और आईडी पुनर्प्राप्ति सटीकता, जो सफलतापूर्वक पुनर्प्राप्त जोड़े के प्रतिशत के आधार पर गणना की जाती है।
शोधकर्ता दावा करते हैं कि CihaNet गुणात्मक परिणामों के संदर्भ में एक बेहतर दृष्टिकोण का प्रतिनिधित्व करता है, और डीपफ़ेक तकनीकों की वर्तमान स्थिति में एक उल्लेखनीय प्रगति है, जो व्यापक और श्रमसाध्य मास्क वास्तुकला और विधियों के बोझ को हटाकर, और पहचान और संदर्भ के बीच एक अधिक उपयोगी और क्रियाशील पृथक्करण प्राप्त करके।
नीचे देखें और नए तरीके के आगे के वीडियो उदाहरण देखें। आप यहां पूरी लंबाई वाला वीडियो पा सकते हैं।
नए पेपर की पूरक सामग्री से, CihaNet विभिन्न पहचानों पर चेहरा स्वैप करता है। स्रोत: https://mitchellx.github.io/#video














