Anderson का एंगल
मानव छवि सिंथेसिस में ‘बुरे बाल दिन’ से निपटना

रोमन मूर्तिकला के स्वर्ण युग के बाद से, मानव बालों को चित्रित करना एक कांटेदार चुनौती रही है। औसत मानव सिर में 100,000 तंतु होते हैं, जिनके रंग के अनुसार विभिन्न प्रकाश सूचकांक होते हैं, और एक निश्चित लंबाई के बाद, वे केवल जटिल भौतिकी मॉडल द्वारा अनुकरण किए जा सकते हैं – जो अब तक केवल ‘पारंपरिक’ सीजीआई विधियों के माध्यम से लागू किए जा सकते हैं।

2017 के डिज़नी के शोध से, एक भौतिकी-आधारित मॉडल एक तरल बाल शैली में वास्तविक आंदोलन लागू करने का प्रयास करता है। स्रोत: https://www.youtube.com/watch?v=-6iF3mufDW0
यह समस्या आधुनिक लोकप्रिय डीपफेक्स विधियों द्वारा खराब तरीके से संबोधित की जाती है। कुछ वर्षों से, अग्रणी पैकेज DeepFaceLab में एक ‘पूरा सिर’ मॉडल है जो केवल जंगम प्रतिनिधित्व के साथ छोटे (आम तौर पर पुरुष) बालों को पकड़ सकता है; और हाल ही में DFL स्थिर साथी FaceSwap (दोनों पैकेज 2017 के विवादास्पद डीपफेक्स स्रोत कोड से व्युत्पन्न हैं) ने BiseNet सेमांटिक सेगमेंटेशन मॉडल का एक कार्यान्वयन प्रदान किया है, जिससे उपयोगकर्ता डीपफेक आउटपुट में कान और बाल शामिल कर सकते हैं।
जब बहुत छोटे बालों को चित्रित करने की बात आती है, तो परिणाम आमतौर पर गुणवत्ता में बहुत सीमित होते हैं, जिसमें पूरे सिर फुटेज पर अधिलेखित होते हैं, न कि उसमें एकीकृत होते हैं।
GAN बाल
मानव सिमुलेशन के दो प्रमुख प्रतिस्पर्धी दृष्टिकोण न्यूरल रेडिएंस फील्ड्स (NeRF) हैं, जो एक दृश्य को कई दृष्टिकोण से पकड़ सकते हैं और इन दृष्टिकोणों का एक 3D प्रतिनिधित्व एक अन्वेषणीय न्यूरल नेटवर्क में समाहित कर सकते हैं; और जेनरेटिव एडवर्सेरियल नेटवर्क (GANs), जो मानव छवि सिंथेसिस के संदर्भ में उल्लेखनीय रूप से अधिक उन्नत हैं (न्यूरफ के 2020 में उद्भव के कारण नहीं)।
NeRF की 3D ज्यामिति की अनुमानित समझ इसे एक दृश्य को बहुत विश्वास और स्थिरता के साथ दोहराने में सक्षम बनाती है, भले ही यह वर्तमान में भौतिकी मॉडल के लागू होने के लिए बहुत कम या कोई संभावना नहीं है – और वास्तव में, कैमरा दृष्टिकोण को बदलने से संबंधित नहीं होने वाले किसी भी प्रकार के परिवर्तन पर एकत्रित डेटा पर बहुत सीमित संभावना है। वर्तमान में, NeRF में मानव बालों की गति को दोहराने की क्षमता बहुत सीमित है।
GAN-आधारित NeRF के समकक्ष एक लगभग घातक नुकसान से शुरू होते हैं, क्योंकि NeRF के विपरीत, एक GAN का लेटेंट स्पेस 3D जानकारी की समझ को स्वाभाविक रूप से एकीकृत नहीं करता है। इसलिए 3D-जागरूक GAN चेहरे की छवि सिंथेसिस हाल के वर्षों में छवि पीढ़ी अनुसंधान में एक गर्म पीछा बन गया है, 2019 के InterFaceGAN में एक प्रमुख सफलता हासिल की गई है।
हालांकि, यहां तक कि InterFaceGAN के प्रदर्शित और चेरी-पिक्ड परिणाम यह दिखाते हैं कि न्यूरल बाल स्थिरता एक कठिन चुनौती है सांविधिक स्थिरता के संदर्भ में, संभावित वीएफएक्स कार्य प्रवाह के लिए:

InterFaceGAN से पोज़ परिवर्तन में ‘सिज़लिंग’ बाल। स्रोत: https://www.youtube.com/watch?v=uoftpl3Bj6w
जैसा कि यह अधिक स्पष्ट होता जा रहा है कि लेटेंट स्पेस के माध्यम से दृश्य पीढ़ी का मैनिपुलेशन एक प्रकार की अल्केमी जैसी प्रतीत होती है, एक बढ़ती संख्या में पत्र सामने आ रहे हैं जो एक GAN कार्य प्रवाह में स्थिरकारी और सामान्यीकरण प्रतिबंध के रूप में CGI-आधारित 3D जानकारी को एकीकृत करते हैं।
CGI तत्व मध्यवर्ती 3D प्रिमिटिव्स द्वारा प्रतिनिधित्व किया जा सकता है, जैसे कि Skinned Multi-Person Linear Model (SMPL), या 3D अनुमान तकनीकों को NeRF के समान तरीके से अपनाकर, जहां ज्यामिति स्रोत छवियों या वीडियो से मूल्यांकन की जाती है।
इसी तरह का एक नया काम, इस सप्ताह जारी, मल्टी-व्यू कंसिस्टेंट जेनरेटिव एडवर्सेरियल नेटवर्क फॉर 3D-एवेयर इमेज सिंथेसिस (MVCGAN) है, जो ReLER, AAII, सिडनी प्रौद्योगिकी विश्वविद्यालय, अलीबाबा समूह के DAMO अकादमी, और झेजियांग विश्वविद्यालय के बीच एक सहयोग है।

MVCGAN द्वारा CELEBA-HQ डेटासेट से व्युत्पन्न छवियों पर यथार्थवादी और मजबूत नए चेहरे के पोज़। स्रोत: https://arxiv.org/pdf/2204.06307.pdf
MVCGAN में एक जेनरेटिव रेडिएंस फील्ड नेटवर्क (GRAF) शामिल है जो एक जेनरेटिव एडवर्सेरियल नेटवर्क में ज्यामितीय प्रतिबंध प्रदान करने में सक्षम है, संभावित रूप से इसी तरह के GAN-आधारित दृष्टिकोण की सबसे प्रामाणिक पोज़िंग क्षमताओं में से कुछ प्राप्त करता है।
हालांकि, MVCGAN के पूरक सामग्री से पता चलता है कि बाहरी 3D ज्यामिति पर आधारित प्रतिबंधों के माध्यम से बाल आयतन, वितरण, स्थिति और व्यवहार स्थिरता प्राप्त करना एक समस्या है जो आसानी से नहीं सुलझाई जा सकती है।

लेखन के समय तक सार्वजनिक रूप से जारी नहीं की गई पूरक सामग्री से, हम देखते हैं कि जबकि MVCGAN से चेहरे की मुद्रा सिंथेसिस वर्तमान राज्य-of-the- कला पर एक उल्लेखनीय प्रगति का प्रतिनिधित्व करती है, सांविधिक बाल स्थिरता अभी भी एक समस्या है।
चूंकि ‘सीधे’ सीजीआई कार्य प्रवाह अभी भी अस्थायी बाल पुनर्निर्माण को एक चुनौती के रूप में पाते हैं, इसलिए कोई कारण नहीं है कि यह मानने के लिए कि पारंपरिक ज्यामिति-आधारित दृष्टिकोण इस प्रकार के बाल सिंथेसिस को लेटेंट स्पेस में लाने जा रहे हैं।
कन्वोल्यूशनल न्यूरल नेटवर्क के साथ बाल स्थिर करना
हालांकि, स्वीडन में चाल्मर्स इंस्टीट्यूट ऑफ टेक्नोलॉजी के तीन शोधकर्ताओं द्वारा एक आगामी पत्र न्यूरल बाल सिमुलेशन में एक अतिरिक्त प्रगति प्रदान कर सकता है।

बाएं, सीएनएन-स्थिरित बाल प्रतिनिधित्व, दाएं, मूल सत्य। लेख के अंत में एम्बेडेड वीडियो में बेहतर रिज़ॉल्यूशन और अतिरिक्त उदाहरण देखें। स्रोत: https://www.youtube.com/watch?v=AvnJkwCmsT4
शीर्षक रियल-टाइम हेयर फिल्टरिंग विद कन्वोल्यूशनल न्यूरल नेटवर्क, पत्र मई के पहले सप्ताह में i3D सिम्पोजियम के लिए प्रकाशित किया जाएगा।
सिस्टम में एक ऑटोएनकोडर-आधारित नेटवर्क शामिल है जो वास्तविक समय में बाल संकल्प का मूल्यांकन करने में सक्षम है, जिसमें स्व-छाया और बाल मोटाई को ध्यान में रखते हुए, ओपनजीएल ज्यामिति द्वारा बीजित एक सीमित संख्या में स्टोकास्टिक नमूनों के आधार पर।
दृष्टिकोण एक सीमित संख्या में नमूनों को स्टोकास्टिक पारदर्शिता के साथ प्रस्तुत करता है और फिर एक U-net को मूल छवि को पुनर्निर्मित करने के लिए प्रशिक्षित करता है।

MVCGAN के तहत, एक सीएनएन स्टोकास्टिक रूप से नमूनाकृत रंग कारकों, हाइलाइट्स, टैंगेंट्स, गहराई और अल्फा को फिल्टर करता है, और संश्लेषित परिणामों को एक संयुक्त छवि में इकट्ठा करता है।
नेटवर्क पाइथन पर प्रशिक्षित है, जो छह से बारह घंटे की अवधि में समाप्त होता है, नेटवर्क आयतन और इनपुट विशेषताओं की संख्या पर निर्भर करता है। प्रशिक्षित पैरामीटर (वजन) तब वास्तविक समय कार्यान्वयन में उपयोग किए जाते हैं।
प्रशिक्षण डेटा सीधे और तरंगदार बालों के लिए कई सौ छवियों को रेंडर करके उत्पन्न किया जाता है, जिसमें यादृच्छिक दूरी और मुद्राएं होती हैं, साथ ही विभिन्न प्रकाश स्थितियां भी होती हैं।

प्रशिक्षण इनपुट के विभिन्न उदाहरण।
नमूनों में बाल पारदर्शिता को स्टोकास्टिक पारदर्शिता के साथ उच्च रिज़ॉल्यूशन पर रेंडर की गई छवियों से औसत किया जाता है। मूल उच्च रिज़ॉल्यूशन डेटा को नेटवर्क और हार्डवेयर सीमाओं को समायोजित करने के लिए डाउनसैंपल किया जाता है, और बाद में एक मानक ऑटोएनकोडर कार्य प्रवाह में अपसैंपल किया जाता है।
वास्तविक समय अनुमान अनुप्रयोग (जो एल्गोरिदम से व्युत्पन्न मॉडल का लाभ उठाता है) में एनवीडिया क्यूडीएनएन के साथ एनवीडिया क्यूडीए का मिश्रण शामिल है। प्रारंभिक इनपुट विशेषताएं ओपनजीएल मल्टीसैंपल्ड रंग बफर में डंप की जाती हैं, और परिणाम क्यूडीएनएन टेंसर में शंट किया जाता है और सीएनएन में प्रसंस्करण के लिए। वे टेंसर तब एक ‘लाइव’ ओपनजीएल टेक्सचर में कॉपी किए जाते हैं और अंतिम छवि में लगाए जाते हैं।
वास्तविक समय प्रणाली एक एनवीडिया आरटीएक्स 2080 पर काम करती है, जो 1024×1024 पिक्सेल का रिज़ॉल्यूशन उत्पन्न करती है।
चूंकि बाल रंग मान अंतिम मानों में पूरी तरह से विभक्त हो जाते हैं जो नेटवर्क द्वारा प्राप्त किए जाते हैं, बाल रंग बदलना एक आसान कार्य है, हालांकि ग्रेडिएंट और धारियों जैसे प्रभाव अभी भी एक भविष्य की चुनौती हैं।

लेखकों ने पत्र के मूल्यांकन में उपयोग किए गए कोड को गिटलैब पर जारी किया है। नीचे MVCGAN के लिए पूरक वीडियो देखें।
निष्कर्ष
एक ऑटोएनकोडर या जीएनएन के लेटेंट स्पेस को नेविगेट करना अभी भी नाव चलाने की तरह है। केवल इस बहुत ही हाल के समय में हम ‘सimpler’ ज्यामिति जैसे चेहरों के पोज़ पीढ़ी के लिए विश्वसनीय परिणाम देखना शुरू कर रहे हैं, दृष्टिकोण जैसे NeRF, GANs, और गैर-डीपफेक (2017) ऑटोएनकोडर फ्रेमवर्क में।
मानव बालों की महत्वपूर्ण वास्तुकला जटिलता, साथ ही साथ भौतिकी मॉडल और अन्य विशेषताओं को शामिल करने की आवश्यकता जिनके लिए वर्तमान छवि सिंथेसिस दृष्टिकोण में कोई प्रावधान नहीं है, यह दर्शाता है कि बाल सिंथेसिस सामान्य चेहरे की सिंथेसिस में एक एकीकृत घटक के रूप में बने रहने की संभावना नहीं है, लेकिन कुछ जटिलता के अलग और अलग नेटवर्क की आवश्यकता होगी – भले ही ऐसे नेटवर्क अंततः व्यापक और अधिक जटिल चेहरे की सिंथेसिस फ्रेमवर्क में शामिल हो सकते हैं।
पहली बार 15 अप्रैल 2022 को प्रकाशित।













