Anderson का एंगल

मानव छवि सिंथेसिस में ‘बुरे बाल दिन’ से निपटना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

रोमन मूर्तिकला के स्वर्ण युग के बाद से, मानव बालों को चित्रित करना एक कांटेदार चुनौती रही है। औसत मानव सिर में 100,000 तंतु होते हैं, जिनके रंग के अनुसार विभिन्न प्रकाश सूचकांक होते हैं, और एक निश्चित लंबाई के बाद, वे केवल जटिल भौतिकी मॉडल द्वारा अनुकरण किए जा सकते हैं – जो अब तक केवल ‘पारंपरिक’ सीजीआई विधियों के माध्यम से लागू किए जा सकते हैं।

2017 के डिज़नी के शोध से, एक भौतिकी-आधारित मॉडल एक तरल बाल शैली में वास्तविक आंदोलन लागू करने का प्रयास करता है। स्रोत: https://www.youtube.com/watch?v=-6iF3mufDW0

2017 के डिज़नी के शोध से, एक भौतिकी-आधारित मॉडल एक तरल बाल शैली में वास्तविक आंदोलन लागू करने का प्रयास करता है। स्रोत: https://www.youtube.com/watch?v=-6iF3mufDW0

यह समस्या आधुनिक लोकप्रिय डीपफेक्स विधियों द्वारा खराब तरीके से संबोधित की जाती है। कुछ वर्षों से, अग्रणी पैकेज DeepFaceLab में एक ‘पूरा सिर’ मॉडल है जो केवल जंगम प्रतिनिधित्व के साथ छोटे (आम तौर पर पुरुष) बालों को पकड़ सकता है; और हाल ही में DFL स्थिर साथी FaceSwap (दोनों पैकेज 2017 के विवादास्पद डीपफेक्स स्रोत कोड से व्युत्पन्न हैं) ने BiseNet सेमांटिक सेगमेंटेशन मॉडल का एक कार्यान्वयन प्रदान किया है, जिससे उपयोगकर्ता डीपफेक आउटपुट में कान और बाल शामिल कर सकते हैं।

जब बहुत छोटे बालों को चित्रित करने की बात आती है, तो परिणाम आमतौर पर गुणवत्ता में बहुत सीमित होते हैं, जिसमें पूरे सिर फुटेज पर अधिलेखित होते हैं, न कि उसमें एकीकृत होते हैं।

GAN बाल

मानव सिमुलेशन के दो प्रमुख प्रतिस्पर्धी दृष्टिकोण न्यूरल रेडिएंस फील्ड्स (NeRF) हैं, जो एक दृश्य को कई दृष्टिकोण से पकड़ सकते हैं और इन दृष्टिकोणों का एक 3D प्रतिनिधित्व एक अन्वेषणीय न्यूरल नेटवर्क में समाहित कर सकते हैं; और जेनरेटिव एडवर्सेरियल नेटवर्क (GANs), जो मानव छवि सिंथेसिस के संदर्भ में उल्लेखनीय रूप से अधिक उन्नत हैं (न्यूरफ के 2020 में उद्भव के कारण नहीं)।

NeRF की 3D ज्यामिति की अनुमानित समझ इसे एक दृश्य को बहुत विश्वास और स्थिरता के साथ दोहराने में सक्षम बनाती है, भले ही यह वर्तमान में भौतिकी मॉडल के लागू होने के लिए बहुत कम या कोई संभावना नहीं है – और वास्तव में, कैमरा दृष्टिकोण को बदलने से संबंधित नहीं होने वाले किसी भी प्रकार के परिवर्तन पर एकत्रित डेटा पर बहुत सीमित संभावना है। वर्तमान में, NeRF में मानव बालों की गति को दोहराने की क्षमता बहुत सीमित है।

GAN-आधारित NeRF के समकक्ष एक लगभग घातक नुकसान से शुरू होते हैं, क्योंकि NeRF के विपरीत, एक GAN का लेटेंट स्पेस 3D जानकारी की समझ को स्वाभाविक रूप से एकीकृत नहीं करता है। इसलिए 3D-जागरूक GAN चेहरे की छवि सिंथेसिस हाल के वर्षों में छवि पीढ़ी अनुसंधान में एक गर्म पीछा बन गया है, 2019 के InterFaceGAN में एक प्रमुख सफलता हासिल की गई है।

हालांकि, यहां तक कि InterFaceGAN के प्रदर्शित और चेरी-पिक्ड परिणाम यह दिखाते हैं कि न्यूरल बाल स्थिरता एक कठिन चुनौती है सांविधिक स्थिरता के संदर्भ में, संभावित वीएफएक्स कार्य प्रवाह के लिए:

InterFaceGAN से पोज़ परिवर्तन में 'सिज़लिंग' बाल। स्रोत: https://www.youtube.com/watch?v=uoftpl3Bj6w

InterFaceGAN से पोज़ परिवर्तन में ‘सिज़लिंग’ बाल। स्रोत: https://www.youtube.com/watch?v=uoftpl3Bj6w

जैसा कि यह अधिक स्पष्ट होता जा रहा है कि लेटेंट स्पेस के माध्यम से दृश्य पीढ़ी का मैनिपुलेशन एक प्रकार की अल्केमी जैसी प्रतीत होती है, एक बढ़ती संख्या में पत्र सामने आ रहे हैं जो एक GAN कार्य प्रवाह में स्थिरकारी और सामान्यीकरण प्रतिबंध के रूप में CGI-आधारित 3D जानकारी को एकीकृत करते हैं।

CGI तत्व मध्यवर्ती 3D प्रिमिटिव्स द्वारा प्रतिनिधित्व किया जा सकता है, जैसे कि Skinned Multi-Person Linear Model (SMPL), या 3D अनुमान तकनीकों को NeRF के समान तरीके से अपनाकर, जहां ज्यामिति स्रोत छवियों या वीडियो से मूल्यांकन की जाती है।

इसी तरह का एक नया काम, इस सप्ताह जारी, मल्टी-व्यू कंसिस्टेंट जेनरेटिव एडवर्सेरियल नेटवर्क फॉर 3D-एवेयर इमेज सिंथेसिस (MVCGAN) है, जो ReLER, AAII, सिडनी प्रौद्योगिकी विश्वविद्यालय, अलीबाबा समूह के DAMO अकादमी, और झेजियांग विश्वविद्यालय के बीच एक सहयोग है।

MVCGAN द्वारा CELEBA-HQ डेटासेट से व्युत्पन्न छवियों पर यथार्थवादी और मजबूत नए चेहरे के पोज़। स्रोत: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN द्वारा CELEBA-HQ डेटासेट से व्युत्पन्न छवियों पर यथार्थवादी और मजबूत नए चेहरे के पोज़। स्रोत: https://arxiv.org/pdf/2204.06307.pdf

MVCGAN में एक जेनरेटिव रेडिएंस फील्ड नेटवर्क (GRAF) शामिल है जो एक जेनरेटिव एडवर्सेरियल नेटवर्क में ज्यामितीय प्रतिबंध प्रदान करने में सक्षम है, संभावित रूप से इसी तरह के GAN-आधारित दृष्टिकोण की सबसे प्रामाणिक पोज़िंग क्षमताओं में से कुछ प्राप्त करता है।

MVCGAN और पिछले तरीकों GRAF, GIRAFFE, और pi-GAN के बीच तुलना।

MVCGAN और पिछले तरीकों GRAF, GIRAFFE, और pi-GAN के बीच तुलना।

हालांकि, MVCGAN के पूरक सामग्री से पता चलता है कि बाहरी 3D ज्यामिति पर आधारित प्रतिबंधों के माध्यम से बाल आयतन, वितरण, स्थिति और व्यवहार स्थिरता प्राप्त करना एक समस्या है जो आसानी से नहीं सुलझाई जा सकती है।

लेखन के समय तक सार्वजनिक रूप से जारी नहीं की गई पूरक सामग्री से, हम देखते हैं कि जबकि MVCGAN से चेहरे की मुद्रा सिंथेसिस वर्तमान राज्य-of-the- कला पर एक उल्लेखनीय प्रगति का प्रतिनिधित्व करती है, सांविधिक बाल स्थिरता अभी भी एक समस्या है।

लेखन के समय तक सार्वजनिक रूप से जारी नहीं की गई पूरक सामग्री से, हम देखते हैं कि जबकि MVCGAN से चेहरे की मुद्रा सिंथेसिस वर्तमान राज्य-of-the- कला पर एक उल्लेखनीय प्रगति का प्रतिनिधित्व करती है, सांविधिक बाल स्थिरता अभी भी एक समस्या है।

चूंकि ‘सीधे’ सीजीआई कार्य प्रवाह अभी भी अस्थायी बाल पुनर्निर्माण को एक चुनौती के रूप में पाते हैं, इसलिए कोई कारण नहीं है कि यह मानने के लिए कि पारंपरिक ज्यामिति-आधारित दृष्टिकोण इस प्रकार के बाल सिंथेसिस को लेटेंट स्पेस में लाने जा रहे हैं।

कन्वोल्यूशनल न्यूरल नेटवर्क के साथ बाल स्थिर करना

हालांकि, स्वीडन में चाल्मर्स इंस्टीट्यूट ऑफ टेक्नोलॉजी के तीन शोधकर्ताओं द्वारा एक आगामी पत्र न्यूरल बाल सिमुलेशन में एक अतिरिक्त प्रगति प्रदान कर सकता है।

बाएं, सीएनएन-स्थिरित बाल प्रतिनिधित्व, दाएं, मूल सत्य। लेख के अंत में एम्बेडेड वीडियो में बेहतर रिज़ॉल्यूशन और अतिरिक्त उदाहरण देखें। स्रोत: https://www.youtube.com/watch?v=AvnJkwCmsT4

बाएं, सीएनएन-स्थिरित बाल प्रतिनिधित्व, दाएं, मूल सत्य। लेख के अंत में एम्बेडेड वीडियो में बेहतर रिज़ॉल्यूशन और अतिरिक्त उदाहरण देखें। स्रोत: https://www.youtube.com/watch?v=AvnJkwCmsT4

शीर्षक रियल-टाइम हेयर फिल्टरिंग विद कन्वोल्यूशनल न्यूरल नेटवर्क, पत्र मई के पहले सप्ताह में i3D सिम्पोजियम के लिए प्रकाशित किया जाएगा।

सिस्टम में एक ऑटोएनकोडर-आधारित नेटवर्क शामिल है जो वास्तविक समय में बाल संकल्प का मूल्यांकन करने में सक्षम है, जिसमें स्व-छाया और बाल मोटाई को ध्यान में रखते हुए, ओपनजीएल ज्यामिति द्वारा बीजित एक सीमित संख्या में स्टोकास्टिक नमूनों के आधार पर।

दृष्टिकोण एक सीमित संख्या में नमूनों को स्टोकास्टिक पारदर्शिता के साथ प्रस्तुत करता है और फिर एक U-net को मूल छवि को पुनर्निर्मित करने के लिए प्रशिक्षित करता है।

MVCGAN के तहत, एक सीएनएन स्टोकास्टिक रूप से नमूनाकृत रंग कारकों, हाइलाइट्स, टैंगेंट्स, गहराई और अल्फा को फिल्टर करता है, और संश्लेषित परिणामों को एक संयुक्त छवि में इकट्ठा करता है।

MVCGAN के तहत, एक सीएनएन स्टोकास्टिक रूप से नमूनाकृत रंग कारकों, हाइलाइट्स, टैंगेंट्स, गहराई और अल्फा को फिल्टर करता है, और संश्लेषित परिणामों को एक संयुक्त छवि में इकट्ठा करता है।

नेटवर्क पाइथन पर प्रशिक्षित है, जो छह से बारह घंटे की अवधि में समाप्त होता है, नेटवर्क आयतन और इनपुट विशेषताओं की संख्या पर निर्भर करता है। प्रशिक्षित पैरामीटर (वजन) तब वास्तविक समय कार्यान्वयन में उपयोग किए जाते हैं।

प्रशिक्षण डेटा सीधे और तरंगदार बालों के लिए कई सौ छवियों को रेंडर करके उत्पन्न किया जाता है, जिसमें यादृच्छिक दूरी और मुद्राएं होती हैं, साथ ही विभिन्न प्रकाश स्थितियां भी होती हैं।

प्रशिक्षण इनपुट के विभिन्न उदाहरण।

प्रशिक्षण इनपुट के विभिन्न उदाहरण।

नमूनों में बाल पारदर्शिता को स्टोकास्टिक पारदर्शिता के साथ उच्च रिज़ॉल्यूशन पर रेंडर की गई छवियों से औसत किया जाता है। मूल उच्च रिज़ॉल्यूशन डेटा को नेटवर्क और हार्डवेयर सीमाओं को समायोजित करने के लिए डाउनसैंपल किया जाता है, और बाद में एक मानक ऑटोएनकोडर कार्य प्रवाह में अपसैंपल किया जाता है।

वास्तविक समय अनुमान अनुप्रयोग (जो एल्गोरिदम से व्युत्पन्न मॉडल का लाभ उठाता है) में एनवीडिया क्यूडीएनएन के साथ एनवीडिया क्यूडीए का मिश्रण शामिल है। प्रारंभिक इनपुट विशेषताएं ओपनजीएल मल्टीसैंपल्ड रंग बफर में डंप की जाती हैं, और परिणाम क्यूडीएनएन टेंसर में शंट किया जाता है और सीएनएन में प्रसंस्करण के लिए। वे टेंसर तब एक ‘लाइव’ ओपनजीएल टेक्सचर में कॉपी किए जाते हैं और अंतिम छवि में लगाए जाते हैं।

वास्तविक समय प्रणाली एक एनवीडिया आरटीएक्स 2080 पर काम करती है, जो 1024×1024 पिक्सेल का रिज़ॉल्यूशन उत्पन्न करती है।

चूंकि बाल रंग मान अंतिम मानों में पूरी तरह से विभक्त हो जाते हैं जो नेटवर्क द्वारा प्राप्त किए जाते हैं, बाल रंग बदलना एक आसान कार्य है, हालांकि ग्रेडिएंट और धारियों जैसे प्रभाव अभी भी एक भविष्य की चुनौती हैं।

लेखकों ने पत्र के मूल्यांकन में उपयोग किए गए कोड को गिटलैब पर जारी किया है। नीचे MVCGAN के लिए पूरक वीडियो देखें।

निष्कर्ष

एक ऑटोएनकोडर या जीएनएन के लेटेंट स्पेस को नेविगेट करना अभी भी नाव चलाने की तरह है। केवल इस बहुत ही हाल के समय में हम ‘सimpler’ ज्यामिति जैसे चेहरों के पोज़ पीढ़ी के लिए विश्वसनीय परिणाम देखना शुरू कर रहे हैं, दृष्टिकोण जैसे NeRF, GANs, और गैर-डीपफेक (2017) ऑटोएनकोडर फ्रेमवर्क में।

मानव बालों की महत्वपूर्ण वास्तुकला जटिलता, साथ ही साथ भौतिकी मॉडल और अन्य विशेषताओं को शामिल करने की आवश्यकता जिनके लिए वर्तमान छवि सिंथेसिस दृष्टिकोण में कोई प्रावधान नहीं है, यह दर्शाता है कि बाल सिंथेसिस सामान्य चेहरे की सिंथेसिस में एक एकीकृत घटक के रूप में बने रहने की संभावना नहीं है, लेकिन कुछ जटिलता के अलग और अलग नेटवर्क की आवश्यकता होगी – भले ही ऐसे नेटवर्क अंततः व्यापक और अधिक जटिल चेहरे की सिंथेसिस फ्रेमवर्क में शामिल हो सकते हैं।

 

पहली बार 15 अप्रैल 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai