Anderson का एंगल
डिज़नी ने सीजीआई को न्यूरल रेंडरिंग के साथ मिलाया ताकि ‘अनकैनी वैली’ की समस्या का समाधान किया जा सके

डिज़नी के एआई अनुसंधान विभाग ने फिल्म-गुणवत्ता वाले चेहरे के अनुकरण के लिए एक हाइब्रिड विधि विकसित की है, जो चेहरे के न्यूरल रेंडरिंग की ताकत को सीजीआई-आधारित दृष्टिकोण की निरंतरता के साथ जोड़ती है।
प्रतीक्षित पत्र का शीर्षक स्टाइल के साथ रेंडरिंग: चेहरे के उच्च गुणवत्ता वाले रेंडरिंग के लिए पारंपरिक और न्यूरल दृष्टिकोण को जोड़ना है, और इसे डिज़नी रिसर्च यूट्यूब चैनल (इस लेख के अंत में एम्बेडेड) पर एक नए 10 मिनट के वीडियो में पूर्वावलोकन किया गया है।

मेशेस को न्यूरल चेहरे के रेंडर्स के साथ जोड़ा गया। वीडियो एम्बेड के लिए लेख के अंत में जाएं और विवरण और गुणवत्ता के लिए देखें। स्रोत: https://www.youtube.com/watch?v=k-RKSGbWLng (जो कि https://www.youtube.com/watch?v=TwpLqTmvqVk से बदल दिया गया है)
जैसा कि वीडियो में उल्लेख किया गया है, चेहरे का न्यूरल रेंडरिंग (जिसमें डीपफेक्स भी शामिल हैं) आंखों और मुंह के अंदरूनी हिस्सों को सीजीआई की तुलना में अधिक वास्तविक बना सकता है, जबकि सीजीआई-चालित चेहरे की बनावट अधिक निरंतर और सिनेमा-स्तरीय वीएफएक्स आउटपुट के लिए उपयुक्त होती है।
इसलिए, डिज़नी न्यूरल जेनरेटर को चेहरे की आसपास की विशेषताओं और ‘जीवन-महत्वपूर्ण’ तत्वों जैसे कि आंखों को संभालने के लिए प्रयोग कर रहा है, जबकि सीजीआई चेहरे की त्वचा और संबंधित तत्वों को आउटपुट में ओवरले कर रहा है।

वीडियो (लेख के अंत में देखें) से डिज़नी के हाइब्रिड दृष्टिकोण की वास्तुकला अवधारणा, जहां एक पुराने स्कूल के सीजीआई मेश, जैसा कि ‘यंग’ कैरी फिशर और दिवंगत पीटर कुशिंग को रोग वन (2016) के लिए पुनर्निर्मित करने के लिए उपयोग किया जाता था, को न्यूरल-रेंडर्ड चेहरे के वातावरण में एकीकृत किया जाता है।[/em>
वीडियो में एक सूक्ष्म संदर्भ दिया गया है कि सीजीआई पुनर्निर्माण की अस्वाभाविकता और ‘अनकैनी वैली’ प्रभाव की आलोचना को स्वीकार किया जाता है, जो ब्रिटिश स्टार वार्स अभिनेता पीटर कुशिंग के रूप में रोग वन (2016) में देखा गया था:
‘[अब भी] लोगों द्वारा आसानी से कब्जा और रेंडर की जाने वाली चीजों और अंतिम फोटोरियलिस्टिक डिजिटल डबल्स के बीच एक बड़ा अंतर है, जिसमें बाल, आंखें और मुंह के अंदरूनी हिस्से शामिल हैं। इस अंतर को बंद करने के लिए, यह आमतौर पर कुशल कलाकारों से बहुत मैनुअल काम लेता है।’
वास्तव में, यहां तक कि सबसे आधुनिक चेहरे कैप्चर सिस्टम भी आंखों, मुंह के अंदरूनी हिस्सों या बालों को पुनर्निर्मित करने का प्रयास नहीं करते हैं, जो ऐसी तकनीकों में प्रामाणिकता के मुद्दों (आंखों) या समय स्थिरता (बाल) के मुद्दों से ग्रस्त होते हैं।

वीडियो यह दिखाता है कि वीएफएक्स कलाकारों को एक典型 आधुनिक चेहरे कैप्चर सत्र के बाद मिलता है। आंखें, बाल, दाढ़ी, और मुंह के अंदरूनी हिस्से सभी उत्पादन पाइपलाइन में अलग-अलग टीमों द्वारा संभाले जाने होंगे, साथ ही टेक्सचर और लाइटिंग भी।[/em>
प्रकाश नियंत्रण
हाइब्रिड दृष्टिकोण प्रकाश व्यवस्था में भी लाभकारी है – चेहरे के न्यूरल रेंडरिंग के लिए एक उल्लेखनीय चुनौती, क्योंकि सीजीआई त्वचा ओवरले को अधिक आसानी से पुनर्प्रकाशित किया जा सकता है।

सीजीआई/न्यूरल दृष्टिकोण का एक एनिमेटेड संस्करण।[/em>
अधिक चुनौतीपूर्ण वातावरण में, जैसे कि बाहरी शूट, शोधकर्ताओं ने एक प्रकार के डीमिलिटराइज्ड ज़ोन के आसपास व्यक्ति को ‘निर्मित’ करने के लिए इनपेंटिंग की एक विधि विकसित की है।

एक ब्लैक मार्जिन उत्पन्न किया जाता है ताकि एक ‘कैनवास’ के लिए इनपेंटिंग के बाहरी हिस्सों को पहचान और सीजीआई त्वचा को संयुक्त सीजीआई/न्यूरल आउटपुट में एकीकृत किया जा सके।[/em>
वीडियो यह कहता है:
‘[न्यूरल] रेंडर पृष्ठभूमि प्रतिबंध के साथ पूरी तरह से मेल नहीं खाता है। – यह केवल एक गाइड के रूप में है, क्योंकि वास्तविक मानव घटकों जैसे बाल, आंखें और दांतों के लिए अनुकूलन करना मुख्य लक्ष्य है। अधिक चुनौतीपूर्ण यह है कि पहचान को स्थिर रखने का प्रयास करें, जबकि परिवेश प्रकाश को बदलने का प्रयास करें।’
न्यूरल रेंडर्स से सीजीआई मेश बनाना
शोध टीम ने एक वेरिएशनल ऑटोएनकोडर भी विकसित किया है जो एक बड़े 3डी चेहरे के छवियों के डेटाबेस पर प्रशिक्षित है, और दावा किया है कि यह मैदान सच्चाई डेटा से ‘यादृच्छिक लेकिन विश्वसनीय’ 3डी चेहरे के मेश उत्पन्न कर सकता है।
इस शोध को पार करने के लिए सीमाएं हैं, जिनमें न्यूरल रेंडरिंग में बाल को समय स्थिर रखने में कठिनाई शामिल है, और वीडियो (नीचे देखें) में एक सीजीआई/न्यूरल चेहरे के चारों ओर एक सुसंगत पैन में तेजी से परिवर्तित होने वाले बाल के कई उदाहरण दिखाता है।
न्यूरल वीडियो रेंडरिंग में समय स्थिरता एक बहुत व्यापक समस्या है जो केवल डिज़नी की नहीं है, और ऐसा लगता है कि इस प्रणाली के बाद के संस्करण बाल जोड़ने के लिए ‘पोस्ट’ में जा सकते हैं या बाल उत्पादन के लिए अन्य संभावित दृष्टिकोणों का उपयोग कर सकते हैं।
डेटासेट जनरेशन के लिए उपयोग
इस विधि का प्रस्ताव सिंथेटिक डेटा के जनरेशन के लिए एक संभावित विधि के रूप में भी किया गया है, और चेहरे की छवि सेट लैंडस्केप को समृद्ध करने के लिए, जो हाल के वर्षों में खतरनाक रूप से एकरूप हो गई है।

डिज़नी इस नई तकनीक को चेहरे की छवि डेटासेट को आबाद करने की कल्पना करता है।[/em>
‘[प्रत्येक] फोटोरियलिस्टिक परिणाम जो हम उत्पन्न करते हैं उसके नीचे एक संबंधित ज्यामिति और उपस्थिति मैप है, जो ज्ञात प्रकाश व्यवस्था के साथ जाने जाने वाले कैमरा दृष्टिकोण से रेंडर किया जाता है। यह ‘मैदान सच्चाई’ जानकारी मोनोक्युलर, 3डी चेहरे के पुनर्निर्माण, चेहरे की पहचान, या दृश्य समझ जैसे डाउनस्ट्रीम अनुप्रयोगों के लिए महत्वपूर्ण हो सकती है। और इसलिए, प्रत्येक रेंडर परिणाम एक डेटा नमूने के रूप में माना जा सकता है, और हम कई विभिन्न व्यक्तियों के कई संस्करण उत्पन्न कर सकते हैं।
‘इसके अलावा, एक ही व्यक्ति को एक ही अभिव्यक्ति में एक ही दृष्टिकोण और प्रकाश व्यवस्था के साथ पुनर्निर्मित करने के लिए, हम अनुकूलन के दौरान यादृच्छिकीकरण बीज को बदलकर फोटोरियलिस्टिक रेंडर के यादृच्छिक संस्करण उत्पन्न कर सकते हैं। ‘
शोधकर्ता यह ध्यान देते हैं कि यह विन्यास योग्य आउटपुट की विविधता चेहरे की पहचान अनुप्रयोगों को प्रशिक्षित करने में उपयोगी हो सकती है, और निष्कर्ष निकालते हैं:
‘[हमारा] तरीका मौजूदा तकनीक का लाभ उठा सकता है चेहरे की त्वचा कैप्चर, मॉडलिंग और रेंडरिंग के लिए, और स्वचालित रूप से पूर्ण फोटोरियलिस्टिक चेहरे के रेंडर बना सकता है जो वांछित पहचान, अभिव्यक्ति और दृश्य कॉन्फ़िगरेशन से मेल खाता है। यह दृष्टिकोण फिल्म और मनोरंजन के लिए चेहरे के रेंडरिंग के लिए अनुप्रयोगों के साथ-साथ गहरे शिक्षण के विभिन्न क्षेत्रों में डेटा जनरेशन के लिए भी है।’
इस नए दृष्टिकोण के लिए एक गहरा नज़र यहाँ देखें:
* मूल वीडियो लिंक को 8 घंटे बाद इस लेख को प्रकाशित करने के बाद एक अन्य समान लिंक के साथ बदल दिया गया था। मैंने सभी प्रासंगिक लिंक बदल दिए, क्योंकि मूल वीडियो का कोई निशान नहीं है।
8:24 जीएमटी + 2 – वीडियो को बदल दिया गया, क्योंकि यह डिज़नी रिसर्च यूट्यूब चैनल द्वारा कुछ कारणों से बदल दिया गया था।












