Anderson का एंगल

पूर्ण शरीर डीपफेक्स बनाने के लिए कई नेर्फ्स को मिलाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

इमेज सिंथेसिस अनुसंधान क्षेत्र नए प्रस्तावों से भरा हुआ है जो युवाओं, विशेष रूप से युवा महिलाओं के विभिन्न प्रकार के परिधानों में पूर्ण शरीर वीडियो और तस्वीरें बनाने में सक्षम प्रणालियों के लिए हैं। अधिकांश उत्पन्न छवियां स्थिर हैं; कभी-कभी प्रतिनिधित्व भी चलते हैं, हालांकि आमतौर पर बहुत अच्छी तरह से नहीं होते हैं।

इस विशेष अनुसंधान धारा की गति संबंधित क्षेत्रों जैसे लेटेंट डिफ्यूजन मॉडल में वर्तमान चकाचौंध स्तर की प्रगति की तुलना में बहुत धीमी है; फिर भी, अनुसंधान समूह, जिनमें से अधिकांश एशिया में हैं, इस समस्या पर निरंतर काम करते हैं।

पिछले 10-15 वर्षों से प्रस्तावित या अर्ध-लॉन्च किए गए 'वर्चुअल ट्राई-ऑन' प्रणालियों में से एक, जहां मशीन लर्निंग-आधारित वस्तु पहचान के माध्यम से शरीर का मूल्यांकन किया जाता है और प्रस्तावित वस्त्रों के अनुसार अनुकूलित किया जाता है। स्रोत: https://www.youtube.com/watch?v=2ZXrgGyhbak

पिछले 10-15 वर्षों से प्रस्तावित या अर्ध-लॉन्च किए गए ‘वर्चुअल ट्राई-ऑन’ प्रणालियों में से एक, जहां मशीन लर्निंग-आधारित वस्तु पहचान के माध्यम से शरीर का मूल्यांकन किया जाता है और प्रस्तावित वस्त्रों के अनुसार अनुकूलित किया जाता है। स्रोत: https://www.youtube.com/watch?v=2ZXrgGyhbak

लक्ष्य फैशन और कपड़ों के बाजार के लिए ‘वर्चुअल ट्राई-ऑन’ के लिए नए प्रणालियों का निर्माण करना है – प्रणालियां जो ग्राहक और वर्तमान में उपलब्ध या जारी होने वाले विशिष्ट उत्पाद दोनों के अनुकूल हो सकती हैं, बिना वास्तविक समय के सुपरइम्पोज़िशन की ज़रूरत के, या ग्राहकों से थोड़ा एनएसएफडब्ल्यू चित्र भेजने के लिए एमएल-आधारित रेंडरिंग पाइपलाइन के लिए।

ईवीए3डी

निरंतर, प्रस्ताव जारी हैं। सिंगापुर के नानयांग टेक्नोलॉजिकल यूनिवर्सिटी से ईवीए3डी सबसे हाल का है, जो एक दिलचस्प दृष्टिकोण का संकेत है जो लंबे समय से आने वाला था – मल्टीपल न्यूरल रेडिएंस फील्ड नेटवर्क का उपयोग, प्रत्येक जो शरीर के एक अलग हिस्से के लिए समर्पित है, और जो तब एक असेंबल्ड और सुसंगत दृश्य में रचित होते हैं।

ईवीए3डी के लिए कई नेर्फ नेटवर्क से बनी एक मोबाइल युवा महिला। स्रोत: https://hongfz16.github.io/projects/EVA3D.html

ईवीए3डी के लिए कई नेर्फ नेटवर्क से बनी एक मोबाइल युवा महिला। स्रोत: https://hongfz16.github.io/projects/EVA3D.html

परिणाम, गति के संदर्भ में,… ठीक हैं। हालांकि ईवीए3डी के दृश्य अजनबी घाटी से बाहर नहीं हैं, वे कम से कम ऑफ-रैंप देख सकते हैं जहां वे खड़े हैं।

ईवीए3डी को उत्कृष्ट बनाने वाली बात यह है कि इस क्षेत्र में लगभग अद्वितीय रूप से, शोधकर्ताओं ने महसूस किया है कि एक एकल नेटवर्क (जीएन, नेर्फ या अन्य) पूर्ण शरीर के संश्लेषण के लिए संपादित और लचीला नहीं हो सकता है – आंशिक रूप से अनुसंधान की गति के कारण, और आंशिक रूप से हार्डवेयर और अन्य लॉजिस्टिक सीमाओं के कारण।

इसलिए, नानयांग टीम ने 16 नेटवर्क और कई प्रौद्योगिकियों के माध्यम से कार्य को उप-विभाजित किया है – एक दृष्टिकोण जो पहले से ही शहरी पर्यावरणों के तंत्रिका रेंडरिंग के लिए ब्लॉक-नेर्फ और सिटीनेर्फ में अपनाया गया है, और जो आगे चलकर पूर्ण शरीर के डीपफेक्स को प्राप्त करने के लिए एक बढ़िया उपाय बन सकता है, नए概念 या हार्डवेयर विकास के अधीन।

विधि

ईवीए3डी में उपयोग किया जाने वाला एसएमपीएल मॉडल मानव ‘प्रायर’ के लिए ट्यून किया गया है – जो व्यक्ति जो मूल रूप से ईवीए3डी द्वारा स्वेच्छा से गहरा बनाया जा रहा है – और इसके स्किनिंग वेट्स एसएमपीएल मॉडल के कैनोनिकल स्पेस (अर्थात ‘आराम’, या ‘तटस्थ’ मुद्रा के बीच के अंतर को नेगोशिएट करते हैं। ) और अंतिम दृश्य कैसे प्रस्तुत किया जाता है।

ईवीए3डी के लिए संकल्पनात्मक कार्यप्रवाह। स्रोत: https://arxiv.org/pdf/2210.04888.pdf

ईवीए3डी के लिए संकल्पनात्मक कार्यप्रवाह。 स्रोत: https://arxiv.org/pdf/2210.04888.pdf

ऊपर दिए गए चित्र में देखा जा सकता है, एसएमपीएल के बाउंडिंग बॉक्स 16 नेटवर्क के लिए सीमा परिभाषाओं के रूप में उपयोग किए जाते हैं जो अंततः शरीर की रचना करेंगे। एसएमपीएल के इनवर्स लीनियर ब्लेंड स्किनिंग (एलबीएस) एल्गोरिदम का उपयोग तब दृश्य नमूने को कैनोनिकल (निष्क्रिय मुद्रा) स्थान में स्थानांतरित करने के लिए किया जाता है। फिर 16 उप-नेटवर्क को इन कॉन्फ़िगरेशन के आधार पर पूछा जाता है, और अंततः एक अंतिम रेंडर में ढाला जाता है।

पूरा नेर्फ कंपोजिट तब एक 3डी मानव जीएन फ्रेमवर्क का निर्माण करने के लिए उपयोग किया जाता है।

दूसरे चरण के जीएन फ्रेमवर्क के रेंडरिंग्स अंततः वास्तविक 2डी छवि संग्रहों के खिलाफ प्रशिक्षित किए जाएंगे।

दूसरे चरण के जीएन फ्रेमवर्क के रेंडरिंग्स अंततः वास्तविक 2डी छवि संग्रहों के खिलाफ प्रशिक्षित किए जाएंगे।

प्रत्येक उप-नेटवर्क, जो मानव शरीर के एक हिस्से का प्रतिनिधित्व करता है, स्टैक्ड मल्टी-लेयर परसेप्ट्रोन (एमएलपी) से बना होता है, जिसमें सायरन (साइनसॉइडल रिप्रेजेंटेशन नेटवर्क) एक्टिवेशन होता है। हालांकि सायरन जैसे वर्कफ्लो में कई समस्याओं का समाधान करता है, और इसी तरह की परियोजनाओं में, यह ओवरफिट होने की प्रवृत्ति रखता है और सामान्यीकरण की तुलना में अधिक करता है, और शोधकर्ता सुझाव देते हैं कि भविष्य में वैकल्पिक लाइब्रेरी का उपयोग किया जा सकता है (लेख के अंत में देखें)।

डेटा, प्रशिक्षण, और परीक्षण

ईवीए3डी को असामान्य डेटा समस्याओं का सामना करना पड़ता है, जो फैशन-आधारित डेटासेट में उपलब्ध मुद्राओं की सीमाओं और टेम्पलेटेड शैली के कारण होता है, जो वैकल्पिक या नए दृश्यों की कमी और पुनरावृत्ति की प्रवृत्ति को दिखाते हैं, संभावित रूप से कपड़ों पर ध्यान केंद्रित करने के लिए न कि उन्हें पहनने वाले मानव पर।

इस असंतुलित मुद्रा वितरण के कारण, ईवीए3डी मानव प्रायर (ऊपर देखें) के आधार पर एसएमपीएल टेम्पलेट ज्यामिति का उपयोग करता है, और फिर इस मुद्रा का एक साइन्ड डिस्टेंस फील्ड (एसडीएफ) ऑफसेट का अनुमान लगाता है, न कि एक सीधा लक्ष्य मुद्रा।

सहायक प्रयोगों के लिए, शोधकर्ताओं ने चार डेटासेट का उपयोग किया: डीपफैशन; एसएचक्यू; यूबीसीफैशन; और एआईएसटी डांस वीडियो डेटाबेस (एआईएसटी डांस डीबी)।

बाद के दो में पहले दो की तुलना में अधिक विविध मुद्राएं हैं, लेकिन वे एक ही व्यक्तियों को दोहराते हैं, जो इस विविधता को रद्द कर देता है; संक्षेप में, डेटा कार्य के लिए अधिक चुनौतीपूर्ण है, दिए गए कार्य को देखते हुए।

एसएसएचक्यू से उदाहरण। स्रोत: https://arxiv.org/pdf/2204.11823.pdf

एसएसएचक्यू से उदाहरण。 स्रोत: https://arxiv.org/pdf/2204.11823.pdf

बेसलाइन का उपयोग ईएनएआरएफ-जीएन था, जो पहली परियोजना थी जिसने 2डी छवि डेटासेट से नेर्फ दृश्यों को प्रस्तुत किया; स्टैनफोर्ड और एनवीडिया का ईजी3डी; और स्टाइलएसडीएफ, वाशिंगटन विश्वविद्यालय, एडोब रिसर्च, और स्टैनफोर्ड विश्वविद्यालय के बीच एक सहयोग – सभी विधियां जो सुपर-रिज़ॉल्यूशन लाइब्रेरी की आवश्यकता होती हैं ताकि मूल से उच्च रिज़ॉल्यूशन तक स्केल अप किया जा सके।

मीट्रिक गोद ली गई विवादास्पद फ्रेचेट इन्सेप्शन डिस्टेंस (एफआईडी) और कर्नल इन्सेप्शन डिस्टेंस (कीआईडी) थे, साथ ही प्रतिशत सही कीपॉइंट्स (पीसीकेएच@0.5)।

मात्रात्मक मूल्यांकन में, ईवीए3डी ने चार डेटासेट में सभी मीट्रिक में अग्रणी रहा:

मात्रात्मक परिणाम।

मात्रात्मक परिणाम。

(NVDA )(ADBE )

शोधकर्ता ध्यान देते हैं कि ईवीए3डी ज्यामिति रेंडरिंग के लिए सबसे कम त्रुटि दर हासिल करता है, जो इस परियोजना के प्रकार में एक महत्वपूर्ण कारक है। वे यह भी देखते हैं कि उनकी प्रणाली उत्पन्न मुद्रा को नियंत्रित कर सकती है और उच्च पीसीकेएच@0.5 स्कोर प्राप्त कर सकती है, जो ईजी3डी के विपरीत है, जो एकमात्र प्रतिस्पर्धी विधि थी जिसने एक श्रेणी में उच्च स्कोर किया।

ईवीए3डी मूल रूप से 512x512px रिज़ॉल्यूशन पर संचालित होता है, हालांकि इसे आसानी से और प्रभावी ढंग से एचडी रिज़ॉल्यूशन में अपस्केल किया जा सकता है यदि अपस्केल लेयर्स को ढेर किया जाए, जैसा कि गूगल ने हाल ही में अपने 1024 रिज़ॉल्यूशन टेक्स्ट-टू-वीडियो ऑफरिंग इमेजन वीडियो के साथ किया है।

विधि के बिना सीमाएं नहीं हैं। लेख यह बताता है कि सायरन एक्टिवेशन सर्कुलर आर्टिफैक्ट का कारण बन सकता है, जिसे भविष्य के संस्करणों में एक वैकल्पिक आधार प्रतिनिधित्व के साथ-साथ 2डी डिकोडर के साथ EG3D के संयोजन का उपयोग करके ठीक किया जा सकता है। इसके अलावा, एसएमपीएल को फैशन डेटा स्रोतों के साथ सटीक रूप से फिट करना मुश्किल है।

अंत में, प्रणाली बड़े और अधिक तरल वस्त्रों जैसे बड़े पोशाकों को आसानी से समायोजित नहीं कर सकती; इस प्रकार के वस्त्र उसी प्रकार के तरल गतिविधि को प्रदर्शित करते हैं जो तंत्रिका रेंडर किए गए बाल बनाने के लिए एक चुनौती है। संभावित रूप से, एक उपयुक्त समाधान दोनों मुद्दों को संबोधित करने में मदद कर सकता है।

 

पहली बार 12 अक्टूबर 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai