Anderson का एंगल
एआई के साथ ‘बेहतर’ शरीर बनाना

अलीबाबा डैमो अकादमी से नए शोध में शरीर की तस्वीरों को स्वचालित रूप से बदलने के लिए एक एआई-चालित कार्यप्रवाह प्रदान किया गया है – यह कंप्यूटर विजन क्षेत्र में एक दुर्लभ प्रयास है, जो वर्तमान में चेहरा-आधारित हेरफेर जैसे कि डीपफेक और जीएन-आधारित चेहरा संपादन पर केंद्रित है।

इनसेट में ‘परिणाम’ कॉलम, जो संशोधित क्षेत्रों को परिभाषित करने वाले जनरेटेड ध्यान मानचित्र हैं। स्रोत: https://arxiv.org/pdf/2203.04670.pdf
शोधकर्ताओं की वास्तुकला में कंकाल मुद्रा अनुमान शामिल है, जो चित्र संश्लेषण और संपादन प्रणालियों द्वारा सामना की जाने वाली जटिलता को संबोधित करने के लिए उपयोग किया जाता है, जो मौजूदा शरीर की तस्वीरों को概念ualize और पैरामीटर करने के लिए है।

अनुमानित कंकाल मानचित्र शरीर के उन क्षेत्रों पर ध्यान केंद्रित करने में मदद करते हैं जिन्हें संभवतः छेड़छाड़ की आवश्यकता होती है, जैसे कि ऊपरी बांह क्षेत्र।
प्रणाली अंततः एक उपयोगकर्ता को पैरामीटर सेट करने की अनुमति देती है जो वजन, मांसपेशियों के द्रव्यमान या वजन वितरण की उपस्थिति को बदल सकते हैं, और कपड़े पहने हुए या बिना शरीर के खंडों पर मनमानी रूपांतरण उत्पन्न करने में सक्षम है।

बाएं, इनपुट छवि; मध्य, व्युत्पन्न ध्यान क्षेत्रों का एक ताप मानचित्र; दाएं, परिवर्तित छवि।
काम का प्रेरणा फोटोग्राफरों और उत्पादन ग्राफिक्स कलाकारों द्वारा की जाने वाली श्रमसाध्य डिजिटल हेरफेर को स्वचालित करने वाले कार्यप्रवाह विकसित करने की है, जो मीडिया की विभिन्न शाखाओं में काम करते हैं, फैशन से लेकर पत्रिका शैली के आउटपुट और प्रचार सामग्री तक।
सामान्य तौर पर, लेखक स्वीकार करते हैं कि ये परिवर्तन आमतौर पर फोटोशॉप और अन्य पारंपरिक बिटमैप संपादकों में ‘वार्प’ तकनीकों के साथ लागू किए जाते हैं, और लगभग विशेष रूप से महिलाओं की तस्वीरों पर उपयोग किए जाते हैं। इसके परिणामस्वरूप, नए प्रक्रिया को सुविधाजनक बनाने के लिए विकसित किए गए कस्टम डेटासेट में मुख्य रूप से महिला विषयों की तस्वीरें शामिल हैं:
‘शरीर की छेड़छाड़ मुख्य रूप से महिलाओं द्वारा वांछित है, इसलिए हमारे संग्रह में अधिकांश महिला फोटो हैं, जो उम्र, नस्ल (अफ्रीकी: एशियाई: कोकेशियान = 0.33:0.35:0.32), मुद्रा, और कपड़ों की विविधता को ध्यान में रखते हुए।’
लेख पेपर का शीर्षक मानव शरीर के पुनर्गठन के लिए संरचना-जागरूक प्रवाह जेनरेशन है, और अलीबाबा के वैश्विक डैमो अकादमी से संबंधित पांच लेखकों द्वारा लिखा गया है।
डेटासेट विकास
आमतौर पर, छवि संश्लेषण और संपादन प्रणालियों के साथ, परियोजना के लिए एक अनुकूलित प्रशिक्षण डेटासेट की आवश्यकता थी। लेखकों ने तीन फोटोग्राफरों को स्टॉक फोटोग्राफी साइट अनस्प्लैश से उपयुक्त छवियों के मानक फोटोशॉप हेरफेर उत्पादन के लिए कमीशन किया, जिसके परिणामस्वरूप 2K रिज़ॉल्यूशन पर 5,000 उच्च गुणवत्ता वाली छवियों का एक डेटासेट – बीआर-5के* – तैयार हुआ।
शोधकर्ता इस बात पर जोर देते हैं कि इस डेटासेट पर प्रशिक्षण का उद्देश्य ‘आदर्शीकृत’ और सामान्य विशेषताओं का उत्पादन करना नहीं है, जो आकर्षण या वांछनीय उपस्थिति के सूचकांक से संबंधित है, बल्कि पेशेवर हेरफेर से जुड़ी केंद्रीय विशेषता मानचित्रों को निकालना है।
हालांकि, वे स्वीकार करते हैं कि हेरफेर अंततः परिवर्तनकारी प्रक्रियाओं को दर्शाते हैं जो ‘वास्तविक’ से ‘आदर्श’ की पूर्व-निर्धारित धारणा तक की प्रगति को मैप करते हैं:
‘हम तीन पेशेवर कलाकारों को फोटोशॉप का उपयोग करके शरीर को छेड़छाड़ करने के लिए आमंत्रित करते हैं, जिसका उद्देश्य लोकप्रिय सौंदर्य मानकों के अनुसार पतले आकार प्राप्त करना है, और सबसे अच्छे एक को मूल सत्य के रूप में चुनते हैं।’
चूंकि फ्रेमवर्क चेहरों से संबंधित नहीं है, उन्हें डेटासेट में शामिल करने से पहले उन्हें धुंधला कर दिया गया था।
वास्तुकला और मूल अवधारणाएं
प्रणाली का कार्यप्रवाह एक उच्च-रिज़ॉल्यूशन पोर्ट्रेट को खिलाता है, इसे कम रिज़ॉल्यूशन में डाउनसैंपल करता है जो उपलब्ध कंप्यूटिंग संसाधनों में फिट हो सकता है, और एक अनुमानित कंकाल-मानचित्र मुद्रा (नीचे की छवि में दूसरा आंकड़ा) और पार्ट अफिनिटी फील्ड्स (पीएएफ) निकालता है, जो 2016 में कार्नेगी मेलन विश्वविद्यालय में रोबोटिक्स संस्थान द्वारा नवाचार किया गया था।
पार्ट अफिनिटी फील्ड्स अंगों की दिशा और व्यापक कंकाल ढांचे के साथ सामान्य संबंध को परिभाषित करने में मदद करते हैं, जो नए परियोजना को एक अतिरिक्त ध्यान/स्थानीयकरण उपकरण प्रदान करते हैं।

2016 के पार्ट अफिनिटी फील्ड्स पेपर से, पूर्वानुमानित पीएएफ अंगों की दिशा को एक 2डी वेक्टर के हिस्से के रूप में एनकोड करते हैं जो अंग की सामान्य स्थिति को भी शामिल करता है। स्रोत: https://arxiv.org/pdf/1611.08050.pdf
हड्डी के मानचित्र, जो वजन की उपस्थिति के साथ-साथ प्रतीत होने वाले परिवर्तनों के लिए प्रतीत होते हैं, शरीर के उन क्षेत्रों पर अंतिम परिवर्तनकारी प्रक्रियाओं को निर्देशित करने में उपयोगी होते हैं जिन्हें संशोधित किया जाना है।
इसके बाद, परिणामों को प्रक्रिया के मध्य भाग में संरचना संबंधी स्व-ध्यान (एसएएसए) में खिलाया जाता है (नीचे दी गई छवि में)।

एसएएसए प्रक्रिया को ईंधन देने वाले प्रवाह जनरेटर की संगति को नियंत्रित करता है, जिसके परिणामों को तब वार्पिंग मॉड्यूल (ऊपर दी गई छवि में दूसरा से दाएं) में पारित किया जाता है, जो डेटासेट में शामिल मैनुअल संशोधनों से सीखे गए परिवर्तनों को लागू करता है।

संरचना संबंधी स्व-ध्यान (एसएएसए) मॉड्यूल प्रासंगिक शरीर के अंगों पर ध्यान केंद्रित करने में मदद करता है, जिससे अनावश्यक या असंबंधित परिवर्तनों से बचा जा सकता है।
आउटपुट छवि को बाद में मूल 2K रिज़ॉल्यूशन में वापस अपसैंपल किया जाता है, जो 2017 शैली के डीपफेक आर्किटेक्चर से मिलता-जुलता है, जिससे लोकप्रिय पैकेज जैसे डीपफेसलैब व्युत्पन्न हुए हैं; अपसैंपलिंग प्रक्रिया जीएन संपादन फ्रेमवर्क में भी सामान्य है।
स्कीमा के लिए ध्यान नेटवर्क संयोजक डी-ध्यान नेटवर्क (कोडा) के बाद बनाया गया है, जो 2019 में अमेज़न एआई और माइक्रोसॉफ्ट के साथ एक संयुक्त अमेरिकी-सिंगापुर अकादमिक सहयोग है।
परीक्षण
प्रवाह-आधारित फ्रेमवर्क का पूर्व प्रवाह-आधारित विधियों एफएएल और वार्पिंग के माध्यम से एनिमेटिंग (एटीडब्ल्यू) के साथ-साथ छवि अनुवाद वास्तुकला पिक्स2पिक्सएचडी और जीएफएलए के खिलाफ परीक्षण किया गया, जिसमें एसएसआईएम, पीएसएनआर और एलपीआईपीएस मूल्यांकन मेट्रिक्स के रूप में उपयोग किए गए थे।

प्रारंभिक परीक्षणों के परिणाम (हेडर में तीर की दिशा यह दर्शाती है कि क्या कम या उच्च संख्या बेहतर है)
ग्रहण किए गए मेट्रिक्स के आधार पर, लेखकों की प्रणाली पूर्व वास्तुकला को पार करती है।
स्वचालित मेट्रिक्स के अलावा, शोधकर्ताओं ने एक उपयोगकर्ता अध्ययन (पूर्व में दिखाए गए परिणाम तालिका के अंतिम स्तंभ में) आयोजित किया, जिसमें 40 प्रतिभागियों को 100-प्रश्न पूल से यादृच्छिक रूप से चुने गए 30 प्रश्न दिखाए गए, जो विभिन्न विधियों से उत्पन्न छवियों से संबंधित थे। 70% उत्तरदाताओं ने नए तकनीक को अधिक ‘दृश्य रूप से आकर्षक’ के रूप में पसंद किया।
चुनौतियाँ
नई पेपर एआई-आधारित शरीर हेरफेर में एक दुर्लभ अभियान का प्रतिनिधित्व करती है। छवि संश्लेषण क्षेत्र वर्तमान में या तो न्यूरल रेडियेंस फील्ड्स (एनईआरएफ) जैसे तरीकों से संपादन योग्य शरीर उत्पन्न करने में अधिक रुचि रखता है, या चेहरा हेरफेर के लिए जीएन और ऑटोएनकोडर्स के लेटेंट स्पेस का अन्वेषण करने पर केंद्रित है।
लेखकों की पहल वर्तमान में केवल वजन में परिवर्तन उत्पन्न करने तक सीमित है, और उन्होंने किसी भी प्रकार की इनपेंटिंग तकनीक को लागू नहीं किया है जो तब पृष्ठभूमि को पुनर्स्थापित करेगी जब किसी व्यक्ति की तस्वीर को पतला किया जाता है।
हालांकि, वे प्रस्ताव करते हैं कि पोर्ट्रेट मैटिंग और पृष्ठभूमि मिश्रण के माध्यम से टेक्सचर अनुमान द्वारा छवि में पहले छिपे हुए विश्व के हिस्सों को पुनर्स्थापित करने की समस्या का समाधान किया जा सकता है।

एआई-चालित वसा कम करने से प्रकट हुई पृष्ठभूमि को पुनर्स्थापित करने का एक प्रस्तावित समाधान।
* प्रीप्रिंट में डेटासेट और परियोजना से आगे के उदाहरणों के बारे में अधिक जानकारी देने वाली पूरक सामग्री का उल्लेख किया गया है, लेकिन इस सामग्री का स्थान पत्र में उपलब्ध नहीं है, और संबंधित लेखक ने अभी तक हमारे अनुरोध का जवाब नहीं दिया है।
पहली बार 10 मार्च 2022 को प्रकाशित किया गया।













