Anderson का एंगल
एआई के साथ ‘बेहतर’ शरीर बनाना

Alibaba DAMO अकादमी के नए शोध ने शरीर की छवियों को पुनः आकार देने के लिए एआई-चालित कार्यप्रवाह प्रदान किया है – कंप्यूटर विज़न क्षेत्र में यह एक दुर्लभ प्रयास है, जो वर्तमान में चेहरा-आधारित हेरफेर जैसे डीपफेक और GAN-आधारित चेहरा संपादन में व्यस्त है।

‘result’ कॉलम में, उत्पन्न ध्यान मानचित्र जो संशोधित किए जाने वाले क्षेत्रों को परिभाषित करते हैं। स्रोत: https://arxiv.org/pdf/2203.04670.pdf स्रोत: https://arxiv.org/pdf/2203.04670.pdf
शोधकर्ताओं की आर्किटेक्चर कंकाल पोज़ अनुमान का उपयोग करती है ताकि छवि संश्लेषण और संपादन प्रणालियों द्वारा मौजूदा शरीर छवियों को अवधारणात्मक और पैरामीट्रिक रूप से संभालने में आने वाली अधिक जटिलता को हल किया जा सके, कम से कम ऐसी सूक्ष्मता स्तर तक जो वास्तविक और चयनात्मक संपादन की अनुमति देती हो।

अनुमानित कंकाल मानचित्र शरीर के उन क्षेत्रों पर ध्यान केंद्रित करने में मदद करते हैं जिन्हें पुनः टच किया जाना संभावित है, जैसे ऊपरी भुजा क्षेत्र।
यह प्रणाली अंततः उपयोगकर्ता को ऐसे पैरामीटर सेट करने में सक्षम बनाती है जो पूर्ण-लंबाई या मध्य-लंबाई की तस्वीरों में वजन, मांसपेशी द्रव्यमान, या वजन वितरण की उपस्थिति को बदल सकते हैं, और कपड़े पहने या बिना कपड़े के शरीर के भागों पर मनमाने रूपांतरण उत्पन्न कर सकती है।

बाएँ, इनपुट छवि; मध्य, व्युत्पन्न ध्यान क्षेत्रों का हीट‑मैप; दाएँ, परिवर्तित छवि।
इस कार्य का प्रेरणा स्रोत वह स्वचालित कार्यप्रवाह विकसित करना है जो विभिन्न मीडिया शाखाओं—फ़ैशन से लेकर मैगज़ीन‑शैली आउटपुट और प्रचार सामग्री—में फ़ोटोग्राफ़रों और प्रोडक्शन ग्राफ़िक कलाकारों द्वारा किए जाने वाले कठिन डिजिटल हेरफेर को बदल सके।
सामान्यतः, लेखक स्वीकार करते हैं कि ये रूपांतरण अक्सर फ़ोटोशॉप और अन्य पारंपरिक बिटमैप संपादकों में ‘वॉर्प’ तकनीकों के साथ लागू किए जाते हैं, और लगभग विशेष रूप से महिलाओं की छवियों पर उपयोग किए जाते हैं। परिणामस्वरूप, नई प्रक्रिया को सुविधाजनक बनाने के लिए विकसित किया गया कस्टम डेटासेट मुख्यतः महिला विषयों की तस्वीरों से बना है:
‘चूँकि शरीर रिटचिंग मुख्यतः महिलाओं द्वारा चाही जाती है, इसलिए हमारे संग्रह में अधिकांश फोटो महिलाएँ हैं, विभिन्न आयु, जातियों (अफ़्रीकी:एशियाई:कॉकेशियन = 0.33:0.35:0.32), पोज़ और वस्त्रों की विविधता को ध्यान में रखते हुए।’
The paper is titled Structure-Aware Flow Generation for Human Body Reshaping, and comes from five authors associated with Alibaba’s global DAMO academy.
डेटासेट विकास
छवि संश्लेषण और संपादन प्रणालियों में अक्सर देखा जाता है कि परियोजना की आर्किटेक्चर को एक अनुकूलित प्रशिक्षण डेटासेट की आवश्यकता होती है। लेखकों ने Unsplash स्टॉक फ़ोटोग्राफी साइट से उपयुक्त छवियों के मानक फ़ोटोशॉप हेरफेर तैयार करने के लिए तीन फ़ोटोग्राफ़रों को नियुक्त किया, जिससे 5,000 उच्च गुणवत्ता वाली छवियों का डेटासेट – शीर्षक BR-5K* – 2K रिज़ॉल्यूशन पर तैयार हुआ।
शोधकर्ता यह ज़ोर देते हैं कि इस डेटासेट पर प्रशिक्षण का उद्देश्य ‘आकर्षण’ या ‘इच्छित दिखावट’ के सामान्यीकृत संकेतकों को उत्पन्न करना नहीं है, बल्कि पेशेवर शरीर‑छवि हेरफेर से जुड़े केंद्रीय फीचर मैपिंग को निकालना है।
हालाँकि, वे स्वीकार करते हैं कि ये हेरफेर अंततः ऐसे परिवर्तनात्मक प्रक्रियाओं को दर्शाते हैं जो ‘वास्तविक’ से एक पूर्वनिर्धारित ‘आदर्श’ अवधारणा की ओर प्रगति करते हैं:
‘हमने तीन पेशेवर कलाकारों को स्वतंत्र रूप से फ़ोटोशॉप में शरीर रिटच करने के लिए आमंत्रित किया, लक्ष्य था लोकप्रिय सौंदर्यशास्त्र को पूरा करने वाले स्लीक फ़िगर बनाना, और सर्वश्रेष्ठ को ग्राउंड‑ट्रुथ के रूप में चुनना।’
चूँकि फ्रेमवर्क ने चेहरों को बिल्कुल ही नहीं छुआ, इसलिए डेटासेट में शामिल करने से पहले उन्हें धुंधला कर दिया गया।
आर्किटेक्चर और मुख्य अवधारणाएँ
सिस्टम का कार्यप्रवाह एक उच्च‑रिज़ॉल्यूशन पोर्ट्रेट को इनपुट में लेता है, उसे कम‑रिज़ॉल्यूशन में डाउनसैंपल करता है जो उपलब्ध कंप्यूटिंग संसाधनों में फिट हो सके, और अनुमानित कंकाल‑मैप पोज़ (नीचे बाएँ चित्र) तथा पार्ट अफिनिटी फ़ील्ड्स (PAFs) निकालता है, जिन्हें 2016 में Carnegie Mellon University के The Robotics Institute ने नवाचार किया था (नीचे एम्बेडेड वीडियो देखें)।
Part Affinity Fields अंगों की अभिविन्यास और व्यापक कंकाल ढाँचे के साथ सामान्य संबद्धता को परिभाषित करने में मदद करती हैं, जिससे नए प्रोजेक्ट को अतिरिक्त ध्यान/स्थानीयकरण उपकरण मिलता है।

2016 के Part Affinity Fields पेपर से, भविष्यवाणी किए गए PAFs अंग की अभिविन्यास को 2D वेक्टर के हिस्से के रूप में एन्कोड करते हैं, जिसमें अंग की सामान्य स्थिति भी शामिल होती है। स्रोत: https://arxiv.org/pdf/1611.08050.pdf स्रोत: https://arxiv.org/pdf/1611.08050.pdf
भले ही उनका वजन के दिखावे से स्पष्ट संबंध न हो, कंकाल मानचित्र अंतिम रूपांतरण प्रक्रियाओं को उन शरीर के भागों की ओर निर्देशित करने में उपयोगी होते हैं जिन्हें संशोधित किया जाना है, जैसे ऊपरी भुजाएँ, नितंब और जांघें।
इसके बाद, परिणामों को प्रक्रिया के केंद्रीय बॉटलनेक में स्थित Structure Affinity Self-Attention (SASA) में फीड किया जाता है (नीचे चित्र देखें)।

SASA प्रवाह जनरेटर की संगति को नियंत्रित करता है, जिसके परिणाम फिर वॉर्पिंग मॉड्यूल (ऊपर‑दाएँ चित्र) को पास किए जाते हैं, जो डेटासेट में शामिल मैनुअल संशोधनों पर प्रशिक्षित रूपांतरणों को लागू करता है।

Structure Affinity Self-Attention (SASA) मॉड्यूल संबंधित शरीर भागों पर ध्यान केंद्रित करता है, जिससे अनावश्यक या अप्रासंगिक रूपांतरणों से बचा जा सके।
आउटपुट छवि को फिर मूल 2K रिज़ॉल्यूशन पर अप‑सैंपल किया जाता है, वह प्रक्रिया 2017‑स्टाइल डीपफेक आर्किटेक्चर के समान है, जिससे DeepFaceLab जैसे लोकप्रिय पैकेज निकले हैं; अप‑सैंपल प्रक्रिया GAN संपादन फ्रेमवर्क में भी सामान्य है।
The attention network for the schema is modeled after Compositional De-Attention Networks (CODA), a 2019 US/Singapore academic collaboration with Amazon (AMZN ) AI and Microsoft.
परीक्षण
फ़्लो‑आधारित फ्रेमवर्क का परीक्षण पूर्व के फ़्लो‑आधारित तरीकों FAL और Animating Through Warping (ATW) के साथ-साथ छवि अनुवाद आर्किटेक्चर Pix2PixHD और GFLA पर किया गया, मूल्यांकन मानकों के रूप में SSIM, PSNR और LPIPS का उपयोग किया गया।

प्रारंभिक परीक्षणों के परिणाम (हेडर में तीर दिशा दर्शाती है कि कम या अधिक मान बेहतर हैं)।
इन अपनाए गए मानकों के आधार पर, लेखकों की प्रणाली पूर्व आर्किटेक्चर की तुलना में बेहतर प्रदर्शन करती है।
स्वचालित मानकों के अतिरिक्त, शोधकर्ताओं ने एक उपयोगकर्ता अध्ययन किया (पहले चित्र में दिखाए गए परिणाम तालिका का अंतिम कॉलम), जिसमें 40 प्रतिभागियों को विभिन्न विधियों द्वारा उत्पन्न छवियों से संबंधित 100‑प्रश्न पूल में से यादृच्छिक रूप से चुने गए 30 प्रश्न दिखाए गए। 70% उत्तरदाताओं ने नई तकनीक को अधिक ‘दृश्य‑आकर्षक’ माना।
चुनौतियाँ
नया पेपर एआई‑आधारित शरीर हेरफेर में एक दुर्लभ प्रयास का प्रतिनिधित्व करता है। छवि संश्लेषण क्षेत्र वर्तमान में या तो Neural Radiance Fields (NeRF) जैसी विधियों से संपादन‑योग्य शरीर उत्पन्न करने में अधिक रुचि रखता है, या फिर GAN के लेटेंट स्पेस और चेहरे के हेरफेर के लिए ऑटोएन्कोडर की संभावनाओं की खोज में फँसा हुआ है।
लेखकों की पहल वर्तमान में केवल महसूस किए गए वजन में परिवर्तन उत्पन्न करने तक सीमित है, और उन्होंने किसी भी प्रकार की इन‑पेंटिंग तकनीक लागू नहीं की है जो किसी व्यक्ति की तस्वीर को पतला करने पर अनिवार्य रूप से उजागर होने वाली पृष्ठभूमि को पुनर्स्थापित कर सके।
हालाँकि, वे प्रस्तावित करते हैं कि पोर्ट्रेट मैटिंग और टेक्सचर इनफ़रेंस के माध्यम से पृष्ठभूमि मिश्रण इस समस्या को सहजता से हल कर सकता है, जिससे मानव ‘अपूर्णता’ द्वारा छिपे हुए विश्व के हिस्सों को पुनः स्थापित किया जा सके।

एआई‑चालित वज़न घटाने से उजागर हुई पृष्ठभूमि को पुनर्स्थापित करने के लिए प्रस्तावित समाधान।
* यद्यपि प्री‑प्रिंट में डेटासेट के बारे में अधिक विवरण देने वाली सहायक सामग्री और परियोजना के अतिरिक्त उदाहरणों का उल्लेख है, इस सामग्री का स्थान पेपर में उपलब्ध नहीं कराया गया है, और संबंधित लेखक ने अभी तक हमारी पहुँच के अनुरोध का जवाब नहीं दिया है।
पहली बार प्रकाशित 10 मार्च 2022.













