Anderson का एंगल

एआई के साथ ‘बेहतर’ शरीर बनाना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Alibaba DAMO अकादमी के नए शोध ने शरीर की छवियों को पुनः आकार देने के लिए एआई-चालित कार्यप्रवाह प्रदान किया है – कंप्यूटर विज़न क्षेत्र में यह एक दुर्लभ प्रयास है, जो वर्तमान में चेहरा-आधारित हेरफेर जैसे डीपफेक और GAN-आधारित चेहरा संपादन में व्यस्त है।

Inset in 'result' columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf

‘result’ कॉलम में, उत्पन्न ध्यान मानचित्र जो संशोधित किए जाने वाले क्षेत्रों को परिभाषित करते हैं। स्रोत: https://arxiv.org/pdf/2203.04670.pdf स्रोत: https://arxiv.org/pdf/2203.04670.pdf

शोधकर्ताओं की आर्किटेक्चर कंकाल पोज़ अनुमान का उपयोग करती है ताकि छवि संश्लेषण और संपादन प्रणालियों द्वारा मौजूदा शरीर छवियों को अवधारणात्मक और पैरामीट्रिक रूप से संभालने में आने वाली अधिक जटिलता को हल किया जा सके, कम से कम ऐसी सूक्ष्मता स्तर तक जो वास्तविक और चयनात्मक संपादन की अनुमति देती हो।

अनुमानित कंकाल मानचित्र शरीर के उन क्षेत्रों पर ध्यान केंद्रित करने में मदद करते हैं जिन्हें पुनः टच किया जाना संभावित है, जैसे ऊपरी भुजा क्षेत्र।

यह प्रणाली अंततः उपयोगकर्ता को ऐसे पैरामीटर सेट करने में सक्षम बनाती है जो पूर्ण-लंबाई या मध्य-लंबाई की तस्वीरों में वजन, मांसपेशी द्रव्यमान, या वजन वितरण की उपस्थिति को बदल सकते हैं, और कपड़े पहने या बिना कपड़े के शरीर के भागों पर मनमाने रूपांतरण उत्पन्न कर सकती है।

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.

बाएँ, इनपुट छवि; मध्य, व्युत्पन्न ध्यान क्षेत्रों का हीट‑मैप; दाएँ, परिवर्तित छवि।

इस कार्य का प्रेरणा स्रोत वह स्वचालित कार्यप्रवाह विकसित करना है जो विभिन्न मीडिया शाखाओं—फ़ैशन से लेकर मैगज़ीन‑शैली आउटपुट और प्रचार सामग्री—में फ़ोटोग्राफ़रों और प्रोडक्शन ग्राफ़िक कलाकारों द्वारा किए जाने वाले कठिन डिजिटल हेरफेर को बदल सके।

सामान्यतः, लेखक स्वीकार करते हैं कि ये रूपांतरण अक्सर फ़ोटोशॉप और अन्य पारंपरिक बिटमैप संपादकों में ‘वॉर्प’ तकनीकों के साथ लागू किए जाते हैं, और लगभग विशेष रूप से महिलाओं की छवियों पर उपयोग किए जाते हैं। परिणामस्वरूप, नई प्रक्रिया को सुविधाजनक बनाने के लिए विकसित किया गया कस्टम डेटासेट मुख्यतः महिला विषयों की तस्वीरों से बना है:

‘चूँकि शरीर रिटचिंग मुख्यतः महिलाओं द्वारा चाही जाती है, इसलिए हमारे संग्रह में अधिकांश फोटो महिलाएँ हैं, विभिन्न आयु, जातियों (अफ़्रीकी:एशियाई:कॉकेशियन = 0.33:0.35:0.32), पोज़ और वस्त्रों की विविधता को ध्यान में रखते हुए।’

The paper is titled Structure-Aware Flow Generation for Human Body Reshaping, and comes from five authors associated with Alibaba’s global DAMO academy.

डेटासेट विकास

छवि संश्लेषण और संपादन प्रणालियों में अक्सर देखा जाता है कि परियोजना की आर्किटेक्चर को एक अनुकूलित प्रशिक्षण डेटासेट की आवश्यकता होती है। लेखकों ने Unsplash स्टॉक फ़ोटोग्राफी साइट से उपयुक्त छवियों के मानक फ़ोटोशॉप हेरफेर तैयार करने के लिए तीन फ़ोटोग्राफ़रों को नियुक्त किया, जिससे 5,000 उच्च गुणवत्ता वाली छवियों का डेटासेट – शीर्षक BR-5K* – 2K रिज़ॉल्यूशन पर तैयार हुआ।

शोधकर्ता यह ज़ोर देते हैं कि इस डेटासेट पर प्रशिक्षण का उद्देश्य ‘आकर्षण’ या ‘इच्छित दिखावट’ के सामान्यीकृत संकेतकों को उत्पन्न करना नहीं है, बल्कि पेशेवर शरीर‑छवि हेरफेर से जुड़े केंद्रीय फीचर मैपिंग को निकालना है।

हालाँकि, वे स्वीकार करते हैं कि ये हेरफेर अंततः ऐसे परिवर्तनात्मक प्रक्रियाओं को दर्शाते हैं जो ‘वास्तविक’ से एक पूर्वनिर्धारित ‘आदर्श’ अवधारणा की ओर प्रगति करते हैं:

‘हमने तीन पेशेवर कलाकारों को स्वतंत्र रूप से फ़ोटोशॉप में शरीर रिटच करने के लिए आमंत्रित किया, लक्ष्य था लोकप्रिय सौंदर्यशास्त्र को पूरा करने वाले स्लीक फ़िगर बनाना, और सर्वश्रेष्ठ को ग्राउंड‑ट्रुथ के रूप में चुनना।’

चूँकि फ्रेमवर्क ने चेहरों को बिल्कुल ही नहीं छुआ, इसलिए डेटासेट में शामिल करने से पहले उन्हें धुंधला कर दिया गया।

आर्किटेक्चर और मुख्य अवधारणाएँ

सिस्टम का कार्यप्रवाह एक उच्च‑रिज़ॉल्यूशन पोर्ट्रेट को इनपुट में लेता है, उसे कम‑रिज़ॉल्यूशन में डाउनसैंपल करता है जो उपलब्ध कंप्यूटिंग संसाधनों में फिट हो सके, और अनुमानित कंकाल‑मैप पोज़ (नीचे बाएँ चित्र) तथा पार्ट अफिनिटी फ़ील्ड्स (PAFs) निकालता है, जिन्हें 2016 में Carnegie Mellon University के The Robotics Institute ने नवाचार किया था (नीचे एम्बेडेड वीडियो देखें)।

Part Affinity Fields अंगों की अभिविन्यास और व्यापक कंकाल ढाँचे के साथ सामान्य संबद्धता को परिभाषित करने में मदद करती हैं, जिससे नए प्रोजेक्ट को अतिरिक्त ध्यान/स्थानीयकरण उपकरण मिलता है।

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf

2016 के Part Affinity Fields पेपर से, भविष्यवाणी किए गए PAFs अंग की अभिविन्यास को 2D वेक्टर के हिस्से के रूप में एन्कोड करते हैं, जिसमें अंग की सामान्य स्थिति भी शामिल होती है। स्रोत: https://arxiv.org/pdf/1611.08050.pdf स्रोत: https://arxiv.org/pdf/1611.08050.pdf

भले ही उनका वजन के दिखावे से स्पष्ट संबंध न हो, कंकाल मानचित्र अंतिम रूपांतरण प्रक्रियाओं को उन शरीर के भागों की ओर निर्देशित करने में उपयोगी होते हैं जिन्हें संशोधित किया जाना है, जैसे ऊपरी भुजाएँ, नितंब और जांघें।

इसके बाद, परिणामों को प्रक्रिया के केंद्रीय बॉटलनेक में स्थित Structure Affinity Self-Attention (SASA) में फीड किया जाता है (नीचे चित्र देखें)।

SASA प्रवाह जनरेटर की संगति को नियंत्रित करता है, जिसके परिणाम फिर वॉर्पिंग मॉड्यूल (ऊपर‑दाएँ चित्र) को पास किए जाते हैं, जो डेटासेट में शामिल मैनुअल संशोधनों पर प्रशिक्षित रूपांतरणों को लागू करता है।

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.

Structure Affinity Self-Attention (SASA) मॉड्यूल संबंधित शरीर भागों पर ध्यान केंद्रित करता है, जिससे अनावश्यक या अप्रासंगिक रूपांतरणों से बचा जा सके।

आउटपुट छवि को फिर मूल 2K रिज़ॉल्यूशन पर अप‑सैंपल किया जाता है, वह प्रक्रिया 2017‑स्टाइल डीपफेक आर्किटेक्चर के समान है, जिससे DeepFaceLab जैसे लोकप्रिय पैकेज निकले हैं; अप‑सैंपल प्रक्रिया GAN संपादन फ्रेमवर्क में भी सामान्य है।

The attention network for the schema is modeled after Compositional De-Attention Networks (CODA), a 2019 US/Singapore academic collaboration with Amazon (AMZN ) AI and Microsoft.

परीक्षण

फ़्लो‑आधारित फ्रेमवर्क का परीक्षण पूर्व के फ़्लो‑आधारित तरीकों FAL और Animating Through Warping (ATW) के साथ-साथ छवि अनुवाद आर्किटेक्चर Pix2PixHD और GFLA पर किया गया, मूल्यांकन मानकों के रूप में SSIM, PSNR और LPIPS का उपयोग किया गया।

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).

प्रारंभिक परीक्षणों के परिणाम (हेडर में तीर दिशा दर्शाती है कि कम या अधिक मान बेहतर हैं)।

इन अपनाए गए मानकों के आधार पर, लेखकों की प्रणाली पूर्व आर्किटेक्चर की तुलना में बेहतर प्रदर्शन करती है।

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.

चयनित परिणाम। अधिक उच्च‑रिज़ॉल्यूशन तुलना के लिए इस लेख में लिंक किए गए मूल PDF को देखें।

स्वचालित मानकों के अतिरिक्त, शोधकर्ताओं ने एक उपयोगकर्ता अध्ययन किया (पहले चित्र में दिखाए गए परिणाम तालिका का अंतिम कॉलम), जिसमें 40 प्रतिभागियों को विभिन्न विधियों द्वारा उत्पन्न छवियों से संबंधित 100‑प्रश्न पूल में से यादृच्छिक रूप से चुने गए 30 प्रश्न दिखाए गए। 70% उत्तरदाताओं ने नई तकनीक को अधिक ‘दृश्य‑आकर्षक’ माना।

चुनौतियाँ

नया पेपर एआई‑आधारित शरीर हेरफेर में एक दुर्लभ प्रयास का प्रतिनिधित्व करता है। छवि संश्लेषण क्षेत्र वर्तमान में या तो Neural Radiance Fields (NeRF) जैसी विधियों से संपादन‑योग्य शरीर उत्पन्न करने में अधिक रुचि रखता है, या फिर GAN के लेटेंट स्पेस और चेहरे के हेरफेर के लिए ऑटोएन्कोडर की संभावनाओं की खोज में फँसा हुआ है।

लेखकों की पहल वर्तमान में केवल महसूस किए गए वजन में परिवर्तन उत्पन्न करने तक सीमित है, और उन्होंने किसी भी प्रकार की इन‑पेंटिंग तकनीक लागू नहीं की है जो किसी व्यक्ति की तस्वीर को पतला करने पर अनिवार्य रूप से उजागर होने वाली पृष्ठभूमि को पुनर्स्थापित कर सके।

हालाँकि, वे प्रस्तावित करते हैं कि पोर्ट्रेट मैटिंग और टेक्सचर इनफ़रेंस के माध्यम से पृष्ठभूमि मिश्रण इस समस्या को सहजता से हल कर सकता है, जिससे मानव ‘अपूर्णता’ द्वारा छिपे हुए विश्व के हिस्सों को पुनः स्थापित किया जा सके।

A proposed solution for restoring background that's revealed by AI-driven fat reduction.

एआई‑चालित वज़न घटाने से उजागर हुई पृष्ठभूमि को पुनर्स्थापित करने के लिए प्रस्तावित समाधान।

 

* यद्यपि प्री‑प्रिंट में डेटासेट के बारे में अधिक विवरण देने वाली सहायक सामग्री और परियोजना के अतिरिक्त उदाहरणों का उल्लेख है, इस सामग्री का स्थान पेपर में उपलब्ध नहीं कराया गया है, और संबंधित लेखक ने अभी तक हमारी पहुँच के अनुरोध का जवाब नहीं दिया है।

पहली बार प्रकाशित 10 मार्च 2022.

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai