Anderson का एंगल
मानव छवियों को एआई के साथ पुनर्स्थापित और संपादित करना

कैलिफोर्निया विश्वविद्यालय मेरेड और एडोबी के बीच एक नए सहयोग ने मानव छवि पूर्णता में राज्य की अत्याधुनिक प्रगति की पेशकश की है – छवियों के उन हिस्सों को ‘अनावरण’ करने का बहुत अध्ययन किया गया कार्य जो छिपे हुए या अवरुद्ध हैं, जैसे कि आभासी प्रयास, एनिमेशन और फोटो संपादन जैसे उद्देश्यों के लिए।

क्षतिग्रस्त छवियों की मरम्मत करने या उन्हें उपयोगकर्ता की इच्छा के अनुसार बदलने के अलावा, मानव छवि पूर्णता प्रणाली जैसे CompleteMe एक संदर्भ छवि (जैसे इन दो उदाहरणों में मध्य स्तंभ में) के माध्यम से मौजूदा छवियों में नई पोशाक लगा सकती हैं। ये उदाहरण नए शोध पत्र के विस्तृत पूरक पीडीएफ से हैं। स्रोत: https://liagm.github.io/CompleteMe/pdf/supp.pdf
नई दृष्टिकोण, CompleteMe: संदर्भ-आधारित मानव छवि पूर्णता नामक, संदर्भ छवियों का उपयोग करता है ताकि प्रणाली को यह सुझाव दिया जा सके कि छिपे हुए या गायब हिस्से को किस सामग्री से बदलना चाहिए (जो फैशन-आधारित प्रयास फ्रेमवर्क के लिए इसकी उपयुक्तता के कारण)।

CompleteMe प्रणाली संदर्भ सामग्री को मानव छवि के अवरुद्ध या अवरुद्ध हिस्से के अनुरूप बना सकती है।
नया प्रणाली एक दोहरी यू-नेट आर्किटेक्चर और एक क्षेत्र-फोकस्ड ध्यान (आरएफए) ब्लॉक का उपयोग करती है जो पुनर्स्थापना उदाहरण के प्रासंगिक क्षेत्र में संसाधनों को संगठित करता है।
शोधकर्ताओं ने संदर्भ-आधारित पूर्णता कार्यों का मूल्यांकन करने के लिए एक नई और चुनौतीपूर्ण बेंचमार्क प्रणाली की भी पेशकश की है (क्योंकि CompleteMe कंप्यूटर दृष्टि में एक मौजूदा और चल रहे शोध श्रृंखला का हिस्सा है, हालांकि इसमें अब तक कोई बेंचमार्क योजना नहीं है)।
परीक्षणों में, और एक अच्छी तरह से स्केल किए गए उपयोगकर्ता अध्ययन में, नई विधि अधिकांश मीट्रिक में आगे निकल गई, और समग्र रूप से आगे निकल गई। कुछ मामलों में, प्रतिद्वंद्वी तरीके पूरी तरह से भ्रमित हो गए थे।

पूरक सामग्री से: AnyDoor विधि एक संदर्भ छवि की व्याख्या करने में विशेष कठिनाई का सामना करती है।
शोध पत्र में कहा गया है:
‘हमारे बेंचमार्क पर व्यापक प्रयोग यह प्रदर्शित करते हैं कि CompleteMe राज्य की कला के तरीकों को पार करता है, दोनों संदर्भ-आधारित और गैर-संदर्भ-आधारित, मात्रात्मक मीट्रिक, गुणात्मक परिणाम और उपयोगकर्ता अध्ययन के संदर्भ में।
‘विशेष रूप से, जटिल मुद्राओं, जटिल कपड़े पैटर्न और विशिष्ट सहायक उपकरण से जुड़े चुनौतीपूर्ण परिदृश्यों में, हमारा मॉडल लगातार बेहतर दृश्य विश्वास और सेमेंटिक संगति प्राप्त करता है।’
दुर्भाग्य से, परियोजना का गिटहब उपस्थिति में कोई कोड नहीं है, न ही इसका वादा है, और पहल, जिसके पास एक मामूली परियोजना पृष्ठ भी है, एक स्वामित्व वास्तुकला के रूप में फ्रेम किया गया है।

नए प्रणाली के विषयपरक प्रदर्शन के आगे के उदाहरण पिछले तरीकों के खिलाफ। इस लेख में बाद में अधिक विवरण।
विधि
CompleteMe फ्रेमवर्क एक संदर्भ यू-नेट द्वारा समर्थित है, जो सहायक सामग्री को प्रक्रिया में एकीकृत करने को संभालता है, और एक सुसंगत यू-नेट, जो एक व्यापक श्रृंखला की प्रक्रियाओं को समायोजित करता है जो अंतिम परिणाम प्राप्त करने के लिए, नीचे दी गई概念 स्कीमा में चित्रित किया गया है:

CompleteMe के लिए概念 स्कीमा। स्रोत: https://arxiv.org/pdf/2504.20042
प्रणाली सबसे पहले मास्क्ड इनपुट छवि को एक लेटेंट प्रतिनिधित्व में एन्कोड करती है। उसी समय, संदर्भ यू-नेट विभिन्न संदर्भ छवियों को संसाधित करता है – प्रत्येक विभिन्न शरीर क्षेत्रों को दिखाता है – विस्तृत स्थान विशेषताओं को निकालने के लिए।
इन विशेषताओं को ‘पूर्ण’ यू-नेट में निहित एक क्षेत्र-फोकस्ड ध्यान ब्लॉक के माध्यम से पारित किया जाता है, जहां वे संबंधित क्षेत्र मास्क का उपयोग करके चयनात्मक रूप से मास्क किए जाते हैं, यह सुनिश्चित करते हुए कि मॉडल केवल संदर्भ छवियों में प्रासंगिक क्षेत्रों पर ध्यान केंद्रित करता है।
मास्क्ड विशेषताएं तब वैश्विक सीएलआईपी-व्युत्पन्न सेमेंटिक विशेषताओं के साथ विच्छिन्न क्रॉस-ध्यान के माध्यम से एकीकृत की जाती हैं, जिससे मॉडल को खोए हुए सामग्री का पुनर्निर्माण करने की अनुमति मिलती है जिसमें दोनों महीने का विवरण और सेमेंटिक संगति होती है।
वास्तविकता और मजबूती को बढ़ाने के लिए, इनपुट मास्किंग प्रक्रिया यादृच्छिक ग्रिड-आधारित अवरोधों को मानव शरीर के आकार मास्क के साथ जोड़ती है, प्रत्येक को समान संभावना के साथ लागू किया जाता है, जिससे मॉडल द्वारा पूरा किए जाने वाले लापता क्षेत्रों की जटिलता बढ़ जाती है।
संदर्भ के लिए केवल
संदर्भ-आधारित छवि पेंटिंग के लिए पिछले तरीकों ने आमतौर पर सेमेंटिक-स्तर एन्कोडर पर भरोसा किया। इस प्रकार की परियोजनाओं में सीएलआईपी शामिल है, और डीआईएनओवी2, दोनों संदर्भ छवियों से वैश्विक विशेषताओं को निकालते हैं, लेकिन अक्सर सटीक पहचान संरक्षण के लिए आवश्यक महीने स्थानिक विवरण खो देते हैं।

पुराने डीआईएनओवी2 दृष्टिकोण के रिलीज़ पत्र से, जो नए अध्ययन में तुलना परीक्षणों में शामिल है: रंगीन ओवरले प्रत्येक स्तंभ के भीतर छवि पैच पर लागू प्रिंसिपल घटक विश्लेषण (पीसीए) के पहले तीन मुख्य घटक दिखाते हैं, यह उजागर करते हुए कि डीआईएनओवी2 विभिन्न छवियों में समान वस्तु भागों को एक साथ समूहित करता है, भाव, शैली या प्रस्तुति में अंतर के बावजूद, संबंधित क्षेत्रों (जैसे पंख, अंग या पहियों) को लगातार मेल खाता है, यह प्रदर्शित करता है कि मॉडल की क्षमता निगरानी के बिना भाग-आधारित संरचना सीखने की। स्रोत: https://arxiv.org/pdf/2304.07193
CompleteMe इस पहलू को संबोधित करता है एक विशेष संदर्भ यू-नेट के माध्यम से, जो स्थिर प्रसार 1.5 से प्रारंभ किया जाता है, लेकिन प्रसार शोर चरण* के बिना संचालित होता है।
प्रत्येक संदर्भ छवि, विभिन्न शरीर क्षेत्रों को कवर करती है, विस्तृत लेटेंट विशेषताओं में एन्कोड की जाती है इस यू-नेट के माध्यम से। वैश्विक सेमेंटिक विशेषताएं सीएलआईपी का उपयोग करके अलग से निकाली जाती हैं, और दोनों सेट की विशेषताएं कैश की जाती हैं क्रॉस-ध्यान एकीकरण के दौरान कुशल उपयोग के लिए। इस प्रकार, प्रणाली लचीले ढंग से कई संदर्भ इनपुट को समायोजित कर सकती है, जबकि महीन-दानेदार उपस्थिति जानकारी को संरक्षित करती है।
ऑर्केस्ट्रेशन
सुसंगत यू-नेट पूर्णता प्रक्रिया के अंतिम चरणों का प्रबंधन करता है। स्थिर प्रसार 1.5 के इनपेंटिंग संस्करण से अनुकूलित, यह लेटेंट रूप में मास्क्ड स्रोत छवि को इनपुट के रूप में लेता है, साथ ही साथ संदर्भ छवियों से विस्तृत स्थानिक विशेषताएं और सीएलआईपी एन्कोडर द्वारा निकाली गई वैश्विक सेमेंटिक विशेषताएं।
इन विभिन्न इनपुट को आरएफए ब्लॉक के माध्यम से एक साथ लाया जाता है, जो संदर्भ सामग्री के सबसे प्रासंगिक क्षेत्रों पर मॉडल का ध्यान केंद्रित करने में एक महत्वपूर्ण भूमिका निभाता है।
ध्यान तंत्र में प्रवेश करने से पहले, संदर्भ विशेषताओं को स्पष्ट रूप से मास्क किया जाता है ताकि असंबंधित क्षेत्रों को हटाया जा सके, और फिर स्रोत छवि के लेटेंट प्रतिनिधित्व के साथ जोड़ा जाता है, यह सुनिश्चित करते हुए कि ध्यान यथासंभव सटीक रूप से निर्देशित किया जाता है।
इस एकीकरण को बढ़ाने के लिए, CompleteMe आईपी-एडेप्टर फ्रेमवर्क से अनुकूलित एक विच्छिन्न क्रॉस-ध्यान तंत्र को एकीकृत करता है:

आईपी-एडेप्टर, जिसका एक हिस्सा CompleteMe में शामिल किया गया है, पिछले तीन वर्षों में लेटेंट प्रसार मॉडल आर्किटेक्चर में विकास के सबसे सफल और अक्सर उपयोग किए जाने वाले परियोजनाओं में से एक है। स्रोत: https://ip-adapter.github.io/
यह मॉडल को स्थानिक रूप से विस्तृत दृश्य विशेषताओं और व्यापक सेमेंटिक संदर्भ को अलग-अलग ध्यान धाराओं के माध्यम से संसाधित करने की अनुमति देता है, जो बाद में एक साथ मिलकर एक सुसंगत पुनर्निर्माण का परिणाम देते हैं, जो लेखकों का दावा है कि पहचान और महीन-दानेदार विवरण दोनों को संरक्षित करता है।
बेंचमार्किंग
संदर्भ-आधारित मानव पूर्णता के लिए एक उपयुक्त डेटासेट की अनुपस्थिति में, शोधकर्ताओं ने अपना खुद का प्रस्ताव दिया है। बेंचमार्क (अनाम) का निर्माण एडोबी रिसर्च के 2023 यूनिह्यूमन परियोजना के लिए डिज़ाइन किए गए डब्ल्यूपोज़ डेटासेट से चुनिंदा छवि जोड़े को क्यूरेट करके किया गया था।

एडोबी रिसर्च 2023 यूनिह्यूमन परियोजना से मुद्राओं के उदाहरण। स्रोत: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
शोधकर्ताओं ने मास्क किए गए क्षेत्रों को इंगित करने के लिए स्रोत मास्क स्वयं खींचे, अंततः 417 त्रिपक्षीय छवि समूह प्राप्त किए जो एक स्रोत छवि, मास्क और संदर्भ छवि का गठन करते हैं।

संदर्भ डब्ल्यूपोज़ डेटासेट से व्युत्पन्न और शोधकर्ताओं द्वारा व्यापक रूप से क्यूरेट किए गए समूहों के दो उदाहरण।
लेखकों ने स्रोत छवियों का वर्णन करने वाले पाठ प्रॉम्प्ट उत्पन्न करने के लिए एलएलएवीए बड़े भाषा मॉडल (एलएलएम) का उपयोग किया।
मीट्रिक का उपयोग किया गया था जो सामान्य से अधिक व्यापक था; इसके अलावा सामान्य पीक सिग्नल-टू-शोर अनुपात (पीएसएनआर), संरचनात्मक समानता सूचकांक (एसएसआईएम) और सीखा हुआ संवेदी छवि पैच समानता (एलपीआईपीएस, इस मामले में मास्क्ड क्षेत्रों का मूल्यांकन करने के लिए), शोधकर्ताओं ने डीआईएनओ का उपयोग समानता स्कोर के लिए किया; ड्रीमसिम पीढ़ी परिणाम मूल्यांकन के लिए; और सीएलआईपी।
डेटा और परीक्षण
काम का परीक्षण करने के लिए, लेखकों ने डिफ़ॉल्ट स्टेबल डिफ्यूजन वी1.5 मॉडल और 1.5 इनपेंटिंग मॉडल दोनों का उपयोग किया। प्रणाली के छवि एन्कोडर ने सीएलआईपी विजन मॉडल का उपयोग किया, साथ ही प्रोजेक्शन परतें – मॉडल द्वारा उपयोग की जाने वाली आंतरिक विशेषता आयामों के साथ मेल खाने के लिए सीएलआईपी आउटपुट को पुनः आकार देने या संरेखित करने के लिए मामूली न्यूरल नेटवर्क।
प्रशिक्षण 30,000 पुनरावृत्तियों के लिए आठ एनवीडिया ए100† जीपीयू पर हुआ, मीन स्क्वायर्ड त्रुटि (एमएसई) हानि द्वारा पर्यवेक्षित, 64 के बैच आकार पर और 2×10-5 की सीखने की दर पर। विभिन्न तत्वों को प्रशिक्षण के दौरान यादृच्छिक रूप से छोड़ दिया गया, ताकि प्रणाली ओवरफिटिंग से बच सके।
डेटासेट को पार्ट्स टू होल डेटासेट से बदल दिया गया था, जो खुद डीपफैशन-मल्टीमोडल डेटासेट पर आधारित था।

CompleteMe के लिए क्यूरेटेड डेटा के विकास में उपयोग किए जाने वाले पार्ट्स टू होल डेटासेट के उदाहरण। स्रोत: https://huanngzh.github.io/Parts2Whole/
लेखकों का कहना है:
‘हमारी आवश्यकताओं को पूरा करने के लिए, हमने प्रशिक्षण जोड़े को पुनः बनाया जो अवरुद्ध छवियों को शामिल करते हैं जिनमें मानव उपस्थिति के विभिन्न पहलुओं को कैप्चर करने वाली कई संदर्भ छवियां होती हैं, साथ ही उनके लघु पाठ लेबल भी होते हैं।
‘प्रत्येक नमूने में हमारे प्रशिक्षण डेटा में छह उपस्थिति प्रकार शामिल हैं: ऊपरी शरीर के कपड़े, निचले शरीर के कपड़े, पूरे शरीर के कपड़े, बाल या सिर के आभूषण, चेहरा, और जूते। मास्किंग रणनीति के लिए, हम 50% यादृच्छिक ग्रिड मास्किंग लागू करते हैं 1 से 30 बार के बीच, जबकि अन्य 50% के लिए, हम मानव शरीर के आकार मास्क का उपयोग मास्किंग जटिलता बढ़ाने के लिए करते हैं।
‘निर्माण पाइपलाइन के बाद, हमें 40,000 छवि जोड़े प्रशिक्षण के लिए प्राप्त हुए।’
प्रतिद्वंद्वी पूर्व गैर-संदर्भ तरीकों का परीक्षण किया गया था बड़े अवरुद्ध मानव छवि पूर्णता (एलओएचसी) और प्लग-एंड-प्ले छवि इनपेंटिंग मॉडल ब्रशनेट थे; संदर्भ-आधारित मॉडल परीक्षण किए गए थे पेंट-बाय-एक्जाम्पल; एंडीडोर; लेफ्ट्रेफिल; और मिमिकब्रश.
लेखकों ने पहले मीट्रिक पर एक मात्रात्मक तुलना के साथ शुरुआत की:

प्रारंभिक मात्रात्मक तुलना के परिणाम।
मात्रात्मक मूल्यांकन के संबंध में, लेखकों का उल्लेख है कि CompleteMe अधिकांश संवेदी मीट्रिक में सबसे उच्च स्कोर प्राप्त करता है, जिनमें सीएलआईपी-आई, डीआईएनओ, ड्रीमसिम और एलपीआईपीएस शामिल हैं, जो संदर्भ छवि के साथ आउटपुट और सेमेंटिक संरेखण और उपस्थिति विश्वास को पकड़ने के लिए अभिप्रेत हैं।
हालांकि, मॉडल सभी बेंचमार्क पर सभी बेसलाइन को पार नहीं करता है। विशेष रूप से, ब्रशनेट सीएलआईपी-टी पर सबसे उच्च स्कोर करता है, लेफ्ट्रेफिल एसएसआईएम और पीएसएनआर में अग्रणी है, और मिमिकब्रश सीएलआईपी-आई पर थोड़ा बेहतर प्रदर्शन करता है।
जबकि CompleteMe समग्र रूप से मजबूत परिणाम दिखाता है, प्रदर्शन अंतर कुछ मामलों में न्यूनतम है, और कुछ मीट्रिक अभी भी प्रतिद्वंद्वी पूर्व तरीकों द्वारा नेतृत्व किया जाता है। शायद अनुचित रूप से, लेखक इन परिणामों को CompleteMe की ताकत के संतुलित प्रदर्शन के प्रमाण के रूप में प्रस्तुत करते हैं दोनों संरचनात्मक और संवेदी आयामों में।
गुणात्मक परीक्षणों के लिए चित्र इस अध्ययन में पुन: उत्पादित करने के लिए बहुत अधिक हैं, और हम पाठक को स्रोत पत्र और व्यापक पूरक पीडीएफ दोनों के लिए संदर्भित करते हैं, जिसमें कई अतिरिक्त गुणात्मक उदाहरण शामिल हैं।
हम मुख्य पत्र में प्रस्तुत किए गए प्राथमिक गुणात्मक उदाहरणों को हाइलाइट करते हैं, साथ ही इस लेख की शुरुआत में पेश किए गए पूल से कुछ अतिरिक्त मामलों का चयन करते हैं:

मुख्य पत्र में प्रस्तुत किए गए प्रारंभिक गुणात्मक परिणाम। कृपया बेहतर रिज़ॉल्यूशन के लिए स्रोत पत्र का संदर्भ लें।
प्रस्तुत गुणात्मक परिणामों पर, लेखकों का टिप्पणी है:
‘दिए गए मास्क्ड इनपुट के साथ, ये गैर-संदर्भ तरीके छवि प्राथमिकों या पाठ प्रॉम्प्ट का उपयोग करके मास्क्ड क्षेत्रों के लिए संभावित सामग्री उत्पन्न करते हैं।
‘हालांकि, जैसा कि लाल बॉक्स में इंगित किया गया है, वे विशिष्ट विवरण जैसे टैटू या विशिष्ट कपड़े पैटर्न को पुनरुत्पादित नहीं कर सकते हैं, क्योंकि उनके पास संदर्भ छवियां नहीं हैं जो समान जानकारी के पुनर्निर्माण को मार्गदर्शन करें।’
एक दूसरी तुलना, जिसका एक हिस्सा नीचे दिखाया गया है, चार संदर्भ-आधारित तरीकों पेंट-बाय-एक्जाम्पल, एंडीडोर, लेफ्ट्रेफिल और मिमिकब्रश पर केंद्रित है। यहां केवल एक संदर्भ छवि और एक पाठ प्रॉम्प्ट प्रदान किया गया था।

संदर्भ-आधारित तरीकों के साथ गुणात्मक तुलना। CompleteMe अधिक वास्तविक पूर्णता और संदर्भ छवि से विशिष्ट विवरण को बेहतर ढंग से संरक्षित करता है। लाल बॉक्स क्षेत्रों को विशेष रूप से रुचि के रूप में उजागर करते हैं।
लेखकों का कहना है:
‘एक मास्क्ड मानव छवि और एक संदर्भ छवि दिए जाने पर, अन्य तरीके संभावित सामग्री उत्पन्न कर सकते हैं, लेकिन अक्सर संदर्भ से संदर्भ जानकारी को सटीक रूप से संरक्षित करने में विफल रहते हैं।
‘कुछ मामलों में, वे असंबंधित सामग्री उत्पन्न करते हैं या संदर्भ छवि से मानव शरीर के संबंधित भागों को गलत तरीके से मैप करते हैं। इसके विपरीत, CompleteMe मास्क्ड क्षेत्र को पूरा करके संदर्भ जानकारी को सटीक रूप से संरक्षित करता है और संदर्भ छवि से मानव शरीर के संबंधित भागों को सही ढंग से मैप करता है।’
मॉडल को मानव धारणा के साथ कितनी अच्छी तरह संरेखित करता है, इसका मूल्यांकन करने के लिए, लेखकों ने 15 एनोटेटर और 2,895 नमूना जोड़े के साथ एक उपयोगकर्ता अध्ययन आयोजित किया। प्रत्येक जोड़ी CompleteMe के आउटपुट की तुलना चार संदर्भ-आधारित बेसलाइन में से एक के साथ करती है: पेंट-बाय-एक्जाम्पल, एंडीडोर, लेफ्ट्रेफिल, या मिमिकब्रश।
एनोटेटरों ने प्रत्येक परिणाम का मूल्यांकन किया पूर्ण क्षेत्र की दृश्य गुणवत्ता और संदर्भ से पहचान विशेषताओं को संरक्षित करने की सीमा के आधार पर – और यहां, समग्र गुणवत्ता और पहचान का मूल्यांकन करते हुए, CompleteMe ने एक अधिक निर्णायक परिणाम प्राप्त किया:

उपयोगकर्ता अध्ययन के परिणाम।
निष्कर्ष
यदि कुछ भी हो, तो इस अध्ययन में गुणात्मक परिणाम अपनी भारी मात्रा से कमजोर हो जाते हैं, क्योंकि करीब से जांच यह दर्शाती है कि नई प्रणाली इस सापेक्ष निचे लेकिन गर्मजोशी से पीछा किए गए क्षेत्र में एक प्रभावी प्रवेश है।
हालांकि, यह पूरक सामग्री में प्रस्तुत परिणामों की भारी मात्रा को देखने और मूल पीडीएफ में ज़ूम इन करने के लिए थोड़ा अतिरिक्त ध्यान देने की आवश्यकता है ताकि यह सराहना की जा सके कि पिछले तरीकों (लगभग सभी मामलों में) की तुलना में संदर्भ सामग्री को अवरुद्ध क्षेत्र में कितनी अच्छी तरह से अनुकूलित किया जाता है।

हम पाठक को पूरक सामग्री में प्रस्तुत परिणामों की जांच करने की दृढ़ता से सलाह देते हैं।
* यह देखना दिलचस्प है कि कैसे अब पुरानी वी1.5 रिलीज़ शोधकर्ताओं के लिए पसंदीदा बनी हुई है – частично विरासत जैसे-जैसे परीक्षण के कारण, लेकिन также इसलिए कि यह सभी स्थिर प्रसार पुनरावलोकनों में सबसे कम सेंसर और संभावित रूप से सबसे आसानी से प्रशिक्षित है, और एफओएसएस फ्लक्स रिलीज़ के सेंसरशिप होबलिंग को साझा नहीं करता है।
† वीआरएएम विनिर्देश नहीं दिया गया है – यह प्रति कार्ड 40GB या 80GB होगा।
मंगलवार, 29 अप्रैल, 2025 को पहली बार प्रकाशित












