Anderson का एंगल

मानव छवियों को एआई के साथ पुनर्स्थापित और संपादित करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

कैलिफोर्निया विश्वविद्यालय मेरेड और एडोबी के बीच एक नए सहयोग ने मानव छवि पूर्णता में राज्य की अत्याधुनिक प्रगति की पेशकश की है – छवियों के उन हिस्सों को ‘अनावरण’ करने का बहुत अध्ययन किया गया कार्य जो छिपे हुए या अवरुद्ध हैं, जैसे कि आभासी प्रयास, एनिमेशन और फोटो संपादन जैसे उद्देश्यों के लिए।

क्षतिग्रस्त छवियों की मरम्मत करने या उन्हें उपयोगकर्ता की इच्छा के अनुसार बदलने के अलावा, मानव छवि पूर्णता प्रणाली जैसे CompleteMe एक संदर्भ छवि (जैसे इन दो उदाहरणों में मध्य स्तंभ में) के माध्यम से मौजूदा छवियों में नई पोशाक लगा सकती हैं। ये उदाहरण नए शोध पत्र के विस्तृत पूरक पीडीएफ से हैं। स्रोत: https://liagm.github.io/CompleteMe/pdf/supp.pdf

क्षतिग्रस्त छवियों की मरम्मत करने या उन्हें उपयोगकर्ता की इच्छा के अनुसार बदलने के अलावा, मानव छवि पूर्णता प्रणाली जैसे CompleteMe एक संदर्भ छवि (जैसे इन दो उदाहरणों में मध्य स्तंभ में) के माध्यम से मौजूदा छवियों में नई पोशाक लगा सकती हैं। ये उदाहरण नए शोध पत्र के विस्तृत पूरक पीडीएफ से हैं। स्रोत: https://liagm.github.io/CompleteMe/pdf/supp.pdf

नई दृष्टिकोण, CompleteMe: संदर्भ-आधारित मानव छवि पूर्णता नामक, संदर्भ छवियों का उपयोग करता है ताकि प्रणाली को यह सुझाव दिया जा सके कि छिपे हुए या गायब हिस्से को किस सामग्री से बदलना चाहिए (जो फैशन-आधारित प्रयास फ्रेमवर्क के लिए इसकी उपयुक्तता के कारण)।

CompleteMe प्रणाली संदर्भ सामग्री को मानव छवि के अवरुद्ध या अवरुद्ध हिस्से के अनुरूप बना सकती है।

CompleteMe प्रणाली संदर्भ सामग्री को मानव छवि के अवरुद्ध या अवरुद्ध हिस्से के अनुरूप बना सकती है।

नया प्रणाली एक दोहरी यू-नेट आर्किटेक्चर और एक क्षेत्र-फोकस्ड ध्यान (आरएफए) ब्लॉक का उपयोग करती है जो पुनर्स्थापना उदाहरण के प्रासंगिक क्षेत्र में संसाधनों को संगठित करता है।

शोधकर्ताओं ने संदर्भ-आधारित पूर्णता कार्यों का मूल्यांकन करने के लिए एक नई और चुनौतीपूर्ण बेंचमार्क प्रणाली की भी पेशकश की है (क्योंकि CompleteMe कंप्यूटर दृष्टि में एक मौजूदा और चल रहे शोध श्रृंखला का हिस्सा है, हालांकि इसमें अब तक कोई बेंचमार्क योजना नहीं है)।

परीक्षणों में, और एक अच्छी तरह से स्केल किए गए उपयोगकर्ता अध्ययन में, नई विधि अधिकांश मीट्रिक में आगे निकल गई, और समग्र रूप से आगे निकल गई। कुछ मामलों में, प्रतिद्वंद्वी तरीके पूरी तरह से भ्रमित हो गए थे।

पूरक सामग्री से: AnyDoor विधि एक संदर्भ छवि की व्याख्या करने में विशेष कठिनाई का सामना करती है।

पूरक सामग्री से: AnyDoor विधि एक संदर्भ छवि की व्याख्या करने में विशेष कठिनाई का सामना करती है।

शोध पत्र में कहा गया है:

‘हमारे बेंचमार्क पर व्यापक प्रयोग यह प्रदर्शित करते हैं कि CompleteMe राज्य की कला के तरीकों को पार करता है, दोनों संदर्भ-आधारित और गैर-संदर्भ-आधारित, मात्रात्मक मीट्रिक, गुणात्मक परिणाम और उपयोगकर्ता अध्ययन के संदर्भ में।

‘विशेष रूप से, जटिल मुद्राओं, जटिल कपड़े पैटर्न और विशिष्ट सहायक उपकरण से जुड़े चुनौतीपूर्ण परिदृश्यों में, हमारा मॉडल लगातार बेहतर दृश्य विश्वास और सेमेंटिक संगति प्राप्त करता है।’

दुर्भाग्य से, परियोजना का गिटहब उपस्थिति में कोई कोड नहीं है, न ही इसका वादा है, और पहल, जिसके पास एक मामूली परियोजना पृष्ठ भी है, एक स्वामित्व वास्तुकला के रूप में फ्रेम किया गया है।

नए प्रणाली के विषयपरक प्रदर्शन के आगे के उदाहरण पिछले तरीकों के खिलाफ। इस लेख में बाद में अधिक विवरण।

नए प्रणाली के विषयपरक प्रदर्शन के आगे के उदाहरण पिछले तरीकों के खिलाफ। इस लेख में बाद में अधिक विवरण।

विधि

CompleteMe फ्रेमवर्क एक संदर्भ यू-नेट द्वारा समर्थित है, जो सहायक सामग्री को प्रक्रिया में एकीकृत करने को संभालता है, और एक सुसंगत यू-नेट, जो एक व्यापक श्रृंखला की प्रक्रियाओं को समायोजित करता है जो अंतिम परिणाम प्राप्त करने के लिए, नीचे दी गई概念 स्कीमा में चित्रित किया गया है:

CompleteMe के लिए概念 स्कीमा। स्रोत: https://arxiv.org/pdf/2504.20042

CompleteMe के लिए概念 स्कीमा। स्रोत: https://arxiv.org/pdf/2504.20042

प्रणाली सबसे पहले मास्क्ड इनपुट छवि को एक लेटेंट प्रतिनिधित्व में एन्कोड करती है। उसी समय, संदर्भ यू-नेट विभिन्न संदर्भ छवियों को संसाधित करता है – प्रत्येक विभिन्न शरीर क्षेत्रों को दिखाता है – विस्तृत स्थान विशेषताओं को निकालने के लिए।

इन विशेषताओं को ‘पूर्ण’ यू-नेट में निहित एक क्षेत्र-फोकस्ड ध्यान ब्लॉक के माध्यम से पारित किया जाता है, जहां वे संबंधित क्षेत्र मास्क का उपयोग करके चयनात्मक रूप से मास्क किए जाते हैं, यह सुनिश्चित करते हुए कि मॉडल केवल संदर्भ छवियों में प्रासंगिक क्षेत्रों पर ध्यान केंद्रित करता है।

मास्क्ड विशेषताएं तब वैश्विक सीएलआईपी-व्युत्पन्न सेमेंटिक विशेषताओं के साथ विच्छिन्न क्रॉस-ध्यान के माध्यम से एकीकृत की जाती हैं, जिससे मॉडल को खोए हुए सामग्री का पुनर्निर्माण करने की अनुमति मिलती है जिसमें दोनों महीने का विवरण और सेमेंटिक संगति होती है।

वास्तविकता और मजबूती को बढ़ाने के लिए, इनपुट मास्किंग प्रक्रिया यादृच्छिक ग्रिड-आधारित अवरोधों को मानव शरीर के आकार मास्क के साथ जोड़ती है, प्रत्येक को समान संभावना के साथ लागू किया जाता है, जिससे मॉडल द्वारा पूरा किए जाने वाले लापता क्षेत्रों की जटिलता बढ़ जाती है।

संदर्भ के लिए केवल

संदर्भ-आधारित छवि पेंटिंग के लिए पिछले तरीकों ने आमतौर पर सेमेंटिक-स्तर एन्कोडर पर भरोसा किया। इस प्रकार की परियोजनाओं में सीएलआईपी शामिल है, और डीआईएनओवी2, दोनों संदर्भ छवियों से वैश्विक विशेषताओं को निकालते हैं, लेकिन अक्सर सटीक पहचान संरक्षण के लिए आवश्यक महीने स्थानिक विवरण खो देते हैं।

पुराने डीआईएनओवी2 दृष्टिकोण के रिलीज़ पत्र से, जो नए अध्ययन में तुलना परीक्षणों में शामिल है: रंगीन ओवरले प्रत्येक स्तंभ के भीतर छवि पैच पर लागू प्रिंसिपल घटक विश्लेषण (पीसीए) के पहले तीन मुख्य घटक दिखाते हैं, यह उजागर करते हुए कि डीआईएनओवी2 विभिन्न छवियों में समान वस्तु भागों को एक साथ समूहित करता है, भाव, शैली या प्रस्तुति में अंतर के बावजूद, संबंधित क्षेत्रों (जैसे पंख, अंग या पहियों) को लगातार मेल खाता है, यह प्रदर्शित करता है कि मॉडल की क्षमता निगरानी के बिना भाग-आधारित संरचना सीखने की। स्रोत: https://arxiv.org/pdf/2304.07193

पुराने डीआईएनओवी2 दृष्टिकोण के रिलीज़ पत्र से, जो नए अध्ययन में तुलना परीक्षणों में शामिल है: रंगीन ओवरले प्रत्येक स्तंभ के भीतर छवि पैच पर लागू प्रिंसिपल घटक विश्लेषण (पीसीए) के पहले तीन मुख्य घटक दिखाते हैं, यह उजागर करते हुए कि डीआईएनओवी2 विभिन्न छवियों में समान वस्तु भागों को एक साथ समूहित करता है, भाव, शैली या प्रस्तुति में अंतर के बावजूद, संबंधित क्षेत्रों (जैसे पंख, अंग या पहियों) को लगातार मेल खाता है, यह प्रदर्शित करता है कि मॉडल की क्षमता निगरानी के बिना भाग-आधारित संरचना सीखने की। स्रोत: https://arxiv.org/pdf/2304.07193

CompleteMe इस पहलू को संबोधित करता है एक विशेष संदर्भ यू-नेट के माध्यम से, जो स्थिर प्रसार 1.5 से प्रारंभ किया जाता है, लेकिन प्रसार शोर चरण* के बिना संचालित होता है।

प्रत्येक संदर्भ छवि, विभिन्न शरीर क्षेत्रों को कवर करती है, विस्तृत लेटेंट विशेषताओं में एन्कोड की जाती है इस यू-नेट के माध्यम से। वैश्विक सेमेंटिक विशेषताएं सीएलआईपी का उपयोग करके अलग से निकाली जाती हैं, और दोनों सेट की विशेषताएं कैश की जाती हैं क्रॉस-ध्यान एकीकरण के दौरान कुशल उपयोग के लिए। इस प्रकार, प्रणाली लचीले ढंग से कई संदर्भ इनपुट को समायोजित कर सकती है, जबकि महीन-दानेदार उपस्थिति जानकारी को संरक्षित करती है।

ऑर्केस्ट्रेशन

सुसंगत यू-नेट पूर्णता प्रक्रिया के अंतिम चरणों का प्रबंधन करता है। स्थिर प्रसार 1.5 के इनपेंटिंग संस्करण से अनुकूलित, यह लेटेंट रूप में मास्क्ड स्रोत छवि को इनपुट के रूप में लेता है, साथ ही साथ संदर्भ छवियों से विस्तृत स्थानिक विशेषताएं और सीएलआईपी एन्कोडर द्वारा निकाली गई वैश्विक सेमेंटिक विशेषताएं।

इन विभिन्न इनपुट को आरएफए ब्लॉक के माध्यम से एक साथ लाया जाता है, जो संदर्भ सामग्री के सबसे प्रासंगिक क्षेत्रों पर मॉडल का ध्यान केंद्रित करने में एक महत्वपूर्ण भूमिका निभाता है।

ध्यान तंत्र में प्रवेश करने से पहले, संदर्भ विशेषताओं को स्पष्ट रूप से मास्क किया जाता है ताकि असंबंधित क्षेत्रों को हटाया जा सके, और फिर स्रोत छवि के लेटेंट प्रतिनिधित्व के साथ जोड़ा जाता है, यह सुनिश्चित करते हुए कि ध्यान यथासंभव सटीक रूप से निर्देशित किया जाता है।

इस एकीकरण को बढ़ाने के लिए, CompleteMe आईपी-एडेप्टर फ्रेमवर्क से अनुकूलित एक विच्छिन्न क्रॉस-ध्यान तंत्र को एकीकृत करता है:

आईपी-एडेप्टर, जिसका एक हिस्सा CompleteMe में शामिल किया गया है, पिछले तीन वर्षों में लेटेंट प्रसार मॉडल आर्किटेक्चर में विकास के सबसे सफल और अक्सर उपयोग किए जाने वाले परियोजनाओं में से एक है। स्रोत: https://ip-adapter.github.io/

आईपी-एडेप्टर, जिसका एक हिस्सा CompleteMe में शामिल किया गया है, पिछले तीन वर्षों में लेटेंट प्रसार मॉडल आर्किटेक्चर में विकास के सबसे सफल और अक्सर उपयोग किए जाने वाले परियोजनाओं में से एक है। स्रोत: https://ip-adapter.github.io/

यह मॉडल को स्थानिक रूप से विस्तृत दृश्य विशेषताओं और व्यापक सेमेंटिक संदर्भ को अलग-अलग ध्यान धाराओं के माध्यम से संसाधित करने की अनुमति देता है, जो बाद में एक साथ मिलकर एक सुसंगत पुनर्निर्माण का परिणाम देते हैं, जो लेखकों का दावा है कि पहचान और महीन-दानेदार विवरण दोनों को संरक्षित करता है।

बेंचमार्किंग

संदर्भ-आधारित मानव पूर्णता के लिए एक उपयुक्त डेटासेट की अनुपस्थिति में, शोधकर्ताओं ने अपना खुद का प्रस्ताव दिया है। बेंचमार्क (अनाम) का निर्माण एडोबी रिसर्च के 2023 यूनिह्यूमन परियोजना के लिए डिज़ाइन किए गए डब्ल्यूपोज़ डेटासेट से चुनिंदा छवि जोड़े को क्यूरेट करके किया गया था।

एडोबी रिसर्च 2023 यूनिह्यूमन परियोजना से मुद्राओं के उदाहरण। स्रोत: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

एडोबी रिसर्च 2023 यूनिह्यूमन परियोजना से मुद्राओं के उदाहरण। स्रोत: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep

शोधकर्ताओं ने मास्क किए गए क्षेत्रों को इंगित करने के लिए स्रोत मास्क स्वयं खींचे, अंततः 417 त्रिपक्षीय छवि समूह प्राप्त किए जो एक स्रोत छवि, मास्क और संदर्भ छवि का गठन करते हैं।

संदर्भ डब्ल्यूपोज़ डेटासेट से व्युत्पन्न और शोधकर्ताओं द्वारा व्यापक रूप से क्यूरेट किए गए समूहों के दो उदाहरण।

संदर्भ डब्ल्यूपोज़ डेटासेट से व्युत्पन्न और शोधकर्ताओं द्वारा व्यापक रूप से क्यूरेट किए गए समूहों के दो उदाहरण।

लेखकों ने स्रोत छवियों का वर्णन करने वाले पाठ प्रॉम्प्ट उत्पन्न करने के लिए एलएलएवीए बड़े भाषा मॉडल (एलएलएम) का उपयोग किया।

मीट्रिक का उपयोग किया गया था जो सामान्य से अधिक व्यापक था; इसके अलावा सामान्य पीक सिग्नल-टू-शोर अनुपात (पीएसएनआर), संरचनात्मक समानता सूचकांक (एसएसआईएम) और सीखा हुआ संवेदी छवि पैच समानता (एलपीआईपीएस, इस मामले में मास्क्ड क्षेत्रों का मूल्यांकन करने के लिए), शोधकर्ताओं ने डीआईएनओ का उपयोग समानता स्कोर के लिए किया; ड्रीमसिम पीढ़ी परिणाम मूल्यांकन के लिए; और सीएलआईपी।

डेटा और परीक्षण

काम का परीक्षण करने के लिए, लेखकों ने डिफ़ॉल्ट स्टेबल डिफ्यूजन वी1.5 मॉडल और 1.5 इनपेंटिंग मॉडल दोनों का उपयोग किया। प्रणाली के छवि एन्कोडर ने सीएलआईपी विजन मॉडल का उपयोग किया, साथ ही प्रोजेक्शन परतें – मॉडल द्वारा उपयोग की जाने वाली आंतरिक विशेषता आयामों के साथ मेल खाने के लिए सीएलआईपी आउटपुट को पुनः आकार देने या संरेखित करने के लिए मामूली न्यूरल नेटवर्क।

प्रशिक्षण 30,000 पुनरावृत्तियों के लिए आठ एनवीडिया ए100 जीपीयू पर हुआ, मीन स्क्वायर्ड त्रुटि (एमएसई) हानि द्वारा पर्यवेक्षित, 64 के बैच आकार पर और 2×10-5 की सीखने की दर पर। विभिन्न तत्वों को प्रशिक्षण के दौरान यादृच्छिक रूप से छोड़ दिया गया, ताकि प्रणाली ओवरफिटिंग से बच सके।

डेटासेट को पार्ट्स टू होल डेटासेट से बदल दिया गया था, जो खुद डीपफैशन-मल्टीमोडल डेटासेट पर आधारित था।

CompleteMe के लिए क्यूरेटेड डेटा के विकास में उपयोग किए जाने वाले पार्ट्स टू होल डेटासेट के उदाहरण। स्रोत: https://huanngzh.github.io/Parts2Whole/

CompleteMe के लिए क्यूरेटेड डेटा के विकास में उपयोग किए जाने वाले पार्ट्स टू होल डेटासेट के उदाहरण। स्रोत: https://huanngzh.github.io/Parts2Whole/

लेखकों का कहना है:

‘हमारी आवश्यकताओं को पूरा करने के लिए, हमने प्रशिक्षण जोड़े को पुनः बनाया जो अवरुद्ध छवियों को शामिल करते हैं जिनमें मानव उपस्थिति के विभिन्न पहलुओं को कैप्चर करने वाली कई संदर्भ छवियां होती हैं, साथ ही उनके लघु पाठ लेबल भी होते हैं।

‘प्रत्येक नमूने में हमारे प्रशिक्षण डेटा में छह उपस्थिति प्रकार शामिल हैं: ऊपरी शरीर के कपड़े, निचले शरीर के कपड़े, पूरे शरीर के कपड़े, बाल या सिर के आभूषण, चेहरा, और जूते। मास्किंग रणनीति के लिए, हम 50% यादृच्छिक ग्रिड मास्किंग लागू करते हैं 1 से 30 बार के बीच, जबकि अन्य 50% के लिए, हम मानव शरीर के आकार मास्क का उपयोग मास्किंग जटिलता बढ़ाने के लिए करते हैं।

‘निर्माण पाइपलाइन के बाद, हमें 40,000 छवि जोड़े प्रशिक्षण के लिए प्राप्त हुए।’

प्रतिद्वंद्वी पूर्व गैर-संदर्भ तरीकों का परीक्षण किया गया था बड़े अवरुद्ध मानव छवि पूर्णता (एलओएचसी) और प्लग-एंड-प्ले छवि इनपेंटिंग मॉडल ब्रशनेट थे; संदर्भ-आधारित मॉडल परीक्षण किए गए थे पेंट-बाय-एक्जाम्पल; एंडीडोर; लेफ्ट्रेफिल; और मिमिकब्रश.

लेखकों ने पहले मीट्रिक पर एक मात्रात्मक तुलना के साथ शुरुआत की:

प्रारंभिक मात्रात्मक तुलना के परिणाम।

प्रारंभिक मात्रात्मक तुलना के परिणाम।

मात्रात्मक मूल्यांकन के संबंध में, लेखकों का उल्लेख है कि CompleteMe अधिकांश संवेदी मीट्रिक में सबसे उच्च स्कोर प्राप्त करता है, जिनमें सीएलआईपी-आई, डीआईएनओ, ड्रीमसिम और एलपीआईपीएस शामिल हैं, जो संदर्भ छवि के साथ आउटपुट और सेमेंटिक संरेखण और उपस्थिति विश्वास को पकड़ने के लिए अभिप्रेत हैं।

हालांकि, मॉडल सभी बेंचमार्क पर सभी बेसलाइन को पार नहीं करता है। विशेष रूप से, ब्रशनेट सीएलआईपी-टी पर सबसे उच्च स्कोर करता है, लेफ्ट्रेफिल एसएसआईएम और पीएसएनआर में अग्रणी है, और मिमिकब्रश सीएलआईपी-आई पर थोड़ा बेहतर प्रदर्शन करता है।

जबकि CompleteMe समग्र रूप से मजबूत परिणाम दिखाता है, प्रदर्शन अंतर कुछ मामलों में न्यूनतम है, और कुछ मीट्रिक अभी भी प्रतिद्वंद्वी पूर्व तरीकों द्वारा नेतृत्व किया जाता है। शायद अनुचित रूप से, लेखक इन परिणामों को CompleteMe की ताकत के संतुलित प्रदर्शन के प्रमाण के रूप में प्रस्तुत करते हैं दोनों संरचनात्मक और संवेदी आयामों में।

गुणात्मक परीक्षणों के लिए चित्र इस अध्ययन में पुन: उत्पादित करने के लिए बहुत अधिक हैं, और हम पाठक को स्रोत पत्र और व्यापक पूरक पीडीएफ दोनों के लिए संदर्भित करते हैं, जिसमें कई अतिरिक्त गुणात्मक उदाहरण शामिल हैं।

हम मुख्य पत्र में प्रस्तुत किए गए प्राथमिक गुणात्मक उदाहरणों को हाइलाइट करते हैं, साथ ही इस लेख की शुरुआत में पेश किए गए पूल से कुछ अतिरिक्त मामलों का चयन करते हैं:

मुख्य पत्र में प्रस्तुत किए गए प्रारंभिक गुणात्मक परिणाम। कृपया बेहतर रिज़ॉल्यूशन के लिए स्रोत पत्र का संदर्भ लें।

मुख्य पत्र में प्रस्तुत किए गए प्रारंभिक गुणात्मक परिणाम। कृपया बेहतर रिज़ॉल्यूशन के लिए स्रोत पत्र का संदर्भ लें।

प्रस्तुत गुणात्मक परिणामों पर, लेखकों का टिप्पणी है:

‘दिए गए मास्क्ड इनपुट के साथ, ये गैर-संदर्भ तरीके छवि प्राथमिकों या पाठ प्रॉम्प्ट का उपयोग करके मास्क्ड क्षेत्रों के लिए संभावित सामग्री उत्पन्न करते हैं।

‘हालांकि, जैसा कि लाल बॉक्स में इंगित किया गया है, वे विशिष्ट विवरण जैसे टैटू या विशिष्ट कपड़े पैटर्न को पुनरुत्पादित नहीं कर सकते हैं, क्योंकि उनके पास संदर्भ छवियां नहीं हैं जो समान जानकारी के पुनर्निर्माण को मार्गदर्शन करें।’

एक दूसरी तुलना, जिसका एक हिस्सा नीचे दिखाया गया है, चार संदर्भ-आधारित तरीकों पेंट-बाय-एक्जाम्पल, एंडीडोर, लेफ्ट्रेफिल और मिमिकब्रश पर केंद्रित है। यहां केवल एक संदर्भ छवि और एक पाठ प्रॉम्प्ट प्रदान किया गया था।

संदर्भ-आधारित तरीकों के साथ गुणात्मक तुलना। CompleteMe अधिक वास्तविक पूर्णता और संदर्भ छवि से विशिष्ट विवरण को बेहतर ढंग से संरक्षित करता है। लाल बॉक्स क्षेत्रों को विशेष रूप से रुचि के रूप में उजागर करते हैं।

संदर्भ-आधारित तरीकों के साथ गुणात्मक तुलना। CompleteMe अधिक वास्तविक पूर्णता और संदर्भ छवि से विशिष्ट विवरण को बेहतर ढंग से संरक्षित करता है। लाल बॉक्स क्षेत्रों को विशेष रूप से रुचि के रूप में उजागर करते हैं।

लेखकों का कहना है:

‘एक मास्क्ड मानव छवि और एक संदर्भ छवि दिए जाने पर, अन्य तरीके संभावित सामग्री उत्पन्न कर सकते हैं, लेकिन अक्सर संदर्भ से संदर्भ जानकारी को सटीक रूप से संरक्षित करने में विफल रहते हैं।

‘कुछ मामलों में, वे असंबंधित सामग्री उत्पन्न करते हैं या संदर्भ छवि से मानव शरीर के संबंधित भागों को गलत तरीके से मैप करते हैं। इसके विपरीत, CompleteMe मास्क्ड क्षेत्र को पूरा करके संदर्भ जानकारी को सटीक रूप से संरक्षित करता है और संदर्भ छवि से मानव शरीर के संबंधित भागों को सही ढंग से मैप करता है।’

मॉडल को मानव धारणा के साथ कितनी अच्छी तरह संरेखित करता है, इसका मूल्यांकन करने के लिए, लेखकों ने 15 एनोटेटर और 2,895 नमूना जोड़े के साथ एक उपयोगकर्ता अध्ययन आयोजित किया। प्रत्येक जोड़ी CompleteMe के आउटपुट की तुलना चार संदर्भ-आधारित बेसलाइन में से एक के साथ करती है: पेंट-बाय-एक्जाम्पल, एंडीडोर, लेफ्ट्रेफिल, या मिमिकब्रश।

एनोटेटरों ने प्रत्येक परिणाम का मूल्यांकन किया पूर्ण क्षेत्र की दृश्य गुणवत्ता और संदर्भ से पहचान विशेषताओं को संरक्षित करने की सीमा के आधार पर – और यहां, समग्र गुणवत्ता और पहचान का मूल्यांकन करते हुए, CompleteMe ने एक अधिक निर्णायक परिणाम प्राप्त किया:

उपयोगकर्ता अध्ययन के परिणाम।

उपयोगकर्ता अध्ययन के परिणाम।

निष्कर्ष

यदि कुछ भी हो, तो इस अध्ययन में गुणात्मक परिणाम अपनी भारी मात्रा से कमजोर हो जाते हैं, क्योंकि करीब से जांच यह दर्शाती है कि नई प्रणाली इस सापेक्ष निचे लेकिन गर्मजोशी से पीछा किए गए क्षेत्र में एक प्रभावी प्रवेश है।

हालांकि, यह पूरक सामग्री में प्रस्तुत परिणामों की भारी मात्रा को देखने और मूल पीडीएफ में ज़ूम इन करने के लिए थोड़ा अतिरिक्त ध्यान देने की आवश्यकता है ताकि यह सराहना की जा सके कि पिछले तरीकों (लगभग सभी मामलों में) की तुलना में संदर्भ सामग्री को अवरुद्ध क्षेत्र में कितनी अच्छी तरह से अनुकूलित किया जाता है।

हम पाठक को पूरक सामग्री में प्रस्तुत परिणामों की जांच करने की दृढ़ता से सलाह देते हैं।

हम पाठक को पूरक सामग्री में प्रस्तुत परिणामों की जांच करने की दृढ़ता से सलाह देते हैं।

 

* यह देखना दिलचस्प है कि कैसे अब पुरानी वी1.5 रिलीज़ शोधकर्ताओं के लिए पसंदीदा बनी हुई है – частично विरासत जैसे-जैसे परीक्षण के कारण, लेकिन также इसलिए कि यह सभी स्थिर प्रसार पुनरावलोकनों में सबसे कम सेंसर और संभावित रूप से सबसे आसानी से प्रशिक्षित है, और एफओएसएस फ्लक्स रिलीज़ के सेंसरशिप होबलिंग को साझा नहीं करता है।

वीआरएएम विनिर्देश नहीं दिया गया है – यह प्रति कार्ड 40GB या 80GB होगा।

मंगलवार, 29 अप्रैल, 2025 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai