Anderson का एंगल

छवि संश्लेषण क्षेत्र ने एक दोषपूर्ण मीट्रिक को अपनाया है, शोध का दावा है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

2021 छवि संश्लेषण क्षेत्र में अभूतपूर्व प्रगति और प्रकाशन की तेज़ गति का एक वर्ष रहा है, जिसमें नवाचारों और गहरे नकली, और कई नए दृष्टिकोणों के माध्यम से मानव व्यक्तित्व को पुन: उत्पन्न करने में सक्षम प्रौद्योगिकियों में सुधार की एक धारा प्रदान की गई है।

हालांकि, जर्मनी के शोधकर्ता अब दावा करते हैं कि सिंथेटिक छवियों की वास्तविकता का स्वचालित रूप से न्याय करने के लिए उपयोग किया जाने वाला मानक घातक रूप से दोषपूर्ण है; और दुनिया भर में सैकड़ों, यहां तक कि हजारों शोधकर्ता जो परिणामों के मूल्यांकन की लागत को कम करने के लिए इसका उपयोग करते हैं, वे एक अंधे मार्ग पर जा रहे हैं।

फ्रेचेट इन्सेप्शन दूरी (एफआईडी) नामक मानक को मानव मानकों के अनुसार छवियों का मूल्यांकन करने में सक्षम नहीं होने के लिए प्रदर्शित करने के लिए, शोधकर्ताओं ने अपने स्वयं के जीएनएएन को तैनात किया, जो एफआईडी (अब एक सामान्य मीट्रिक) के लिए अनुकूलित किया गया था। उन्होंने पाया कि एफआईडी अपने स्वयं के जुनून का पालन कर रहा है, जो छवि संश्लेषण के लिए इसके उद्देश्य से बहुत अलग है, और यह नियमित रूप से ‘मानव’ मानक की विवेक को प्राप्त करने में विफल रहता है:

विभिन्न मॉडलों द्वारा उत्पन्न छवियों के लिए एफआईडी स्कोर (निम्न बेहतर) मानक डेटासेट और वास्तुकला का उपयोग करते हुए। शोधकर्ता नए पत्र में प्रश्न पूछते हैं 'क्या आप इन रैंकिंग से सहमत होंगे?'। स्रोत: https://openreview.net/pdf?id=mLG96UpmbYz

मानक डेटासेट और वास्तुकला का उपयोग करते हुए विभिन्न मॉडलों द्वारा उत्पन्न छवियों के लिए एफआईडी स्कोर (निम्न बेहतर)। शोधकर्ता नए पत्र में प्रश्न पूछते हैं ‘क्या आप इन रैंकिंग से सहमत होंगे?’। स्रोत: https://openreview.net/pdf?id=mLG96UpmbYz

इसके अलावा, पत्र यह सुझाव देता है कि ‘स्पष्ट’ उपचार, जैसे कि इसके आंतरिक इंजन को प्रतिस्पर्धी इंजनों के साथ बदलना, केवल एक सेट के पूर्वाग्रह को दूसरे के साथ बदल देगा। लेखक सुझाव देते हैं कि अब यह नए शोध पहलों पर निर्भर करता है कि वे सिंथेटिक रूप से उत्पन्न फोटो में ‘प्रामाणिकता’ का मूल्यांकन करने के लिए बेहतर मीट्रिक विकसित करें।

पत्र शीर्षक है फ्रेचेट इन्सेप्शन दूरी में आंतरिक पूर्वाग्रह, और यह मैक्स प्लैंक इंस्टीट्यूट फॉर इन्फॉर्मेटिक्स में स्टीफन जंग और साइगेन विश्वविद्यालय में मार्ग्रेट क्यूपर से आया है।

छवि संश्लेषण के लिए एक स्कोरिंग सिस्टम की खोज

जैसा कि नए शोध में उल्लेख किया गया है, छवि संश्लेषण फ्रेमवर्क, जैसे कि जीएनएएन और एनकोडर/डिकोडर वास्तुकला, में प्रगति परिणामों का मूल्यांकन करने के तरीकों से आगे निकल गई है। मानव मूल्यांकन के अलावा, इन प्रणालियों के परिणामों का मूल्यांकन करने के लिए एक संख्यात्मक और पुनरुत्पादक तरीके की आवश्यकता होती है।

इसलिए, कई मीट्रिक फ्रेमवर्क विकसित किए गए हैं, जिनमें इन्सेप्शन स्कोर (आईएस) शामिल है, जो 2016 में पत्र जीएनएएन के लिए सुधारित तकनीक में शामिल किया गया था, जो जीएनएएन के आविष्कारक, इयान गुडफेलो द्वारा सह-लिखित था।

2018 में आईएस स्कोर को एक व्यापक रूप से लागू मीट्रिक के रूप में खारिज करने से जीएनएएन छवि संश्लेषण समुदाय में एफआईडी को व्यापक रूप से अपनाने का मार्ग प्रशस्त हुआ। हालांकि, इन्सेप्शन स्कोर की तरह, एफआईडी भी गूगल के इन्सेप्शन वी3 इमेज क्लासिफिकेशन नेटवर्क (आईवी3) पर आधारित है।

नई पत्र के लेखक तर्क देते हैं कि फ्रेचेट इन्सेप्शन दूरी आईवी3 में हानिकारक पूर्वाग्रहों को आगे बढ़ाती है, जिससे छवि गुणवत्ता का अनिश्चित वर्गीकरण होता है।

चूंकि एफआईडी को एक मशीन लर्निंग फ्रेमवर्क में एक विवेचक के रूप में शामिल किया जा सकता है (एक निर्मित ‘न्यायाधीश’ जो तय करता है कि जीएनएएन अच्छा प्रदर्शन कर रहा है या नहीं), यह मानव द्वारा लागू किए जाने वाले मानकों का सटीक प्रतिनिधित्व करने की आवश्यकता है।

फ्रेचेट इन्सेप्शन दूरी

एफआईडी जीएनएएन (या समान कार्यक्षमता) मॉडल बनाने के लिए उपयोग किए जाने वाले प्रशिक्षण डेटासेट में विशेषताओं के वितरण की तुलना करता है, और उस प्रणाली के परिणामों के साथ।

इसलिए, यदि एक जीएनएएन फ्रेमवर्क 10,000 छवियों (उदाहरण के लिए, मशहूर हस्तियों) पर प्रशिक्षित किया जाता है, तो एफआईडी मूल (वास्तविक) छवियों की तुलना जीएनएएन द्वारा उत्पन्न नकली छवियों से करता है। एफआईडी स्कोर जितना कम होगा, जीएनएएन उतना ही निकट ‘फोटोरियलिस्टिक’ छवियों के करीब पहुंच जाएगा, एफआईडी के मानदंडों के अनुसार।

पत्र से, एफएचक्यू64, एनवीडिया के बहुत लोकप्रिय एफएचक्यू डेटासेट का एक उपसेट पर प्रशिक्षित जीएनएएन के परिणाम। यहां, हालांकि एफआईडी स्कोर 5.38 है, जो बहुत कम है, परिणाम औसत मानव को प्रसन्न या आश्वस्त नहीं करते हैं।

पत्र से, एफएचक्यू64, एनवीडिया के बहुत लोकप्रिय एफएचक्यू डेटासेट का एक उपसेट पर प्रशिक्षित जीएनएएन के परिणाम। यहां, हालांकि एफआईडी स्कोर 5.38 है, जो बहुत कम है, परिणाम औसत मानव को प्रसन्न या आश्वस्त नहीं करते हैं।

समस्या, लेखकों का तर्क है, यह है कि इन्सेप्शन वी3, जिसके अनुमान फ्रेचेट इन्सेप्शन दूरी को शक्ति प्रदान करते हैं, छवि संश्लेषण के कार्य को ध्यान में रखते हुए सही स्थानों पर नहीं देख रहे हैं।

इन्सेप्शन वी3 को इमेजनेट वस्तु पहचान चुनौती पर प्रशिक्षित किया जाता है, जो कि हाल के वर्षों में छवि संश्लेषण के उद्देश्यों के विकास के साथ तर्कसंगत रूप से विरोधाभासी है। आईवी3 मॉडल की कठोरता को डेटा वृद्धि द्वारा परीक्षण करता है: यह छवियों को यादृच्छिक रूप से फ्लिप करता है, उन्हें 8-100% के बीच एक यादृच्छिक स्केल में फिट करता है, पहलू अनुपात (3/4 से 4/3 के बीच) बदलता है, और यादृच्छिक रंग विकृतियों को चमक, संतृप्ति और कंट्रास्ट से संबंधित करता है।

जर्मनी स्थित शोधकर्ताओं ने पाया है कि आईवी3 को किनारों और बनावट के आधार पर विशेषताओं को निकालने की प्रवृत्ति है, न कि रंग और तीव्रता जानकारी के आधार पर, जो सिंथेटिक छवियों के लिए प्रामाणिकता के अधिक अर्थपूर्ण सूचक होंगे; और इसका मूल उद्देश्य वस्तु पता लगाने के लिए अनुपयुक्त रूप से छवि संश्लेषण के लिए उपयोग किया जा रहा है। लेखक कहते हैं*:

‘[इन्सेप्शन वी3] किनारों और बनावट के आधार पर विशेषताओं को निकालने की प्रवृत्ति है, न कि रंग और तीव्रता जानकारी के आधार पर। यह इसके वृद्धि पाइपलाइन के साथ संरेखित है जो रंग विकृतियों को पेश करता है, लेकिन उच्च आवृत्ति जानकारी को संरक्षित रखता है (गॉसियन धुंधला के साथ वृद्धि के विपरीत)।

‘परिणामस्वरूप, एफआईडी इस पूर्वाग्रह को विरासत में मिलता है। जब इसका उपयोग रैंकिंग मीट्रिक के रूप में किया जाता है, तो बनावट को अच्छी तरह से पुन: उत्पन्न करने वाले जनरेटिव मॉडल रंग वितरण को अच्छी तरह से पुन: उत्पन्न करने वाले मॉडल की तुलना में पसंद किए जा सकते हैं.’

डेटा और विधि

अपने अनुमान का परीक्षण करने के लिए, लेखकों ने दो जीएनएएन वास्तुकला, डीसीजीएन और एसएनजीएन, को एनवीडिया के एफएचक्यू मानव चेहरा डेटासेट पर प्रशिक्षित किया, जिसे 64^2 छवि रिज़ॉल्यूशन में डाउनसैंपल किया गया था, जिसे एफएचक्यू64 नाम दिया गया था।

तीन जीएनएएन प्रशिक्षण प्रक्रियाओं का पीछा किया गया था: जीएनएएन जी+डी, एक मानक विवेचक-आधारित नेटवर्क; जीएनएएन एफआईडी|जी+डी, जहां एफआईडी एक अतिरिक्त विवेचक के रूप में कार्य करता है; और जीएनएएन एफआईडी|जी, जहां जीएनएएन पूरी तरह से रोलिंग एफआईडी स्कोर से संचालित होता है।

तकनीकी रूप से, लेखकों का तर्क है कि एफआईडी हानि प्रशिक्षण को स्थिर करना चाहिए, और यहां तक कि संभावित रूप से पूरी तरह से विवेचक (जैसा कि #3, जीएनएएन एफआईडी|जी में है) को प्रतिस्थापित कर सकता है, जबकि मानव-आनंददायक परिणामों का उत्पादन करता है।

व्यवहार में, परिणाम काफी अलग हैं, जो – लेखकों का अनुमान है – एफआईडी सहायता प्राप्त मॉडल ‘गलत मीट्रिक पर ओवरफिटिंग’ कर रहे हैं। शोधकर्ता ध्यान देते हैं:

‘हम अनुमान लगाते हैं कि जनरेटर प्रशिक्षण डेटा वितरण से मेल खाने के लिए अनुपयुक्त विशेषताओं का उत्पादन करना सीखता है। यह अवलोकन [जीएनएएन एफआईडी|जी] के मामले में अधिक गंभीर हो जाता है। यहां, हम देखते हैं कि विवेचक की अनुपस्थिति स्थानिक रूप से असंगत विशेषता वितरण की ओर ले जाती है। उदाहरण के लिए [एसएनजीएन एफआईडी|जी] मुख्य रूप से एकल आंखें जोड़ता है और चेहरे की विशेषताओं को एक भयावह तरीके से संरेखित करता है।’

एसएनजीएन एफआईडी|जी द्वारा उत्पन्न चेहरों के उदाहरण।

एसएनजीएन एफआईडी|जी द्वारा उत्पन्न चेहरों के उदाहरण।

लेखक निष्कर्ष निकालते हैं*:

‘जबकि मानव अनnotators निश्चित रूप से एसएनजीएन डी+जी द्वारा उत्पन्न छवियों को एसएनजीएन एफआईडी|जी की तुलना में पसंद करेंगे (जब डेटा विश्वासता की तुलना में कला को पसंद किया जाता है), हम देखते हैं कि यह एफआईडी द्वारा प्रतिबिंबित नहीं किया जाता है। इसलिए, एफआईडी मानव धारणा के साथ संरेखित नहीं है

‘हम तर्क देते हैं कि छवि वर्गीकरण नेटवर्क द्वारा प्रदान की गई विवेचक विशेषताएं एक अर्थपूर्ण मीट्रिक के आधार के लिए पर्याप्त नहीं हैं। ‘

कोई आसान विकल्प नहीं

लेखकों ने यह भी पाया कि इन्सेप्शन वी3 को एक समान इंजन के साथ बदलने से समस्या का समाधान नहीं हुआ। इन्सेप्शन वी3 को ‘विभिन्न वर्गीकरण नेटवर्कों के व्यापक चयन’ के साथ प्रतिस्थापित करने से, जिन्हें इमेजनेट-सी (इमेजनेट का एक उपसेट जो सामान्य रूप से उत्पन्न छवि संश्लेषण फ्रेमवर्क से उत्पन्न छवियों में विकृतियों और विकृतियों को बेंचमार्क करने के लिए डिज़ाइन किया गया है) के खिलाफ परीक्षण किया गया था, शोधकर्ता अपने परिणामों में काफी सुधार नहीं कर सके:

इन्सेप्शन वी3 में मौजूद पूर्वाग्रह अन्य वर्गीकरण नेटवर्कों में भी व्यापक रूप से मौजूद हैं। इसके अलावा, हम देखते हैं कि विभिन्न नेटवर्क विकृति प्रकार के बीच अलग-अलग रैंकिंग उत्पन्न करेंगे.’

लेखक पत्र के अंत में आशा व्यक्त करते हैं कि जारी शोध एक ‘मानव-संरेखित और निरपेक्ष मीट्रिक’ विकसित करेगा जो छवि जनरेटर वास्तुकला के लिए एक न्यायसंगत रैंकिंग को सक्षम करने में सक्षम होगा।

 

* लेखकों का जोर।

पहली बार 2 दिसंबर 2021, 1 बजे जीएमटी+2 पर प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai