Anderson का एंगल

इमेजनेट की ऐतिहासिक सटीकता का मूल्यांकन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

गूगल रिसर्च और यूसी बर्कले से एक नए अध्ययन में कंप्यूटर विजन (सीवी) अनुसंधान क्षेत्र की इमेजनेट डेटासेट और इसके कई व्युत्पन्नों पर निर्भरता के बारे में लंबे समय से चली आ रही आलोचना को जोड़ा गया है। श्रमसाध्य मैनुअल मूल्यांकन के बाद, लेखकों ने निष्कर्ष निकाला कि इमेजनेट के मल्टी-लेबल सबसेट मूल्यांकन पर सर्वश्रेष्ठ मॉडल द्वारा की गई लगभग 50% कथित त्रुटियां वास्तव में त्रुटियां नहीं हैं।

लेख से:

‘हमारा विश्लेषण यह दर्शाता है कि लगभग आधी कथित त्रुटियां वास्तव में त्रुटियां नहीं हैं, और हम नए वैध मल्टी-लेबल का पता लगाते हैं, जो यह प्रदर्शित करता है कि सावधानी से समीक्षा किए बिना, हम इन मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से कम आंकते हैं। ‘

‘दूसरी ओर, हम यह भी पाते हैं कि आज के सर्वश्रेष्ठ मॉडल अभी भी कई त्रुटियां (40%) करते हैं जो मानव समीक्षकों के लिए स्पष्ट रूप से गलत हैं।’

इमेजनेट के इतिहास में एक बड़े हिस्से में छवि/पाठ जोड़ियों के मूल्यांकन के माध्यम से अध्ययन द्वारा डेटासेट की गलत लेबलिंग – विशेष रूप से अकुशल भीड़ से – क्षेत्र को कैसे प्रभावित कर सकती है, इसका खुलासा किया गया था।

[कैप्शन id=”attachment_181496″ align=”alignnone” width=”900″]शीर्ष पंक्ति में, त्रुटि गंभीरता के उदाहरण: पहले दो उदाहरणों में, नए मॉडल को बस भविष्यवाणी की गई लेबल गलत मिला; तीसरे उदाहरण में, नए मॉडल ने एक पहले से गायब बहु-लेबल (एक लेबल जो छवि के एक नए वर्गीकरण को संबोधित करता है) की पहचान की; शीर्ष पंक्ति में अंतिम छवि में, मॉडल की भविष्यवाणी अस्पष्ट है, क्योंकि तस्वीर एक मधुमक्खी-मक्खी है और मक्खी नहीं है। हालांकि, औसत मधुमक्खी डिप्टेरा कीट ऑर्डर से संबंधित है, इसलिए यह अपवाद लगभग एक विशेषज्ञ अनोटेटर के लिए भी ध्यान देने योग्य होगा। नीचे की पंक्ति में चार त्रुटि श्रेणियां हैं, जिनमें उदाहरण हैं। स्रोत: https://arxiv.org/pdf/2205.04596.pdf शीर्ष पंक्ति में, त्रुटि गंभीरता के उदाहरण: पहले दो उदाहरणों में, नए मॉडल को बस भविष्यवाणी की गई लेबल गलत मिला; तीसरे उदाहरण में, नए मॉडल ने एक पहले से गायब बहु-लेबल (एक लेबल जो छवि के एक नए वर्गीकरण को संबोधित करता है) की पहचान की; शीर्ष पंक्ति में अंतिम छवि में, मॉडल की भविष्यवाणी अस्पष्ट है, क्योंकि तस्वीर एक मधुमक्खी-मक्खी है और मक्खी नहीं है। हालांकि, औसत मधुमक्खी डिप्टेरा कीट ऑर्डर से संबंधित है, इसलिए यह अपवाद लगभग एक विशेषज्ञ अनोटेटर के लिए भी ध्यान देने योग्य होगा। नीचे की पंक्ति में चार त्रुटि श्रेणियां हैं, जिनमें उदाहरण हैं। स्रोत: https://arxiv.org/pdf/2205.04596.pdf[/कैप्शन]

शोधकर्ताओं ने इमेजनेट डेटासेट के ऐतिहासिक त्रुटि रिकॉर्ड की समीक्षा के लिए एक छोटी संख्या में समर्पित मूल्यांकनकर्ताओं को नियुक्त किया, जिसमें पाया गया कि त्रुटि निर्णयों में से बहुत से स्वयं त्रुटिपूर्ण हैं – एक खोज जो वर्षों से इमेजनेट बेंचमार्क पर कई परियोजनाओं के खराब स्कोरिंग को संशोधित कर सकती है।

इमेजनेट सीवी संस्कृति में प्रतिष्ठित होने के साथ, शोधकर्ता तर्क देते हैं कि सटीकता में सुधार कम होता जा रहा है, और नई मॉडल जो स्थापित लेबल सटीकता से आगे निकलती हैं और जो नए (अर्थात अतिरिक्त) लेबल सुझाती हैं, उन्हें मूल रूप से अनुपालन के लिए दंडित किया जा रहा है।

‘उदाहरण के लिए,’ लेखकों का观察 है। ‘क्या हमें एक प्री-बेक्ड बैगेल को एक बैगेल के रूप में भविष्यवाणी करने वाले मॉडल को दंडित करना चाहिए, जैसा कि इस कार्य में हमारे द्वारा समीक्षा की जाने वाली मॉडल में से एक करता है?’

[कैप्शन id=”attachment_181497″ align=”alignnone” width=”429″]लेख से, एक नए मॉडल ने पूर्व भविष्यवाणी को चुनौती दी कि फोटो में वस्तु आटा है, और सुझाव दिया कि वस्तु वास्तव में एक बैगेल है। लेख से, एक नए मॉडल ने पूर्व भविष्यवाणी को चुनौती दी कि फोटो में वस्तु आटा है, और सुझाव दिया कि वस्तु वास्तव में एक बैगेल है।[/कैप्शन]

एक भीड़ से काम करने वाले कार्यकर्ता के दृष्टिकोण से जो ऐसी वस्तु की पहचान करने के लिए कार्य करने के लिए नियुक्त किया गया है, यह एक सेमेंटिक और यहां तक कि दार्शनिक दुविधा है जिसे केवल बहु-लेबलिंग द्वारा हल किया जा सकता है (जैसा कि अक्सर बाद के सबसेट और इमेजनेट के बाद के संस्करणों में होता है); उपरोक्त मामले में, वस्तु वास्तव में आटा और कम से कम एक नवजात बैगेल है।

[कैप्शन id=”attachment_181498″ align=”alignnone” width=”978″]शोध में परीक्षण के दौरान कस्टम मॉडल में उत्पन्न होने वाली प्रमुख (ऊपर) और मामूली (नीचे) त्रुटियां। मूल इमेजनेट लेबल बाएं हाथ की पहली छवियां हैं। शोध में परीक्षण के दौरान कस्टम मॉडल में उत्पन्न होने वाली प्रमुख (ऊपर) और मामूली (नीचे) त्रुटियां। मूल इमेजनेट लेबल बाएं हाथ की पहली छवियां हैं।[/कैप्शन]

स्पष्ट समाधान हैं लेबलिंग के लिए अधिक संसाधनों का आवंटन (जो अधिकांश कंप्यूटर विजन अनुसंधान परियोजनाओं के बजट प्रतिबंधों के भीतर एक चुनौती है); और, जैसा कि लेखकों पर जोर दिया जाता है, डेटासेट और लेबल मूल्यांकन उप-सेटों को नियमित रूप से अपडेट करना (जो अन्य बाधाओं के बीच ‘जैसे कि जैसे’ ऐतिहासिक निरंतरता को तोड़ने और नए शोध पत्रों में समानता के संबंध में योग्यता और अस्वीकृति के साथ भरने का जोखिम है)।

स्थिति को ठीक करने के एक कदम के रूप में, शोधकर्ताओं ने इमेजनेट का एक नया उप-डेटासेट विकसित किया है जिसे इमेजनेट-मेजर (इमेजनेट-एम) कहा जाता है, जिसे वे ‘आज के शीर्ष मॉडलों द्वारा की गई स्पष्ट त्रुटियों का 68-उदाहरण “प्रमुख त्रुटि” स्लाइस – एक स्लाइस जहां मॉडल को लगभग完璧 होना चाहिए, लेकिन आज ऐसा नहीं कर रहे हैं। ‘

लेख पेपर का शीर्षक जब आटा एक बैगेल बन जाता है? इमेजनेट पर शेष त्रुटियों का विश्लेषण है, और यह गूगल रिसर्च के चार लेखकों द्वारा संयुक्त रूप से यूसी बर्कले के सारा फ्रिडोविच-कील के साथ लिखा गया है।

तकनीकी ऋण

निष्कर्ष महत्वपूर्ण हैं क्योंकि इमेजनेट में पहचाने गए शेष त्रुटियां (या गलत तरीके से पहचाने गए), इसकी स्थापना के 16 वर्षों में, शोध के केंद्रीय अध्ययन, एक तैनाती योग्य मॉडल और एक त्रुटि-प्रवण मॉडल के बीच अंतर का प्रतिनिधित्व कर सकते हैं जो लाइव डेटा पर छोड़ा नहीं जा सकता है। जैसा कि हमेशा, अंतिम मील महत्वपूर्ण है

कंप्यूटर विजन और इमेज सिंथेसिस अनुसंधान क्षेत्र ने प्रभावी रूप से इमेजनेट को एक बेंचमार्क मेट्रिक के रूप में ‘स्व-चयन’ किया है – कई कारणों से, न कि इसलिए कि शुरुआती अपनाने वालों की एक फसल, एक समय में जब उच्च-मात्रा और अच्छी तरह से लेबल वाले डेटासेट दुर्लभ थे, इतने सारे अनुसंधान पहल का उत्पादन किया कि इमेजनेट के खिलाफ परीक्षण जल्द ही नए फ्रेमवर्क के लिए व्यापक रूप से लागू बेंचमार्क ‘मानक’ बन गया।

विधि

इमेजनेट में ‘शेष त्रुटियों’ की तलाश में, शोधकर्ताओं ने एक मानक वीआईटी मॉडल (89.5% की सटीकता हासिल करने में सक्षम) का उपयोग किया, विट-3बी, जो जेएफटी-3बी पर प्री-ट्रेन किया गया था और इमेजनेट-1के पर फाइन-ट्यून किया गया था।

इमेजनेट2012_मल्टी-लेबल डेटासेट का उपयोग करते हुए, शोधकर्ताओं ने विट-3बी की प्रारंभिक मल्टी-लेबल सटीकता (एमएलए) 96.3% के रूप में दर्ज की, जिसके दौरान मॉडल ने 676 स्पष्ट त्रुटियां कीं। यह उन त्रुटियों (और एक लालची सूप मॉडल द्वारा उत्पादित त्रुटियों) का अध्ययन करना था जो लेखकों ने करना चाहते थे।

शेष 676 त्रुटियों का मूल्यांकन करने के लिए, लेखकों ने भीड़ कार्यकर्ताओं से परहेज किया, यह देखते हुए कि इस प्रकार की त्रुटियां औसत अनोटेटर के लिए ध्यान देने योग्य हो सकती हैं, लेकिन पांच विशेषज्ञ समीक्षकों के एक पैनल को इकट्ठा किया और प्रत्येक समीक्षक को एक समर्पित उपकरण बनाया ताकि वे एक ही समय में भविष्यवाणी की गई वर्ग, भविष्यवाणी की गई स्कोर, ग्राउंड ट्रुथ लेबल और छवि को देख सकें।

[कैप्शन id=”attachment_181499″ align=”alignnone” width=”686″]परियोजना के लिए बनाया गया यूआई। परियोजना के लिए बनाया गया यूआई।[/कैप्शन]

कुछ मामलों में, विवादों को हल करने के लिए आगे की जांच की आवश्यकता थी, और गूगल इमेज खोज का उपयोग एक सहायक उपकरण के रूप में किया गया था।

‘[एक] दिलचस्प लेकिन अकेले मामले में, एक टैक्सी कैब (टैक्सी कैब संकेतकों के अलावा पीले रंग के अलावा) की भविष्यवाणी छवि में मौजूद थी; हमने भविष्यवाणी को वास्तव में एक टैक्सी कैब के रूप में निर्धारित किया, और नहीं बस एक मानक वाहन द्वारा, पृष्ठभूमि में एक लैंडमार्क पुल की पहचान करके शहर को स्थानीयकृत करने के लिए, और उस शहर में टैक्सी के लिए एक बाद की छवि खोज ने उसी टैक्सी मॉडल और लाइसेंस प्लेट डिज़ाइन की छवियां उत्पन्न कीं, मॉडल की वास्तव में सटीक भविष्यवाणी को मान्य करता है। ‘

प्रारंभिक समीक्षा के बाद शोध के कई चरणों में, लेखकों ने चार नए त्रुटि प्रकारों का गठन किया: फाइन-ग्रेन्ड त्रुटि, जहां भविष्यवाणी की गई वर्ग जमीनी सच्चाई लेबल के समान है; फाइन-ग्रेन्ड के साथ बाहर-शब्दकोश (ओओवी), जहां मॉडल एक वस्तु की पहचान करता है जिसका वर्ग सही है लेकिन इमेजनेट में मौजूद नहीं है; स्पोरियस संबंध, जहां भविष्यवाणी की गई लेबल छवि के संदर्भ से बाहर पढ़ा जाता है; और गैर-प्रोटोटाइप, जहां जमीनी सच्चाई वस्तु वर्ग का एक संदिग्ध उदाहरण है जो भविष्यवाणी की गई लेबल के समान है।

कुछ मामलों में, जमीनी सच्चाई स्वयं ‘सच’ नहीं थी:

‘मूल 676 त्रुटियों की समीक्षा के बाद [इमेजनेट में पाई गई], हमने पाया कि 298 या तो सही थे या अस्पष्ट थे, या निर्धारित किया कि मूल जमीनी सच्चाई गलत या समस्याग्रस्त थी। ‘

विभिन्न डेटासेट, उप-सेट और सत्यापन सेट पर एक थकाऊ और जटिल प्रयोगों के दौर के बाद, लेखकों ने पाया कि अध्ययन में दो मॉडल वास्तव में पारंपरिक तकनीकों के तहत वे जो ‘त्रुटियां’ करते हैं उनमें से आधे के लिए सही थे (मानव समीक्षकों द्वारा निर्धारित)।

लेख निष्कर्ष निकालता है:

‘इस पत्र में, हमने इमेजनेट मल्टी-लेबल सत्यापन सेट पर विट-3बी और ग्रीडी सूप मॉडल द्वारा की गई हर शेष त्रुटि का विश्लेषण किया। ‘

‘कुल मिलाकर, हमने पाया कि: 1) जब एक बड़ा, उच्च सटीकता मॉडल एक नए मॉडल द्वारा नहीं बनाई गई एक नई भविष्यवाणी करता है, तो यह लगभग आधे समय एक सही नई बहु-लेबल होती है; 2) उच्च सटीकता मॉडल हमारी श्रेणियों और त्रुटियों की गंभीरता में एक स्पष्ट पैटर्न का प्रदर्शन नहीं करते हैं जो वे हल करते हैं; 3) सOTA मॉडल आज मानव-मूल्यांकित मल्टी-लेबल सबसेट पर सर्वश्रेष्ठ विशेषज्ञ मानव के प्रदर्शन को बड़े पैमाने पर मिलान या पार करने वाले हैं; 4) शोर प्रशिक्षण डेटा और अंडर-निर्दिष्ट वर्ग त्रुटि वर्गीकरण में सुधार के प्रभावी मापन को सीमित करने वाला एक कारक हो सकता है। ‘

 

पहली बार 15 मई 2022 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai