Anderson का एंगल
इमेजनेट की ऐतिहासिक सटीकता का मूल्यांकन

गूगल रिसर्च और यूसी बर्कले से एक नए अध्ययन में कंप्यूटर विजन (सीवी) अनुसंधान क्षेत्र की इमेजनेट डेटासेट और इसके कई व्युत्पन्नों पर निर्भरता के बारे में लंबे समय से चली आ रही आलोचना को जोड़ा गया है। श्रमसाध्य मैनुअल मूल्यांकन के बाद, लेखकों ने निष्कर्ष निकाला कि इमेजनेट के मल्टी-लेबल सबसेट मूल्यांकन पर सर्वश्रेष्ठ मॉडल द्वारा की गई लगभग 50% कथित त्रुटियां वास्तव में त्रुटियां नहीं हैं।
लेख से:
‘हमारा विश्लेषण यह दर्शाता है कि लगभग आधी कथित त्रुटियां वास्तव में त्रुटियां नहीं हैं, और हम नए वैध मल्टी-लेबल का पता लगाते हैं, जो यह प्रदर्शित करता है कि सावधानी से समीक्षा किए बिना, हम इन मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से कम आंकते हैं। ‘
‘दूसरी ओर, हम यह भी पाते हैं कि आज के सर्वश्रेष्ठ मॉडल अभी भी कई त्रुटियां (40%) करते हैं जो मानव समीक्षकों के लिए स्पष्ट रूप से गलत हैं।’
इमेजनेट के इतिहास में एक बड़े हिस्से में छवि/पाठ जोड़ियों के मूल्यांकन के माध्यम से अध्ययन द्वारा डेटासेट की गलत लेबलिंग – विशेष रूप से अकुशल भीड़ से – क्षेत्र को कैसे प्रभावित कर सकती है, इसका खुलासा किया गया था।
[कैप्शन id=”attachment_181496″ align=”alignnone” width=”900″]
शोधकर्ताओं ने इमेजनेट डेटासेट के ऐतिहासिक त्रुटि रिकॉर्ड की समीक्षा के लिए एक छोटी संख्या में समर्पित मूल्यांकनकर्ताओं को नियुक्त किया, जिसमें पाया गया कि त्रुटि निर्णयों में से बहुत से स्वयं त्रुटिपूर्ण हैं – एक खोज जो वर्षों से इमेजनेट बेंचमार्क पर कई परियोजनाओं के खराब स्कोरिंग को संशोधित कर सकती है।
इमेजनेट सीवी संस्कृति में प्रतिष्ठित होने के साथ, शोधकर्ता तर्क देते हैं कि सटीकता में सुधार कम होता जा रहा है, और नई मॉडल जो स्थापित लेबल सटीकता से आगे निकलती हैं और जो नए (अर्थात अतिरिक्त) लेबल सुझाती हैं, उन्हें मूल रूप से अनुपालन के लिए दंडित किया जा रहा है।
‘उदाहरण के लिए,’ लेखकों का观察 है। ‘क्या हमें एक प्री-बेक्ड बैगेल को एक बैगेल के रूप में भविष्यवाणी करने वाले मॉडल को दंडित करना चाहिए, जैसा कि इस कार्य में हमारे द्वारा समीक्षा की जाने वाली मॉडल में से एक करता है?’
[कैप्शन id=”attachment_181497″ align=”alignnone” width=”429″]
एक भीड़ से काम करने वाले कार्यकर्ता के दृष्टिकोण से जो ऐसी वस्तु की पहचान करने के लिए कार्य करने के लिए नियुक्त किया गया है, यह एक सेमेंटिक और यहां तक कि दार्शनिक दुविधा है जिसे केवल बहु-लेबलिंग द्वारा हल किया जा सकता है (जैसा कि अक्सर बाद के सबसेट और इमेजनेट के बाद के संस्करणों में होता है); उपरोक्त मामले में, वस्तु वास्तव में आटा और कम से कम एक नवजात बैगेल है।
[कैप्शन id=”attachment_181498″ align=”alignnone” width=”978″]
स्पष्ट समाधान हैं लेबलिंग के लिए अधिक संसाधनों का आवंटन (जो अधिकांश कंप्यूटर विजन अनुसंधान परियोजनाओं के बजट प्रतिबंधों के भीतर एक चुनौती है); और, जैसा कि लेखकों पर जोर दिया जाता है, डेटासेट और लेबल मूल्यांकन उप-सेटों को नियमित रूप से अपडेट करना (जो अन्य बाधाओं के बीच ‘जैसे कि जैसे’ ऐतिहासिक निरंतरता को तोड़ने और नए शोध पत्रों में समानता के संबंध में योग्यता और अस्वीकृति के साथ भरने का जोखिम है)।
स्थिति को ठीक करने के एक कदम के रूप में, शोधकर्ताओं ने इमेजनेट का एक नया उप-डेटासेट विकसित किया है जिसे इमेजनेट-मेजर (इमेजनेट-एम) कहा जाता है, जिसे वे ‘आज के शीर्ष मॉडलों द्वारा की गई स्पष्ट त्रुटियों का 68-उदाहरण “प्रमुख त्रुटि” स्लाइस – एक स्लाइस जहां मॉडल को लगभग完璧 होना चाहिए, लेकिन आज ऐसा नहीं कर रहे हैं। ‘
लेख पेपर का शीर्षक जब आटा एक बैगेल बन जाता है? इमेजनेट पर शेष त्रुटियों का विश्लेषण है, और यह गूगल रिसर्च के चार लेखकों द्वारा संयुक्त रूप से यूसी बर्कले के सारा फ्रिडोविच-कील के साथ लिखा गया है।
तकनीकी ऋण
निष्कर्ष महत्वपूर्ण हैं क्योंकि इमेजनेट में पहचाने गए शेष त्रुटियां (या गलत तरीके से पहचाने गए), इसकी स्थापना के 16 वर्षों में, शोध के केंद्रीय अध्ययन, एक तैनाती योग्य मॉडल और एक त्रुटि-प्रवण मॉडल के बीच अंतर का प्रतिनिधित्व कर सकते हैं जो लाइव डेटा पर छोड़ा नहीं जा सकता है। जैसा कि हमेशा, अंतिम मील महत्वपूर्ण है।
कंप्यूटर विजन और इमेज सिंथेसिस अनुसंधान क्षेत्र ने प्रभावी रूप से इमेजनेट को एक बेंचमार्क मेट्रिक के रूप में ‘स्व-चयन’ किया है – कई कारणों से, न कि इसलिए कि शुरुआती अपनाने वालों की एक फसल, एक समय में जब उच्च-मात्रा और अच्छी तरह से लेबल वाले डेटासेट दुर्लभ थे, इतने सारे अनुसंधान पहल का उत्पादन किया कि इमेजनेट के खिलाफ परीक्षण जल्द ही नए फ्रेमवर्क के लिए व्यापक रूप से लागू बेंचमार्क ‘मानक’ बन गया।
विधि
इमेजनेट में ‘शेष त्रुटियों’ की तलाश में, शोधकर्ताओं ने एक मानक वीआईटी मॉडल (89.5% की सटीकता हासिल करने में सक्षम) का उपयोग किया, विट-3बी, जो जेएफटी-3बी पर प्री-ट्रेन किया गया था और इमेजनेट-1के पर फाइन-ट्यून किया गया था।
इमेजनेट2012_मल्टी-लेबल डेटासेट का उपयोग करते हुए, शोधकर्ताओं ने विट-3बी की प्रारंभिक मल्टी-लेबल सटीकता (एमएलए) 96.3% के रूप में दर्ज की, जिसके दौरान मॉडल ने 676 स्पष्ट त्रुटियां कीं। यह उन त्रुटियों (और एक लालची सूप मॉडल द्वारा उत्पादित त्रुटियों) का अध्ययन करना था जो लेखकों ने करना चाहते थे।
शेष 676 त्रुटियों का मूल्यांकन करने के लिए, लेखकों ने भीड़ कार्यकर्ताओं से परहेज किया, यह देखते हुए कि इस प्रकार की त्रुटियां औसत अनोटेटर के लिए ध्यान देने योग्य हो सकती हैं, लेकिन पांच विशेषज्ञ समीक्षकों के एक पैनल को इकट्ठा किया और प्रत्येक समीक्षक को एक समर्पित उपकरण बनाया ताकि वे एक ही समय में भविष्यवाणी की गई वर्ग, भविष्यवाणी की गई स्कोर, ग्राउंड ट्रुथ लेबल और छवि को देख सकें।
[कैप्शन id=”attachment_181499″ align=”alignnone” width=”686″]
कुछ मामलों में, विवादों को हल करने के लिए आगे की जांच की आवश्यकता थी, और गूगल इमेज खोज का उपयोग एक सहायक उपकरण के रूप में किया गया था।
‘[एक] दिलचस्प लेकिन अकेले मामले में, एक टैक्सी कैब (टैक्सी कैब संकेतकों के अलावा पीले रंग के अलावा) की भविष्यवाणी छवि में मौजूद थी; हमने भविष्यवाणी को वास्तव में एक टैक्सी कैब के रूप में निर्धारित किया, और नहीं बस एक मानक वाहन द्वारा, पृष्ठभूमि में एक लैंडमार्क पुल की पहचान करके शहर को स्थानीयकृत करने के लिए, और उस शहर में टैक्सी के लिए एक बाद की छवि खोज ने उसी टैक्सी मॉडल और लाइसेंस प्लेट डिज़ाइन की छवियां उत्पन्न कीं, मॉडल की वास्तव में सटीक भविष्यवाणी को मान्य करता है। ‘
प्रारंभिक समीक्षा के बाद शोध के कई चरणों में, लेखकों ने चार नए त्रुटि प्रकारों का गठन किया: फाइन-ग्रेन्ड त्रुटि, जहां भविष्यवाणी की गई वर्ग जमीनी सच्चाई लेबल के समान है; फाइन-ग्रेन्ड के साथ बाहर-शब्दकोश (ओओवी), जहां मॉडल एक वस्तु की पहचान करता है जिसका वर्ग सही है लेकिन इमेजनेट में मौजूद नहीं है; स्पोरियस संबंध, जहां भविष्यवाणी की गई लेबल छवि के संदर्भ से बाहर पढ़ा जाता है; और गैर-प्रोटोटाइप, जहां जमीनी सच्चाई वस्तु वर्ग का एक संदिग्ध उदाहरण है जो भविष्यवाणी की गई लेबल के समान है।
कुछ मामलों में, जमीनी सच्चाई स्वयं ‘सच’ नहीं थी:
‘मूल 676 त्रुटियों की समीक्षा के बाद [इमेजनेट में पाई गई], हमने पाया कि 298 या तो सही थे या अस्पष्ट थे, या निर्धारित किया कि मूल जमीनी सच्चाई गलत या समस्याग्रस्त थी। ‘
विभिन्न डेटासेट, उप-सेट और सत्यापन सेट पर एक थकाऊ और जटिल प्रयोगों के दौर के बाद, लेखकों ने पाया कि अध्ययन में दो मॉडल वास्तव में पारंपरिक तकनीकों के तहत वे जो ‘त्रुटियां’ करते हैं उनमें से आधे के लिए सही थे (मानव समीक्षकों द्वारा निर्धारित)।
लेख निष्कर्ष निकालता है:
‘इस पत्र में, हमने इमेजनेट मल्टी-लेबल सत्यापन सेट पर विट-3बी और ग्रीडी सूप मॉडल द्वारा की गई हर शेष त्रुटि का विश्लेषण किया। ‘
‘कुल मिलाकर, हमने पाया कि: 1) जब एक बड़ा, उच्च सटीकता मॉडल एक नए मॉडल द्वारा नहीं बनाई गई एक नई भविष्यवाणी करता है, तो यह लगभग आधे समय एक सही नई बहु-लेबल होती है; 2) उच्च सटीकता मॉडल हमारी श्रेणियों और त्रुटियों की गंभीरता में एक स्पष्ट पैटर्न का प्रदर्शन नहीं करते हैं जो वे हल करते हैं; 3) सOTA मॉडल आज मानव-मूल्यांकित मल्टी-लेबल सबसेट पर सर्वश्रेष्ठ विशेषज्ञ मानव के प्रदर्शन को बड़े पैमाने पर मिलान या पार करने वाले हैं; 4) शोर प्रशिक्षण डेटा और अंडर-निर्दिष्ट वर्ग त्रुटि वर्गीकरण में सुधार के प्रभावी मापन को सीमित करने वाला एक कारक हो सकता है। ‘
पहली बार 15 मई 2022 को प्रकाशित।












