Anderson का एंगल

कंप्यूटर विजन मॉडल्स को वास्तविक छवियों के बजाय यादृच्छिक शोर पर प्रशिक्षित करना

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मैसाचुसेट्स इंस्टीट्यूट ऑफ टेक्नोलॉजी कंप्यूटर साइंस एंड आर्टिफिशियल इंटेलिजेंस लेबोरेटरी (सीएसएआईएल) के शोधकर्ताओं ने कंप्यूटर विजन डेटासेट में यादृच्छिक शोर छवियों का उपयोग करके कंप्यूटर विजन मॉडल को प्रशिक्षित करने के साथ प्रयोग किया है, और उन्होंने पाया है कि इसके बजाय कचरा उत्पन्न करने के लिए, यह विधि आश्चर्यजनक रूप से प्रभावी है:

प्रयोग से उत्पन्न जनरेटिव मॉडल, प्रदर्शन के अनुसार क्रमबद्ध। स्रोत: https://openreview.net/pdf?id=RQUl8gZnN7O

प्रयोग से उत्पन्न जनरेटिव मॉडल, प्रदर्शन के अनुसार क्रमबद्ध। स्रोत: https://openreview.net/pdf?id=RQUl8gZnN7O

लोकप्रिय कंप्यूटर विजन आर्किटेक्चर में स्पष्ट रूप से ‘दृश्य कचरा’ डालने से इस प्रकार के प्रदर्शन की उम्मीद नहीं है। ऊपर दी गई छवि के दाहिने हिस्से में, काले स्तंभ चार ‘वास्तविक’ डेटासेट के लिए सटीकता स्कोर (इमेजनेट-100 पर) का प्रतिनिधित्व करते हैं। जबकि ‘यादृच्छिक शोर’ डेटासेट (विभिन्न रंगों में, ऊपरी बाएं सूचकांक देखें) उसे मैच नहीं कर सकते हैं, वे लगभग सभी सटीकता के लिए सम्मानजनक ऊपरी और निचले सीमा (लाल डैश्ड लाइनें) के भीतर हैं।

इस अर्थ में ‘सटीकता’ का अर्थ यह नहीं है कि परिणाम आवश्यक रूप से एक चेहरे जैसा दिखता है, एक चर्च, एक पिज्जा, या किसी अन्य विशिष्ट डोमेन के लिए जिसे आप एक छवि संश्लेषण प्रणाली बनाने में रुचि रखते हैं, जैसे कि एक जनरेटिव एडवर्सेरियल नेटवर्क, या एक एनकोडर/डिकोडर फ्रेमवर्क।

इसके बजाय, इसका अर्थ है कि सीएसएआईएल मॉडल ने छवि डेटा से व्यापक रूप से लागू होने वाले केंद्रीय ‘सत्य’ का अनुमान लगाया है जो इतना असंरचित है कि यह प्रदान करने में सक्षम नहीं होना चाहिए।

विविधता बनाम प्राकृतिकता

इन परिणामों को ओवरफिटिंग के लिए जिम्मेदार नहीं ठहराया जा सकता है: ओपन रिव्यू पर लेखकों और समीक्षकों के बीच एक जीवंत विचार-विमर्श यह बताता है कि दृश्य रूप से विविध डेटासेट (जैसे ‘मृत पत्तियां’, ‘फ्रैक्टल’ और ‘प्रक्रियात्मक शोर’ – नीचे दी गई छवि देखें) की सामग्री को एक प्रशिक्षण डेटासेट में मिलाने से सटीकता में वास्तव में सुधार होता है इन प्रयोगों में।

यह सुझाव देता है (और यह एक क्रांतिकारी धारणा है) कि ‘विविधता’ ‘प्राकृतिकता’ से अधिक महत्वपूर्ण है।

प्रयोग में उपयोग किए गए विभिन्न प्रकार के यादृच्छिक छवि डेटासेट को इंटरैक्टिव रूप से देखने के लिए परियोजना पृष्ठ। स्रोत: https://mbaradad.github.io/learning_with_noise/

प्रयोग में उपयोग किए गए विभिन्न प्रकार के यादृच्छिक छवि डेटासेट को इंटरैक्टिव रूप से देखने के लिए परियोजना पृष्ठ स्रोत: https://mbaradad.github.io/learning_with_noise/

शोधकर्ताओं द्वारा प्राप्त परिणाम छवि-आधारित न्यूरल नेटवर्क और उन्हें प्रत्येक वर्ष बड़ी मात्रा में फेंके जाने वाले ‘वास्तविक दुनिया’ की छवियों के बीच मूलभूत संबंध को सवाल में लाते हैं, और यह बताते हैं कि विशाल छवि डेटासेट प्राप्त करने, क्यूरेट करने और अन्यथा संभालने की आवश्यकता अंततः अप्रासंगिक हो सकती है। लेखक कहते हैं:

‘वर्तमान दृष्टि प्रणाली विशाल डेटासेट पर प्रशिक्षित होती हैं, और इन डेटासेट के साथ लागतें जुड़ी होती हैं: क्यूरेशन महंगा है, वे मानव पूर्वाग्रह विरासत में मिलते हैं, और गोपनीयता और उपयोग अधिकारों के बारे में चिंताएं हैं। इन लागतों का मुकाबला करने के लिए, सस्ते डेटा स्रोतों से सीखने में रुचि बढ़ी है, जैसे कि अनलेबल्ड छवियां। ‘

‘इस पत्र में, हम एक कदम आगे बढ़ते हैं और पूछते हैं कि क्या हम पूरी तरह से वास्तविक छवि डेटासेट को छोड़कर प्रक्रियात्मक शोर प्रक्रियाओं से सीखने के द्वारा कर सकते हैं। ‘

शोधकर्ता सुझाव देते हैं कि वर्तमान मशीन लर्निंग आर्किटेक्चर छवियों से कुछ ऐसा अनुमान लगा सकते हैं जो पहले सोचा गया था, और ‘अर्थहीन’ छवियां संभावित रूप से इस ज्ञान को बहुत सस्ते में प्रदान कर सकती हैं, यहां तक कि प्रशिक्षण समय पर यादृच्छिक छवियां उत्पन्न करने वाले डेटासेट-जेनरेशन आर्किटेक्चर के संभावित उपयोग के साथ:

हम दो मुख्य गुणों की पहचान करते हैं जो दृश्य प्रणालियों के लिए अच्छे सिंथेटिक डेटा बनाने में मदद करते हैं: 1) प्राकृतिकता, 2) विविधता। दिलचस्प बात यह है कि सबसे प्राकृतिक डेटा हमेशा सबसे अच्छा नहीं होता है, क्योंकि प्राकृतिकता विविधता की लागत पर आ सकती है। ‘

‘यह तथ्य कि प्राकृतिक डेटा मदद कर सकता है आश्चर्य की बात नहीं है, और यह सुझाव देता है कि वास्तव में बड़े पैमाने पर वास्तविक डेटा में मूल्य है। हालांकि, हम पाते हैं कि महत्वपूर्ण बात यह नहीं है कि डेटा वास्तविक है, बल्कि यह है कि यह प्राकृतिक है, अर्थात यह वास्तविक डेटा के कुछ संरचनात्मक गुणों को पकड़ना चाहिए। ‘

‘इनमें से कई गुणों को सरल शोर मॉडल में पकड़ा जा सकता है। ‘

विभिन्न 'यादृच्छिक छवि' डेटासेट पर एक अलेक्सनेट-व्युत्पन्न एनकोडर से उत्पन्न सुविधा दृश्यांकन, जो 3रे और 5वें (अंतिम) कन्वोल्यूशनल परत को कवर करता है। यहां उपयोग की गई विधि 2017 में गूगल एआई रिसर्च में बताई गई है।

विभिन्न ‘यादृच्छिक छवि’ डेटासेट पर एक अलेक्सनेट-व्युत्पन्न एनकोडर से उत्पन्न सुविधा दृश्यांकन, जो 3रे और 5वें (अंतिम) कन्वोल्यूशनल परत को कवर करता है। यहां उपयोग की गई विधि 2017 में गूगल एआई रिसर्च में बताई गई है।

पत्र, जो 35वें कॉन्फ्रेंस ऑन न्यूरल इन्फॉर्मेशन प्रोसेसिंग सिस्टम (न्यूरिप्स 2021) में सिडनी में प्रस्तुत किया गया था, का शीर्षक लर्निंग टू सी बाय लुकिंग एट नॉइज है, और यह सीएसएआईएल के छह शोधकर्ताओं से समान योगदान के साथ आता है।

काम को न्यूरिप्स 2021 में स्पॉटलाइट चयन के लिए सर्वसम्मति से अनुशंसित किया गया था, जिसमें सहकर्मी समीक्षकों ने इसे ‘वैज्ञानिक सफलता’ के रूप में वर्णित किया था जो एक ‘महान अध्ययन क्षेत्र’ खोलता है, भले ही यह उतने ही सवाल उठाता है जितने उत्तर देता है।

पत्र में, लेखक निष्कर्ष निकालते हैं:

‘हमने दिखाया है कि जब पिछले शोध परिणामों का उपयोग करके प्राकृतिक छवि सांख्यिकी का डिज़ाइन किया जाता है, तो ये डेटासेट दृश्य प्रतिनिधित्व को सफलतापूर्वक प्रशिक्षित कर सकते हैं। हमें आशा है कि यह पत्र विभिन्न दृश्य कार्यों में उच्च प्रदर्शन प्राप्त करने वाले संरचित शोर का उत्पादन करने में सक्षम नए जनरेटिव मॉडल के अध्ययन को प्रेरित करेगा। ‘

‘क्या हम इमेजनेट प्रीट्रेनिंग के साथ प्राप्त प्रदर्शन को मैच कर सकते हैं? शायद किसी विशिष्ट कार्य के लिए विशिष्ट बड़े प्रशिक्षण सेट की अनुपस्थिति में, सबसे अच्छा प्री-प्रशिक्षण मानक वास्तविक डेटासेट जैसे इमेजनेट का उपयोग करना नहीं हो सकता है। ‘

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai