Anderson का एंगल

कंप्यूटर विजन डेटासेट में JPEG आर्टिफैक्ट समस्या का समाधान

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मैरीलैंड विश्वविद्यालय और फेसबुक एआई के एक नए अध्ययन में पाया गया है कि गहरे शिक्षण प्रणालियों के लिए डेटासेट में उच्च संकुचित JPEG छवियों का उपयोग करने से ‘महत्वपूर्ण प्रदर्शन जुर्माना’ होता है, और इस प्रभाव को कम करने के लिए कुछ नए तरीके प्रस्तुत किए गए हैं।

अध्ययन रिपोर्ट में, जिसका शीर्षक डीप लर्निंग में जेपीईजी संपीड़न दोषों का विश्लेषण और कम करना है, दावा किया गया है कि यह पिछले अध्ययनों की तुलना में ‘काफी अधिक व्यापक’ है जो कंप्यूटर विजन डेटासेट में कलाकृतियों के प्रभावों की जांच करते हैं। इस पत्र में पाया गया है कि ‘[भारी] से मध्यम जेपीईजी संपीड़न मानक मेट्रिक्स पर महत्वपूर्ण प्रदर्शन जुर्माना लेता है’, और यह कि न्यूरल नेटवर्क ऐसी विकृतियों के प्रति पहले के काम की तुलना में कम मजबूत हो सकते हैं जो सुझाव देते हैं

<img class="size-full wp-image-177824" src="https://www.unite.ai/wp-content/uploads/2021/09/dog-identification.jpg" alt="2018 मोबाइलनेटवी2 डेटासेट से एक कुत्ते की तस्वीर। गुणवत्ता 10 (बाएं) पर, एक वर्गीकरण प्रणाली सही नस्ल 'पेम्ब्रोक वेल्श कॉर्गी' की पहचान करने में विफल रहती है, इसके बजाय 'नॉर्विच टेरियर' (प्रणाली पहले से ही जानती है कि यह एक कुत्ते की तस्वीर है, लेकिन नस्ल नहीं) का अनुमान लगाती है; दूसरा बायां, एक ऑफ-द-शेल्फ जेपीईजी आर्टिफैक्ट-सुधारित छवि का संस्करण फिर से सही नस्ल की पहचान करने में विफल रहता है; दूसरा दायां, लक्षित आर्टिफैक्ट सुधार सही वर्गीकरण को बहाल करता है; और दायां, मूल फोटो, सही तरीके से वर्गीकृत। स्रोत: https://arxiv.org/pdf/2011.08932.pdf

संपीड़न कलाकृतियों को ‘डेटा’ के रूप में

अत्यधिक जेपीईजी संपीड़न 8×8 ब्लॉक्स के आसपास दृश्यमान या अर्ध-दृश्यमान सीमाओं का निर्माण करने की संभावना है जिनसे एक जेपीईजी को पिक्सेल ग्रिड में इकट्ठा किया जाता है। एक बार जब ये ब्लॉकिंग या ‘रिंगिंग’ कलाकृतियां दिखाई देती हैं, तो वे मशीन लर्निंग प्रणालियों द्वारा वास्तविक दुनिया के तत्वों के रूप में गलत व्याख्या की जा सकती हैं, जब तक कि इसके लिए कुछ मुआवजा नहीं दिया जाता है।

ऊपर, एक कंप्यूटर विजन मशीन लर्निंग सिस्टम एक अच्छी गुणवत्ता वाली तस्वीर से एक 'साफ' ग्रेडिएंट छवि निकालता है। नीचे, निम्न-गुणवत्ता वाली छवि में 'ब्लॉकिंग' कलाकृतियां विषय की विशेषताओं को धुंधला कर देती हैं और छवि सेट से निकाली गई विशेषताओं को संक्रमित कर सकती हैं, विशेष रूप से तब जब उच्च और निम्न गुणवत्ता वाली छवियां डेटासेट में होती हैं, जैसे कि केवल सामान्य डेटा साफ्टवेयर के साथ वेब-स्क्रैप्ड संग्रह। स्रोत: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

ऊपर, एक कंप्यूटर विजन मशीन लर्निंग सिस्टम एक अच्छी गुणवत्ता वाली तस्वीर से एक ‘साफ’ ग्रेडिएंट छवि निकालता है। नीचे, निम्न-गुणवत्ता वाली छवि में ‘ब्लॉकिंग’ कलाकृतियां विषय की विशेषताओं को धुंधला कर देती हैं और छवि सेट से निकाली गई विशेषताओं को संक्रमित कर सकती हैं, विशेष रूप से तब जब उच्च और निम्न गुणवत्ता वाली छवियां डेटासेट में होती हैं, जैसे कि केवल सामान्य डेटा साफ्टवेयर के साथ वेब-स्क्रैप्ड संग्रह। स्रोत: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf

जैसा कि पहली छवि में देखा गया है, ऐसी कलाकृतियां छवि वर्गीकरण कार्यों को प्रभावित कर सकती हैं, जिसका अर्थ है कि पाठ-मान्यता एल्गोरिदम भी कलाकृति-प्रभावित अक्षरों को सही ढंग से पहचानने में विफल हो सकते हैं।

छवि संश्लेषण प्रशिक्षण प्रणालियों (जैसे डीपफेक सॉफ्टवेयर या जीएनएन-आधारित छवि पीढ़ी प्रणाली) के मामले में, डेटासेट में एक ‘अवैध’ ब्लॉक कम गुणवत्ता वाली, अत्यधिक संकुचित छवियों का कारण हो सकता है या तो पुनरुत्पादन की मध्य गुणवत्ता को नीचे खींच सकता है या उच्च गुणवत्ता वाली छवियों से निकाली गई विशेषताओं द्वारा ओवरराइड किया जा सकता है। दोनों ही मामलों में, बेहतर डेटा वांछनीय है – या कम से कम, सुसंगत डेटा।

जेपीईजी – आमतौर पर ‘पर्याप्त’

जेपीईजी संपीड़न एक अपरिवर्तनीय खो देने वाला कोडेक है जो विभिन्न छवि प्रारूपों पर लागू किया जा सकता है, हालांकि यह मुख्य रूप से जेफआईएफ छवि फ़ाइल रैपर पर लागू किया जाता है। इसके बावजूद, जेपीईजी (.jpg) प्रारूप इसके संबंधित संपीड़न विधि के नाम पर रखा गया था, न कि जेफआईएफ रैपर के लिए छवि डेटा के लिए।

हाल के वर्षों में, जेपीईजी शैली की कलाकृति मिटाने के लिए एआई-संचालित अपस्केलिंग/पुनर्स्थापना दिनचर्या के हिस्से के रूप में पूरी मशीन लर्निंग आर्किटेक्चर विकसित हुए हैं। एआई-आधारित संपीड़न कलाकृति हटाना अब कई व्यावसायिक उत्पादों में शामिल किया गया है, जैसे कि टोपाज़ छवि/वीडियो सूट, और हाल के एडोब फोटोशॉप संस्करणों की न्यूरल सुविधाएं

1986 जेपीईजी योजना के बाद से, जो वर्तमान में सामान्य उपयोग में है, को 1990 के दशक की शुरुआत में तय किया गया था, इसलिए यह जेपीईजी छवि को बचाने के लिए गुणवत्ता स्तर (1-100) का संकेत देने वाले मेटाडेटा को जोड़ना संभव नहीं है – कम से कम, बिना तीस से अधिक वर्षों के उपभोक्ता, पेशेवर और शैक्षिक सॉफ्टवेयर प्रणालियों को संशोधित किए जो ऐसे मेटाडेटा की अपेक्षा नहीं करते थे।

इसके परिणामस्वरूप, यह असामान्य नहीं है कि जेपीईजी छवि डेटा की मूल्यांकित या ज्ञात गुणवत्ता के अनुसार मशीन लर्निंग प्रशिक्षण दिनचर्या को अनुकूलित किया जाता है, जैसा कि शोधकर्ताओं ने नए पत्र (नीचे देखें) के लिए किया है। मेटाडेटा प्रविष्टि की अनुपस्थिति में, यह या तो छवि को कैसे संपीड़ित किया गया था (यानी, एक नुकसान रहित स्रोत से संपीड़ित किया गया था), या अनुमानित गुणवत्ता के माध्यम से माना जाता है प्रतिभाशाली एल्गोरिदम या मैनुअल वर्गीकरण के माध्यम से।

एक आर्थिक समझौता

जेपीईजी एकमात्र खो देने वाला संपीड़न विधि नहीं है जो मशीन लर्निंग डेटासेट की गुणवत्ता को प्रभावित कर सकती है; पीडीएफ फ़ाइलों में संपीड़न सेटिंग्स भी इस तरह की जानकारी को त्याग सकती हैं और स्थानीय या नेटवर्क संग्रह के लिए डिस्क स्थान बचाने के लिए बहुत कम गुणवत्ता वाले स्तरों पर सेट की जा सकती हैं।

यह आर्काइव.ऑर्ग पर विभिन्न पीडीएफ का नमूना लेकर देखा जा सकता है, जिनमें से कुछ को इतना भारी संपीड़ित किया गया है कि वे छवि या पाठ-मान्यता प्रणालियों के लिए एक उल्लेखनीय चुनौती हैं। कई मामलों में, जैसे कि कॉपीराइट किताबें, इस तरह की तीव्र संपीड़न को एक प्रकार के सस्ते डीआरएम के रूप में लागू किया गया प्रतीत होता है, जिस तरह से कॉपीराइट धारक यूजर-अपलोडेड यूट्यूब वीडियो के लिए जो वे आईपी पर रखते हैं, उनका समाधान करते हैं, जिससे ‘ब्लॉकी’ वीडियो पूर्ण-रेस पurchases के लिए प्रेरित करने वाले प्रचार टोकन के रूप में छोड़ दिया जाता है, न कि उन्हें हटा दिया जाता है।

अन्य कई मामलों में, रिज़ॉल्यूशन या छवि गुणवत्ता निम्न है क्योंकि डेटा बहुत पुराना है, और एक ऐसे युग से आता है जब स्थानीय और नेटवर्क भंडारण अधिक महंगा था, और जब सीमित नेटवर्क गति ने उच्च गुणवत्ता वाली पुनरुत्पादन की तुलना में अत्यधिक अनुकूलित और पोर्टेबल छवियों को प्राथमिकता दी।

यह तर्क दिया गया है कि जेपीईजी, जबकि अब सबसे अच्छा समाधान नहीं है, इंटरनेट की नींव के साथ अंतर्निहित एक अवशेष बुनियादी ढांचे के रूप में ‘स्थापित’ किया गया है जो मूल रूप से हटाने योग्य नहीं है।

विरासत बोझ

बाद की नवाचारों जैसे जेपीईजी 2000, पीएनजी और (सबसे हाल ही).वेबपी प्रारूप बेहतर गुणवत्ता प्रदान करते हैं, पुराने मशीन लर्निंग डेटासेट को फिर से नमूना लेना संभवतः अकादमिक समुदाय में वर्ष-दर-वर्ष कंप्यूटर विजन चुनौतियों की निरंतरता और इतिहास को ‘रीसेट’ कर देगा – एक बाधा जो पीएनजी डेटासेट छवियों को उच्च गुणवत्ता वाले सेटिंग्स पर फिर से बचाने के मामले में भी लागू होगी। इसे एक प्रकार का तकनीकी ऋण माना जा सकता है।

वेनरेबल सर्वर-ड्राइवन छवि प्रसंस्करण लाइब्रेरी जैसे इमेजमैगिक.वेबपी सहित बेहतर प्रारूपों का समर्थन करते हैं, छवि परिवर्तन आवश्यकताएं अक्सर विरासत प्रणालियों में होती हैं जो केवल जेपीजी या पीएनजी (जो नुकसान रहित संपीड़न प्रदान करता है, लेकिन देरी और डिस्क स्थान की लागत पर) के लिए सेट अप की जाती हैं। यहां तक कि वर्डप्रेस, जो लगभग 40% सभी वेबसाइटों को संचालित करता है, ने.वेबपी समर्थन तीन महीने पहले जोड़ा था।

पीएनजी 1990 के दशक के उत्तरार्ध में जीआईएफ फ़ाइलों में उपयोग किए जाने वाले एलडब्ल्यूजेड संपीड़न प्रारूप पर 1995 की घोषणा के जवाब में एक खुला स्रोत समाधान के रूप में उत्पन्न हुआ, जिस पर यूनिसिस और कंप्यूसर्व द्वारा रॉयल्टी का भुगतान किया जाना था। इसके बावजूद, पीएनजी ने कभी भी व्यापक उपयोग या समर्थन प्राप्त नहीं किया, और यहां तक कि 2019 में ट्विटर से भी प्रतिबंधित कर दिया गया था।

इसके अलावा, जेपीईजी संपीड़न तेज, स्थान-कुशल और सभी प्रकार की प्रणालियों में गहराई से निहित है – और इसलिए, यह मशीन लर्निंग दृश्य में पूरी तरह से गायब होने की संभावना नहीं है।

एआई/जेपीईजी सुलह का सर्वश्रेष्ठ बनाना

एक हद तक, मशीन लर्निंग समुदाय ने जेपीईजी संपीड़न की खामियों के साथ खुद को अनुकूलित कर लिया है: 2011 में, यूरोपीय रेडियोलॉजी सोसाइटी (ईएसआर) ने एक अध्ययन प्रकाशित किया था जिसमें ‘अपरिवर्तनीय छवि संपीड़न की व्यावहारिकता’ पर मार्गदर्शन प्रदान किया गया था रेडियोलॉजिकल इमेजिंग में’; जब प्रतिष्ठित एमएनआईएसटी पाठ-मान्यता डेटासेट (जिसका छवि डेटा मूल रूप से एक नए बाइनरी प्रारूप में आपूर्ति की गई थी) को एक ‘नियमित’ छवि प्रारूप में पोर्ट किया गया था, तो जेपीईजी, पीएनजी के बजाय चुना गया था; और एक पहले (2020) सहयोग से नए पत्र के लेखकों ने एक नए आर्किटेक्चर की पेशकश की थी जेपीईजी छवि गुणवत्ता की कमियों के लिए मशीन लर्निंग प्रणालियों को कैलिब्रेट करने के लिए, बिना मॉडल को प्रत्येक जेपीईजी गुणवत्ता सेटिंग पर प्रशिक्षित किए – एक सुविधा जो नए कार्य में उपयोग की जाती है।

वास्तव में, जेपीईजी डेटा की गुणवत्ता-वेरिएंट उपयोगिता पर अनुसंधान एक मशीन लर्निंग में एक अपेक्षाकृत समृद्ध क्षेत्र है। एक (असंबंधित) 2016 परियोजना में सेंटर फॉर ऑटोमेशन रिसर्च से मैरीलैंड विश्वविद्यालय ने वास्तव में डीसीटी डोमेन पर केंद्रित किया है (जहां जेपीईजी कलाकृतियां निम्न गुणवत्ता वाली सेटिंग्स पर होती हैं) गहरी विशेषता निष्कर्षण के मार्ग के रूप में; एक 2019 परियोजना में जेपीईजी डेटा की बाइट-स्तरीय पठन पर केंद्रित किया गया है बिना समय लेने वाली आवश्यकता के छवियों को वास्तव में डिकंप्रेस करने की (यानी, उन्हें किसी बिंदु पर एक स्वचालित कार्य प्रवाह में खोलना); और एक अध्ययन 2019 से फ्रांस में जेपीईजी संपीड़न का लाभ वस्तु मान्यता दिनचर्या के लिए लेता है।

परीक्षण और निष्कर्ष

मैरीलैंड विश्वविद्यालय और फेसबुक के नवीनतम अध्ययन पर लौटते हुए, शोधकर्ताओं ने 10-90 (नीचे जिस पर छवि असंभव रूप से विकृत हो जाती है, और ऊपर जिस पर यह नुकसान रहित संपीड़न के बराबर होती है) के बीच संपीड़ित छवियों पर जेपीईजी पठनीयता और उपयोगिता का परीक्षण करने का प्रयास किया। परीक्षण में उपयोग की जाने वाली छवियां प्रत्येक लक्ष्य गुणवत्ता मूल्य पर पूर्व-संपीड़ित की गईं, जिसमें कम से कम आठ प्रशिक्षण सत्र शामिल थे।

मॉडल को चार तरीकों से स्टोकास्टिक ग्रेडिएंट डिसेंट पर प्रशिक्षित किया गया था: बेसलाइन, जहां कोई अतिरिक्त उपाय जोड़े नहीं गए थे; पर्यवेक्षित फाइन-ट्यूनिंग, जहां प्रशिक्षण सेट को पूर्व-प्रशिक्षित वजन और लेबल वाले डेटा का लाभ मिला (हालांकि शोधकर्ता स्वीकार करते हैं कि यह उपभोक्ता-स्तर के अनुप्रयोगों में प्रतिकृति करना मुश्किल हो सकता है); कलाकृति सुधार, जहां संपीड़ित छवियों पर प्रशिक्षण से पहले सुधार/सुधार किया गया था; और कार्य-लक्षित कलाकृति सुधार, जहां कलाकृति सुधार नेटवर्क प्रशिक्षित त्रुटियों पर फाइन-ट्यून किया गया था।

प्रशिक्षण विभिन्न डेटासेट पर हुआ, जिनमें रेसनेट, फास्टआरसीएनएन, मोबाइलनेटवी2, मास्कआरसीएनएन और केरास के इन्सेप्शनवी3 के कई संस्करण शामिल थे।

कार्य-लक्षित कलाकृति सुधार के बाद नमूना नुकसान परिणाम नीचे दिखाए गए हैं (नीचे = बेहतर).

अध्ययन में प्राप्त परिणामों के विवरण में गहराई से जाना संभव नहीं है, क्योंकि शोधकर्ताओं के निष्कर्ष जेपीईजी कलाकृतियों का मूल्यांकन करने और इसे कम करने के नए तरीकों के बीच विभाजित हैं। प्रशिक्षण को प्रति-गुणवत्ता पर इतने सारे डेटासेट पर दोहराया गया था; और कार्यों में वस्तु पता लगाने, खंडीकरण, और वर्गीकरण जैसे कई उद्देश्य शामिल थे। मूल रूप से, नई रिपोर्ट खुद को जेपीईजी कलाकृतियों से संबंधित कई मुद्दों को संबोधित करने वाले एक व्यापक संदर्भ कार्य के रूप में स्थापित करती है।

फिर भी, पत्र का सामान्य निष्कर्ष यह है कि ‘जेपीईजी संपीड़न में भारी से मध्यम संपीड़न के लिए एक तेज जुर्माना है’। यह यह भी दावा करता है कि इसकी नए, अनलेबल्ड मिटिगेशन रणनीतियां अन्य समान दृष्टिकोणों के बीच श्रेष्ठ परिणाम प्राप्त करती हैं; यह कि जटिल कार्यों के लिए, शोधकर्ताओं की पर्यवेक्षित विधि अपने समकक्षों को बेहतर प्रदर्शन करती है, भले ही इसके पास मैदान-त्रुटि लेबल तक पहुंच नहीं है; और यह कि ये नए तरीके मॉडल पुन: प्रयोग की अनुमति देते हैं, क्योंकि प्राप्त वजन कार्यों के बीच स्थानांतरित किए जा सकते हैं।

वर्गीकरण कार्यों के संदर्भ में, पत्र यह स्पष्ट रूप से कहता है कि ‘जेपीईजी ग्रेडिएंट गुणवत्ता को कम करता है और साथ ही स्थानीयकरण त्रुटियां भी पैदा करता है’।

लेखक भविष्य के अध्ययन को जेपीईजी 2000, वेबपी, एचईआईएफ और बीपीजी जैसे अन्य संपीड़न विधियों को शामिल करने की आशा करते हैं। वे सुझाव देते हैं कि उनकी विधि वीडियो संपीड़न एल्गोरिदम में अनुरूप अनुसंधान में लागू की जा सकती है।

चूंकि अध्ययन में कार्य-लक्षित कलाकृति सुधार विधि इतनी सफल साबित हुई है, लेखकों ने परियोजना के दौरान प्रशिक्षित वजन जारी करने का इरादा व्यक्त किया है, यह उम्मीद करते हुए कि ‘[कई] अनुप्रयोग हमारे टीटीएसी वजन का उपयोग बिना किसी संशोधन के लाभान्वित करेंगे’।

 

n.b. लेख के लिए स्रोत छवि thispersondoesnotexist.com से है

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]