Anderson का एंगल
लोकप्रिय COVIDx डेटासेट की यूके के शोधकर्ताओं द्वारा आलोचना की गई

यूके से एक शोध समूह ने कंप्यूटर विजन-आधारित विश्लेषण के लिए खुले स्रोत डेटासेट के वैज्ञानिक विश्वास की आलोचना की है, जो कि COVID-19 रोगियों के छाती के एक्स-रे के विश्लेषण पर केंद्रित है, जिसमें लोकप्रिय खुले स्रोत डेटासेट COVIDx पर केंद्रित है।
शोधकर्ताओं ने, जिन्होंने विभिन्न एआई प्रशिक्षण मॉडल में COVIDx का परीक्षण किया है, दावा किया है कि यह ‘वास्तविक नैदानिक समस्या’ का प्रतिनिधित्व नहीं करता है, परिणाम ‘फुले हुए’ हैं, और मॉडल ‘वास्तविक दुनिया के डेटा’ पर अच्छी तरह से सामान्य नहीं हैं।
लेखकों ने यह भी उल्लेख किया है कि जो डेटा COVIDx बनाता है वह असंगत है, जहां मूल छवियां विभिन्न रिज़ॉल्यूशन में आती हैं जो गहरे शिक्षण वर्कफ़्लो द्वारा प्रशिक्षण के लिए आवश्यक सुसंगत आकार में स्वचालित रूप से प्रारूपित होती हैं, और यह प्रक्रिया छवि पुनर्निर्धारण अल्गोरिदम के संबंध में धोखाधड़ी से भरे कलाकृतियों को पेश कर सकती है, न कि डेटा के नैदानिक पहलू के संबंध में।
पत्र में पेपर कहा जाता है, कोविड -19 के लिए गहरे शिक्षण समाधान विकसित करने के लिए खुले डेटा का उपयोग करने के जाल, और यह लीड्स विश्वविद्यालय में सेंटर फॉर कंप्यूटेशनल इमेजिंग एंड सिमुलेशन इन बायोमेडिसिन (सीआईएसटीआईबी) के बीच एक सहयोग है, साथ ही शहर के पांच अन्य संगठनों के शोधकर्ताओं के साथ, जिनमें लीड्स टीचिंग अस्पताल एनएचएस ट्रस्ट शामिल हैं।
शोध विवरण, अन्य नकारात्मक प्रथाओं के बीच, COVIDx डेटासेट में ‘लेबल का दुरुपयोग’ को विस्तार से बताता है, साथ ही ‘पक्षपात और संघात’ का उच्च जोखिम भी है। शोधकर्ताओं के अपने प्रयोग जो डेटासेट को तीन व्यवहार्य गहरे शिक्षण मॉडल के माध्यम से डालते हैं, उन्हें यह निष्कर्ष निकालने के लिए प्रेरित करते हैं कि ‘व्यापक रूप से समस्या डोमेन में रिपोर्ट किए गए असाधारण प्रदर्शन को फुलाया जाता है, मॉडल प्रदर्शन परिणाम विकृत होते हैं, और मॉडल वास्तविक दुनिया के डेटा पर अच्छी तरह से सामान्य नहीं होते हैं। ‘
एक में पांच विपरीत डेटासेट
रिपोर्ट* बताती है कि इस क्षेत्र में अधिकांश वर्तमान एआई-आधारित विधियां विभिन्न खुले स्रोत रिपॉजिटरी से ‘विविध’ डेटा संग्रह पर निर्भर करती हैं, यह देखते हुए कि पांच डेटासेट, जो विशिष्ट विशेषताओं के साथ हैं, को COVIDx डेटासेट में एकत्र किया गया है, शोधकर्ताओं के विचार में पर्याप्त डेटा गुणवत्ता और प्रकार की समानता के बिना।
COVIDx डेटासेट मई 2020 में वाटरलू विश्वविद्यालय में सिस्टम डिज़ाइन इंजीनियरिंग विभाग के नेतृत्व में एक संघ के प्रयास के रूप में जारी किया गया था, डेटा के रूप में उपलब्ध कराया गया था COVID-Net ओपन सोर्स पहल के हिस्से के रूप में।
पांच संग्रह जो COVIDx बनाते हैं वे हैं: COVID-19 इमेज डेटा संग्रह (मॉन्ट्रियल शोधकर्ताओं से एक ओपन सोर्स सेट); COVID-19 छाती एक्स-रे डेटासेट पहल; Actualmed COVID-19 छाती एक्स-रे डेटासेट; COVID-19 रेडियोग्राफी डेटाबेस; और RSNA न्यूमोनिया डिटेक्शन चैलेंज डेटासेट, जो कई पूरे-कोविड सेटों में से एक है जो महामारी संकट के लिए सेवा में लाया गया है।
(RICORD – नीचे देखें – बाद में COVIDx में जोड़ा गया है, लेकिन चूंकि यह अध्ययन में रुचि के मॉडल के बाद शामिल किया गया था, इसलिए इसे परीक्षण डेटा से बाहर रखा गया था, और किसी भी मामले में यह COVIDx को और भी अधिक विविधता प्रदान करने की प्रवृत्ति रखता है, जो अध्ययन के लेखकों की केंद्रीय शिकायत है।)
शोधकर्ता दावा करते हैं कि COVIDx COVID शोध से संबंधित वैज्ञानिक समुदाय में अपनी तरह का ‘सबसे बड़ा और सबसे व्यापक रूप से उपयोग किया जाने वाला’ डेटासेट है, और COVIDx डेटासेट के त्रिपक्षीय योजना (अर्थात, ‘सामान्य’, ‘न्यूमोनिया’, और ‘COVID-19’) के अनुरूप बाहरी डेटासेट से आयातित डेटा पर्याप्त रूप से अनुरूप नहीं है।
निकट पर्याप्त..?
अध्ययन के समय में योगदान देने वाले डेटासेट की उत्पत्ति और उपयुक्तता की जांच करते हुए, शोधकर्ताओं ने पाया कि ‘लेबल का दुरुपयोग’ हुआ है, जहां एक प्रकार का डेटा दूसरे वर्ग में रखा गया है, जैसा कि शोधकर्ताओं का दावा है:
‘RSNA रिपॉजिटरी, जो NIH Chestx-ray8 से सार्वजनिक रूप से उपलब्ध छाती एक्स-रे डेटा का उपयोग करता है [**], एक सेगमेंटेशन कार्य के लिए डिज़ाइन किया गया था और इस तरह तीन वर्गों की छवियां हैं – ‘फेफड़े की अपारदर्शिता’, ‘कोई फेफड़े की अपारदर्शिता / सामान्य नहीं’, और ‘सामान्य’, ‘फेफड़े की अपारदर्शिता’ मामलों के लिए बाउंडिंग बॉक्स उपलब्ध हैं।
‘COVIDx में इसका संकलन करने में ‘फेफड़े की अपारदर्शिता’ वर्ग की सभी छाती एक्स-रे को न्यूमोनिया वर्ग में शामिल किया गया है। ‘
प्रभावी रूप से, पत्र दावा करता है, COVIDx पद्धति ‘न्यूमोनिया’ की परिभाषा को ‘सभी न्यूमोनिया-जैसी फेफड़े की अपारदर्शिता’ तक बढ़ाती है। नतीजतन, तुलनात्मक डेटा प्रकार का मूल्य संभावित रूप से खतरे में है। शोधकर्ता कहते हैं:
‘ […] COVIDx डेटासेट में न्यूमोनिया वर्ग में छाती एक्स-रे हैं जो कई अन्य रोगों के साथ जुड़े हुए हैं, जिनमें प्लूरल इफ्यूजन, इन्फिल्ट्रेशन, कंसोलिडेशन, एम्फीसेमा और द्रव्यमान शामिल हैं। कंसोलिडेशन संभावित न्यूमोनिया की एक रेडियोलॉजिकल विशेषता है, नैदानिक निदान नहीं। कंसोलिडेशन का उपयोग न्यूमोनिया के प्रतिस्थापन के रूप में करना, इसका दस्तावेजीकरण किए बिना, भ्रामक हो सकता है। ‘

COVIDx से जुड़ी वैकल्पिक रोगशास्त्र (COVID-19 के अलावा). स्रोत: https://arxiv.org/ftp/arxiv/papers/2109/2109.08020.pdf
रिपोर्ट में पाया गया है कि केवल 6.13% RSNA से 4,305 न्यूमोनिया मामलों को सटीक रूप से लेबल किया गया था, जो कि केवल 265 वास्तविक न्यूमोनिया मामलों का प्रतिनिधित्व करता है।
इसके अलावा, COVIDx में शामिल कई गैर-न्यूमोनिया मामले सह-रोगों का प्रतिनिधित्व करते थे – अन्य बीमारियों की जटिलताएं, या अन्यथा स्थितियों में गैर-न्यूमोनिया से संबंधित माध्यमिक चिकित्सा मुद्दे जो आवश्यक रूप से न्यूमोनिया से संबंधित नहीं हैं।
सामान्य नहीं
रिपोर्ट आगे सुझाव देती है कि RSNA चुनौती डेटासेट का COVIDx पर प्रभाव डेटा की सांख्यिकीय स्थिरता को बाधित कर सकता है। शोधकर्ता देखते हैं कि COVIDx RSNA डेटा के ‘सामान्य’ वर्ग को प्राथमिकता देता है, प्रभावी रूप से व्यापक डेटासेट में ‘कोई फेफड़े की अपारदर्शिता / सामान्य नहीं’ वर्गों को बाहर करता है। पत्र कहता है:
‘जबकि यह ‘सामान्य’ लेबल के भीतर अपेक्षित है, न्यूमोनिया वर्ग का विस्तार करना और केवल ‘सामान्य’ छाती एक्स-रे का उपयोग करना, न्यूमोनिया-नकारात्मक मामलों के बजाय, वर्गीकरण कार्य को बहुत सरल बना देता है।
‘परिणाम यह है कि डेटासेट जो वास्तविक नैदानिक समस्या से दूर एक कार्य को प्रतिबिंबित करता है। ‘
असंगत डेटा मानकों से संभावित पूर्वाग्रह
पत्र में COVIDx में कई प्रकार के पूर्वाग्रहों का पता चलता है, यह देखते हुए कि कुछ योगदान देने वाले डेटा पेडियाट्रिक छाती एक्स-रे छवियों को वयस्क रोगियों की एक्स-रे के साथ मिलाता है, और आगे यह देखता है कि यह डेटा COVIDx में पेडियाट्रिक छवियों का ‘महत्वपूर्ण’ स्रोत है।
इसके अलावा, RSNA डेटासेट की छवियों में 1024×1024 रिज़ॉल्यूशन है, जबकि एक अन्य योगदान देने वाले डेटासेट में केवल 299×299 रिज़ॉल्यूशन है। चूंकि मशीन लर्निंग मॉडल छवियों को उपलब्ध प्रशिक्षण स्थान (लेटेंट स्पेस) में समायोजित करने के लिए अनिवार्य रूप से पुनर्निर्धारित करेंगे, इसका मतलब है कि 299×299 छवियों को प्रशिक्षण वर्कफ़्लो में बढ़ाया जाएगा (संभावित रूप से स्केलिंग अल्गोरिदम से संबंधित कलाकृतियों को पेश करते हुए), और बड़ी छवियों को कम किया जाएगा। फिर से, यह गहरे शिक्षण-आधारित कंप्यूटर विजन विश्लेषण के लिए आवश्यक समान डेटा मानकों के खिलाफ है।
इसके अलावा, ActMed डेटा जो COVIDx में शामिल किया गया है में COVID-19 छाती एक्स-रे में ‘डिस्क-आकार के मार्कर’ हैं, एक पुनरावृत्ति विशेषता जो व्यापक डेटासेट के साथ असंगत है, और जिसे ‘पुनरावृत्ति आउटलियर’ के रूप में संभाला जाना चाहिए।
यह वह मुद्दा है जिसे आमतौर पर डेटा को साफ करने या छोड़ने के द्वारा संबोधित किया जाता है, क्योंकि मार्करों की पुनरावृत्ति पर्याप्त है कि यह प्रशिक्षण में एक ‘विशेषता’ के रूप में पंजीकृत हो, लेकिन व्यापक योजना में इसका उपयोग करने के लिए पर्याप्त बार-बार नहीं है। मार्करों के प्रभाव को छोड़ने के लिए एक तंत्र के बिना, वे संभावित रूप से मशीन लर्निंग प्रणाली की विधि द्वारा रोगसूचक घटना के रूप में माने जा सकते हैं।
प्रशिक्षण और परीक्षण
शोधकर्ताओं ने COVIDx का दो तुलनात्मक डेटासेट के खिलाफ तीन मॉडल पर परीक्षण किया। अतिरिक्त दो डेटासेट RICORD थे, जिसमें 1096 COVID-19 छाती एक्स-रे शामिल थे, जो चार देशों से 361 रोगियों से सourced थे; और CheXpert, एक सार्वजनिक डेटासेट
तीन मॉडल जिनका उपयोग किया गया था वे COVID-Net, CoroNet और DarkCovidNet थे। तीनों मॉडल कनवोल्यूशनल न्यूरल नेटवर्क (CNN) का उपयोग करते हैं, हालांकि CoroNet में एक दो-चरणीय छवि वर्गीकरण प्रक्रिया है, जिसमें ऑटोएनकोडर आउटपुट को एक CNN वर्गीकरणकर्ता में पास किया जाता है।
परीक्षण में पाया गया कि सभी मॉडलों के प्रदर्शन में एक ‘तेज गिरावट’ हुई जब COVIDx डेटासेट की तुलना में गैर-COVIDx डेटासेट पर परीक्षण किया गया, जो 86% सटीकता का परिणाम था जब COVIDx डेटा का उपयोग किया गया था। हालांकि, यदि डेटा गलत लेबल किया गया है या गलत तरीके से समूहीकृत किया गया है, तो वे प्रभावी रूप से झूठे परिणाम हैं। शोधकर्ताओं ने तुलनात्मक बाहरी डेटासेट पर काफी कम सटीकता परिणामों की सूचना दी, जिसे पत्र अधिक वास्तविक और सही तरीके से वर्गीकृत डेटा के रूप में प्रस्तावित करता है।
इसके अलावा, पत्र में कहा गया है:
‘COVIDx परीक्षण डेटा पर 500 ग्रेड-CAM सैलिएंसी मैप्स की एक नैदानिक समीक्षा, जो DarkCovidNet द्वारा उत्पन्न की गई थी, ने नैदानिक रूप से अप्रासंगिक विशेषताओं में एक प्रवृत्ति का महत्व दिखाया। यह अक्सर हड्डी संरचनाओं और मुलायम ऊतकों पर ध्यान केंद्रित करने के बजाय फेफड़े के क्षेत्रों के विस्तृत द्विपक्षीय अपारदर्शिता के बजाय। ‘

यह एक पुष्टि किए गए COVID-19 मामले का एक्स-रे है, जिसे DarkCovidNet पर COVIDx से प्रशिक्षित 0.938 पूर्वानुमान संभावना दी गई है।
निष्कर्ष
शोधकर्ता COVIDx डेटासेट में छाती एक्स-रे छवियों से संबंधित जनसांख्यिकी या नैदानिक डेटा की कमी की आलोचना करते हैं, यह तर्क देते हुए कि इसके बिना, ‘संघात कारकों’ जैसे आयु के लिए खाता करना असंभव है।
वे यह भी देखते हैं कि COVIDx डेटासेट में पाए गए मुद्दे अन्य डेटासेट पर लागू हो सकते हैं जो इसी तरह से सourced थे (अर्थात, पूरे-कोविड रेडियोलॉजिकल इमेज डेटाबेस को हाल के कोविड एक्स-रे इमेज डेटा के साथ मिलाने के बिना पर्याप्त डेटा वास्तुकला, विचलन मुआवजा, और इस दृष्टिकोण की सीमाओं के स्पष्ट दृष्टिकोण के साथ)।
रिपोर्ट में COVIDx की कमियों को सारांशित करते हुए, शोधकर्ता कहते हैं कि ‘व्यापक रूप से समस्या डोमेन में रिपोर्ट किए गए असाधारण प्रदर्शन [कोविडएक्स] फुलाया जाता है, मॉडल प्रदर्शन परिणाम विकृत होते हैं, और मॉडल वास्तविक दुनिया के डेटा पर अच्छी तरह से सामान्य नहीं होते हैं। ‘
रिपोर्ट निष्कर्ष निकालती है:
‘उपलब्ध अस्पताल डेटा की कमी के साथ-साथ समस्या डोमेन में पर्याप्त मॉडल मूल्यांकन की कमी ने खुले स्रोत डेटा के उपयोग को शोध समुदाय को गुमराह करने दिया है। चिकित्सा निदान में एआई शोध की विश्वसनीयता को नुकसान पहुंचाने के जोखिम के साथ महामारी के दौरान मॉडल प्रदर्शन मेट्रिक्स के फुलाए हुए प्रकाशन जारी है। इस डोमेन में शोध की गुणवत्ता में सुधार करने के लिए यह होना चाहिए, यह डेटा से शुरू होना चाहिए। ‘
*हालांकि अध्ययन के शोधकर्ता दावा करते हैं कि उन्होंने नए पत्र के लिए डेटा, फाइलें और कोड ऑनलाइन उपलब्ध कराए हैं, लॉगिन की आवश्यकता है, और लेखन के समय, सामान्य जनता के लिए फाइलों तक पहुंच नहीं है। ** चेस्टएक्स-रे8: हॉस्पिटल-स्केल चेस्ट एक्स-रे डेटाबेस और सामान्य थोरैक्स रोगों के कमजोर-पर्यवेक्षित वर्गीकरण और स्थानीयकरण पर बेंचमार्क – https://arxiv.org/pdf/1705.02315.pdf












