एआई की मूल बातें

कंफ्यूजन मैट्रिक्स क्या है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मशीन लर्निंग और डेटा साइंस में सबसे शक्तिशाली विश्लेषणात्मक उपकरणों में से एक कंफ्यूजन मैट्रिक्स है। कंफ्यूजन मैट्रिक्स शोधकर्ताओं को यह जानकारी देने में सक्षम है कि एक मशीन लर्निंग क्लासिफायर ने डेटासेट में लक्ष्य वर्गों के संबंध में कैसा प्रदर्शन किया है। एक कंफ्यूजन मैट्रिक्स ठीक से वर्गीकृत उदाहरणों के खिलाफ वर्गीकृत उदाहरणों को प्रदर्शित करेगा। आइए एक कंफ्यूजन मैट्रिक्स की संरचना और इसकी व्याख्या कैसे की जा सकती है, इस पर एक गहरी नज़र डालें।

कंफ्यूजन मैट्रिक्स क्या है?

शुरू करने के लिए, कंफ्यूजन मैट्रिक्स की एक सरल परिभाषा देते हैं। कंफ्यूजन मैट्रिक्स एक पूर्वानुमानिक विश्लेषण उपकरण है। विशेष रूप से, यह एक तालिका है जो वास्तविक मानों की तुलना मॉडल के पूर्वानुमानित मानों के साथ प्रदर्शित करती है। मशीन लर्निंग के संदर्भ में, कंफ्यूजन मैट्रिक्स एक मीट्रिक के रूप में उपयोग किया जाता है ताकि यह विश्लेषण किया जा सके कि एक मशीन लर्निंग क्लासिफायर ने एक डेटासेट पर कैसा प्रदर्शन किया। कंफ्यूजन मैट्रिक्स सटीकता, सटीकता, विशिष्टता, और रिकॉल जैसे मीट्रिक्स का एक दृश्य प्रस्तुत करता है।

कंफ्यूजन मैट्रिक्स विशेष रूप से उपयोगी है क्योंकि यह अन्य प्रकार के वर्गीकरण मीट्रिक्स जैसे कि साधारण सटीकता की तुलना में एक अधिक पूर्ण चित्र प्रस्तुत करता है कि मॉडल ने कैसा प्रदर्शन किया। केवल सटीकता जैसे मीट्रिक का उपयोग करने से यह स्थिति उत्पन्न हो सकती है जहां मॉडल एक वर्ग को पूरी तरह से और लगातार गलत पहचान रहा है, लेकिन यह ध्यान देने योग्य नहीं है क्योंकि औसत प्रदर्शन अच्छा है। जबकि कंफ्यूजन मैट्रिक्स विभिन्न मानों की तुलना प्रदान करता है जैसे कि झूठी नकारात्मक, सच्ची नकारात्मक, झूठी सकारात्मक, और सच्ची सकारात्मक।

आइए कंफ्यूजन मैट्रिक्स द्वारा प्रस्तुत किए जाने वाले विभिन्न मीट्रिक्स को परिभाषित करें।

कंफ्यूजन मैट्रिक्स में रिकॉल

रिकॉल वास्तविक सकारात्मक उदाहरणों की संख्या को झूठी नकारात्मक उदाहरणों और कुल सकारात्मक उदाहरणों की संख्या से विभाजित किया जाता है। दूसरे शब्दों में, रिकॉल वास्तविक सकारात्मक उदाहरणों के अनुपात का प्रतिनिधित्व करता है जो एक मशीन लर्निंग मॉडल द्वारा वर्गीकृत किया गया है। रिकॉल को सकारात्मक उदाहरणों के प्रतिशत के रूप में दिया जाता है जो मॉडल ने सभी सकारात्मक उदाहरणों में से वर्गीकृत किया है। इस मान को “हिट रेट” भी कहा जा सकता है, और एक संबंधित मान “संवेदनशीलता” है, जो रिकॉल की संभावना का वर्णन करता है, या वास्तविक सकारात्मक भविष्यवाणियों की दर।

कंफ्यूजन मैट्रिक्स में सटीकता

रिकॉल की तरह, सटीकता एक मान है जो मॉडल के प्रदर्शन को सकारात्मक उदाहरण वर्गीकरण के संदर्भ में ट्रैक करता है। हालांकि, सटीकता यह जानने से संबंधित है कि मॉडल द्वारा सकारात्मक के रूप में लेबल किए गए उदाहरणों में से कितने वास्तव में सकारात्मक थे। इसकी गणना करने के लिए, सच्चे सकारात्मक उदाहरणों की संख्या को झूठी सकारात्मक उदाहरणों और सच्चे सकारात्मक उदाहरणों की संख्या से विभाजित किया जाता है।

रिकॉल और सटीकता के बीच अंतर को स्पष्ट करने के लिए, सटीकता यह जानने की कोशिश करती है कि सभी उदाहरणों को मॉडल द्वारा सकारात्मक के रूप में लेबल किए जाने का प्रतिशत क्या है, जबकि रिकॉल यह ट्रैक करता है कि सभी वास्तविक सकारात्मक उदाहरणों में से कितने मॉडल द्वारा पहचाने गए थे।

कंफ्यूजन मैट्रिक्स में विशिष्टता

जबकि रिकॉल और सटीकता सकारात्मक उदाहरणों और सच्ची सकारात्मक दर को ट्रैक करने वाले मान हैं, विशिष्टता नकारात्मक उदाहरणों की सच्ची दर या मॉडल द्वारा नकारात्मक के रूप में परिभाषित किए गए उदाहरणों की संख्या को मापती है जो वास्तव में नकारात्मक थे। इसकी गणना नकारात्मक के रूप में वर्गीकृत उदाहरणों की संख्या को झूठी सकारात्मक उदाहरणों और सच्चे नकारात्मक उदाहरणों की संख्या से विभाजित करके की जाती है।

कंफ्यूजन मैट्रिक्स को समझना

फोटो: जैकवर विकिमीडिया कॉमन्स के माध्यम से, (https://commons.wikimedia.org/wiki/File:ConfusionMatrix.png), सीसी बाय एसए 3.0

कंफ्यूजन मैट्रिक्स का उदाहरण

सटीकता, रिकॉल, संवेदनशीलता, और विशिष्टता जैसे आवश्यक शब्दों को परिभाषित करने के बाद, हम देख सकते हैं कि ये विभिन्न मान कैसे एक कंफ्यूजन मैट्रिक्स के भीतर प्रस्तुत किए जाते हैं। एक कंफ्यूजन मैट्रिक्स वर्गीकरण के मामलों में उत्पन्न होता है, जब दो या अधिक वर्ग होते हैं। उत्पन्न की गई कंफ्यूजन मैट्रिक्स को आवश्यकतानुसार उतना ही ऊंचा और चौड़ा बनाया जा सकता है, जिसमें किसी भी वांछित संख्या में वर्ग हो सकते हैं, लेकिन सरलता के लिए, हम एक द्विआधारी वर्गीकरण कार्य के लिए 2 x 2 कंफ्यूजन मैट्रिक्स की जांच करेंगे।

एक उदाहरण के रूप में, मान लें कि एक वर्गीकारक एक रोग की उपस्थिति का निर्धारण करने के लिए उपयोग किया जा रहा है। विशेषताएं वर्गीकारक में फीड की जाएंगी, और वर्गीकारक दो अलग-अलग वर्गीकरणों में से एक को वापस करेगा – या तो रोगी को रोग नहीं है या उन्हें है।

मैट्रिक्स के बाएं हाथ की ओर से शुरू करते हैं। मैट्रिक्स का बायां हिस्सा वर्गीकारक द्वारा व्यक्तिगत वर्गों के लिए किए गए पूर्वानुमानों का प्रतिनिधित्व करता है। एक द्विआधारी वर्गीकरण कार्य में दो पंक्तियां होंगी। मैट्रिक्स के ऊपरी हिस्से में, यह डेटा उदाहरणों के वास्तविक मानों को ट्रैक करता है, वास्तविक वर्ग लेबल।

एक कंफ्यूजन मैट्रिक्स की व्याख्या करने के लिए, मॉडल के पूर्वानुमानों को मॉडल के वास्तविक लेबल के साथ जोड़कर की जा सकती है। इस मामले में, सच्चे सकारात्मक मान, या सही सकारात्मक पूर्वानुमानों की संख्या, मैट्रिक्स के ऊपरी बाएं कोने में स्थित है। झूठी सकारात्मक मान ऊपरी दाएं कोने में पाए जाते हैं, जहां उदाहरण वास्तव में नकारात्मक हैं लेकिन वर्गीकारक ने उन्हें सकारात्मक के रूप में चिह्नित किया है।

मैट्रिक्स के निचले बाएं कोने में वर्गीकारक द्वारा नकारात्मक के रूप में चिह्नित उदाहरणों को प्रदर्शित किया जाता है जो वास्तव में सकारात्मक थे। अंत में, मैट्रिक्स के निचले दाएं कोने में सच्चे नकारात्मक मान, या वास्तव में नकारात्मक उदाहरण पाए जाते हैं।

जब डेटासेट में दो से अधिक वर्ग होते हैं, तो मैट्रिक्स उन वर्गों की संख्या से बढ़ जाता है। उदाहरण के लिए, यदि तीन वर्ग हैं, तो मैट्रिक्स 3 x 3 मैट्रिक्स होगा। मैट्रिक्स के आकार की परवाह किए बिना, व्याख्या करने की विधि बिल्कुल समान है। बाएं हाथ की ओर पूर्वानुमानित मान होते हैं और वास्तविक वर्ग लेबल ऊपरी हिस्से में चलते हैं। सही तरीके से पूर्वानुमानित उदाहरण बाएं से दाएं तक तिरछे चलते हैं। मैट्रिक्स को देखकर आप उपरोक्त चार पूर्वानुमानिक मीट्रिक्स को समझ सकते हैं।

उदाहरण के लिए, आप सच्चे सकारात्मक और झूठी नकारात्मक मानों को जोड़कर और उन्हें सच्चे सकारात्मक उदाहरणों की संख्या से विभाजित करके रिकॉल की गणना कर सकते हैं। जबकि सटीकता की गणना झूठी सकारात्मक मानों को सच्चे सकारात्मक मानों के साथ जोड़कर और परिणाम को सच्चे सकारात्मक मानों से विभाजित करके की जा सकती है।

हालांकि किसी को सटीकता, रिकॉल, और विशिष्टता जैसे मीट्रिक्स की गणना करने में समय लग सकता है, ये मीट्रिक्स इतने सामान्य रूप से उपयोग किए जाते हैं कि अधिकांश मशीन लर्निंग लाइब्रेरी उन्हें प्रदर्शित करने के तरीके प्रदान करती हैं। उदाहरण के लिए, पाइथन के लिए स्किट-लर्न में एक फंक्शन है जो एक कंफ्यूजन मैट्रिक्स उत्पन्न करता है।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।