एआई की मूल बातें

के-निकटतम पड़ोसी (के-नियरेस्ट नेबर्स) क्या है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

के-निकटतम पड़ोसी (के-नियरेस्ट नेबर्स) क्या है?

के-निकटतम पड़ोसी एक मशीन लर्निंग तकनीक और एल्गोरिथ्म है जो रिग्रेशन और क्लासिफिकेशन दोनों कार्यों के लिए उपयोग किया जा सकता हैके-निकटतम पड़ोसी एक चुने हुए संख्या में डेटा बिंदुओं के लेबल की जांच करता है जो एक लक्ष्य डेटा बिंदु के आसपास हैं, ताकि यह अनुमान लगाया जा सके कि डेटा बिंदु किस वर्ग में आता है। के-निकटतम पड़ोसी (के-नियरेस्ट नेबर्स) एक अवधारणात्मक रूप से सरल लेकिन बहुत शक्तिशाली एल्गोरिथ्म है, और इन कारणों से, यह सबसे लोकप्रिय मशीन लर्निंग एल्गोरिथ्म में से एक है। आइए के-नियरेस्ट नेबर्स एल्गोरिथ्म को गहराई से देखें और देखें कि यह वास्तव में कैसे काम करता है। के-नियरेस्ट नेबर्स के काम करने की अच्छी समझ आपको इसके सर्वोत्तम और सबसे खराब उपयोग के मामलों की सराहना करने में मदद करेगी।

के-निकटतम पड़ोसी (के-नियरेस्ट नेबर्स) का अवलोकन

फोटो: Antti Ajanki AnAj via Wikimedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:KnnClassification.svg)

आइए एक 2D विमान पर एक डेटासेट को दृश्यीकृत करें। एक ग्राफ पर फैले हुए डेटा बिंदुओं की कल्पना करें जो छोटे समूहों में वितरित हैं। के-निकटतम पड़ोसी डेटा बिंदुओं के वितरण की जांच करता है और, मॉडल को दिए गए तर्कों के आधार पर, यह डेटा बिंदुओं को समूहों में विभाजित करता है। इन समूहों को फिर एक लेबल सौंपा जाता है। एक के-निकटतम पड़ोसी मॉडल का मुख्य अनुमान यह है कि जो डेटा बिंदु/उदाहरण एक दूसरे के करीब मौजूद हैं वे बहुत समान हैं, जबकि यदि एक डेटा बिंदु दूसरे समूह से दूर है तो यह उन डेटा बिंदुओं से असमान है।

एक के-निकटतम पड़ोसी मॉडल दो ग्राफ बिंदुओं के बीच की दूरी का उपयोग करके समानता की गणना करता है। बिंदुओं के बीच की दूरी जितनी अधिक होगी, वे उतने ही कम समान होंगे। बिंदुओं के बीच दूरी की गणना करने के कई तरीके हैं, लेकिन सबसे आम दूरी माप यूरोक्लिडियन दूरी (दो बिंदुओं के बीच सीधी रेखा में दूरी) है।

के-निकटतम पड़ोसी एक पर्यवेक्षित लर्निंग एल्गोरिथ्म है, जिसका अर्थ है कि डेटासेट में उदाहरणों को लेबल असाइन किए जाने चाहिए/उनके वर्ग ज्ञात होने चाहिए। के-निकटतम पड़ोसी के बारे में दो अन्य महत्वपूर्ण बातें हैं। पहला, के-निकटतम पड़ोसी एक गैर-मापदंड एल्गोरिथ्म है। इसका अर्थ है कि जब मॉडल का उपयोग किया जाता है तो डेटासेट के बारे में कोई अनुमान नहीं लगाया जाता है। इसके बजाय, मॉडल पूरी तरह से प्रदान किए गए डेटा से निर्मित होता है। दूसरा, के-निकटतम पड़ोसी का उपयोग करते समय डेटासेट को प्रशिक्षण और परीक्षण सेट में विभाजित नहीं किया जाता है। के-निकटतम पड़ोसी प्रशिक्षण और परीक्षण सेट के बीच कोई सामान्यीकरण नहीं करता है, इसलिए सभी प्रशिक्षण डेटा का उपयोग तब किया जाता है जब मॉडल से अनुमान लगाने के लिए कहा जाता है।

के-निकटतम पड़ोसी एल्गोरिथ्म कैसे काम करता है

के-निकटतम पड़ोसी एल्गोरिथ्म तीन मुख्य चरणों से गुजरता है जब यह किया जाता है:

  1. को चुने हुए पड़ोसियों की संख्या में सेट करना।
  2. एक प्रदान किए गए/परीक्षण उदाहरण और डेटासेट उदाहरणों के बीच दूरी की गणना करना।
  3. गणना की गई दूरियों को सॉर्ट करना।
  4. शीर्ष के लेबल प्राप्त करना।
  5. परीक्षण उदाहरण के बारे में एक अनुमान वापस करना।

पहले चरण में, को उपयोगकर्ता द्वारा चुना जाता है और यह एल्गोरिथ्म को बताता है कि कितने पड़ोसियों (कितने आसपास के डेटा बिंदुओं) को लक्ष्य उदाहरण के समूह में आने के बारे में निर्णय लेने के लिए विचार किया जाना चाहिए। दूसरे चरण में, ध्यान दें कि मॉडल परीक्षण उदाहरण और डेटासेट में हर उदाहरण के बीच दूरी की जांच करता है। दूरियों को एक सूची में जोड़ा जाता है और सॉर्ट किया जाता है। उसके बाद, सॉर्ट की गई सूची की जांच की जाती है और शीर्ष के लेबल वापस आ जाते हैं। दूसरे शब्दों में, यदि को 5 पर सेट किया जाता है, तो मॉडल लक्ष्य डेटा बिंदु के 5 सबसे निकटतम डेटा बिंदुओं के लेबल की जांच करता है। जब लक्ष्य डेटा बिंदु के बारे में एक अनुमान लगाने की बात आती है, तो यह महत्वपूर्ण है कि क्या यह एक रिग्रेशन या क्लासिफिकेशन कार्य है। रिग्रेशन कार्य के लिए, शीर्ष के लेबल का औसत उपयोग किया जाता है, जबकि क्लासिफिकेशन के मामले में शीर्ष के लेबल का मोड उपयोग किया जाता है।

के-निकटतम पड़ोसी को लागू करने के लिए उपयोग किए जाने वाले सटीक गणितीय संचालन दूरी माप के चुने हुए मूल्य पर निर्भर करते हैं। यदि आप दूरी माप की गणना के बारे में अधिक जानना चाहते हैं, तो आप यूरोक्लिडियन, मैनहट्टन, और मिंकोवस्की जैसे सबसे आम दूरी माप के बारे में पढ़ सकते हैं।

के मूल्य क्यों महत्वपूर्ण है

के-निकटतम पड़ोसी का उपयोग करने का मुख्य प्रतिबंध यह है कि एक अनुचित मूल्य के (गलत पड़ोसियों की संख्या) चुनाव से अनुमानों में बड़ा अंतर आ सकता है। यदि ऐसा होता है, तो वापस आने वाले अनुमानों में बहुत बड़ा अंतर हो सकता है। यह बहुत महत्वपूर्ण है कि जब के-निकटतम पड़ोसी एल्गोरिथ्म का उपयोग किया जाता है, तो के लिए उचित मूल्य चुना जाए। आप के लिए एक मूल्य चुनना चाहते हैं जो मॉडल की अनुमान लगाने की क्षमता को अधिकतम करे जबकि यह कम त्रुटियों को कम करता है।

फोटो: Agor153 via Wikimedia Commons, CC BY SA 3.0 (https://en.wikipedia.org/wiki/File:Map1NN.png)

के के निम्न मूल्य का अर्थ है कि के-निकटतम पड़ोसी द्वारा दिए गए अनुमान कम स्थिर और विश्वसनीय हैं। इस बात को समझने के लिए कि यह क्यों है, एक मामले पर विचार करें जहां हमारे पास एक लक्ष्य डेटा बिंदु के आसपास 7 पड़ोसी हैं। आइए मान लें कि के-निकटतम पड़ोसी मॉडल के साथ काम कर रहा है जिसमें के मूल्य 2 है (हम इसे दो निकटतम पड़ोसियों को देखने के लिए कह रहे हैं ताकि एक अनुमान लगाया जा सके कि परीक्षण उदाहरण किस समूह में आता है)। यदि पड़ोसियों का अधिकांश (पांच में से सात) नीले वर्ग में आते हैं, लेकिन दो निकटतम पड़ोसी लाल हैं, तो मॉडल यह अनुमान लगाएगा कि परीक्षण उदाहरण लाल है। इस मॉडल के अनुमान के बावजूद, ऐसे परिदृश्य में नीला एक बेहतर अनुमान होगा।

यदि यह मामला है, तो के के उच्चतम मूल्य को क्यों नहीं चुना जाना चाहिए? यह इसलिए है क्योंकि मॉडल को बहुत सारे पड़ोसियों पर विचार करने के लिए कहने से भी सटीकता कम हो जाएगी। जैसे ही के-निकटतम पड़ोसी मॉडल द्वारा विचार किए जाने वाले त्रिज्या बढ़ती है, यह अंततः अन्य समूहों के करीब डेटा बिंदुओं पर विचार करना शुरू कर देगा और गलत वर्गीकरण होने लगेगा। उदाहरण के लिए, भले ही शुरू में चुना गया बिंदु लाल क्षेत्रों में से एक में था, यदि के को बहुत अधिक सेट किया जाता है, तो मॉडल अन्य क्षेत्रों में बिंदुओं पर विचार करने के लिए पहुंच जाएगा। के-निकटतम पड़ोसी मॉडल का उपयोग करते समय, के के विभिन्न मूल्यों का परीक्षण किया जाता है ताकि यह देखा जा सके कि कौन सा मूल्य मॉडल को सर्वोत्तम प्रदर्शन प्रदान करता है।

के-निकटतम पड़ोसी के फायदे और नुकसान

आइए के-निकटतम पड़ोसी मॉडल के कुछ फायदे और नुकसानों पर नजर डालें。

फायदे:

के-निकटतम पड़ोसी रिग्रेशन और क्लासिफिकेशन दोनों कार्यों के लिए उपयोग किया जा सकता है, जो कि कुछ अन्य पर्यवेक्षित लर्निंग एल्गोरिथ्म के विपरीत है।

के-निकटतम पड़ोसी बहुत सटीक और उपयोग में आसान है। यह सरल है, समझने में आसान है, और लागू करने में आसान है।

के-निकटतम पड़ोसी किसी भी अनुमान के बारे में डेटा के बारे में कोई अनुमान नहीं लगाता है, जिसका अर्थ है कि यह विभिन्न प्रकार की समस्याओं के लिए उपयोग किया जा सकता है।

नुकसान:

के-निकटतम पड़ोसी अधिकांश या सभी डेटा को संग्रहीत करता है, जिसका अर्थ है कि मॉडल को बहुत अधिक मेमोरी की आवश्यकता होती है और यह गणनात्मक रूप से महंगा है। बड़े डेटासेट भी अनुमानों को लंबा समय लेने का कारण बन सकते हैं।

के-निकटतम पड़ोसी डेटासेट के पैमाने के प्रति बहुत संवेदनशील होता है और अन्य मॉडलों की तुलना में अप्रासंगिक विशेषताओं से आसानी से प्रभावित हो सकता है।

के-निकटतम पड़ोसी का सारांश

के-निकटतम पड़ोसी मशीन लर्निंग एल्गोरिथ्म में से सबसे सरल है। के-निकटतम पड़ोसी की अवधारणा में सरल होने के बावजूद, यह एक शक्तिशाली एल्गोरिथ्म है जो अधिकांश समस्याओं पर उच्च सटीकता प्रदान करता है। जब आप के-निकटतम पड़ोसी का उपयोग करते हैं, तो सुनिश्चित करें कि आप विभिन्न के मूल्यों के साथ प्रयोग करें ताकि आप सबसे अधिक सटीकता प्रदान करने वाला मूल्य प्राप्त कर सकें।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।