एआई की मूल बातें
लीनियर रिग्रेशन क्या है?
लीनियर रिग्रेशन एक सतत लक्ष्य को एक या अधिक इनपुट फीचर के रैखिक संयोजन के रूप में मॉडल करता है। इसे भविष्यवाणी, अनुमान और यह समझने के लिए एक पारदर्शी बेसलाइन के रूप में उपयोग किया जाता है कि क्या अधिक जटिल मॉडल महत्वपूर्ण मूल्य जोड़ता है।
स्वतंत्र चर और निर्भर चर शब्द मॉडल में भूमिकाओं को दर्शाते हैं, न कि सिद्ध कारण‑और‑परिणाम को। एक रिग्रेशन संबंध को पहचान सकता है जबकि मिश्रण, चयन पक्षपात, प्रतिकूल कारणता या माप त्रुटि संबंध की व्याख्या करती है।
मुख्य बिंदु
- लक्ष्य y को इनपुट फीचर X से मॉडल किया जाता है; लेख के पुराने संस्करण में एक सूत्र व्याख्या में इन लेबलों को उलटा दिया गया था।
- साधारण न्यूनतम वर्ग वर्गीकृत शेषों के योग को न्यूनतम करता है।
- शेष निदान और अनुमानों का अनुमान और अनिश्चितता में महत्व है।
- रिज और लासो नियमितीकरण तब मदद करता है जब भविष्यवक्ता बहुत अधिक या सहसंबद्ध हों।

सरल लीनियर रिग्रेशन
एक फीचर के साथ, मॉडल है:
ŷ = β₀ + β₁x
β₀ इंटरसेप्ट है और β₁ ढाल है। अवलोकन i के लिए शेष yᵢ - ŷᵢ है। साधारण न्यूनतम वर्ग (OLS) ऐसे गुणांक चुनता है जो वर्गीकृत शेषों के योग को न्यूनतम करता है।
ढाल मॉडल के अंतर्गत फीचर में एक इकाई परिवर्तन के साथ लक्ष्य में अपेक्षित परिवर्तन का अनुमान लगाती है। इसे कारणात्मक प्रभाव के रूप में वर्णित नहीं किया जाना चाहिए जब तक अध्ययन डिज़ाइन और अनुमानों से कारणात्मक पहचान का समर्थन न हो।
बहु-लीनियर रिग्रेशन
जब p फीचर हों:
ŷ = β₀ + β₁x₁ + β₂x₂ + … + βₚxₚ
प्रत्येक गुणांक को अन्य सम्मिलित फीचर के सापेक्ष शर्तीय रूप में व्याख्यायित किया जाता है। बहु रिग्रेशन श्रेणीबद्ध चर को एन्कोडिंग, बहुपद पद और अंतःक्रियाओं के माध्यम से शामिल कर सकता है। यह “रैखिक” बना रहता है क्योंकि यह गुणांक में रैखिक है, भले ही परिवर्तित फीचर जैसे x² शामिल हों।
अनुमान और निदान
भविष्यवाणी के लिए, मुख्य प्रश्न है कि मॉडल कितनी अच्छी तरह सामान्यीकृत होता है। क्लासिकल गुणांक परीक्षण और अंतरालों के लिए, अतिरिक्त अनुमानों का महत्व बढ़ जाता है:
- रैखिकता: शर्तीय औसत को चुनी हुई रैखिक रूप में दर्शाया जाता है।
- स्वतंत्र या सही ढंग से मॉडल किए गए त्रुटियां: दोहराए गए, समूहित, स्थानिक, या समय‑श्रृंखला अवलोकन एक अलग त्रुटि संरचना की आवश्यकता कर सकते हैं।
- स्थिर त्रुटि वैरिएंस: विषमविचलन मानक त्रुटियों और अनिश्चितता अनुमान को प्रभावित करता है।
- सीमित बहु-रैखिकता: अत्यधिक सहसंबद्ध भविष्यवक्ताओं से व्यक्तिगत गुणांक अस्थिर हो जाते हैं।
- शेष वितरण: सामान्यता कुछ छोटे नमूने के अनुमान में प्रासंगिक है, यह आवश्यक नहीं कि प्रत्येक फीचर सामान्य हो।
शेष प्लॉट, लीवर और प्रभाव माप, तथा डोमेन समीक्षा आउट्लायर, गैर‑रैखिकता, बदलते वैरिएंस, या ऐसे अवलोकन पहचान सकते हैं जो फिट को हावी करते हैं।
भविष्यवाणी का मूल्यांकन
- औसत निरपेक्ष त्रुटि (MAE) निरपेक्ष शेष आकार का औसत लेती है।
- औसत वर्ग त्रुटि (MSE) बड़ी त्रुटियों को अधिक वजन देती है।
- मूल औसत वर्ग त्रुटि (RMSE) वर्गीकृत त्रुटि को लक्ष्य इकाइयों में वापस लाती है।
- R² मूल्यांकित डेटा पर शेष परिवर्तन को एक स्थिर बेसलाइन से तुलना करता है।
R² सटीकता नहीं है, कारण स्थापित नहीं करता, और होल्ड‑आउट डेटा पर नकारात्मक हो सकता है। सत्यापन को वास्तविक भविष्यवाणी सेटिंग से मेल खाना चाहिए, जिसमें आवश्यक होने पर समय या समूह‑सचेत विभाजन शामिल हों।
रिज, लासो, और इलास्टिक नेट
रिज रिग्रेशन एक L2 दंड जोड़ता है जो गुणांक को संकुचित करता है और सहसंबद्ध भविष्यवक्ताओं को स्थिर करता है। लासो एक L1 दंड जोड़ता है और गुणांक को शून्य पर सेट कर सकता है। इलास्टिक नेट दोनों को मिलाता है। इन दंडों की तुलना करने से पहले फीचर आमतौर पर संगत स्केलिंग की आवश्यकता रखते हैं।
नियमितीकरण कम वैरिएंस के बदले में बायस लाता है और ओवरफ़िटिंग को कम कर सकता है। दंड की शक्ति सत्यापन के साथ चुनी जाती है, न कि अंतिम परीक्षण सेट से।
जब लीनियर रिग्रेशन गलत उपकरण हो
एक रैखिक मॉडल तब विफल हो सकता है जब संबंध अत्यधिक गैर‑रैखिक हों, त्रुटियां पिछले मानों पर निर्भर हों, लक्ष्य वितरण को विशेष मॉडलिंग की आवश्यकता हो, या कुछ आउट्लायर वर्गीकृत हानि को हावी करें। डिसीजन ट्रीज़, सामान्यीकृत रैखिक मॉडल, समय‑श्रृंखला मॉडल, मजबूत रिग्रेशन, या गैर‑रैखिक विधियां बेहतर फिट हो सकती हैं।
भले ही एक जटिल मॉडल जीतता हो, लीनियर रिग्रेशन एक मूल्यवान बेसलाइन बना रहता है। यदि कोई बड़ा सिस्टम इसे विश्वसनीय रूप से पार नहीं कर सकता, तो अतिरिक्त जटिलता को उचित नहीं ठहराया जा सकता।
मॉडल अनुमानों, अनुमान, और निदान
लीनियर रिग्रेशन एक संख्यात्मक परिणाम के शर्तीय औसत को इंटरसेप्ट प्लस भारित भविष्यवक्ताओं के रूप में मॉडल करता है। साधारण न्यूनतम वर्ग ऐसे गुणांक चुनता है जो वर्गीकृत शेष को न्यूनतम करता है। गुणांक निर्दिष्ट मॉडल के तहत अन्य सम्मिलित चर को स्थिर रखते हुए एक‑इकाई भविष्यवक्ता परिवर्तन के लिए अपेक्षित परिणाम परिवर्तन का वर्णन करते हैं। यह एक संबंध है जब तक कारणात्मक पहचान अनुमानों और अध्ययन डिज़ाइन से अधिक का समर्थन न हो। इकाइयाँ, कोडिंग, रूपांतरण, अंतःक्रियाएँ, और संदर्भ श्रेणियाँ व्याख्या निर्धारित करती हैं, इसलिए डेटा शब्दकोश के बिना गुणांक अधूरे होते हैं।
क्लासिकल अनुमान कार्यात्मक रूप, स्वतंत्र त्रुटियों, स्थिर वैरिएंस, और त्रुटि वितरण के बारे में अनुमानों पर निर्भर करता है, विशेष परीक्षणों और अंतरालों के लिए। शेष‑वर्सेज‑फिटेड प्लॉट गैर‑रैखिकता या विषमविचलन को उजागर करते हैं; Q–Q प्लॉट टेल व्यवहार का मूल्यांकन करते हैं; लीवर और प्रभाव निदान उन अवलोकनों की पहचान करते हैं जो अनुमान को दृढ़ता से प्रभावित करते हैं। सहसंबद्ध भविष्यवक्ताओं से अनिश्चितता बढ़ती है और व्यक्तिगत गुणांक अस्थिर हो जाते हैं, भले ही भविष्यवाणियां पर्याप्त हों। असुविधाजनक डेटा बिंदुओं को हटाने के बजाय मजबूत मानक त्रुटियां, रूपांतरण, स्प्लाइन, पदानुक्रमित संरचना, या अन्य मॉडल की आवश्यकता हो सकती है।
नियमितीकरण, मूल्यांकन, और जिम्मेदार उपयोग
रिज रिग्रेशन L2 दंड के साथ गुणांक को संकुचित करता है, जबकि लासो L1 दंड के साथ कुछ को शून्य पर सेट कर सकता है; इलास्टिक नेट दोनों को मिलाता है। जब दंड स्केल तुलनीय होना चाहिए तो भविष्यवक्ताओं को मानकीकृत करें और वैधता या क्रॉस‑वैलिडेशन के साथ शक्ति चुनें। औसत निरपेक्ष त्रुटि, मूल औसत वर्ग त्रुटि, शेष वितरण, विभिन्न रेंज में कैलिब्रेशन, और अनिश्चितता का मूल्यांकन करें, उपयोग को प्रतिबिंबित करने वाले समय या समूह विभाजन के साथ। एक औसत बेसलाइन और गैर‑रैखिक विकल्पों से तुलना करें, लेकिन जब पारदर्शिता और स्थिरता मूल्यवान हों तो रैखिक मॉडल रखें।
देखी गई भविष्यवक्ता रेंज से परे एक्सट्रापोलेशन फिटेड रेखा का अनुसरण करता है बिना प्रमाण के और खतरनाक हो सकता है। उत्पादन में फीचर रेंज, अनुपलब्धता, शेष, और उपसमूह त्रुटि की निगरानी करें। भविष्यवाणी अंतराल व्यक्तिगत परिणाम अनिश्चितता को दर्शाते हैं और औसत के लिए विश्वास अंतराल से व्यापक होते हैं; दोनों को अनुमानों की आवश्यकता होती है। जब लक्ष्य प्रभाव अनुमान है तो कारणात्मक बायस लाने वाले चरों को नियंत्रित करने से बचें। लीनियर रिग्रेशन एक परिभाषित संबंध के लिए सटीक उपकरण है, न कि यह सार्वभौमिक गारंटी कि दुनिया रैखिक है या कोई गुणांक हस्तक्षेप का प्रतिनिधित्व करता है।
व्यावहारिक उदाहरण: डिलीवरी समय का अनुमान
एक लॉजिस्टिक्स टीम दूरी, सेवा स्तर, क्षेत्र, सप्ताह का दिन, और ज्ञात मौसम से डिलीवरी अवधि को मॉडल करती है। यह गैर‑रैखिक शेष पैटर्न की जांच करती है और एक रैखिक समीकरण को शाब्दिक भौतिकी मानने के बजाय उचित स्प्लाइन और अंतःक्रियाएँ जोड़ती है। कैरियर और मार्ग समूह वैधता फ़ोल्ड निर्धारित करते हैं। औसत निरपेक्ष त्रुटि, टेल त्रुटि, अंतराल कवरेज, और प्रणालीगत बायस रिपोर्ट किए जाते हैं। रद्द की गई डिलीवरी और आगमन के बाद दर्ज डेटा को बाहर रखा जाता है या स्पष्ट रूप से मॉडल किया जाता है।
गुणांक इकाइयों में दस्तावेज़ीकृत होते हैं और सहसंबद्ध भविष्यवक्ताओं के तहत अस्थिरता के लिए जांचे जाते हैं। मॉडल मान्य दूरी और क्षेत्र रेंज से परे एक्सट्रापोलेशन को अस्वीकार करता है। भविष्यवाणी अंतराल अनुमानों के साथ होते हैं, और डाउनस्ट्रीम शेड्यूलिंग उनकी अनिश्चितता का उपयोग करती है। निगरानी फीचर रेंज, शेष, अंतराल कवरेज, और नेटवर्क परिवर्तन के बाद बायस को ट्रैक करती है। कैरियर या मौसम के बारे में कारणात्मक दावा केवल भविष्यवाणी गुणांक से नहीं किया जाता; हस्तक्षेप का समर्थन करने के लिए परिचालन प्रयोग या अधिक मजबूत पहचान आवश्यक होगी।
कार्यान्वयन प्रमाण और परिचालन तत्परता
एक उत्पादन निर्णय को सफल प्रदर्शन से अधिक की आवश्यकता होती है। इरादे वाले उपयोगकर्ताओं, संचालन वातावरण, इनपुट, आउटपुट, निर्भरताओं, मालिक, और प्रत्येक महत्वपूर्ण विफलता के परिणाम को परिभाषित करें। ट्यूनिंग से पहले एक पुनरुत्पादनीय बेसलाइन और एक संस्करणित मूल्यांकन सेट स्थापित करें। सामान्य मामलों, सीमा शर्तों, विकृत या अनुपलब्ध इनपुट, वितरण परिवर्तन, निर्भरता आउटेज, दुरुपयोग, और उन समूहों या वातावरणों का परीक्षण करें जो सबसे अधिक सेवा‑हीन हो सकते हैं। कार्य गुणवत्ता को कैलिब्रेशन या अनिश्चितता, लेटेंसी, थ्रूपुट, संसाधन लागत, पहुँच, गोपनीयता, और सुरक्षा के साथ मापें। प्रत्येक परिवर्तन और थ्रेशोल्ड को रिकॉर्ड करें ताकि एक स्वतंत्र समीक्षक परिणाम को पुन: उत्पन्न कर सके और आकर्षक प्रोटोटाइप से प्रमाण को अलग कर सके।
लॉन्च से पहले, रिलीज़, अपवाद, परिवर्तन, रोलबैक, और रिटायरमेंट के लिए अधिकार सौंपें। चरणबद्ध रोलआउट का उपयोग करें, एक सुरक्षित फॉलबैक बनाए रखें, और जानबूझकर डाली गई विफलताओं के साथ निगरानी को सत्यापित करें। परिचालन टेलीमेट्री को इनपुट गुणवत्ता, आउटपुट व्यवहार, मॉडल या नियम संस्करण, निर्भरता स्वास्थ्य, मानव ओवरराइड, और अनावश्यक संवेदनशील डेटा एकत्र किए बिना पुष्टि किए गए परिणाम दिखाने चाहिए। अलर्ट थ्रेशोल्ड और प्रतिक्रिया मालिक को परिभाषित करें, फिर तैनाती के बाद वास्तविक‑विश्व प्रमाण की समीक्षा करें बजाय यह मानने के कि ऑफ़लाइन प्रदर्शन बना रहेगा। जब भी डेटा स्रोत, उपयोगकर्ता, मॉडल, विक्रेता, नीतियां, हार्डवेयर, या लक्ष्य बदलें, पुनः‑मूल्यांकन करें। एक बनाए रखा गया सिस्टम को दस्तावेज़ीकृत पुनर्प्राप्ति, घटना सीख, विलोपन और रखरखाव प्रक्रियाओं, और एक स्पष्ट बिंदु की भी आवश्यकता होती है जहाँ इसे निष्क्रिय या प्रतिस्थापित किया जाना चाहिए।
अक्सर पूछे जाने वाले प्रश्न
क्या लीनियर रिग्रेशन को केवल एक इनपुट वेरिएबल की आवश्यकता होती है?
नहीं। सरल रिग्रेशन में एक भविष्यवक्ता होता है, जबकि बहु‑लीनियर रिग्रेशन कई संख्यात्मक, एन्कोडेड श्रेणीबद्ध, रूपांतरित, और अंतःक्रिया फीचर का उपयोग कर सकता है।
क्या लीनियर रिग्रेशन कारणता सिद्ध कर सकता है?
नहीं। कारणात्मक व्याख्या के लिए एक ठोस शोध डिज़ाइन और मिश्रण, चयन, माप, और हस्तक्षेप के बारे में अनुमानों की आवश्यकता होती है। केवल एक भविष्यवाणी गुणांक फिटेड मॉडल में एक संबंध का वर्णन करता है।












