एआई की मूल बातें

रिन्फोर्समेंट लर्निंग क्या है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

रिन्फोर्समेंट लर्निंग क्या है?

सरल शब्दों में, रिन्फोर्समेंट लर्निंग एक मशीन लर्निंग तकनीक है जिसमें एक कृत्रिम बुद्धिमत्ता एजेंट को कार्यों और संबंधित पुरस्कारों के पुनरावृत्ति के माध्यम से प्रशिक्षित किया जाता है। एक रिन्फोर्समेंट लर्निंग एजेंट एक पर्यावरण में प्रयोग करता है, कार्य करता है और जब सही कार्य किए जाते हैं तो पुरस्कृत किया जाता है। समय के साथ, एजेंट सीखता है कि कार्यों को अधिकतम करने के लिए कार्य करें। यह रिन्फोर्समेंट लर्निंग की एक त्वरित परिभाषा है, लेकिन रिन्फोर्समेंट लर्निंग के पीछे की अवधारणाओं पर एक नज़दीकी नज़र डालने से आपको इसकी एक बेहतर, अधिक सहज ज्ञान युक्त समझ मिलेगी।

“रिन्फोर्समेंट लर्निंग” शब्द मानसिक स्वास्थ्य में पुरस्कार की अवधारणा से लिया गया है। इस कारण से, आइए मानसिक स्वास्थ्य की अवधारणा को समझने के लिए एक पल लें। मानसिक स्वास्थ्य में, पुरस्कार शब्द का अर्थ है कि कुछ ऐसा है जो एक विशिष्ट प्रतिक्रिया/कार्य की संभावना को बढ़ाता है। यह पुरस्कार की अवधारणा ऑपरेंट कंडीशनिंग के सिद्धांत का एक केंद्रीय विचार है, जिसे मूल रूप से मनोवैज्ञानिक बी.एफ. स्किनर द्वारा प्रस्तावित किया गया था। इस संदर्भ में, पुरस्कार कुछ भी है जो एक विशिष्ट व्यवहार की आवृत्ति को बढ़ाता है। यदि हम मानवों के लिए संभावित पुरस्कारों के बारे में सोचते हैं, तो वे प्रशंसा, नौकरी में वृद्धि, मिठाई और मजेदार गतिविधियों जैसी चीजें हो सकती हैं।

मानसिक स्वास्थ्य में, दो प्रकार के पुरस्कार होते हैं। एक है सकारात्मक पुरस्कार और दूसरा है नकारात्मक पुरस्कार। सकारात्मक पुरस्कार एक व्यवहार को बढ़ाने के लिए कुछ जोड़ना है, जैसे कि आपके कुत्ते को अच्छा व्यवहार करने पर एक ट्रीट देना। नकारात्मक पुरस्कार में एक उत्तेजना को हटाना शामिल है ताकि एक व्यवहार हो सके, जैसे कि एक डरे हुए बिल्ली को बाहर निकालने के लिए तेज आवाज बंद करना।

सकारात्मक और नकारात्मक पुरस्कार

सकारात्मक पुरस्कार एक व्यवहार की आवृत्ति को बढ़ाता है, जबकि नकारात्मक पुरस्कार इसे घटाता है।一般 रूप से, रिन्फोर्समेंट लर्निंग में सकारात्मक पुरस्कार का सबसे अधिक उपयोग किया जाने वाला पुरस्कार प्रकार है, क्योंकि यह मॉडल को एक दिए गए कार्य पर प्रदर्शन को अधिकतम करने में मदद करता है। न केवल यह, बल्कि सकारात्मक पुरस्कार मॉडल को अधिक टिकाऊ परिवर्तन करने में मदद करता है, जो परिवर्तन निरंतर पैटर्न बन सकते हैं और लंबे समय तक बने रह सकते हैं।

इसके विपरीत, जबकि नकारात्मक पुरस्कार भी एक व्यवहार को अधिक संभव बनाता है, यह एक मॉडल के न्यूनतम प्रदर्शन मानक को बनाए रखने के लिए उपयोग किया जाता है, न कि इसके अधिकतम प्रदर्शन को प्राप्त करने के लिए। रिन्फोर्समेंट लर्निंग में नकारात्मक पुरस्कार एक मॉडल को अवांछित कार्यों से दूर रखने में मदद कर सकता है, लेकिन यह वास्तव में एक मॉडल को वांछित कार्यों का अन्वेषण करने के लिए नहीं बना सकता है।

एक रिन्फोर्समेंट एजेंट को प्रशिक्षित करना

जब एक रिन्फोर्समेंट लर्निंग एजेंट को प्रशिक्षित किया जाता है, तो चार अलग-अलग सामग्री या राज्य प्रशिक्षण में उपयोग किए जाते हैं: प्रारंभिक राज्य (राज्य 0), नया राज्य (राज्य 1), क्रियाएं और पुरस्कार।

कल्पना कीजिए कि हम एक रिन्फोर्समेंट एजेंट को एक प्लेटफ़ॉर्मिंग वीडियो गेम खेलने के लिए प्रशिक्षित कर रहे हैं जहां एआई का लक्ष्य स्क्रीन के दाईं ओर जाने के लिए स्तर के अंत तक पहुंचना है। गेम की प्रारंभिक स्थिति पर्यावरण से ली जाती है, जिसका अर्थ है कि गेम का पहला फ्रेम विश्लेषण किया जाता है और मॉडल को दिया जाता है। इस जानकारी के आधार पर, मॉडल को एक क्रिया तय करनी होगी।

प्रशिक्षण के प्रारंभिक चरणों में, ये क्रियाएं यादृच्छिक होती हैं, लेकिन जब मॉडल को पुरस्कृत किया जाता है, तो कुछ क्रियाएं अधिक सामान्य हो जाती हैं। एजेंट द्वारा की गई क्रिया के बाद गेम का पर्यावरण अपडेट किया जाता है और एक नया राज्य या फ्रेम बनाया जाता है। यदि एजेंट द्वारा की गई क्रिया ने एक वांछित परिणाम उत्पन्न किया, तो इस मामले में एजेंट अभी भी जीवित है और किसी दुश्मन द्वारा मारा नहीं गया है, तो एजेंट को कुछ पुरस्कार दिया जाता है और यह भविष्य में इसी तरह की क्रिया करने की संभावना बढ़ जाती है।

यह बुनियादी प्रणाली लगातार दोहराई जाती है, बार-बार होती है, और प्रत्येक बार एजेंट थोड़ा और सीखता है और अपने पुरस्कार को अधिकतम करने का प्रयास करता है।

एपिसोडिक बनाम निरंतर कार्य

रिन्फोर्समेंट लर्निंग कार्यों को आमतौर पर दो अलग-अलग श्रेणियों में रखा जा सकता है: एपिसोडिक कार्य और निरंतर कार्य。

एपिसोडिक कार्य सीखने/प्रशिक्षण लूप को तब तक चलाते हैं जब तक कि कुछ अंतिम मानदंड पूरे नहीं हो जाते और प्रशिक्षण समाप्त हो जाता है। एक गेम में, यह स्तर के अंत तक पहुंचने या खतरे में गिरने जैसे कि कांटों पर जा सकता है। इसके विपरीत, निरंतर कार्यों में कोई समाप्ति मानदंड नहीं होता है, जो मूल रूप से तब तक प्रशिक्षण जारी रखता है जब तक कि इंजीनियर इसे समाप्त करने का निर्णय नहीं लेता।

मोंटे कार्लो बनाम टेम्पोरल डिफरेंस

एक रिन्फोर्समेंट लर्निंग एजेंट को प्रशिक्षित करने के दो मुख्य तरीके हैं। मोंटे कार्लो दृष्टिकोण में, पुरस्कार केवल प्रशिक्षण एपिसोड के अंत में एजेंट को दिया जाता है (इसका स्कोर अपडेट किया जाता है)। दूसरे शब्दों में, केवल जब समाप्ति शर्त हिट होती है तो मॉडल सीखता है कि यह कितना अच्छा प्रदर्शन करता है। यह जानकारी का उपयोग करके यह अपडेट और कर सकता है और जब अगले प्रशिक्षण दौर की शुरुआत होगी तो यह नई जानकारी के अनुसार प्रतिक्रिया करेगा।

टेम्पोरल-डिफरेंस विधि मोंटे कार्लो विधि से इस मायने में भिन्न है कि मूल्य अनुमान, या स्कोर अनुमान, प्रशिक्षण एपिसोड के दौरान अपडेट किया जाता है। जब मॉडल अगले समय चरण में आगे बढ़ता है, तो मूल्य अपडेट किए जाते हैं।

अन्वेषण बनाम शोषण

एक रिन्फोर्समेंट लर्निंग एजेंट को प्रशिक्षित करना एक संतुलन का कार्य है, जिसमें दो अलग-अलग मेट्रिक्स का संतुलन शामिल है: अन्वेषण और शोषण।

अन्वेषण पर्यावरण के बारे में अधिक जानकारी एकत्र करने की क्रिया है, जबकि शोषण पर्यावरण के बारे में पहले से ज्ञात जानकारी का उपयोग पुरस्कार अंक अर्जित करने के लिए किया जाता है। यदि एक एजेंट केवल अन्वेषण करता है और कभी शोषण नहीं करता है, तो वांछित कार्य कभी नहीं किए जाएंगे। दूसरी ओर, यदि एजेंट केवल शोषण करता है और कभी अन्वेषण नहीं करता है, तो एजेंट केवल एक कार्य सीखेगा और अन्य संभावित रणनीतियों की खोज नहीं करेगा जो पुरस्कार अर्जित कर सकती हैं। इसलिए, अन्वेषण और शोषण के बीच संतुलन बनाना रिन्फोर्समेंट लर्निंग एजेंट बनाने के लिए महत्वपूर्ण है।

रिन्फोर्समेंट लर्निंग के लिए उपयोग के मामले

रिन्फोर्समेंट लर्निंग का उपयोग विभिन्न भूमिकाओं में किया जा सकता है, और यह उन अनुप्रयोगों के लिए सबसे उपयुक्त है जहां कार्यों को स्वचालन की आवश्यकता होती है।

उद्योगों में रोबोटों द्वारा कार्यों के स्वचालन के लिए रिन्फोर्समेंट लर्निंग उपयोगी साबित हो सकती है। रिन्फोर्समेंट लर्निंग का उपयोग लंबे ग्रंथों का सारांश तैयार करने वाले मॉडल बनाने के लिए भी किया जा सकता है। शोधकर्ता स्वास्थ्य सेवा क्षेत्र में रिन्फोर्समेंट लर्निंग का उपयोग करने के साथ भी प्रयोग कर रहे हैं, जहां रिन्फोर्समेंट एजेंट उपचार नीतियों के अनुकूलन जैसे कार्यों को संभालते हैं। रिन्फोर्समेंट लर्निंग का उपयोग छात्रों के लिए शैक्षिक सामग्री को अनुकूलित करने के लिए भी किया जा सकता है।

रिन्फोर्समेंट लर्निंग का सारांश

रिन्फोर्समेंट लर्निंग एक शक्तिशाली तरीका है जिससे एआई एजेंटों का निर्माण किया जा सकता है जो प्रभावशाली और कभी-कभी आश्चर्यजनक परिणाम प्रदान कर सकते हैं। एक एजेंट को रिन्फोर्समेंट लर्निंग के माध्यम से प्रशिक्षित करना जटिल और कठिन हो सकता है, क्योंकि इसमें कई प्रशिक्षण पुनरावृत्तियों और अन्वेषण/शोषण विरोधाभास का सावधानीपूर्वक संतुलन की आवश्यकता होती है। हालांकि, यदि सफल होता है, तो रिन्फोर्समेंट लर्निंग के साथ बनाया गया एक एजेंट विभिन्न वातावरणों में जटिल कार्य कर सकता है।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।