एआई मॉडल और प्लेटफ़ॉर्म
डीपमाइंड और गूगल ब्रेन रीन्फोर्समेंट लर्निंग की दक्षता में सुधार के लिए तरीके बनाने का लक्ष्य रखते हैं

रीन्फोर्समेंट लर्निंग सिस्टम शक्तिशाली और मजबूत हो सकते हैं, जो हजारों प्रशिक्षण पुनरावृत्तियों के माध्यम से अत्यधिक जटिल कार्यों को पूरा करने में सक्षम होते हैं। जबकि रीन्फोर्समेंट लर्निंग एल्गोरिदम जटिल और कभी-कभी आश्चर्यजनक व्यवहार को सक्षम करने में सक्षम होते हैं, उन्हें प्रशिक्षित करने में बहुत समय लगता है और उन्हें विशाल मात्रा में डेटा की आवश्यकता होती है। ये कारक रीन्फोर्समेंट लर्निंग तकनीकों को काफी अकुशल बनाते हैं, और हाल ही में अल्फाबेट डीपमाइंड और गूगल ब्रेन की शोध टीमों ने रीन्फोर्समेंट लर्निंग सिस्टम बनाने के लिए अधिक कुशल तरीकों को खोजने का प्रयास किया है।
वेंचरबीट द्वारा रिपोर्ट के अनुसार, संयुक्त शोध समूह ने हाल ही में रीन्फोर्समेंट लर्निंग प्रशिक्षण को अधिक कुशल बनाने के तरीकों का प्रस्ताव किया है। प्रस्तावित सुधारों में से एक एक एल्गोरिदम था जिसे एडाप्टिव बिहेवियर पॉलिसी शेयरिंग (एबीपीएस) कहा जाता है, जबकि दूसरा एक फ्रेमवर्क था जिसे यूनिवर्सल वैल्यू फंक्शन अप्रॉक्सिमेटर्स (यूवीएफए) कहा जाता है। एबीपीएस एआई एजेंटों को अपने अनुकूली रूप से चुने गए अनुभवों को साझा करने देता है, जबकि यूवीएफए उन्हें निर्देशित अन्वेषण नीतियों की जांच करने की अनुमति देता है।
एबीपीएस का उद्देश्य मॉडल को प्रशिक्षित करते समय हाइपरपैरामीटर्स को अनुकूलित करने की प्रक्रिया को तेज करना है। एबीपीएस हाइपरपैरामीटर्स को अधिक तेज़ी से खोजने में मदद करता है जो मॉडल के प्रदर्शन को बेहतर बनाते हैं, जिससे विभिन्न हाइपरपैरामीटर्स के साथ कई एजेंटों को उनके व्यवहार नीति अनुभवों को साझा करने की अनुमति मिलती है। अधिक सटीक होने के लिए, एबीपीएस रीन्फोर्समेंट लर्निंग एजेंटों को एक नीति द्वारा स्वीकृत कार्यों से कार्यों का चयन करने देता है और फिर उन्हें एक पुरस्कार और अवलोकन प्रदान किया जाता है जो अगली स्थिति पर आधारित होता है।
एआई रीन्फोर्समेंट एजेंटों को विभिन्न संभावित हाइपरपैरामीटर्स के संयोजन के साथ प्रशिक्षित किया जाता है, जैसे कि डिके रेट और लर्निंग रेट। मॉडल को प्रशिक्षित करते समय, लक्ष्य यह है कि मॉडल उन हाइपरपैरामीटर्स के संयोजन पर अभिसरण करे जो इसके प्रदर्शन को बेहतर बनाते हैं, और इस मामले में वे जो डेटा की दक्षता में सुधार करते हैं। दक्षता बढ़ाने के लिए, कई एजेंटों को एक ही समय में प्रशिक्षित किया जाता है और केवल एक एजेंट के व्यवहार को अगले समय चरण में तैनात किया जाता है। लक्ष्य एजेंट की नीति का उपयोग कार्यों को नमूना करने के लिए किया जाता है। परिवर्तनों को एक साझा स्थान में लॉग किया जाता है, और इस स्थान का लगातार मूल्यांकन किया जाता है ताकि नीति चयन की आवश्यकता नहीं हो। प्रशिक्षण के अंत में, एजेंटों का एक समूह चुना जाता है और शीर्ष प्रदर्शन करने वाले एजेंटों को अंतिम तैनाती के लिए चुना जाता है।
यूवीएफए के संदर्भ में, यह रीन्फोर्समेंट लर्निंग की एक सामान्य समस्या से निपटने का प्रयास करता है, जो अक्सर कमजोर रूप से प्रबलित एजेंटों को कार्यों को सीखने में असमर्थ बनाता है। यूवीएफए इस समस्या का समाधान करने का प्रयास करता है जो एक एजेंट को एक ही समय में शोषण और अन्वेषण नीतियों के एक अलग सेट को सीखने देता है। कार्यों को अलग करने से एक फ्रेमवर्क बनता है जो अन्वेषण नीतियों को पर्यावरण की जांच करने की अनुमति देता है, जबकि शोषण नीतियां वर्तमान कार्य के लिए पुरस्कार को अधिकतम करने का प्रयास करती हैं। यूवीएफए की अन्वेषण नीतियां एक बेसलाइन आर्किटेक्चर के रूप में कार्य करती हैं जो तब भी सुधारित होती हैं जब कोई प्राकृतिक पुरस्कार नहीं मिल रहे हों। ऐसी स्थिति में, एक फंक्शन जो आंतरिक पुरस्कारों के अनुरूप होता है, को अनुमानित किया जाता है, जो एजेंटों को पर्यावरण में सभी राज्यों का अन्वेषण करने के लिए प्रेरित करता है, भले ही वे अक्सर परिचित राज्यों में लौट आते हैं।
वेंचरबीट द्वारा समझाया गया, जब यूवीएफए फ्रेमवर्क लागू किया जाता है, तो सिस्टम के आंतरिक पुरस्कारों को सीधे एजेंट को इनपुट के रूप में दिया जाता है। एजेंट एक प्रकरण के दौरान सभी इनपुटों (जैसे पुरस्कार, कार्य, और राज्य) का प्रतिनिधित्व रखता है। परिणाम यह है कि पुरस्कार समय के साथ संरक्षित होता है और एजेंट की नीति कम से कम कुछ हद तक हमेशा इसके द्वारा सूचित होती है।
यह “प्रकरण नवीनता” और “जीवन-लंबी नवीनता” मॉड्यूल के उपयोग के माध्यम से प्राप्त किया जाता है। पहले मॉड्यूल का कार्य वर्तमान, प्रकरण स्मृति को धारण करना और वर्तमान खोजों को पहले से उल्लिखित प्रतिनिधित्व के साथ मैप करना है, जिससे एजेंट प्रशिक्षण के प्रत्येक चरण के लिए एक आंतरिक प्रकरण पुरस्कार निर्धारित कर सकता है। इसके बाद, वर्तमान अवलोकन से जुड़ा राज्य स्मृति में जोड़ा जाता है। दूसरी ओर, जीवन-लंबी नवीनता मॉड्यूल कई प्रकरणों के दौरान एजेंट की अन्वेषण आवृत्ति को प्रभावित करने के लिए जिम्मेदार है।
अल्फाबेट/गूगल टीमों के अनुसार, नए प्रशिक्षण तकनीकों ने पहले से ही रीन्फोर्समेंट लर्निंग सिस्टम को प्रशिक्षित करने में महत्वपूर्ण सुधार की संभावना का प्रदर्शन किया है। यूवीएफए ने कुछ आधार एजेंटों के प्रदर्शन को दोगुना कर दिया जो विभिन्न एटारी गेम खेलते थे। दूसरी ओर, एबीपीएस ने कुछ ही एटारी गेमों पर प्रदर्शन में सुधार किया, जिससे शीर्ष प्रदर्शन करने वाले एजेंटों के बीच परिवर्तनशीलता लगभग 25% कम हो गई। यूवीएफए प्रशिक्षित एल्गोरिदम ने पिटफॉल में एक उच्च स्कोर हासिल किया, जिसमें मानव डेमो की किसी भी इंजीनियर्ड सुविधा की कमी थी।












