एआई मॉडल और प्लेटफ़ॉर्म
पोकेल्मोन: एक मानव-परित्यक्त एजेंट जो पोकेमोन की लड़ाई में एलएलएम का उपयोग करता है
बड़े भाषा मॉडल और जेनरेटिव एआई ने प्राकृतिक भाषा प्रसंस्करण कार्यों की एक विस्तृत श्रृंखला पर अभूतपूर्व सफलता का प्रदर्शन किया है। एनएलपी क्षेत्र पर विजय प्राप्त करने के बाद, जेनएआई और एलएलएम शोधकर्ताओं के लिए अगली चुनौती यह है कि वे कैसे बड़े भाषा मॉडल को वास्तविक दुनिया में स्वायत्त रूप से कार्य करने के लिए प्राप्त कर सकते हैं, जिसमें पाठ से कार्रवाई तक एक विस्तारित पीढ़ी का अंतराल है, जो कि कृत्रिम सामान्य बुद्धिमत्ता की खोज में एक महत्वपूर्ण परिदृश्य का प्रतिनिधित्व करता है। ऑनलाइन गेम्स को बड़े भाषा मॉडल के निकाय एजेंटों को विकसित करने के लिए एक उपयुक्त परीक्षण आधार माना जाता है जो दृश्य वातावरण के साथ बातचीत करते हैं जैसे कि एक मानव करेगा।
उदाहरण के लिए, एक लोकप्रिय ऑनलाइन सिमुलेशन गेम माइनक्राफ्ट में, निर्णय लेने वाले एजेंटों को खिलाड़ियों की मदद के लिए नियोजित किया जा सकता है जो दुनिया का अन्वेषण करते हैं और साथ ही साथ उपकरण बनाने और कार्यों को हल करने के लिए कौशल विकसित करते हैं। एक और उदाहरण एलएलएम एजेंटों की दृश्य वातावरण के साथ बातचीत करने की क्षमता को दूसरे ऑनलाइन गेम, द सिम्स में देखा जा सकता है, जहां एजेंटों ने सामाजिक बातचीत में उल्लेखनीय सफलता का प्रदर्शन किया है और मानवों के समान व्यवहार प्रदर्शित करते हैं। हालांकि, मौजूदा गेम्स की तुलना में, रणनीतिक लड़ाई गेम एलएलएम की क्षमता को आभासी गेम खेलने के लिए बेंचमार्क करने के लिए एक बेहतर विकल्प साबित हो सकते हैं। रणनीतिक गेम्स के लिए मुख्य कारण यह है कि जीत की दर को सीधे मापा जा सकता है, और सुसंगत विरोधी जिनमें मानव खिलाड़ी और एआई शामिल हैं, हमेशा उपलब्ध होते हैं।
इसी पर आधारित, पोकेल्मोन का उद्देश्य दुनिया का पहला निकाय एजेंट बनना है जो रणनीतिक गेम्स में मानव-स्तर का प्रदर्शन प्राप्त करता है, जैसा कि पोकेमोन की लड़ाई में देखा जाता है। पोकेल्मोन फ्रेमवर्क के मूल में तीन मुख्य रणनीतियां शामिल हैं:
- पाठ-आधारित प्रतिक्रिया का उपयोग करके नीति को पुनः प्राप्त करने के लिए लड़ाई से तुरंत प्राप्त पाठ-आधारित प्रतिक्रिया का उपभोग करने वाला संदर्भ में प्रबलित学习।
- बाहरी ज्ञान को पुनः प्राप्त करने के लिए ज्ञान-संवर्धित पीढ़ी जो भ्रम का मुकाबला करने में मदद करती है, जिससे एजेंट समय पर और उचित तरीके से कार्य कर सके।
- सुसंगत कार्रवाई पीढ़ी जो शक्तिशाली विरोधियों का सामना करते समय पैनिक स्विचिंग समस्या को कम करती है।
इस लेख का उद्देश्य पोकेल्मोन फ्रेमवर्क को गहराई से कवर करना है, और हम तंत्र, पद्धति, वास्तुकला के साथ-साथ राज्य के कला फ्रेमवर्क के साथ इसकी तुलना करने जा रहे हैं। हम यह भी चर्चा करेंगे कि पोकेल्मोन फ्रेमवर्क कैसे मानव-जैसी लड़ाई रणनीतियों और समय पर निर्णय लेने की क्षमता प्रदर्शित करता है, और लगभग 50% की सम्मानजनक जीत की दर हासिल करता है। तो आइए शुरू करें。
पोकेल्मोन: एक मानव-परित्यक्त एजेंट जो पोकेमोन की लड़ाई में एलएलएम का उपयोग करता है
बड़े भाषा मॉडल और जेनरेटिव एआई फ्रेमवर्क की क्षमताओं और दक्षता में पिछले कुछ वर्षों में हुई वृद्धि अद्भुत रही है, खासकर एनएलपी कार्यों पर। हाल ही में, डेवलपर्स और एआई शोधकर्ताओं ने जेनरेटिव एआई और एलएलएम को वास्तविक दुनिया के दृश्यों में अधिक प्रमुख बनाने के तरीकों पर काम किया है, जिसमें शारीरिक दुनिया में स्वायत्त रूप से कार्य करने की क्षमता है। इस स्वायत्त प्रदर्शन को प्राप्त करने के लिए, शोधकर्ता और डेवलपर्स गेम्स को एक उपयुक्त परीक्षण बिस्तर मानते हैं जो एलएलएम-निकाय एजेंटों को विकसित करने के लिए है जो दृश्य वातावरण के साथ बातचीत करते हैं जैसे कि एक मानव करेगा।
पहले, डेवलपर्स ने माइनक्राफ्ट और सिम्स जैसे आभासी सिमुलेशन गेम्स पर एलएलएम-निकाय एजेंटों को विकसित करने का प्रयास किया है, हालांकि यह माना जाता है कि पोकेमोन जैसे रणनीतिक गेम्स बेहतर विकल्प हो सकते हैं। पोकेमोन की लड़ाई डेवलपर्स को एक पोकेमोन गेम में एक प्रशिक्षक की लड़ाई क्षमता का मूल्यांकन करने में मदद करती है और अन्य रणनीतिक गेम्स की तुलना में कई फायदे प्रदान करती है। चूंकि कार्रवाई और राज्य स्थान विचारों में विभाजित हैं, इसलिए उन्हें पाठ में अनुवादित किया जा सकता है बिना किसी नुकसान के। निम्नलिखित चित्र एक典型 पोकेमोन लड़ाई को दर्शाता है जहां खिलाड़ी को हर मोड़ पर वर्तमान पोकेमोन की स्थिति के आधार पर एक कार्रवाई उत्पन्न करने के लिए कहा जाता है। उपयोगकर्ताओं के पास पांच अलग-अलग पोकेमोन चुनने का विकल्प होता है और कार्रवाई स्थान में चार चालें होती हैं। इसके अलावा, गेम एलएलएम के लिए तनाव और अंतर्दृष्टि लागत को कम करने में मदद करता है क्योंकि मोड़-आधारित प्रारूप गहन खेल की आवश्यकता को समाप्त करता है। परिणामस्वरूप, प्रदर्शन मुख्य रूप से बड़े भाषा मॉडल की तर्क क्षमता पर निर्भर करता है।

पोकेल्मोन: पद्धति और वास्तुकला
पोकेल्मोन फ्रेमवर्क की समग्र वास्तुकला निम्नलिखित छवि में दिखाई गई है।

प्रत्येक मोड़ पर, पोकेल्मोन फ्रेमवर्क पिछले कार्यों और उनकी संबंधित पाठ-आधारित प्रतिक्रिया का उपयोग करके नीति को पुनः प्राप्त करता है, साथ ही साथ वर्तमान राज्य जानकारी को बाहरी ज्ञान जैसे कि क्षमता/चाल प्रभाव या लाभ/कमजोर संबंध के साथ बढ़ाता है। इनपुट के रूप में, पोकेल्मोन फ्रेमवर्क स्वतंत्र रूप से कई कार्रवाइयों का उत्पादन करता है, और फिर सबसे सुसंगत ones को अंतिम आउटपुट के रूप में चुनता है।
संदर्भ में प्रबलित学习
मानव खिलाड़ी और एथलीट अक्सर निर्णय लेते हैं न केवल वर्तमान स्थिति के आधार पर, बल्कि वे पिछले कार्यों और अन्य खिलाड़ियों के अनुभवों से प्रतिक्रिया पर भी विचार करते हैं। यह कहा जा सकता है कि सकारात्मक प्रतिक्रिया ही एक खिलाड़ी को अपनी गलतियों से सीखने में मदद करती है, और उन्हें बार-बार एक ही गलती करने से रोकती है। उचित प्रतिक्रिया के बिना, पोकेल्मोन एजेंट एक ही गलत कार्रवाई पर अटक सकते हैं, जैसा कि निम्नलिखित चित्र में दिखाया गया है।

जैसा कि देखा जा सकता है, गेम एजेंट एक पोकेमोन पात्र के खिलाफ एक जल-आधारित चाल का उपयोग करता है जिसमें “सूखी त्वचा” क्षमता है, जो जल-आधारित हमलों को रद्द कर देती है। गेम उपयोगकर्ता को स्क्रीन पर “प्रतिरक्षित” संदेश फ्लैश करके आगाह करने का प्रयास करता है, जो एक मानव खिलाड़ी को अपनी कार्रवाई को पुनः विचार करने और बदलने के लिए प्रेरित कर सकता है, भले ही उन्हें “सूखी त्वचा” के बारे में पता न हो। हालांकि, यह जानकारी एजेंट के लिए राज्य विवरण में शामिल नहीं है, जिसके परिणामस्वरूप एजेंट एक ही गलती को दोहराता है।
पोकेल्मोन एजेंट को अपनी पिछली गलतियों से सीखने के लिए, फ्रेमवर्क संदर्भ में प्रबलित学习 दृष्टिकोण को लागू करता है। प्रबलित学习 एक लोकप्रिय दृष्टिकोण है जो नीति को परिष्कृत करने में मदद करता है, जिसमें कार्रवाइयों का मूल्यांकन करने के लिए संख्यात्मक पुरस्कारों की आवश्यकता होती है। चूंकि बड़े भाषा मॉडल भाषा को व्याख्या और समझने में सक्षम हैं, पाठ-आधारित विवरण पुरस्कार के रूप में उभरे हैं। पिछले कार्यों से पाठ-आधारित प्रतिक्रिया को शामिल करके, पोकेल्मोन एजेंट अपनी नीति को पुनः प्राप्त करने में सक्षम है, अर्थात संदर्भ में प्रबलित学习। पोकेल्मोन फ्रेमवर्क चार प्रकार की प्रतिक्रिया विकसित करता है,
- एक हमले द्वारा किए गए वास्तविक नुकसान, जो दो连续 मोड़ों के बीच एचपी में अंतर के आधार पर होता है।
- हमले की प्रभावशीलता, जो हमले की प्रभावशीलता को दर्शाती है, जो कि क्षमता/चाल प्रभाव या प्रकार के लाभ के कारण कोई प्रभाव नहीं होने, अप्रभावी या अत्यधिक प्रभावी हो सकती है।
- चाल निष्पादन के लिए प्राथमिकता क्रम, जो विरोधी पोकेमोन की सटीक सांख्यिकी के अभाव में, गति का एक अनुमान प्रदान करता है।
- चालों के निष्पादन का वास्तविक प्रभाव, जो हमले और स्थिति दोनों में परिणाम हो सकते हैं, जैसे कि एचपी की वसूली, सांख्यिकीय वृद्धि या कमी, और स्थितियों जैसे जमना, जलना या जहर।

इसके अलावा, संदर्भ में प्रबलित学习 दृष्टिकोण का उपयोग करने से प्रदर्शन में महत्वपूर्ण वृद्धि होती है, जैसा कि निम्नलिखित चित्र में दिखाया गया है।

जब इसे जीपीटी-4 पर मूल प्रदर्शन के खिलाफ रखा जाता है, तो जीत की दर लगभग 10% बढ़ जाती है, साथ ही लड़ाई स्कोर में लगभग 13% की वृद्धि होती है। इसके अलावा, जैसा कि निम्नलिखित चित्र में दिखाया गया है, एजेंट पिछले मोड़ों में निष्पादित चालों का विश्लेषण करना शुरू कर देता है और अपनी कार्रवाई को बदलने का प्रयास करता है यदि पिछले मोड़ों में निष्पादित चालें अपेक्षाओं को पूरा नहीं करती हैं।

ज्ञान-संवर्धित पीढ़ी या केएजी
हालांकि संदर्भ में प्रबलित学习 को लागू करने से भ्रम को कम करने में मदद मिलती है, यह अभी भी गंभीर परिणामों का कारण बन सकता है इससे पहले कि एजेंट प्रतिक्रिया प्राप्त करे। उदाहरण के लिए, यदि एजेंट एक आग-प्रकार के पोकेमोन के साथ एक घास-प्रकार के पोकेमोन से लड़ता है, तो पहला संभवतः एक मोड़ में जीत जाएगा। भ्रम को और कम करने और एजेंट की निर्णय लेने की क्षमता में सुधार करने के लिए, पोकेल्मोन फ्रेमवर्क ज्ञान-संवर्धित पीढ़ी या केएजी दृष्टिकोण को लागू करता है, जो बाहरी ज्ञान का उपयोग करके पीढ़ी को संवर्धित करने की एक तकनीक है।
अब, जब मॉडल उपरोक्त चार प्रकार की प्रतिक्रिया उत्पन्न करता है, तो यह पोकेमोन चालों और जानकारी को एनोटेट करता है, जिससे एजेंट को अपने आप प्रकार लाभ संबंध का अनुमान लगाने की अनुमति मिलती है। भ्रम को और कम करने के प्रयास में, पोकेल्मोन फ्रेमवर्क विरोधी पोकेमोन और एजेंट के पोकेमोन की प्रकार लाभ और कमजोरियों को पर्याप्त विवरण के साथ स्पष्ट रूप से एनोटेट करता है। इसके अलावा, पोकेमोन की विशिष्ट चालों और क्षमताओं को याद रखना मुश्किल हो सकता है, खासकर जब इतने सारे पोकेमोन होते हैं। निम्नलिखित तालिका ज्ञान-संवर्धित पीढ़ी के परिणामों को दर्शाती है। यह ध्यान देने योग्य है कि ज्ञान-संवर्धित पीढ़ी दृष्टिकोण को लागू करके, पोकेल्मोन फ्रेमवर्क जीत की दर को लगभग 20% बढ़ाने में सक्षम है, 36% से 55% तक।

इसके अलावा, डेवलपर्स ने观察 किया कि जब एजेंट को पोकेमोन के बारे में बाहरी ज्ञान प्रदान किया गया, तो यह सही समय पर विशेष चालों का उपयोग करने लगा।

सुसंगत कार्रवाई पीढ़ी
मौजूदा मॉडल्स दर्शाते हैं कि प्रोम्प्टिंग और तर्क दृष्टिकोणों को लागू करने से एलएलएम की क्षमता को जटिल कार्यों को हल करने में सुधारा जा सकता है। इसके बजाय एक-शॉट कार्रवाई उत्पन्न करने के, पोकेल्मोन फ्रेमवर्क मौजूदा प्रोम्प्टिंग रणनीतियों का मूल्यांकन करता है, जिनमें सीओटी या चेन ऑफ थॉट, टीओटी या ट्री ऑफ थॉट, और सेल्फ कंसिस्टेंसी शामिल हैं। चेन ऑफ थॉट के लिए, एजेंट पहले एक विचार उत्पन्न करता है जो वर्तमान लड़ाई परिदृश्य का विश्लेषण करता है और विचार पर आधारित एक कार्रवाई का उत्पादन करता है। सेल्फ कंसिस्टेंसी के लिए, एजेंट तीन बार कार्रवाइयों का उत्पादन करता है और अधिकतम वोट प्राप्त करने वाले आउटपुट का चयन करता है। अंत में, ट्री ऑफ थॉट दृष्टिकोण के लिए, फ्रेमवर्क तीन कार्रवाइयों का उत्पादन करता है, जैसा कि सेल्फ कंसिस्टेंसी में, लेकिन स्वयं द्वारा उनका मूल्यांकन करने के बाद सबसे अच्छा एक का चयन करता है। निम्नलिखित तालिका प्रोम्प्टिंग दृष्टिकोणों के प्रदर्शन को सारांशित करती है।

प्रत्येक मोड़ के लिए केवल एक कार्रवाई होती है, जिसका अर्थ है कि यदि एजेंट स्विच करने का निर्णय लेता है और विरोधी हमला करने का निर्णय लेता है, तो स्विच-इन पोकेमोन को नुकसान होगा। सामान्य तौर पर, एजेंट स्विच करने का निर्णय लेता है क्योंकि यह एक प्रकार लाभ स्विच करने के लिए एक बाहरी पोकेमोन को स्विच करना चाहता है, और स्विचिंग-इन पोकेमोन विरोधी पोकेमोन की चालों के लिए प्रतिरोधी होने के कारण नुकसान को सहन कर सकता है। हालांकि, जैसा कि ऊपर दिखाया गया है, सीओटी तर्क वाले एजेंट के लिए, यहां तक कि जब शक्तिशाली विरोधी कई घुमावदार होते हैं, तो यह मिशन के साथ असंगत रूप से कार्य करता है, क्योंकि यह पोकेमोन में स्विच करना चाह सकता है लेकिन कई पोकेमोन और पीछे की ओर, जिसे हम पैनिक स्विचिंग कहते हैं। पैनिक स्विचिंग चालों को लेने के अवसरों को समाप्त करती है और हार का कारण बनती है।
पोकेल्मोन: परिणाम और प्रयोग
परिणामों पर चर्चा करने से पहले, यह समझना आवश्यक है कि लड़ाई का परिवेश कैसे काम करता है। प्रत्येक मोड़ की शुरुआत में, परिवेश सर्वर से एक कार्रवाई-अनुरोध संदेश प्राप्त करता है और मोड़ के अंत में इसका उत्तर देगा, जिसमें पिछले मोड़ से निष्पादन परिणाम भी शामिल है।
- संदेश को पार्स करता है और स्थानीय राज्य चरों को अपडेट करता है, 2. फिर राज्य चरों को पाठ में अनुवादित करता है। पाठ विवरण में मुख्य रूप से चार भाग होते हैं: 1. अपनी टीम की जानकारी, जिसमें मैदान में और बाहर (अप्रयुक्त) पोकेमोन के गुण शामिल हैं।
- विरोधी टीम की जानकारी, जिसमें मैदान में और बाहर (कुछ जानकारी अज्ञात) विरोधी पोकेमोन के गुण शामिल हैं।
- मैदान की जानकारी, जिसमें मौसम, प्रवेश खतरे, और क्षेत्र शामिल हैं।
- ऐतिहासिक मोड़ लॉग जानकारी, जिसमें दोनों पोकेमोन की पिछली कार्रवाइयां शामिल हैं और एक लॉग कतार में संग्रहीत की जाती हैं। एलएलएम लॉग को इनपुट के रूप में लेते हैं और अगले चरण के लिए कार्रवाइयों का उत्पादन करते हैं। कार्रवाई को सर्वर पर भेजा जाता है और मानव द्वारा की गई कार्रवाई के साथ एक ही समय में निष्पादित किया जाता है।
मानव खिलाड़ियों के खिलाफ लड़ाई
निम्नलिखित तालिका पोकेल्मोन एजेंट के मानव खिलाड़ियों के खिलाफ प्रदर्शन को दर्शाती है।

जैसा कि देखा जा सकता है, पोकेल्मोन एजेंट लेडर खिलाड़ियों के खिलाफ प्रदर्शन प्रदान करता है जो एक आमंत्रित खिलाड़ी की तुलना में उच्च जीत की दर के साथ-साथ व्यापक लड़ाई अनुभव के साथ हैं।
लड़ाई कौशल विश्लेषण
पोकेल्मोन फ्रेमवर्क शायद ही कभी प्रभावी चाल चुनने में गलती करता है और ज्ञान-संवर्धित पीढ़ी रणनीति के कारण एक अन्य उपयुक्त पोकेमोन में स्विच करता है।

जैसा कि ऊपर दिखाया गया है, एजेंट केवल एक पोकेमोन का उपयोग करके पूरे विरोधी टीम को हरा देता है क्योंकि यह विभिन्न हमले की चालें चुनने में सक्षम है जो विरोधी के लिए सबसे प्रभावी हैं। इसके अलावा, पोकेल्मोन फ्रेमवर्क मानव-जैसी क्षय रणनीति प्रदर्शित करता है। कुछ पोकेमोन में “जहरीला” चाल होती है जो प्रत्येक मोड़ पर अतिरिक्त नुकसान पहुंचा सकती है, जबकि “पुनरुद्धार” चाल इसे अपने एचपी को पुनरुद्धार करने की अनुमति देती है। इसका लाभ उठाते हुए, एजेंट पहले विरोधी पोकेमोन को जहर देता है और फिर पुनरुद्धार चाल का उपयोग करके खुद को बेहोश होने से रोकता है।

अंतिम विचार
इस लेख में, हमने पोकेल्मोन के बारे में बात की है, जो एक दृष्टिकोण है जो बड़े भाषा मॉडल को मानव खिलाड़ियों के खिलाफ पोकेमोन की लड़ाई में स्वायत्त रूप से खेलने की अनुमति देता है। पोकेल्मोन का उद्देश्य दुनिया का पहला निकाय एजेंट बनना है जो रणनीतिक गेम्स में मानव-स्तर का प्रदर्शन प्राप्त करता है, जैसा कि पोकेमोन की लड़ाई में देखा जाता है। पोकेल्मोन फ्रेमवर्क तीन मुख्य रणनीतियों को प्रस्तुत करता है: संदर्भ में प्रबलित学习, जो पाठ-आधारित प्रतिक्रिया का उपभोग करके नीति को पुनः प्राप्त करने के लिए उपयोग किया जाता है, ज्ञान-संवर्धित पीढ़ी जो बाहरी ज्ञान को पुनः प्राप्त करने के लिए उपयोग किया जाता है ताकि भ्रम का मुकाबला किया जा सके और एजेंट समय पर और उचित तरीके से कार्य कर सके, और सुसंगत कार्रवाई पीढ़ी जो शक्तिशाली विरोधियों का सामना करते समय पैनिक स्विचिंग समस्या को रोकती है।












