एआई मॉडल और प्लेटफ़ॉर्म
एआई शोधकर्ता वीडियो गेम खेलने वाले मॉडल का निर्माण करते हैं जो पिछली घटनाओं को याद रख सकते हैं

उबर के एआई लैब में शोधकर्ताओं की एक टीम ने हाल ही में एक प्रणाली विकसित की है एआई एल्गोरिदम की जो क्लासिक एटारी वीडियो गेम में मानव खिलाड़ियों और अन्य एआई प्रणालियों को पीछे छोड़ देती है। शोधकर्ताओं द्वारा विकसित एआई प्रणाली पिछले सफल रणनीतियों को याद रखने में सक्षम है, और जो पहले काम करता था उस पर आधारित नई रणनीतियों का निर्माण करती है। अध्ययन की शोध टीम का मानना है कि उन्होंने जिन एल्गोरिदम को विकसित किया है, उनके अन्य तकनीकी क्षेत्रों जैसे भाषा प्रसंस्करण और रोबोटिक्स में अनुप्रयोग हैं।
वीडियो गेम खेलने में सक्षम एआई प्रणालियों को बनाने के लिए आमतौर पर उपयोग की जाने वाली विधि प्रतिबल सीखने के एल्गोरिदम का उपयोग करना है। प्रतिबल सीखने के एल्गोरिदम एक कार्य को करने के लिए संभावित क्रियाओं की एक श्रृंखला का अन्वेषण करके सीखते हैं, और प्रत्येक क्रिया के बाद, उन्हें एक प्रकार का प्रतिबल (पुरस्कार या दंड) प्रदान किया जाता है। समय के साथ, एआई मॉडल सीखता है कि कौन सी क्रियाएं बड़े पुरस्कारों की ओर ले जाती हैं, और यह उन क्रियाओं को करने की संभावना बढ़ जाती है। दुर्भाग्य से, प्रतिबल सीखने के मॉडल में परेशानी होती है जब वे डेटासेट में अन्य डेटा बिंदुओं के साथ असंगत डेटा बिंदुओं का सामना करते हैं।
शोध टीम के अनुसार, उनके दृष्टिकोण को अन्य एआई शोधकर्ताओं द्वारा नहीं माना जाने का कारण यह है कि रणनीति प्रतिबल सीखने में आमतौर पर उपयोग किए जाने वाले “आंतरिक प्रेरणा” दृष्टिकोण से भिन्न है। आंतरिक प्रेरणा दृष्टिकोण के साथ समस्या यह है कि मॉडल “भूलने” के लिए प्रवण हो सकता है जो अभी भी अन्वेषण के योग्य हैं। इस घटना को “अनubandhan” के रूप में जाना जाता है। परिणामस्वरूप, जब मॉडल अप्रत्याशित डेटा का सामना करता है, तो यह उन क्षेत्रों को भूल सकता है जिन्हें अभी भी अन्वेषण किया जाना चाहिए।
टेकएक्सप्लोरे के अनुसार, शोध टीम ने एक सीखने के मॉडल को बनाने का लक्ष्य रखा जो अधिक लचीला और अप्रत्याशित डेटा का जवाब देने में सक्षम हो। शोधकर्ताओं ने इस समस्या का समाधान करके एक एल्गोरिदम पेश किया जो पिछले मॉडल द्वारा की गई सभी क्रियाओं को याद रख सकता है जब यह एक समस्या का समाधान करने का प्रयास करता है। जब एआई मॉडल एक डेटा बिंदु का सामना करता है जो उसके द्वारा अब तक सीखे गए डेटा के साथ संगत नहीं है, तो मॉडल अपने मेमोरी मैप की जांच करता है। मॉडल तब यह निर्धारित करता है कि कौन सी रणनीतियां सफल और विफल रहीं और रणनीतियों का चयन करता है।
जब एक वीडियो गेम खेलते हुए, मॉडल गेम के स्क्रीनशॉट एकत्र करता है क्योंकि यह खेलता है, अपनी क्रियाओं का एक लॉग बनाता है। छवियों को उनकी समानता के आधार पर समूहीकृत किया जाता है, जो समय के स्पष्ट बिंदु बनाते हैं जिनसे मॉडल संदर्भ ले सकता है। एल्गोरिदम लॉग की गई छवियों का उपयोग एक दिलचस्प समय बिंदु पर वापस जाने और वहां से अन्वेषण जारी रखने के लिए कर सकता है। जब मॉडल यह पाता है कि यह हार रहा है, तो यह ली गई स्क्रीनशॉट को देखेगा और एक अलग रणनीति का प्रयास करेगा।
बीबीसी के अनुसार, एआई एजेंट के लिए खतरनाक परिदृश्यों को संभालने की भी समस्या है। यदि एजेंट एक खतरे में आता है जो इसे मार सकता है, तो यह उन क्षेत्रों में वापस जाने से रोकेगा जिन्हें और अन्वेषण की आवश्यकता है, एक समस्या जिसे “उत्पात” के रूप में जाना जाता है। एआई मॉडल उत्पात समस्याओं को पुराने क्षेत्रों की खोज को प्रोत्साहित करने के लिए उपयोग की जाने वाली प्रक्रिया से अलग एक अलग प्रक्रिया के माध्यम से संभालता है।
शोध टीम ने मॉडल को 55 एटारी गेम खेलने के लिए रखा। ये गेम आमतौर पर एआई मॉडल के प्रदर्शन को बेंचमार्क करने के लिए उपयोग किए जाते हैं, लेकिन शोधकर्ताओं ने अपने मॉडल के लिए एक मोड़ जोड़ा। शोधकर्ताओं ने गेम में अतिरिक्त नियम पेश किए, मॉडल को निर्देश दिया कि न केवल उच्चतम स्कोर प्राप्त करने का प्रयास करें, बल्कि हर बार एक और उच्च स्कोर प्राप्त करने का प्रयास करें। जब मॉडल के प्रदर्शन के परिणामों का विश्लेषण किया गया, तो शोधकर्ताओं ने पाया कि उनकी एआई प्रणाली लगभग 85% समय गेम में अन्य एआई को पीछे छोड़ देती है। एआई मोंटेज़ुमा की प्रतिशोध नामक गेम में विशेष रूप से अच्छा प्रदर्शन किया, एक प्लेटफ़ॉर्म गेम जहां खिलाड़ी खतरों से बचता है और खजाने इकट्ठा करता है। गेम ने एक मानव खिलाड़ी के रिकॉर्ड को तोड़ दिया और किसी अन्य एआई प्रणाली की तुलना में उच्च स्कोर हासिल किया।
उबर एआई शोधकर्ताओं के अनुसार, शोध टीम द्वारा उपयोग की जाने वाली रणनीतियों का रोबोटिक्स जैसे उद्योगों में अनुप्रयोग है। रोबोट उन क्रियाओं को याद रखने की क्षमता से लाभान्वित होते हैं जो सफल होते हैं, जो काम नहीं करते हैं, और जिन्हें अभी तक आजमाया नहीं गया है।












