एआई मॉडल और प्लेटफ़ॉर्म

डीपमाइंड का नया एआई गेम खेलते समय नियम सीखने में सक्षम है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अल्फाबेट की सहायक कंपनी डीपमाइंड ने हाल ही में एक एआई सिस्टम विकसित किया है जो गेम खेलते समय नियम सीखने में सक्षम है। जबकि डीपमाइंड ने पहले भी शतरंज, शोगी, गो और वीडियो गेम जैसे गेम में महारत हासिल करने वाले प्रभावशाली एआई मॉडल बनाए हैं, इन मॉडलों को पहले से गेम के नियम प्रदान करने होते हैं। इस प्रकार, डीपमाइंड का नया एआई पिछले एआई अल्गोरिदम की तुलना में एक उल्लेखनीय सुधार है जो रिनफोर्समेंट लर्निंग के माध्यम से गेम सीखते हैं।

एआई सिस्टम – मुज़ेरो

नेचर पत्रिका में हाल ही में प्रकाशित एक शोध पत्र में, डीपमाइंड ने विस्तार से बताया कि उनका नया एआई सिस्टम कैसे काम करता है। नए एआई, मुज़ेरो को “लुक-आगे खोज” नामक सिद्धांत के कारण गेम खेलते समय नियम सीखने में सक्षम बनाया गया है। इंगेडेट की रिपोर्ट के अनुसार, मुज़ेरो लुक-आगे खोज का उपयोग विरोधियों की सबसे संभावित प्रतिक्रियाओं के आधार पर निर्णय लेने के लिए करता है।

जब शतरंज जैसे गेम में संभावित चालों पर विचार किया जाता है, तो मुज़ेरो उन चालों को प्राथमिकता देने में सक्षम है जो सबसे अधिक संभावित और प्रासंगिक हैं। मुज़ेरो फिर सफल और असफल दोनों चालों से सीखता है। यह सभी संभावित कारकों को मॉडल नहीं करता है, बल्कि केवल उन कारकों पर विचार करता है जो निर्णय लेने के लिए सबसे प्रासंगिक हैं। मुज़ेरो मूल रूप से उन कई संभावित चरों को कम करता है जिन पर विचार किया जा सकता है और केवल सबसे प्रभावी विशेषताओं को निकालता है। ये विशेषताएं एक पेड़-आधारित खोज अल्गोरिदम में प्रस्तुत की जाती हैं। पेड़ की संभावनाएं फिर परीक्षण वातावरण की विशेषताओं पर आधारित एक सीखे हुए मॉडल के साथ जोड़ी जाती हैं। लुक-आगे खोज तब की जाती है जब पर्यावरण के सबसे प्रासंगिक पहलुओं की पहचान हो जाती है।

एक अंतिम निर्णय लेने के लिए, तीन कारकों पर विचार किया जाता है।

मुज़ेरो पिछले निर्णय के परिणाम, वर्तमान स्थिति और आगे की संभावित क्रियाओं पर विचार करता है। यह दृष्टिकोण डीपमाइंड द्वारा पहले उपयोग किए जाने वाले दृष्टिकोणों से बेहतर है, जिनमें बुनियादी लुक-आगे खोज और पेड़-आधारित मॉडल शामिल हैं। मुज़ेरो शतरंज, शोगी और गो में अल्फाज़ेरो के रूप में अच्छा प्रदर्शन करने में सक्षम था, और जब यह मिस पैक-मैन गेम खेला, तो मुज़ेरो केवल छह या सात चालों पर विचार कर सकता था। इसके बावजूद, एआई अभी भी बहुत अच्छा प्रदर्शन करने में सक्षम था। डीपमाइंड ने मुज़ेरो की क्षमताओं का परीक्षण करने के लिए इसकी क्षमताओं को सीमित करने का भी प्रयास किया, जिसमें यह देखना शामिल था कि यह कितने सिमुलेशन कर सकता है trước कि यह एक चाल पर प्रतिबद्ध हो।一般, जितना अधिक समय कार्यक्रम को संभावित चालों पर विचार करने के लिए दिया गया, उतना ही बेहतर यह प्रदर्शन किया।

डीपमाइंड के प्रिंसिपल रिसर्च साइंटिस्ट, डेविड सिल्वर, टेकएक्सप्लोर के माध्यम से बताया कि मुज़ेरो पहला एआई मॉडल है जो अपने आप पर्यावरण के नियमों का प्रतिनिधित्व बना सकता है और उस प्रतिनिधित्व का उपयोग क्रियाओं की योजना बनाने के लिए करता है।

“हमारे पास पहली बार एक ऐसी प्रणाली है जो वास्तव में अपने आप यह समझने में सक्षम है कि दुनिया कैसे काम करती है और उस समझ का उपयोग इस तरह की जटिल लुक-आगे योजना के लिए करती है जिसे आप पहले शतरंज जैसे गेम में देख चुके हैं,” सिल्वर ने कहा। “(मुज़ेरो) शून्य से शुरू कर सकता है और केवल परीक्षण और त्रुटि के माध्यम से, दुनिया के नियमों की खोज कर सकता है और उन नियमों का उपयोग करके siêuमानव प्रदर्शन हासिल कर सकता है।”

संभावित अनुप्रयोग

एक एआई जो वास्तव में कार्य के प्रतिबंधों को सीखने और उन प्रतिबंधों के भीतर काम करने में सक्षम है, उसके कई संभावित अनुप्रयोग हैं। मुज़ेरो का उपयोग वीडियो संपीड़न जैसे कार्यों के लिए किया जा सकता है, जो ऐतिहासिक रूप से एआई का उपयोग करके स्वचालित करना मुश्किल रहा है क्योंकि विभिन्न वीडियो प्रारूपों और संपीड़न मोड हैं। मुज़ेरो लगभग 5% संपीड़न सुधार हासिल करने में सक्षम था। यह गूगल और यूट्यूब द्वारा होस्ट किए जाने वाले वीडियो की बड़ी संख्या के लिए परिणाम हो सकता है। वीडियो के अलावा, डीपमाइंड मुज़ेरो तकनीकों का उपयोग प्रोटीन आर्किटेक्चर डिजाइन और रोबोटिक्स प्रोग्रामिंग के लिए भी कर रहा है।

साउथेम्प्टन विश्वविद्यालय के कंप्यूटर विज्ञान के प्रोफेसर वेंडी हॉल के अनुसार, मुज़ेरो रिनफोर्समेंट लर्निंग अल्गोरिदम के लिए “एक महत्वपूर्ण कदम” है। हालांकि, हॉल चिंतित हैं कि अल्गोरिदम का दुरुपयोग किया जा सकता है। उदाहरण के लिए, अमेरिकी वायु सेना ने पहले से ही मुज़ेरो पर शोध पत्रों का उल्लेख किया है ताकि एक एआई सिस्टम बनाया जा सके जो यू-2 जासूसी विमानों से मिसाइलें लॉन्च कर सके। यह डीपमाइंड के शोधकर्ताओं के विपरीत है, जिन्होंने घातक स्वायत्त हथियारों की लताड़ करने के लिए घातक स्वायत्त हथियारों की प्रतिज्ञा पर हस्ताक्षर किए हैं और तर्क दिया है कि किसी भी घातक प्रौद्योगिकी को मानव नियंत्रण में रहना चाहिए।

सिल्वर ने बताया कि डीपमाइंड भविष्य की ओर देख रहा है, जिसमें मस्तिष्क की तरह शक्तिशाली और लचीले अल्गोरिदम विकसित करने का लक्ष्य है। लचीले अल्गोरिदम बनाने का पहला कदम यह समझना है कि एक प्रणाली के लिए बुद्धिमान होने का क्या अर्थ है, और बुद्धिमत्ता जटिल पर्यावरण के पैटर्न और नियमों को पहचानने की क्षमता से जुड़ी हुई है।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।