एआई मॉडल और प्लेटफ़ॉर्म

एआई एजेंट वर्चुअल हाइड एंड सीक में इमर्जेंट इंटेलिजेंस प्रॉपर्टीज़ का प्रदर्शन करते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एआई के बारे में शोध करने के बारे में एक दिलचस्प तथ्य यह है कि यह अक्सर ऐसे कार्यों को निष्पादित कर सकता है और रणनीतियों का पालन कर सकता है जो इसके डिज़ाइनर शोधकर्ताओं को आश्चर्यचकित कर देते हैं। यह एक हालिया वर्चुअल गेम ऑफ हाइड एंड सीक में हुआ, जहां एक दूसरे के खिलाफ कई एआई एजेंटों को पिट किया गया था। सैन फ्रांसिस्को स्थित एआई फर्म ओपनएआई के शोधकर्ताओं को यह पता चला कि उनके एआई एजेंट गेम वर्ल्ड में रणनीतियों का शोषण करना शुरू कर दिया जो शोधकर्ताओं को नहीं पता था कि वे मौजूद हैं।

ओपनएआई ने एक समूह के एआई एजेंटों को एक दूसरे के साथ हाइड एंड सीक गेम खेलने के लिए प्रशिक्षित किया है। एआई प्रोग्रामों को रिनफोर्समेंट लर्निंग के साथ प्रशिक्षित किया जाता है, एक तकनीक जहां वांछित व्यवहार को एआई अल्गोरिदम से प्राप्त किया जाता है जो अल्गोरिदम को फीडबैक प्रदान करके प्राप्त किया जाता है। एआई शुरू में यादृच्छिक क्रियाएं करता है, और हर बार जब यह एक क्रिया करता है जो इसे अपने लक्ष्य के करीब ले जाता है, तो एजेंट को पुरस्कृत किया जाता है। एआई का उद्देश्य अधिकतम पुरस्कार प्राप्त करना है, इसलिए यह यह देखने के लिए प्रयोग करता है कि कौन सी क्रियाएं इसे अधिक पुरस्कार दिलाती हैं। ट्रायल और त्रुटि के माध्यम से, एआई उन रणनीतियों को पहचानने में सक्षम है जो इसे जीत दिला सकती हैं, जो इसे सबसे अधिक पुरस्कार दिला सकती हैं।

रिनफोर्समेंट लर्निंग ने पहले से ही गेम के नियमों को सीखने में आश्चर्यकारी सफलता दिखाई है। ओपनएआई ने हाल ही में एक एआई टीम को डोटा 2 खेलने के लिए प्रशिक्षित किया, और एआई ने पिछले साल एक विश्व-चैंपियन मानव खिलाड़ियों की टीम को हराया। एक समान चीज स्टारक्राफ्ट गेम के साथ हुई जब डीपमाइंड द्वारा गेम पर एआई को प्रशिक्षित किया गया। रिनफोर्समेंट लर्निंग का उपयोग एआई प्रोग्रामों को पिक्चर्स को व्याख्या करने और मूलभूत सामान्य ज्ञान तर्क का उपयोग करने के लिए पिक्चर्स के साथ मानवों को खेलने के लिए सिखाने के लिए भी किया गया है।

शोधकर्ताओं द्वारा बनाए गए हाइड एंड सीक वीडियो गेम में, एक दूसरे के खिलाफ कई एआई एजेंटों को पिट किया गया था। परिणाम एक प्रकार की हथियारों की दौड़ थी, जहां प्रत्येक एजेंट दूसरे को पछाड़ना चाहता था और सबसे अधिक पुरस्कार अंक प्राप्त करना चाहता था। एक एजेंट द्वारा अपनाई गई एक नई रणनीति इसके प्रतिद्वंद्वी को एक नई रणनीति की तलाश करने का कारण बनती है, और इसके विपरीत। ओपनएआई के एक शोधकर्ता, इगोर मोर्डैच, ने आईईई स्पेक्ट्रम को बताया कि यह प्रयोग यह दिखाता है कि एजेंटों के बीच इस प्रकार की ट्रायल और त्रुटि प्रक्रिया “उनके लिए आश्चर्यजनक व्यवहार सीखने के लिए पर्याप्त है – यह बच्चों के साथ खेलने जैसा है।”

आश्चर्यजनक व्यवहार क्या थे? शोधकर्ताओं ने चार मूलभूत रणनीतियों की अपेक्षा की थी जो उन्हें उम्मीद थी कि एआई एजेंट सीखेंगे, और उन्होंने उन्हें अपेक्षाकृत जल्दी से सीख लिया, केवल 25 मिलियन सिम्युलेटेड गेम के बाद प्रतिभाशाली हो गए। गेम एक 3डी वातावरण में हुआ, जिसमें रैंप, ब्लॉक और दीवारें थीं। एआई एजेंटों ने एक दूसरे के चारों ओर दौड़ना, ब्लॉक को स्थानांतरित करना और रैंप को स्थानांतरित करना सीखा। एआई शिकारी एजेंटों ने रैंप को खींचकर हाइडर्स के किले में प्रवेश करना सीखा, जबकि हाइडर्स ने रैंप को अपने किले में ले जाने का प्रयास किया ताकि शिकारी उनका उपयोग न कर सकें।

हालांकि, 380 मिलियन गेम के बेंचमार्क के आसपास, कुछ अप्रत्याशित हुआ। एआई एजेंटों ने दो रणनीतियों को सीखा जो शोधकर्ताओं को नहीं पता था कि वे मौजूद हैं। शिकारी एजेंटों ने सीखा कि एक बॉक्स पर कूदकर और इसे एक निकटवर्ती किले की ओर मोड़कर, वे किले में कूद सकते हैं और हाइडर को ढूंढ सकते हैं। शोधकर्ताओं को यह एहसास नहीं था कि गेम वातावरण के भौतिकी में यह संभव था। हाइडर्स ने इस मुद्दे से निपटने के लिए बॉक्स को अपने किले में खींचना सीखा।

जबकि रिनफोर्समेंट लर्निंग अल्गोरिदम के साथ प्रशिक्षित एजेंटों का अप्रत्याशित व्यवहार इस मामले में हानिरहित है, यह अन्य स्थितियों में रिनफोर्समेंट लर्निंग को लागू करने के बारे में कुछ संभावित चिंताओं को उठाता है। ओपनएआई की शोध टीम के एक सदस्य, बोवेन बेकर, ने आईईई स्पेक्ट्रम को बताया कि यह अप्रत्याशित व्यवहार संभावित रूप से खतरनाक हो सकता है। आखिर, अगर रोबोट अप्रत्याशित तरीके से व्यवहार करना शुरू कर दें?

“इन वातावरणों का निर्माण करना मुश्किल है,” बेकर ने समझाया। “एजेंट अप्रत्याशित व्यवहार के साथ आने वाले हैं, जो एक सुरक्षा समस्या होगी जब आप उन्हें अधिक जटिल वातावरण में डालेंगे।”

हालांकि, बेकर ने यह भी समझाया कि रिनफोर्समेंट रणनीतियां वर्तमान समस्याओं के लिए नवाचारी समाधानों का नेतृत्व कर सकती हैं। रिनफोर्समेंट लर्निंग के साथ प्रशिक्षित सिस्टम एक विस्तृत श्रृंखला की समस्याओं को हल कर सकते हैं जिनके समाधान हम कल्पना भी नहीं कर सकते हैं।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।