एआई मॉडल और प्लेटफ़ॉर्म

तकनीक एआई को दूर भविष्य में सोचने में सक्षम बनाती है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एमआईटी, एमआईटी-आईबीएम वॉटसन एआई लैब, और अन्य संस्थानों के शोधकर्ताओं की एक टीम ने एक नई दृष्टिकोण विकसित की है जो कृत्रिम बुद्धिमत्ता (एआई) एजेंटों को दूरदर्शी दृष्टिकोण प्राप्त करने में सक्षम बनाती है। दूसरे शब्दों में, एआई भविष्य में दूर तक सोचने में सक्षम है जब यह अपने व्यवहार को पूरा करने के लिए अन्य एआई एजेंटों के व्यवहार को शामिल करने पर विचार करता है।

यह शोध न्यूरल इन्फॉर्मेशन प्रोसेसिंग सिस्टम्स कॉन्फ्रेंस में प्रस्तुत किया जाने वाला है।

एआई अन्य एजेंटों की भविष्य की क्रियाओं पर विचार करता है

टीम द्वारा बनाया गया मशीन-लर्निंग फ्रेमवर्क सहयोगी या प्रतिस्पर्धी एआई एजेंटों को यह सोचने में सक्षम बनाता है कि अन्य एजेंट क्या करेंगे। यह केवल अगले कदमों के लिए नहीं है, बल्कि समय अनंत तक पहुंचता है। एजेंट अपने व्यवहार को अनुकूलित करते हैं ताकि वे अन्य एजेंटों के भविष्य के व्यवहार को प्रभावित कर सकें और उन्हें लंबी अवधि के समाधानों तक पहुंचाने में मदद कर सकें।

टीम के अनुसार, इस फ्रेमवर्क का उपयोग, उदाहरण के लिए, एक खोए हुए ट्रेकर को खोजने के लिए एक साथ काम करने वाले स्वायत्त ड्रोन द्वारा किया जा सकता है। इसका उपयोग स्व-ड्राइविंग वाहनों द्वारा भी किया जा सकता है ताकि वे अन्य वाहनों की भविष्य की चालों की भविष्यवाणी कर सकें और यात्री सुरक्षा में सुधार कर सकें।

डोंग-की किम एमआईटी लेबोरेटरी फॉर इंफॉर्मेशन एंड डिसीजन सिस्टम्स (एलआईडीएस) में एक स्नातक छात्र हैं और शोध पत्र के प्रमुख लेखक हैं।

“जब एआई एजेंट सहयोग या प्रतिस्पर्धा कर रहे होते हैं, तो सबसे महत्वपूर्ण बात यह है कि उनके व्यवहार भविष्य में किसी बिंदु पर मिलते हैं,” किम कहते हैं। “रास्ते में बहुत सारे अस्थायी व्यवहार होते हैं जो लंबे समय में बहुत मायने नहीं रखते हैं। इस मिले हुए व्यवहार तक पहुंचना ही हमें वास्तव में चिंतित करता है, और अब हमारे पास यह करने के लिए एक गणितीय तरीका है।”

शोधकर्ताओं द्वारा हल की गई समस्या को बहु-एजेंट प्रबलीकरण सीखने के रूप में जाना जाता है, जहां प्रबलीकरण सीखना एक प्रकार का मशीन लर्निंग है जहां एआई एजेंट ट्रायल और त्रुटि द्वारा सीखते हैं।

जबकि कई सहयोगी या प्रतिस्पर्धी एजेंट एक साथ सीख रहे होते हैं, प्रक्रिया बहुत अधिक जटिल हो सकती है। जब एजेंट अन्य एजेंटों के भविष्य के कदमों के बारे में अधिक सोचते हैं, साथ ही साथ अपने व्यवहार और यह कैसे अन्य लोगों को प्रभावित करता है, तो समस्या को बहुत अधिक गणनात्मक शक्ति की आवश्यकता होती है।

एआई अनंत के बारे में सोचता है

“एआई वास्तव में खेल के अंत के बारे में सोचना चाहता है, लेकिन वे नहीं जानते कि खेल कब समाप्त होगा,” किम कहते हैं। “उन्हें यह सोचने की जरूरत है कि वे अपने व्यवहार को अनंत तक कैसे समायोजित कर सकते हैं ताकि वे भविष्य में किसी दूर के समय में जीत सकें। हमारे पत्र में मूल रूप से एक नई वस्तु का प्रस्ताव है जो एआई को अनंत के बारे में सोचने में सक्षम बनाता है।”

यह एक अल्गोरिथ्म में अनंत को एकीकृत करना असंभव है, इसलिए टीम ने प्रणाली को इस तरह से डिज़ाइन किया है कि एजेंट भविष्य के एक बिंदु पर ध्यान केंद्रित करते हैं जहां उनका व्यवहार अन्य एजेंटों के साथ मेल खाता है। इसे संतुलन के रूप में जाना जाता है, और एक संतुलन बिंदु एजेंटों के लंबी अवधि के प्रदर्शन को निर्धारित करता है।

एक बहु-एजेंट परिदृश्य में कई संतुलन हो सकते हैं, और जब एक प्रभावी एजेंट सक्रिय रूप से अन्य एजेंटों के भविष्य के व्यवहार को प्रभावित करता है, तो वे एक वांछनीय संतुलन तक पहुंच सकते हैं जो एजेंट के दृष्टिकोण से है। जब सभी एजेंट एक दूसरे को प्रभावित करते हैं, तो वे एक सामान्य अवधारणा के रूप में जाने जाने वाले एक “सक्रिय संतुलन” तक पहुंचते हैं।

फर्थर फ्रेमवर्क

टीम का मशीन-लर्निंग फ्रेमवर्क फर्थर नामक है, और यह एजेंटों को सिखाता है कि वे अन्य एजेंटों के साथ अपने संवादों के आधार पर अपने व्यवहार को कैसे समायोजित करें ताकि वे सक्रिय संतुलन प्राप्त कर सकें।

फ्रेमवर्क दो मशीन-लर्निंग मॉड्यूल पर निर्भर करता है। पहला एक अनुमान मॉड्यूल है जो एक एजेंट को अन्य एजेंटों के भविष्य के व्यवहार और सीखने के अल्गोरिथ्म का अनुमान लगाने में सक्षम बनाता है जो वे उपयोग करते हैं जो पिछले कार्यों पर आधारित है। जानकारी को तब प्रबलीकरण सीखने वाले मॉड्यूल में डाला जाता है, जिस पर एजेंट अपने व्यवहार को अनुकूलित करने और अन्य एजेंटों को प्रभावित करने के लिए निर्भर करता है।

“चुनौती अनंत के बारे में सोचने की थी। हमें इसके लिए कई अलग-अलग गणितीय उपकरणों का उपयोग करना पड़ा और व्यावहारिक रूप से इसका काम करने के लिए कुछ धारणाएं करनी पड़ीं।” किम कहते हैं।

टीम ने विभिन्न परिदृश्यों में अन्य बहु-एजेंट प्रबलीकरण सीखने के फ्रेमवर्क के खिलाफ अपनी विधि का परीक्षण किया, जहां एआई एजेंट जो फर्थर का उपयोग करते हैं आगे निकल जाते हैं।

दृष्टिकोण विकेंद्रीकृत है, इसलिए एजेंट स्वतंत्र रूप से सीखते हैं कि कैसे जीतना है। इसके अलावा, यह अन्य विधियों की तुलना में बेहतर है जिन्हें एजेंटों को नियंत्रित करने के लिए एक केंद्रीय कंप्यूटर की आवश्यकता होती है।

टीम के अनुसार, फर्थर का उपयोग बहु-एजेंट समस्याओं की एक विस्तृत श्रृंखला में किया जा सकता है। किम विशेष रूप से इसके आर्थिक अनुप्रयोगों के लिए आशावादी है, जहां इसका उपयोग समय के साथ बदलते व्यवहार और हितों वाले कई बातचीत करने वाले संस्थाओं वाली स्थितियों में ध्वनि नीति विकसित करने के लिए किया जा सकता है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।