एआई मॉडल और प्लेटफ़ॉर्म

डीपमाइंड ने सुरक्षित रूप से प्रशिक्षित करने के लिए पुनरावृत्ति शिक्षा एआई की एक नई विधि की सूचना दी

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

पुनरावृत्ति शिक्षा एक आशाजनक मार्ग है जो एआई विकास में अत्यधिक जटिल कार्यों को संभालने में सक्षम एआई का उत्पादन करता है। पुनरावृत्ति एआई एल्गोरिदम मोबाइल रोबोटिक्स सिस्टम और स्व-ड्राइविंग कारों सहित अन्य अनुप्रयोगों के निर्माण में उपयोग किए जाते हैं। हालांकि, पुनरावृत्ति एआई को प्रशिक्षित करने के तरीके के कारण, वे कभी-कभी अजीब और अप्रत्याशित व्यवहार प्रदर्शित कर सकते हैं। ये व्यवहार खतरनाक हो सकते हैं, और एआई शोधकर्ता इस समस्या को “सुरक्षित अन्वेषण” समस्या कहते हैं, जो एआई को असुरक्षित राज्यों की अन्वेषण में फंसने का कारण बनती है।

हाल ही में, गूगल की एआई शोध प्रयोगशाला डीपमाइंड ने एक पेपर जारी किया जिसमें सुरक्षित अन्वेषण समस्या से निपटने और पुनरावृत्ति शिक्षा एआई को सुरक्षित तरीके से प्रशिक्षित करने के लिए नए तरीके प्रस्तावित किए गए। डीपमाइंड द्वारा सुझाए गए तरीके में पुरस्कार हैकिंग या पुरस्कार मानदंड में कमियों के लिए भी सुधार किया गया है।

डीपमाइंड की नई विधि में दो अलग-अलग प्रणालियाँ हैं जो एआई के व्यवहार को निर्देशित करने के लिए डिज़ाइन की गई हैं जब असुरक्षित व्यवहार उत्पन्न हो सकता है। डीपमाइंड की प्रशिक्षण तकनीक द्वारा उपयोग की जाने वाली दो प्रणालियाँ एक उत्पादक मॉडल और एक आगे की गतिविधि मॉडल हैं। दोनों मॉडल विभिन्न डेटा पर प्रशिक्षित किए जाते हैं, जैसे कि सुरक्षा विशेषज्ञों द्वारा प्रदर्शन और पूरी तरह से यादृच्छिक वाहन ट्रैक। डेटा को एक पर्यवेक्षक द्वारा विशिष्ट पुरस्कार मूल्यों के साथ लेबल किया जाता है, और एआई एजेंट पैटर्न को उठाएगा जो इसे सबसे बड़ा पुरस्कार एकत्र करने में सक्षम बनाएगा। असुरक्षित राज्यों को भी लेबल किया गया है, और एक बार मॉडल ने सफलतापूर्वक पुरस्कार और असुरक्षित राज्यों की भविष्यवाणी की है, तो इसे लक्षित कार्यों को करने के लिए तैनात किया जाता है।

शोध टीम ने पत्र में समझाया है कि विचार संभावित व्यवहार बनाने के लिए है, वांछित व्यवहार का सुझाव देने के लिए, और इन कल्पनात्मक परिदृश्यों को यथासंभव सूचित करने के लिए, साथ ही साथ सीखने के वातावरण के साथ सीधे हस्तक्षेप से बचने के लिए। डीपमाइंड टीम इस दृष्टिकोण को रेक्वेस्ट, या पुरस्कार प्रश्न संश्लेषण के माध्यम से मार्ग अनुकूलन कहती है।

रेक्वेस्ट चार अलग-अलग प्रकार के व्यवहार की ओर ले जाने में सक्षम है। पहले प्रकार का व्यवहार एन्सेम्बल पुरस्कार मॉडल के बारे में अनिश्चितता को अधिकतम करने का प्रयास करता है। दूसरे और तीसरे व्यवहार पूर्वानुमानित पुरस्कारों को कम करने और अधिकतम करने का प्रयास करते हैं। पूर्वानुमानित पुरस्कारों को कम करने से उन व्यवहारों की खोज हो सकती है जिन्हें मॉडल गलत तरीके से पूर्वानुमानित कर रहा है। दूसरी ओर, पूर्वानुमानित पुरस्कार को अधिकतम करने से उच्चतम सूचना मूल्य वाले व्यवहार लेबल प्राप्त होते हैं। अंत में, चौथे प्रकार का व्यवहार मार्ग की नईता को अधिकतम करने का प्रयास करता है, ताकि मॉडल पुरस्कारों की परियोजना की परवाह किए बिना अन्वेषण जारी रखे।

एक बार मॉडल ने वांछित स्तर के पुरस्कार संग्रह तक पहुँच जाता है, तो एक योजना एजेंट निर्णय लेने के लिए सीखे हुए पुरस्कारों का उपयोग करता है। यह मॉडल-निर्धारित नियंत्रण योजना एजेंटों को गतिशील मॉडल का उपयोग करके और संभावित परिणामों की भविष्यवाणी करके असुरक्षित राज्यों से बचने के लिए सीखने देती है, शुद्ध परीक्षण और त्रुटि के माध्यम से सीखने वाले एल्गोरिदम के विपरीत।

वेंचरबीट की रिपोर्ट के अनुसार, डीपमाइंड शोधकर्ता मानते हैं कि उनकी परियोजना पहली पुनरावृत्ति शिक्षा प्रणाली है जो नियंत्रित, सुरक्षित तरीके से सीखने में सक्षम है:

“हमारे ज्ञान के अनुसार, रेक्वेस्ट पहला पुरस्कार मॉडलिंग एल्गोरिदम है जो असुरक्षित राज्यों के बारे में सुरक्षित रूप से सीखता है और उच्च-आयामी, निरंतर राज्यों वाले वातावरण में तंत्रिका नेटवर्क पुरस्कार मॉडल को प्रशिक्षित करने के लिए स्केल करता है। अब तक, हमने केवल रेक्वेस्ट की प्रभावशीलता का प्रदर्शन किया है जो कि अपेक्षाकृत सरल गतिविधियों वाले सिम्युलेटेड डोमेन में है। भविष्य के काम का एक दिशा 3डी डोमेन में रेक्वेस्ट का परीक्षण करना है जो अधिक वास्तविक भौतिकी और पर्यावरण में अन्य एजेंटों के साथ कार्य करता है।”

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।