एआई मॉडल और प्लेटफ़ॉर्म
गूगल का एआई रोबोट्स को कुत्तों को देखकर चलना सिखाता है
आज के सबसे उन्नत रोबोट्स में से भी कुछ अभी भी थोड़े अकड़कर और झटकेदार तरीके से चलते हैं। रोबोट्स को अधिक जीवनीय और तरल तरीके से चलाने के लिए, गूगल के शोधकर्ताओं ने एक एआई सिस्टम विकसित किया है जो वास्तविक जानवरों की गतिविधियों से सीखने में सक्षम है। गूगल शोध टीम ने अपने दृष्टिकोण के बारे में विस्तार से बताया है। शोधकर्ताओं का मानना है कि रोबोट्स को अधिक प्राकृतिक गति प्रदान करने से उन्हें वास्तविक दुनिया के कार्यों को पूरा करने में मदद मिल सकती है जिनमें सटीक गति की आवश्यकता होती है, जैसे कि एक भवन के विभिन्न स्तरों के बीच आइटम वितरित करना।
वेंचरबीट के अनुसार, शोध टीम ने रोबोट्स को प्रशिक्षित करने के लिए सुदृढ़ सीखने का उपयोग किया। शोधकर्ताओं ने वास्तविक जानवरों की गतिविधियों के क्लिप एकत्र किए और सुदृढ़ सीखने (आरएल) तकनीकों का उपयोग करके रोबोट्स को जानवरों की गतिविधियों की नकल करने के लिए प्रेरित किया। इस मामले में, शोधकर्ताओं ने रोबोट्स को एक कुत्ते के क्लिप पर प्रशिक्षित किया, जिसे एक भौतिकी सिम्युलेटर में डिज़ाइन किया गया था, जिसमें एक चार-पैर वाले यूनिट्री लाइकागो रोबोट को कुत्ते की गतिविधियों की नकल करने का निर्देश दिया गया था। प्रशिक्षण के बाद, रोबोट जटिल गतिविधियों जैसे कि कूदना, मुड़ना और तेजी से चलना करने में सक्षम था, जो लगभग 2.6 मील प्रति घंटे की गति से थी।
प्रशिक्षण डेटा में लगभग 200 मिलियन नमूने शामिल थे जिनमें कुत्तों की गतिविधियों को ट्रैक किया गया था, जो एक भौतिकी सिम्युलेटर में थे। विभिन्न गतिविधियों को तब पुरस्कार कार्यों और नीतियों के माध्यम से चलाया गया जो एजेंटों ने सीखे थे। एक बार जब नीतियां सिम्युलेटर में बनाई गईं, तो उन्हें वास्तविक दुनिया में लेटेंट स्पेस अनुकूलन तकनीक का उपयोग करके स्थानांतरित किया गया। चूंकि भौतिकी सिम्युलेटर जो रोबोट्स को प्रशिक्षित करने के लिए उपयोग किए गए थे वे वास्तविक दुनिया की गतिविधियों के कुछ पहलुओं को केवल अनुमानित कर सकते थे, शोधकर्ताओं ने सिम्युलेशन में विभिन्न विक्षोभों को यादृच्छिक रूप से लागू किया, जो विभिन्न स्थितियों के तहत संचालन का अनुकरण करने के लिए थे।
शोध टीम के अनुसार, उन्हें केवल 50 अलग-अलग परीक्षणों से एकत्र किए गए आठ मिनट के डेटा का उपयोग करके सिम्युलेशन नीतियों को वास्तविक दुनिया के रोबोट्स में अनुकूलित करने में सक्षम थे। शोधकर्ताओं ने प्रदर्शित किया कि वास्तविक दुनिया के रोबोट विभिन्न विशिष्ट गतिविधियों जैसे कि ट्रॉटिंग, मुड़ना, कूदना और पेसिंग की नकल करने में सक्षम थे। वे यहां तक कि एनिमेशन कलाकारों द्वारा बनाए गए एनिमेशन की नकल करने में सक्षम थे, जैसे कि एक संयोजन कूद और मोड़。
शोधकर्ता अपने निष्कर्षों को इस प्रकार सारांशित करते हैं:
“हम दिखाते हैं कि संदर्भ गति डेटा का लाभ उठाकर, एक एकल सीखने-आधारित दृष्टिकोण पैर वाले रोबोट्स के लिए विभिन्न व्यवहारों के लिए नियंत्रक स्वचालित रूप से संश्लेषित करने में सक्षम है। सीखने की प्रक्रिया में नमूना कुशल डोमेन अनुकूलन तकनीकों को शामिल करके, हमारी प्रणाली सिम्युलेशन में अनुकूलनीय नीतियों को सीखने में सक्षम है जो तब वास्तविक दुनिया में तेजी से अनुकूलित की जा सकती है।”
सुदृढ़ सीखने की प्रक्रिया के दौरान उपयोग की जाने वाली नियंत्रण नीतियों में कुछ सीमाएं थीं। हार्डवेयर और एल्गोरिदम द्वारा लगाए गए प्रतिबंधों के कारण, कुछ चीजें थीं जो रोबोट बस नहीं कर सकते थे। वे नहीं दौड़ सकते थे या बड़े कूद नहीं बना सकते थे, उदाहरण के लिए। सीखी गई नीतियों ने भी मैन्युअल रूप से डिज़ाइन की गई गतिविधियों की तुलना में उतनी स्थिरता नहीं दिखाई। शोध टीम नियंत्रकों को अधिक मजबूत और विभिन्न प्रकार के डेटा से सीखने में सक्षम बनाने के लिए काम को आगे बढ़ाना चाहती है। आदर्श रूप से, भविष्य के फ्रेमवर्क के संस्करण वीडियो डेटा से सीखने में सक्षम होंगे।










