الروبوتات والذكاء الاصطناعي الفيزيائي

الروبوتات قادرة على تعلم المهام المعقدة من خلال عدة تجارب

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في أحد أحدث التطورات في مجال الروبوتات، قام باحثون في جامعة جنوب كاليفورنيا (USC) بتطوير نظام يتيح للروبوتات تعلم المهام المعقدة من خلال تجارب قليلة. والأمر الأكثر إثارة للإعجاب هو أن بعض هذه التجارب يمكن أن تكون غير کاملة.

تم تقديم البحث في مؤتمر التعلم الروبوتي (CoRL) في 18 نوفمبر، تحت عنوان “التعلم من التجارب باستخدام المنطق الزمني الإشاري.”

النظام

يتم قياس جودة كل تجربة بحيث يمكن للنظام التعلم من نجاحاته وفشله. على عكس الطرق الحالية، التي تتطلب على الأقل 100 تجربة لتعليم مهمة معينة، يتطلب النظام الجديد فقط بضع تجارب. بطريقة直觉، طريقة تعلم هذه الروبوتات تشبه طريقة تعلم البشر من بعضهم البعض. على سبيل المثال، يشاهد البشر ويتعلمون من الآخرين الذين يكملون المهام بنجاح أو بصور غير کاملة.

أنيرود بورانيك هو المؤلف الرئيسي للبحث وطالب دكتوراه في علوم الحاسوب في كلية الهندسة في جامعة USC Viterbi.

قال بورانيك: “许多 أنظمة التعلم الآلي والتعلم التعزيزي تتطلب كميات كبيرة من البيانات ومئات التجارب – تحتاج إلى إنسان ليقوم بالتجربة مرة بعد مرة، وهو أمر غير ممكن”.

وأضاف: “بالإضافة إلى ذلك، معظم الناس لا يملكون معرفة بالبرمجة لتحديد ما يجب على الروبوت فعله، ولا يمكن للإنسان أن يثبت كل ما يحتاجه الروبوت إلى معرفته. ماذا لو واجه الروبوت شيئًا لم يره من قبل؟这是 تحدي رئيسي”.

استخدم الباحثون “المنطق الزمني الإشاري” أو STL لتحديد جودة التجارب، وترتيبها وفقًا لذلك، وإنشاء مكافآت متأصلة.

هناك两个 سبب رئيسي لاختيار الباحثين STL:

  1. من خلال التعلم من التجارب، يمكن للروبوتات التقاط العيوب أو السلوكيات غير الآمنة والافعال غير المرغوبة.
  2. يمكن أن تختلف جودة التجارب حسب المستخدم الذي يقدمها، وبعض التجارب تكون أفضل من غيرها في تحديد السلوك المرغوب.

من خلال تطوير النظام بهذه الطريقة، يمكن للروبوت التعلم من التجارب غير الكاملة، حتى لو لم تتوافق مع متطلبات المنطق. بمعنى آخر، يصل إلى استنتاجه الخاص حول الدقة أو النجاح.

ستيفانوس نيكولايديس هو مؤلف مشارك وأستاذ مساعد في علوم الحاسوب في جامعة USC Viterbi.

قال نيكولايديس: “لنفترض أن الروبوتات تتعلم من أنواع مختلفة من التجارب – يمكن أن تكون تجربة يدوية أو فيديوهات أو محاكاة – إذا قمت بشيء غير آمن، فإن النهج المعتاد سيفعل إحدى هذه الأشياء: إما أن يهملها تمامًا، أو أسوأ من ذلك، سيتعلم الروبوت الشيء الخطأ”.

“في المقابل، يستخدم هذا العمل بذكاء بعض التفكير العادي في شكل منطق لفهم أجزاء التجربة الجيدة وأجزاء غير الجيدة”، يضيف. “في جوهره، هذا هو ما يفعله البشر أيضًا”.

المنطق الزمني الإشاري

يمكن للروبوتات التفكير في النتائج الحالية والمستقبلية من خلال STL، وهو لغة رمزية رياضية تعبيرية. في السابق، اعتمد البحث على “المنطق الزمني الخطي”.

جيو ديشموه هو مهندس سابق في شركة تويوتا وأستاذ مساعد في علوم الحاسوب في جامعة USC.

قال ديشموه: “عندما ندخل عالم الأنظمة الإلكترونية الفيزيائية، مثل الروبوتات والسيارات ذاتية القيادة، حيث يكون الوقت حاسمًا، يصبح المنطق الزمني الخطي متعبًا بعض الشيء، لأنه يفكر في تسلسلات القيم الصحيحة/الخاطئة للمتغيرات، بينما يسمح STL التفكير في الإشارات الفيزيائية”.

كان فريق الباحثين مفاجئًا بنجاح النظام.

قال نيكولايديس: “بالمقارنة مع خوارزمية متقدمة تستخدم على نطاق واسع في تطبيقات الروبوتات، يمكنك رؤية فرقًا كبيرًا في عدد التجارب المطلوبة”.

وفقًا للباحثين، يمكن للنظام التعلم من محاكاة القيادة وفي النهاية من الفيديوهات. الخطوة التالية هي اختباره على روبوتات حقيقية، حيث تم الاختبار الأولي على محاكي لعبة. سيكون النظام مفيدًا للتطبيقات مثل تلك الموجودة في البيئات المنزلية والمستودعات ومركبات استكشاف الفضاء.

قال نيكولايديس: “إذا كنا نريد الروبوتات أن تكون شركاء جيدين ومساعدين للناس، فإنهم يجب أن يتعلموا ويتكيفوا مع تفضيلات البشر بفعالية كبيرة. يوفر نظامنا ذلك”.

أليكس يقود عمليات الأخبار المدعومة بالذكاء الاصطناعي في Unite.AI، حيث يجمع بين الصحافة والبحث والأتمتة لدعم تغطية الذكاء الاصطناعي في الوقت المناسب وبشكل قابل للتوسع. يساعد عمله في ضمان ظهور التطورات الناشئة في مجال الذكاء الاصطناعي بكفاءة، مع الحفاظ على معايير التحرير الخاصة بالموقع.