نماذج ومنصات الذكاء الاصطناعي

وكلاء الذكاء الاصطناعي يظهر على خصائص الذكاء الناشئ في لعبة الاختفاء والبحث الافتراضية

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

من الحقائق المثيرة للاهتمام حول البحث في الذكاء الاصطناعي هو أنه يمكن أن ينفذ أحيانًا أفعال واستراتيجيات ت驚ز الباحثين أنفسهم. حدث هذا خلال لعبة افتراضية最近 من لعبة الاختفاء والبحث، حيث تم وضع وكلاء ذكاء اصطناعي متعددين ضد بعضهم البعض. كان الباحثون في شركة OpenAI، وهي شركة ذكاء اصطناعي مقرها سان فرانسيسكو، مفاجئين باكتشاف أن وكلاءهم الذكاء الاصطناعي بدؤوا في استغلال استراتيجيات في عالم اللعبة لم يكن الباحثون يعرفون حتى وجودها.

قامت OpenAI بتدريب مجموعة من وكلاء الذكاء الاصطناعي على لعب لعبة الاختفاء والبحث مع بعضهم البعض. يتم تدريب البرامج الذكاء الاصطناعي باستخدام تقنية التعلم التعزيزي، وهي تقنية يتم فيها استخراج السلوك المرغوب فيه من خوارزميات الذكاء الاصطناعي من خلال تقديم反馈 لها. يبدأ الذكاء الاصطناعي bằng أخذ إجراءات عشوائية، وكل مرة يأخذ فيها إجراءً يقربه من هدفه، يتم مكافأته. يرغب الذكاء الاصطناعي في الحصول على أكبر قدر ممكن من المكافآت، لذلك سيجرب أن يجد الإجراءات التي ستجلب له المزيد من المكافآت. من خلال التجربة والخطأ، يمكن للذكاء الاصطناعي أن يميز الاستراتيجيات التي ستؤدي به إلى النصر، تلك التي ستمنحه أكبر مكافأة.

التعلم التعزيزي قد أظهر بالفعل نجاحًا مثيرًا في تعلم قواعد الألعاب. قامت OpenAI مؤخرًا بتدريب فريق من الذكاء الاصطناعي على لعب لعبة DOTA 2، وهزمت الذكاء الاصطناعي فريقًا من البشر الأبطال العالميين في العام الماضي. حدث شيء مشابه مع لعبة StarCraft عندما تم تدريب الذكاء الاصطناعي على اللعبة بواسطة DeepMind. تم استخدام التعلم التعزيزي أيضًا لتعليم برامج الذكاء الاصطناعي لعب لعبة Pictionary مع البشر، وتعلم تفسير الصور واستخدام التفكير المنطقي البسيط.

في لعبة الاختفاء والبحث التي تم إنشاؤها بواسطة الباحثين، تم وضع وكلاء ذكاء اصطناعي متعددين ضد بعضهم البعض. كان النتيجة نوعًا من السباق التكنولوجي، حيث يريد كل وكيل أن يتفوق على الآخر ويتحصل على أكبر عدد من نقاط المكافأة. سيتسبب استراتيجية جديدة يتبناها وكيل في أن يبحث خصمه عن استراتيجية جديدة لمواجهته، وهكذا دواليك. أشار إيجور مورداتش، باحث في OpenAI، إلى IEEE Spectrum أن هذا التجربة بين الوكلاء “كافية لتعلم السلوكيات المثيرة للدهشة من تلقاء أنفسهم -เหมือน الأطفال الذين يلعبون مع بعضهم البعض”.

ما هي السلوكيات المثيرة للدهشة بالضبط؟ كان لدى الباحثون أربعة استراتيجيات أساسية توقعوا أن يتعلمها وكلاء الذكاء الاصطناعي، وتمكنوا من تعلمها بسرعة، وأصبحوا كفوئين فيها بعد 25 مليون لعبة محاكاة. تم لعب اللعبة في بيئة ثلاثية الأبعاد مليئة بالمنحدرات والكتل والجدران. تعلم وكلاء الذكاء الاصطناعي ملاحقة بعضهم البعض، ووضع الكتل لإنشاء حصون يمكنهم الاختباء فيها، ووضع المنحدرات. تعلم وكلاء البحث سحب المنحدرات حولهم للدخول إلى حصون المختبئين، في حين تعلم المختبئون محاولة أخذ المنحدرات إلى داخل حصونهم حتى لا يستطيع وكلاء البحث استخدامها.

然而، حول معيار 380 مليون لعبة، حدث شيء غير متوقع. تعلم وكلاء الذكاء الاصطناعي استخدام استراتيجيتين لم يتوقعها الباحثون. تعلم وكلاء البحث أنهم يمكن أن يقفزوا على صندوق ويلعبان/يتحركون بالصندوق تجاه حصن قريب، ويمكنهم القفز إلى الحصن وايجاد المختبئ. لم يكن الباحثون يعرفون حتى أن هذا ممكن في фізياء بيئة اللعبة. تعلم المختبئون مواجهة هذه القضية بسحب الصناديق إلى مكانهم داخل حصونهم.

في حين أن السلوك غير المتوقع لوكلاء الذكاء الاصطناعي المُدرَّب على خوارزميات التعلم التعزيزي قد يكون أthing في هذه الحالة، إلا أنه يثير بعض المخاوف حول كيفية تطبيق التعلم التعزيزي في مواقف أخرى. أشار عضو في فريق البحث في OpenAI، بون بيكر، إلى IEEE Spectrum أن هذه السلوكيات غير المتوقعة يمكن أن تكون خطيرة. ماذا لو بدأ الروبوتات في السلوك بطريقة غير متوقعة؟

“بناء هذه البيئات صعب”، أشار بيكر. “سيأتي الوكلاء بهذه السلوكيات غير المتوقعة، والتي ستكون مشكلة أمنية في المستقبل عندما توضع في بيئات أكثر تعقيدًا”.

然而، أشار بيكر أيضًا إلى أن استراتيجيات التعلم التعزيزي يمكن أن تؤدي إلى حلول مبتكرة لمشاكلنا الحالية. يمكن أن تحل أنظمة مدربة بالتعلم التعزيزي مجموعة واسعة من المشاكل بالحلول التي قد لا نستطيع حتى تخيلها.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.