نماذج ومنصات الذكاء الاصطناعي
بوكلمون: وسيط متساوٍ مع الإنسان مع LLM لمعارك بوكيمون
لقد أظهرت نماذج اللغة الكبيرة والذكاء الاصطناعي التوليدي نجاحًا غير مسبوق في مجموعة واسعة من مهام معالجة اللغة الطبيعية. بعد احتلال حقل NLP، التحدي التالي لباحثي GenAI و LLMs هو استكشاف كيف يمكن للنماذج اللغوية الكبيرة العمل بشكل مستقل في العالم الحقيقي مع فجوة توليد موسعة من النص إلى الإجراء، وبالتالي تمثل نمطًا هامًا في سعي الذكاء الاصطناعي العام. يعتبر الألعاب عبر الإنترنت أساسًا مناسبًا لتطوير وكلاء نموذج لغة متجسد يتفاعلون مع البيئة المرئية بطريقة تشبه سلوك الإنسان.
على سبيل المثال، في لعبة模拟 عبر الإنترنت شائعة مثل Minecraft، يمكن استخدام وكلاء اتخاذ القرارات للمساعدة في استكشاف العالم وتطوير المهارات لصنع أدوات وحل المهام. مثال آخر لوكلاء LLM التفاعل مع البيئة المرئية يمكن أن يكون في لعبة أخرى عبر الإنترنت، The Sims، حيث أظهر الوكلاء نجاحًا ملحوظًا في التفاعلات الاجتماعية وسلوك يشبه سلوك البشر. ومع ذلك، بالمقارنة مع الألعاب الحالية، قد تثبت ألعاب المعركة التكتيكية أنها خيار أفضل لتحديد قدرة نماذج اللغة الكبيرة على لعب ألعاب افتراضية. السبب الرئيسي لماذا تعتبر الألعاب التكتيكية بمثابة معيار أفضل هو أن معدل الفوز يمكن قياسه مباشرة، ومتعرضون متساقطون بما في ذلك لاعبون بشريون وذكاء اصطناعي دائمًا متاحون.
بناءً على نفس المبدأ، يهدف بوكلمون إلى أن يكون أول وسيط متجسد يصل إلى أداء على مستوى الإنسان في الألعاب التكتيكية، مثل معارك بوكيمون. في جوهره، يتضمن إطار بوكلمون ثلاث استراتيجيات رئيسية.
- تعلم التعزيز في السياق الذي يستهلك ملاحظات نصية مشتقة من المعارك على الفور لتحسين السياسة بشكل متكرر.
- توليد معزز بالمعرفة الذي يسترد معرفة خارجية لمكافحة الوهم، مما يسمح للوكيل بالتصرف بشكل صحيح ومتى لزم الأمر.
- توليد إجراء متسق لتحسين حالة التبديل الهستيري عندما يواجه الوكيل لاعبًا قويًا ويريد تجنبه.
تهدف هذه المقالة إلى تغطية إطار بوكلمون بالتفصيل، ونستكشف آليته وطريقة عمله وعمارة الإطار ومقارنته بالاطارات الحالية.
بوكلمون: وسيط متساوٍ مع الإنسان مع LLM لمعارك بوكيمون
نماذج اللغة الكبيرة والذكاء الاصطناعي التوليدي أظهرت نجاحًا غير مسبوق في مجموعة واسعة من مهام معالجة اللغة الطبيعية. مؤخرًا، عمل المطورون وباحثو الذكاء الاصطناعي على جعل الذكاء الاصطناعي التوليدي ونموذج اللغة الكبيرة أكثر بروزًا في السيناريوهات الحقيقية مع القدرة على العمل بشكل مستقل في العالم المادي.
سابقًا، حاول المطورون تطوير وكلاء نموذج لغة متجسد في ألعاب模拟 افتراضية مثل Minecraft و The Sims، على الرغم من أن الألعاب التكتيكية مثل بوكيمون قد تكون خيارًا أفضل لتطوير هؤلاء الوكلاء. تمكن معارك بوكيمون المطورين من تقييم قدرة المدرب على المشاركة في المعارك، ويوفر العديد من المزايا على الألعاب التكتيكية الأخرى.

بوكلمون: المنهجية والهيكل
تمثل الصورة التالية الإطار العام والهيكل لإطار بوكلمون.

خلال كل دورة، يستخدم إطار بوكلمون الإجراءات السابقة وملحقاتها النصية لتطوير السياسة بشكل متكرر، بالإضافة إلى تعزيز المعلومات الحالية بالمعرفة الخارجية مثل تأثيرات القدرات أو العلاقات بين النقاط القوية والضعف.
تعلم التعزيز في السياق
غالبًا ما يتخذ اللاعبون البشريون والرياضيون قرارات لا تستند فقط إلى الحالة الحالية، بل يعتمدون أيضًا على ملاحظات الإجراءات السابقة وتجارب لاعبين آخرين.
يمكن القول إن الملاحظات الإيجابية هي ما يساعد اللاعب على تعلم الأخطاء وتجنب تكرار نفس الخطأ مرارًا وتكرارًا.

كما هو موضح، يستخدم الوكيل في اللعبة حركة مائية ضد بوكيمون يتمتع بقدرة “الجلد الجاف” التي تمكنه من إلغاء الضرر الناتج عن الهجمات المائية.
لضمان أن يتعلم وكيل بوكلمون من الأخطاء السابقة، يطبق الإطار نهج تعلم التعزيز في السياق.
- الضرر الفعلي الناتج عن حركة الهجوم بناءً على الفرق في النقاط الصحية على مدار دورين متتاليين.
- فعالية حركات الهجوم.
- ترتيب الأولوية لتنفيذ الحركة.
- النتائج الفعلية لحركات التنفيذ على الخصم.

علاوة على ذلك، يؤدي استخدام نهج تعلم التعزيز في السياق إلى تحسين الأداء بشكل كبير كما هو موضح في الصورة التالية.

عندما يتم مقارنته بأداء الأصلي على GPT-4، يزيد معدل الفوز بنسبة 10٪ تقريبًا مع تحسن بنسبة 13٪ في درجة المعركة.

توليد معزز بالمعرفة أو KAG
على الرغم من أن تطبيق تعلم التعزيز في السياق يساعد في الحد من الوهم إلى حد ما، إلا أنه يمكن أن يؤدي إلى عواقب فادحة قبل أن يتلقى الوكيل الملاحظات.
لخفض الوهمさらに وتحسين قدرة الوكيل على اتخاذ القرارات، يطبق إطار بوكلمون نهج توليد معزز بالمعرفة أو KAG، وهو تقنية تستخدم المعرفة الخارجية لتعزيز التوليد.

علاوة على ذلك، لوحظ أن الوكيل بدأ في استخدام الحركات الخاصة في الوقت المناسب كما هو موضح في الصورة التالية.

توليد إجراء متسق
تظهر النماذج الحالية أن تطبيق نهج التوجيه والاستدلال يمكن أن يعزز قدرة نموذج اللغة الكبيرة على حل المهام المعقدة.

هناك إجراء واحد فقط لكل دورة، مما يعني أنه حتى إذا قرر الوكيل التبديل، فإن بوكيمون التبديل سيتعرض للضرر.
بوكلمون: النتائج والتحеримات
قبل أن نناقش النتائج، من المهم لنا فهم بيئة المعركة.
- يستقبل البيئة رسالة طلب إجراء من الخادم وستستجيب للرسالة في النهاية، والتي تحتوي أيضًا على نتائج التنفيذ من الدورة السابقة.
- ي訳 البيئة الرسالة ويتحديث متغيرات الحالة المحلية، ثم يترجم متغيرات الحالة إلى نص.
- يحتوي وصف النص على أربعة أجزاء رئيسية: معلومات الفريق الخاص، ومعلومات فريق الخصم، ومعلومات ساحة المعركة، وسجل histórico للدورات السابقة.
- يستخدم نموذج اللغة الكبيرة الحالة المترجمة كمدخل ويتوقع إجراءات الدورة التالية.
معركة ضد لاعبين بشريين
تظهر الجدول التالي أداء وكيل بوكلمون ضد لاعبين بشريين.

كما هو موضح، يؤدي وكيل بوكلمون أداءً مشابهًا للاعبين في السلم الذين لديهم معدل فوز أعلى مقارنة باللاعبين المدعوين والذين لديهم خبرة معركة واسعة.
تحليل مهارة المعركة
نادرًا ما يخطئ إطار بوكلمون في اختيار الحركة الفعالة، ويتبدل إلى بوكيمون مناسب آخر بفضل استراتيجية توليد معزز بالمعرفة.

كما هو موضح في المثال أعلاه، يستخدم الوكيل بوكيمون واحد فقط للهزيمة الفريق 敌対全体، حيث يتمكن من اختيار حركات هجوم مختلفة، تلك التي تكون الأكثر فعالية للخصم في ذلك الموقف.

أفكار ختامية
في هذه المقالة، ناقشنا بوكلمون، نهجًا يسمح لنموذج اللغة الكبيرة باللعب بمفرده في معارك بوكيمون ضد لاعبين بشريين.












