نماذج ومنصات الذكاء الاصطناعي
إيوريكا: تصميم مكافآت على مستوى الإنسان عبر برمجة نماذج اللغة الكبيرة
مع التقدم الذي أحرزته نماذج اللغة الكبيرة في السنوات الأخيرة، لا ي驚 أن هذه الإطارات تعمل بشكل جيد كمحطات семантиكية لمهام اتخاذ القرارات التسلسلية على مستوى عال. ومع ذلك، لا يزال المطورون يجدون صعوبة في استخدام إمكانيات هذه الإطارات بشكل كامل لتعلم مهام التلاعب على مستوى منخفض. على الرغم من كفاءتهم، تتطلب نماذج اللغة الكبيرة الحالية خبرة كبيرة في المجال والموضوع لتعلم مهارات بسيطة أو إنشاء محفزات نصية، مما يخلق فجوة كبيرة بين أدائهم وقدرات الإنسان.
لجسر هذه الفجوة، قدم مطورو نفيديا وكلية كاليفورنيا و宾سيلفانيا وغيرهم إطار إيوريكا، خوارزمية تصميم على مستوى الإنسان مدعومة بنماذج اللغة الكبيرة. يهدف إطار إيوريكا إلى استخدام إمكانيات نماذج اللغة الكبيرة، بما في ذلك كتابة البرمجيات وتحسين السياق وتوليد المحتوى بدون إطلاق، لتحقيق تحسين غير مسبوق للرموز المكافئة. هذه الرموز المكافئة، عندما تُستخدم مع تعلم التعزيز، تمكن الإطارات من تعلم مهارات معقدة أو أداء مهام التلاعب.
في هذه المقالة، سنقوم بفحص إطار إيوريكا من منظور التطوير، مستكشفين هيكله وآليته والنتائج التي يحققها في توليد دوال المكافأة. هذه الدوال، كما يزعم المطورون، تفوق تلك التي تم إنشاؤها بواسطة البشر. سنقوم أيضًا بالغوص في كيفية تمكين إطار إيوريكا من نهج جديد لتعلم التعزيز باستخدام反馈 بشري من خلال تمكين التعلم بدون تدرج في السياق.
إيوريكا: مقدمة
اليوم، توفر إطارات نماذج اللغة الكبيرة المتقدمة مثل جبت-3 وجبت-4 نتائج ممتازة عند استخدامها كمحطات семантиكية لمهام اتخاذ القرارات التسلسلية على مستوى عال، لكن المطورين ما زالوا يبحثون عن طرق لتحسين أدائهم عند تعلم مهام التلاعب على مستوى منخفض. بالإضافة إلى ذلك، لاحظ المطورون أن تعلم التعزيز يمكن أن يُستخدم لتحقيق نتائج مستدامة في ظروف التلاعب الدقيق، وفي مجالات أخرى، شريطة أن تكون دوال المكافأة مصممة بعناية بواسطة مصممي بشريين، وأن تكون هذه الدوال قادرة على توفير إشارات التعلم للمسارات المفضلة. عند مقارنة مهام تعلم التعزيز في العالم الحقيقي التي تقبل مكافآت نادرة، تجعل من الصعب على النموذج تعلم الأنماط، وتوفر تشكيل المكافآت الإشارات التعلم الإضافية اللازمة. بالإضافة إلى ذلك،尽管 دوال المكافأة مهمة، فإن تصميمها صعب للغاية، وأحيانًا ما يؤدي التصميم غير الأمثل إلى سلوكيات غير مقصودة.

للتغلب على هذه التحديات وزيادة كفاءة رموز المكافأة، يهدف إطار إيوريكا أو الخوارزمية التطورية الشاملة للمكافأة إلى تحقيق المساهمات التالية:
- تحقيق أداء على مستوى الإنسان لتصميم دوال المكافأة.
- حل مهام التلاعب بدون استخدام هندسة مكافأة يدوية.
- توليد دوال مكافأة أكثر انسجامًا مع الإنسان وأكثر أداءً من خلال إدخال نهج جديد لتعلم بدون تدرج في السياق.
توجد ثلاثة خيارات تصميم خوارزمية رئيسية قام المطورون باختيارها لتعزيز عمومية إطار إيوريكا: البحث التطوري، والبيئة كسياق، واعتبار المكافأة. أولاً، يقترح إطار إيوريكا إدخال رمز المصدر البيئي مباشرةً كسياق لتوليد دوال مكافأة قابلة للتنفيذ في إعداد بدون إطلاق. بعد ذلك، يقوم الإطار bằng بحث تطوري لتحسين جودة مكافآته بشكل كبير، واقتراح مجموعات من مرشحي المكافأة مع كل تكرار أو دورة، ورفinement تلك التي يجد أنها الأكثر وعدًا. في المرحلة الثالثة والأخيرة، يستخدم الإطار نهجًا لتعكس المكافأة لجعل تحسين المكافآت في السياق أكثر فعالية، وهو عملية في النهاية تمكن الإطار من تمكين تحرير المكافآت المستهدف والآلي باستخدام ملخص نصي لجودة المكافآت على أساس إحصاءات تدريب السياسة.
إيوريكا: هيكل الخوارزمية ومشكلة الإعداد
الهدف الرئيسي من تشكيل المكافأة هو إرجاع دالة مكافأة مشكلة لدالة مكافأة حقيقية قد تواجه صعوبات عند التحسين المباشر مثل المكافآت النادرة. بالإضافة إلى ذلك، يمكن للمصممين الوصول إلى دوال المكافأة الحقيقية فقط من خلال استفسارات، وهذا هو السبب في أن إطار إيوريكا يختار توليد المكافأة، وهو إعداد تركيبي للبرمجيات يعتمد على مشكلة تصميم المكافأة.
البيئة كسياق
اليوم، تحتاج إطارات نماذج اللغة الكبيرة إلى مواصفات البيئة كمدخلات لتصميم المكافآت، بينما يقترح إطار إيوريكا إدخال رمز المصدر البيئي مباشرة كسياق دون رمز المكافأة، مما يسمح لنماذج اللغة الكبيرة باختيار نموذج العالم كسياق. يوجد两个 فائدة رئيسيان لنهج إيوريكا. أولاً، يتم تدريب نماذج اللغة الكبيرة للبرمجة على مجموعات بيانات الأكواد الأصلية المكتوبة بلغات برمجة موجودة مثل سي وسي++ وبايثون وجافا، وهو السبب في أنها أفضل في إنتاج مخرجات البرمجية عندما يُسمح لها بكتابة البرمجية مباشرة في بنية اللغة التي تم تدريبها عليها. ثانيًا، يُظهر رمز المصدر البيئي عادةً البيئات المشاركة семантиًا، والمتغيرات المناسبة للاستخدام في محاولة لإخراج دالة مكافأة وفقًا للمهمة المحددة.
البحث التطوري
يهدف إدخال البحث التطوري في إطار إيوريكا إلى تقديم حلًا طبيعيًا للتحديات الناجمة عن عدم الكفاءة وتشغيل الأخطاء. مع كل تكرار أو دورة، يقوم الإطار بتقديم مخرجات مستقلة متعددة من نموذج اللغة الكبيرة، ويتقلص احتمال وجود دوال مكافأة معيبة خلال التكرارات مع زيادة عدد العينات.
تعكس المكافأة
لتحقيق تحسين المكافآت في السياق بشكل أكثر فعالية، يُستخدم إطار إيوريكا نهجًا لتعكس المكافأة. يُطلب من دوال المكافأة في إطار إيوريكا كشف مكوناتها بشكل فردي، مما يسمح للإطار بتتبع قيم.scalar لكل مكون مكافأة فريد في نقاط تفتيش السياسة خلال مرحلة التدريب بأكملها.
التدريب والأساس
توجد مكونات تدريب رئيسية两 في إطار إيوريكا: تعلم السياسة وتقييم مكافآت.
تعلم السياسة
تُحسّن دوال المكافأة النهائية لكل مهمة فردية باستخدام خوارزمية تعلم تعزيز相同 باستخدام نفس مجموعة المعلمات المحددة بدقة لجعل المكافآت الهندسية تعمل بشكل جيد.
تقييم مكافآت
كما تختلف معايير المهمة في الشكل والmeaning Семантиك مع كل مهمة، يقدم إطار إيوريكا درجة المكافأة الم 정규ة، وهي مقياس شامل لمقارنة أداء الإطار مع المكافآت البشرية المنشأة الخبراء وفقًا لمقاييس الحقيقة الأرضية.
النتائج والنتائج
لتحليل أداء إطار إيوريكا، سنقوم بتقييمه على معايير مختلفة، بما في ذلك أدائه مقابل المكافآت البشرية، وتحسين النتائج بمرور الوقت، وتوليد مكافآت جديدة، وتمكين التحسين المستهدف، والعمل مع反馈 بشري.
إيوريكا تفوق المكافآت البشرية
تُظهر النتائج المجمعة في الشكل التالي أداء إطار إيوريكا مقابل المكافآت البشرية.

تحسين مستمر بمرور الوقت
تُظهر النتائج التالية تحسين أداء إطار إيوريكا بمرور الوقت.

توليد مكافآت جديدة
يمكن تقييم nouve المكافآت لإطار إيوريكا عن طريق حساب الارتباط بين المكافآت البشرية ومكافآت إيوريكا على جميع مهام إساك.
تمكين التحسين المستهدف
لتحليل أهمية إضافة تعكس المكافأة إلى تعكس المكافأة، قام المطورون بتقييم إطار إيوريكا بدون تعكس المكافأة، والذي يقلل من تعليمات التعكس إلى قيم فقط.
العمل مع反馈 بشري
لإدماج مجموعة واسعة من المدخلات لتوليد دوال مكافأة أكثر انسجامًا مع الإنسان وأكثر أداءً، يقدم إطار إيوريكا نهجًا جديدًا لتعلم بدون تدرج في السياق لتعلم التعزيز باستخدام反馈 بشري.
أفكار نهائية
في هذه المقالة، تحدثنا عن إطار إيوريكا، خوارزمية تصميم على مستوى الإنسان مدعومة بنماذج اللغة الكبيرة، والتي تحاول استخدام إمكانيات نماذج اللغة الكبيرة لتحقيق تحسين غير مسبوق لرموز المكافأة. يمكن استخدام رمز المكافأة مع تعلم التعزيز لتعلم مهارات معقدة أو أداء مهام التلاعب. بدون تدخل بشري أو هندسة محفزات خاصة بالمهمة، يوفر الإطار khảيات تصميم المكافأة على مستوى الإنسان على مجموعة واسعة من المهام، ويتميز بقدرته على تعلم مهام معقدة بمنهج تعلم مناهج.
بشكل عام، يُظهر أداء إطار إيوريكا وتنوعه إمكانية دمج الخوارزميات التطورية مع نماذج اللغة الكبيرة لتحقيق نهج قابل للتوسيع وعمومي لتصميم المكافآت، وقد تكون هذه الرؤية قابلة للتطبيق على مشاكل البحث المفتوح الأخرى.












