نماذج ومنصات الذكاء الاصطناعي

وجوه تعلم التعزيز المتعددة: تشكيل نماذج اللغة الكبيرة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في السنوات الأخيرة، أعادت نماذج اللغة الكبيرة (LLM) تعريف مجال الذكاء الاصطناعي (AI)، مما ermögن للأجهزة فهم وإنشاء نصوص تشبه الإنسان بمهارة ملحوظة. يعود هذا النجاح في الغالب إلى التطورات في منهجيات التعلم الآلي، بما في ذلك التعلم العميق وتعلم التعزيز (RL). في حين لعبت التعلم الإشرافي دورًا حاسمًا في تدريب LLM، ظهر تعلم التعزيز كأداة قوية لتحسين وتعزيز قدراتهم بشكل أكبر من مجرد التعرف على الأنماط البسيطة.

يسمح تعلم التعزيز للنماذج LLM بالتعلم من الخبرة، ويتحسين سلوكها بناءً على المكافآت أو العقوبات. تم تطوير متغيرات مختلفة من RL، مثل تعلم التعزيز من التغذية الراجعة البشرية (RLHF) وتعلم التعزيز مع مكافآت قابلة للتحقق (RLVR) وتحسين السياسة النسبية المجموعة (GRPO) وتحسين التفضيل المباشر (DPO)، لتعدين LLMs، وضمان انطباقها مع التفضيلات البشرية وتحسين قدراتهم في التفكير.

يستكشف هذا المقال مختلف نهجات تعلم التعزيز التي تشكل LLMs، ويفحص مساهماتها وتأثيرها على تطوير الذكاء الاصطناعي.

فهم تعلم التعزيز في الذكاء الاصطناعي

تعلم التعزيز (RL) هو نموذج تعلم آلي حيث يتعلم العامل اتخاذ القرارات من خلال التفاعل مع البيئة. بدلاً من الاعتماد حصريًا على مجموعات البيانات المُصنفة، يتخذ العامل إجراءات، ويتلقى التغذية الراجعة في شكل مكافآت أو عقوبات، ويتحسين استراتيجيته وفقًا لذلك.

对于 LLMs، يضمن تعلم التعزيز أن النماذج تنتج استجابات تتوافق مع التفضيلات البشرية والقواعد الأخلاقية والمنطق العملي. الهدف ليس فقط إنتاج جمل صحيحة من الناحية النحوية، ولكن أيضًا جعلها مفيدة ومهمة ومتوافقة مع المعايير الاجتماعية.

تعلم التعزيز من التغذية الراجعة البشرية (RLHF)

أحد أكثر تقنيات RL استخدامًا في تدريب LLM هو RLHF. بدلاً من الاعتماد حصريًا على مجموعات البيانات المحددة مسبقًا، يتحسن LLMs من خلال RLHF عن طريق دمج التفضيلات البشرية في دورة التدريب. يتضمن هذا العملية عادة ما يلي:

  1. جمع التغذية الراجعة البشرية: يقيم المُvaluators البشريون استجابات النموذج وتصنفها بناءً على الجودة والاتساق والفائدة والدقة.
  2. تدريب نموذج المكافأة: يتم استخدام هذه التصنيفات لتدريب نموذج مكافأة منفصل يتنبأ بالاستجابة التي يفضلها البشر.
  3. التحسين بدقة RL: يتم تدريب LLM باستخدام نموذج المكافأة هذا لتحسين استجاباته بناءً على التفضيلات البشرية.

تم استخدام هذا النهج في تحسين نماذج مثل ChatGPT وClaude. في حين أن RLHF قد لعبت دورًا حيويًا في جعل LLMs أكثر انطباقًا مع تفضيلات المستخدم، وتقليل الانحياز، وتحسين قدرتهم على اتباع تعليمات معقدة، إلا أنها تتطلب الكثير من الموارد، حيث تحتاج إلى عدد كبير من المُvaluators البشر لتقويم ومعالجة مخرجات الذكاء الاصطناعي. هذا القيد أدى إلى قيام الباحثين بفحص أساليب بديلة، مثل تعلم التعزيز من التغذية الراجعة الاصطناعية (RLAIF) وتعلم التعزيز مع مكافآت قابلة للتحقق (RLVR).

RLAIF: تعلم التعزيز من التغذية الراجعة الاصطناعية

على عكس RLHF، يعتمد RLAIF على تفضيلات اصطناعية لتطوير LLMs بدلاً من التغذية الراجعة البشرية. يعمل عن طريق توظيف نظام اصطناعي آخر، عادةً نموذج لغة كبير، لتقييم وتصنيف الاستجابات، مما يخلق نظام مكافأة تلقائي يمكن أن يوجه عملية التعلم للنموذج.

يحُل هذا النهج مشاكل التوسع المرتبطة بـ RLHF، حيث يمكن أن تكون التصنيفات البشرية مكلفة ومستهلكة للوقت. من خلال استخدام التغذية الراجعة الاصطناعية، يزيد RLAIF من الاتساق والكفاءة، ويقلل من التباين الذي قد تطرحه الآراء البشرية Subjective. على الرغم من أن RLAIF هو نهج قيم لتحسين LLMs على نطاق واسع، إلا أنه يمكن أن يعزز في بعض الأحيان الانحيازات الحالية في نظام الذكاء الاصطناعي.

تعلم التعزيز مع مكافآت قابلة للتحقق (RLVR)

في حين يعتمد RLHF وRLAIF على التغذية الراجعة Subjective، يستخدم RLVR مكافآت قابلة للتحقق موضوعيًا لتدريب LLMs. هذا الأسلوب فعال بشكل خاص في المهام التي تتوافق مع معايير الصحة واضحة، مثل:

  • حل المشكلات الرياضية
  • إنشاء الكود
  • معالجة البيانات المهيكلة

في RLVR، يتم تقييم استجابات النموذج باستخدام قواعد أو خوارزميات محددة مسبقًا. تُحدد وظيفة المكافأة القابلة للتحقق ما إذا كانت الاستجابة تتوافق مع المعايير المتوقعة، وتمنح درجة عالية للجوابات الصحيحة ودرجة منخفضة للجوابات الخاطئة.

يقلل هذا النهج من الاعتماد على التصنيف البشري والانحيازات الاصطناعية، مما يجعل التدريب أكثر قابلية للتوسع وتكلفة. على سبيل المثال، في مهام التفكير الرياضي، تم استخدام RLVR لتحسين نماذج مثل DeepSeek’s R1-Zero، مما مكنها من التحسين الذاتي دون تدخل بشري.

تحسين تعلم التعزيز لنماذج اللغة الكبيرة

بالإضافة إلى التقنيات المذكورة أعلاه التي توجيه كيفية حصول LLMs على المكافآت والتعلم من التغذية الراجعة، هناك جانب آخر حاسم في RL وهو كيفية تعديل سلوك (أو سياسات) النماذج بناءً على هذه المكافآت. هذا هو المكان الذي تظهر فيه تقنيات التحسين المتقدمة.

التحسين في RL هو ببساطة عملية تحديث سلوك النموذج لتعظيم المكافآت. في حين أن النهج التقليدية ل RL غالبًا ما تعاني من عدم الاستقرار والكفاءة عند تحسين LLMs، تم تطوير نهج mới لتحسين LLMs. هنا هي استراتيجيات التحسين الرائدة المستخدمة لتدريب LLMs:

  • تحسين السياسة القريبة (PPO): PPO هو أحد أكثر تقنيات RL استخدامًا لتحسين LLMs. أحد التحديات الرئيسية في RL هو ضمان أن تحديثات النموذج تحسن الأداء دون تغييرات فجائية ودرasticaة قد تقلل من جودة الاستجابة. يعالج PPO هذا عن طريق إدخال تحديثات سياسة خاضعة للرقابة، مما يحدد تحسين استجابات النموذج بشكل متدرج وآمن للحفاظ على الاستقرار. كما يوازن بين الاستكشاف والاستغلال، مما يساعد النماذج على اكتشاف استجابات أفضل في حين تعزيز السلوكيات الفعالة. بالإضافة إلى ذلك، PPO كفء في العينة، حيث يستخدم مجموعات بيانات أصغر لتقليل وقت التدريب مع الحفاظ على الأداء العالي. يتم استخدام هذه الطريقة على نطاق واسع في نماذج مثل ChatGPT، مما يضمن أن الاستجابات تبقى مفيدة وملائمة ومتوافقة مع التوقعات البشرية دون التكيف المفرط مع إشارات المكافأة المحددة.
  • تحسين التفضيل المباشر (DPO): DPO هو تقنية أخرى لتحسين RL تركز على تحسين مخرجات النموذج بشكل مباشر لتوافق مع التفضيلات البشرية. على عكس الخوارزميات التقليدية ل RL التي تعتمد على نمذجة المكافأة المعقدة، يُحسن DPO النموذج مباشرة بناءً على بيانات التفضيل الثنائي – مما يعني أنه يحدد ببساطة ما إذا كانت مخرجة أفضل من أخرى. يعتمد هذا النهج على المُvaluators البشر لترتيب استجابات متعددة تم إنشاؤها بواسطة النموذج لاستجابة معينة. ثم يتم تحسين النموذج لزيادة احتمال إنتاج استجابات ذات تصنيف أعلى في المستقبل. DPO فعال بشكل خاص في السيناريوهات التي يصعب فيها الحصول على نماذج مكافأة مفصلة. من خلال تبسيط RL، يسمح DPO للنماذج الذكية بتحسين مخرجاتها دون العبء الحسابي المرتبط بتقنيات RL الأكثر تعقيدًا.
  • تحسين السياسة النسبية المجموعة (GRPO): أحد أحدث التطورات في تقنيات تحسين RL للنماذج LLMs هو GRPO. في حين أن تقنيات RL التقليدية، مثل PPO، تتطلب نموذج قيمة لتقدير ميزة الاستجابات المختلفة والتي تتطلب قوة حسابية عالية وموارد ذاكرة كبيرة، يلغي GRPO الحاجة إلى نموذج قيمة منفصل عن طريق استخدام إشارات المكافأة من توليدات مختلفة على نفس الاستجابة. هذا يعني أنه بدلاً من مقارنة المخرجات بنموذج قيمة ثابت، يقارنها ببعضها البعض، مما يقلل بشكل كبير من العبء الحسابي. واحدة من أكثر التطبيقات الملحوظة ل GRPO كانت في DeepSeek R1-Zero، وهو نموذج تم تدريبه بالكامل بدون تعدين إشرافي وتمكن من تطوير مهارات التفكير المتقدمة من خلال التطور الذاتي.

الخلاصة

يلعب تعلم التعزيز دورًا حاسمًا في تحسين نماذج اللغة الكبيرة (LLMs) من خلال تعزيز انطباقها مع التفضيلات البشرية وتنظيم قدراتهم في التفكير. تقنيات مثل RLHF وRLAIF وRLVR توفر نهجًا مختلفًا للتعلم القائم على المكافأة، في حين أن أساليب التحسين مثل PPO وDPO وGRPO تحسن كفاءة التدريب وثباته. مع استمرار تطور LLMs، يصبح دور تعلم التعزيز أكثر أهمية في جعل هذه النماذج أكثر ذكاءً واخلاقيًا ومتعقلًا.

LHF وRLAIF وRLVR توفر نهجًا مختلفًا للتعلم القائم على المكافأة، في حين أن أساليب التحسين مثل PPO وDPO وGRPO تحسن كفاءة التدريب وثباته. مع استمرار تطور LLMs، يصبح دور تعلم التعزيز أكثر أهمية في جعل هذه النماذج أكثر ذكاءً واخلاقيًا ومتعقلًا.

الدكتور تيهسين زيا هو أستاذ مساعد دائم في جامعة كومساتس إسلام آباد، وحاصل على دكتوراه في الذكاء الاصطناعي من جامعة التكنولوجيا في فيينا، النمسا. يتخصص في الذكاء الاصطناعي وتعلم الآلة وعلوم البيانات ورؤية الكمبيوتر، وقدم مساهمات كبيرة من خلال منشورات في مجلات علمية مشهورة. كما قاد الدكتور تيهسين مشاريع صناعية مختلفة كمستслед رئيسي وقدم خدماته كمستشار في الذكاء الاصطناعي.