نماذج ومنصات الذكاء الاصطناعي

زفير-7B: مقدمة في التقطير المباشر للاستيعاب في نماذج اللغة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قد تقدمت قدرة وأداء نماذج اللغة الكبيرة المفتوحة بشكل كبير في السنوات الأخيرة، وشهدنا التقدم من نماذج GPT-2 المبكرة إلى إطارات LLM أكثر ضيقًا ودقة وفعالية، والتي تستخدم كمية كبيرة من الرموز التي تعتبر أكبر من الكمية “المثلى من حيث الحوسبة” الموصى بها بواسطة قوانين التوسع Chinchilla. بالإضافة إلى ذلك، أظهر المطورون أن هذه الإطارات LLM الصغيرة يمكن تدريبها بشكل أكبر باستخدام نهج dSFT أو التصفية الخفيفة الموجهة، الذي يستخدم الإخراج من نموذج معلم فعال كبيانات موجهة للنموذج الطالب في محاولة لتعزيز الدقة.

في هذه المقالة، سنناقش إطار زفير-7B، وهو معيار حديث للنماذج التي تحتوي على 7 مليارات معلمة، ولا يتطلب تعليقات بشرية. الهدف الرئيسي للإطار هو تمكين المطورين من إنتاج نماذج لغة كبيرة مفتوحة متوافقة مع نوايا المستخدمين أكثر من أي وقت مضى. إطار زفير-7B لا يفحص فقط تطبيق النهج الحالية لنماذج LLM الأكبر، مثل dSFT، بل يبحث أيضًا في إمكانية استخدام نهج أخرى لتعلم نموذج محادثة مع تحسين في الاستيعاب مع نوايا المستخدم.

زفير-7B: مقدمة في التقطير المباشر للاستيعاب في نماذج اللغة

كما ذكرنا سابقًا، تقدمت نماذج اللغة بشكل كبير في السنوات الأخيرة، من إطارات GPT-2 المبكرة إلى إطارات LLM الحالية مثل GPT-4 و MiniGPT-5، والتي على الرغم من أنها تستنفد الرموز بدرجة عالية، إلا أنها أكثر دقة وأكثر فعالية. أحد الملامح الرئيسية لهذه الإطارات LLM المتقدمة هي أنها تدمج كمية كبيرة من الرموز أكثر من الكمية التي كانت تعتبر مثلى من حيث الحوسبة في السابق.

الاستيعاب دائمًا كان تحديًا كبيرًا للمطورين، مع أعمال حديثة تركز على تطوير معايير مثل AlpacaEval و MT-Bench، التي تم تصميمها لاستهداف سوء التوجه. الدافع لتنمية إطار زفير يعود إلى مشكلة استخدام التصفية لاستيعاب نموذج LLM مفتوح صغير، حيث يتم استخدام تعليقات ذكاء اصطناعي لجمع بيانات التفضيل من مجموعة من نموذج المعلم، ثم تطبيق التصفية المباشرة لتحسين التفضيل كهدف تعليمي رئيسي، وهو نهج يسمى dDPO أو التصفية المباشرة لتحسين التفضيل.

تم تطوير إطار زفير-7B لتحقق هذا النهج، وهو في بعض الجوانب نسخة متوافقة مع إطار Mistral-7B الحالي. يستخدم الإطار أولاً dSFT أو التصفية الخفيفة الموجهة بناءً على مجموعة بيانات UltraChat، ثم يطبق نهج dDPO أو التصفية المباشرة لتحسين التفضيل على بيانات التعليقات. تشير التجارب إلى أن إطار زفير-7B مع 7 مليارات معلمة يُنتج نتائج قابلة للمقارنة مع تلك التي تُنتجها نماذج محادثة متوافقة مع تعليقات بشرية مع أكثر من 70 مليار معلمة.

الرسم التوضيحي أعلاه يظهر أداء نماذج اللغة المختلفة على معيار MT-Bench. يتم وضع إطار زفير-7B المُدرَّب باستخدام نهج dDPO مقابل نماذج لغة أكبر مملوكة ومتاحة للجمهور، والتي تم تدريبها باستخدام تعلم تعزيزي إضافي، وتم تضمين كمية كبيرة من تعليقات بشرية. كما هو واضح، على الرغم من الفرق الكبير في عدد المعلمات التي تستخدمها هذه الإطارات، يُنتج إطار زفير-7B نتائج قابلة للمقارنة مع معظمها، ويتفوق على عدة إطارات في مجالات مختلفة.

زفير-7B: الطريقة والهيكل والنتائج

الهدف الرئيسي لإطار زفير-7B هو مساعدة نموذج لغة كبير مفتوح على الاستيعاب مع نوايا المستخدمين، ويتوافق الإطار مع نهج مشابه لذلك المستخدم في إطار InstructGPT، ويهدف إلى توليد نموذج طالب فعال ودقيق.

الرسم التوضيحي التالي يظهر الخطوات الثلاث الرئيسية المشاركة في عمل إطار زفير-7B.

  1. dSFT لإنشاء مجموعة بيانات كبيرة باستخدام أسلوب تعليمي ذاتي.
  2. جمع تعليقات ذكاء اصطناعي باستخدام مجموعة من نماذج المحادثة، متبوعة بتحويل تفضيلي وتسجيل بواسطة GPT-4.
  3. تصفية دPO للنموذج dSFT باستخدام بيانات التعليقات.

dSFT أو التصفية الخفيفة الموجهة

يبدأ الإطار مع نموذج لغة كبير مفتوح خام يحتاج إلى تدريب لاستجابة لتحفيزات المستخدم. تقليدًا، يتم تدريب هذه النماذج LLM على استجابة لتحفيزات المستخدم باستخدام SFT أو التصفية الخفيفة الموجهة على مجموعة بيانات تتكون من تعليمات عالية الجودة وresponses tương ứng.

تعليقات ذكاء اصطناعي من خلال التفضيل

يستخدم الإطار تعليقات ذكاء اصطناعي من نموذج المعلم على مخرجات نماذج أخرى لتحقيق التصفية، بدلاً من تعليقات بشرية. النهج المتبع في إطار زفير متأثر بذلك المستخدم في إطار UltraFeedback، الذي يستخدم نموذج المعلم لتوفير تفضيلات على مخرجات النموذج.

dDPO أو التصفية المباشرة لتحسين التفضيل

dDPO هو الخطوة النهائية في إطار زفير، وهدفها الرئيسي هو تحسين نموذج المعلم dSFT عن طريق تعظيم احتمال تصنيف الاستجابة المفضلة في نموذج تفضيل محدد بواسطة دالة مكافأة باستخدام نموذج اللغة الطالب. يتم تدريب المكافأة أولاً، ثم يتم عينة من السياسة الحالية لحساب التحديثات، وبالتالي تعظيم التصفية.

زفير-7B: التجارب والنتائج

يتم إجراء تجارب إطار زفير على إطار Mistral-7B الحالي، الذي يُنتج أداءً قابلاً للمقارنة مع نماذج لغة أكبر على مجموعة من مهام معالجة اللغة الطبيعية.

مجموعات البيانات

يستخدم إطار زفير مجموعتين حواريتين تم تصفيتها من مزيج من النماذج المملوكة والمتاحة للجمهور، والتي أثبتت نفسها في إنتاج نماذج محادثة فعالة.

UltraChat

UltraChat هو مجموعة بيانات ذاتية التحسين التي تتكون من حوالي 1.5 مليون حوار متعدد الدورات، موزعة على 30 موضوعًا و 20 مادة نصية تم إنشاؤها بواسطة إطار GPT-3.5-Turbo.

UltraFeedback

UltraFeedback هو مجموعة بيانات تحفيزية تحتوي على أكثر من 64 ألف تحفيز، مع كل تحفيز يحتوي على أربع استجابات لنموذج لغة مختلف. يستخدم إطار زفير أعلى متوسط درجة من مجموعة بيانات UltraFeedback لإنشاء تفضيلات ثنائية، ويتم رفض واحدة من الاستجابات الثلاث المتبقية كعينة عشوائية.

التقييم

为了 تقييم أداء إطار زفير، اختار المطورون معياري محادثة، أحدهما لمدة دورة واحدة والآخر لمدة多 دورات، في محاولة لتقييم قدرة النموذج على اتباع تعليمات المستخدم والاستجابة بشكل مناسب.

MT-Bench

يتكون معيار MT-Bench من 160 سؤالاً موزعة على 8 مجالات معرفية فريدة، ويجب على النموذج الإجابة على السؤال الأول ثم تقديم استجابة على السؤال التالي.

AlpacaEval

AlpacaEval هو معيار لمدة دورة واحدة، حيث يولد النموذج أو الإطار استجابات المستخدم لما يزيد عن 800 سؤال موزعة على مواضيع مختلفة، مع التركيز الرئيسي على الفائدة.

بالإضافة إلى هذين المعيارين الرئيسيين، يتم تقييم إطار زفير-7B أيضًا على لوحة القيادة المفتوحة للنماذج اللغة لمهام التصنيف المتعددة، ARC، HellaSwag، MMLU، وغيرها. بالإضافة إلى ذلك، بغض النظر عن المعيار الذي يتم تقييم إطار زفير-7B عليه، يتم مقارنته بنماذج مملوكة ومتاحة للجمهور، مع أن إجراءات التوجيه هي العامل المتميز الوحيد.

النتائج

دعونا ننظر الآن إلى كيفية أداء إطار زفير-7B، وكيف يقارن بنماذج اللغة الحالية.

تطبيق نهج dDPO يعزز قدرات المحادثة

الجدول التالي يقارن أداء إطار زفير-7B بنماذج لغة حالية على معايير AlpacaEval و MT-Bench.

كما هو واضح، عندما يتم وضع إطار زفير-7B مقابل نماذج مفتوحة بحجم 7 مليارات معلمة، يتفوق إطار زفير-7B بشكل كبير على نماذج dSFT عبر المعايير الثلاثة، ويحدد معايير جديدة لأداء النماذج.

dDPO يعزز أداء المهام الأكاديمية

الرسم التوضيحي التالي يقارن أداء إطار زفير-7B بنماذج لغة مفتوحة ومتاحة للجمهور.

كما هو واضح، يتفوق إطار زفير-7B بشكل كبير على نماذج LLM بحجم 7 مليارات معلمة، ويتفوق على أفضل نماذج dSFT.

تحسين التفضيل

في الرسم التوضيحي التالي، نقيم كيفية تأثير الخطوات المختلفة في عملية التوجيه على الأداء. كما هو واضح، يعزز نهج dDPO عندما يتم دمجه مع dSFT الأداء بشكل كبير على كلا مجموعتي البيانات MT-Bench و AlpacaEval.

أخيرًا، في الرسم التوضيحي التالي، يمكننا رؤية دقة الاختبار والتدريب أثناء تنفيذ DPO. كما هو واضح، لا يؤثر نهج DPO على أداء النموذج في المهام الجانبية.

الخلاصة

في هذه المقالة، ناقشنا إطار زفير-7B، الذي يهدف إلى حل تحدي التقطير من نموذج لغة كبير إلى إطار مُسبقsmaller. الهدف الرئيسي للإطار هو تمكين المطورين من إنتاج نماذج لغة كبيرة مفتوحة متوافقة مع نوايا المستخدمين أكثر من أي وقت مضى.

ومع ذلك، على الرغم من النتائج الواعدة، فإن إطار زفير-7B ليس كاملًا، ويتطلب بعض العمل. واحدة من التحديات الواضحة هي استخدام إطار GPT-4 لتقييم معايير MT-Bench و AlpacaEval، والتي غالبًا ما تمتحيز تجاه النماذج التي تقوم بتصفيتها بنفسها. ومع ذلك، يأمل إطار زفير-7B في开拓 طريقًا لاستكشاف قدرات النماذج المفتوحة الصغيرة القادرة على التفاعل مع نوايا المستخدمين وعمليات التفاعل.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.