نماذج ومنصات الذكاء الاصطناعي

تقييم نماذج اللغة الكبيرة: دليل تقني

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

انفجرت نماذج اللغة الكبيرة (LLM) مثل GPT-4 و Claude و LLaMA في الشهرة. بفضل قدرتهم على توليد نص مشابه للغاية للإنسان، يتم استخدام هذه الأنظمة الآن لكل شيء من إنشاء المحتوى إلى بوتات الدردشة لخدمة العملاء.

لكن كيف نعرف ما إذا كانت هذه النماذج جيدة حقًا؟ مع ظهور نماذج LLM جديدة باستمرار، كلها تدعي أنها أكبر وأفضل، كيف نقيم أدائها ونقارن بينها؟

في هذا الدليل الشامل، سنستكشف أفضل تقنيات تقييم نماذج اللغة الكبيرة. سننظر إلى الفوائد والعيوب لكل نهج، متى يتم تطبيقه، وكيف يمكنك استغلاله في اختبار LLM الخاص بك.

مetrics خاصة بالمهام

أحد الطرق الأكثر مباشرة لتقييم LLM هو اختباره على مهام NLP المحددة باستخدام معايير معيارية. على سبيل المثال:

التلخيص

对于 مهام التلخيص، يتم استخدام معايير مثل ROUGE (الملخص الموجه للتعلم) بشكل شائع. يقارن ROUGE التلخيص الذي تم إنشاؤه بواسطة النموذج بالتلخيص المكتوب من قبل الإنسان “المرجعي”، ويعتبر الت重疊 بين الكلمات أو العبارات.

هناك عدة أنواع من ROUGE، كل منها له فوائده وعيوبه:

  • ROUGE-N: يقارن الت重疊 بين n-grams (تسلسلات من N كلمات). ROUGE-1 يستخدم unigrams (كلمات فردية)، ROUGE-2 يستخدم bigrams، إلخ. الميزة هي أنه يلتقط ترتيب الكلمات، لكنه يمكن أن يكون صارمًا.
  • ROUGE-L: يعتمد على أطول تسلسل مشترك (LCS). أكثر مرونة في ترتيب الكلمات، لكنه يركز على النقاط الرئيسية.
  • ROUGE-W: يوزن التطابقات LCS حسب أهميتها. يحاول تحسين ROUGE-L.

بشكل عام، معايير ROUGE سريعة وآلية وتعمل جيدًا لترتيب تلخيصات النظام. ومع ذلك، لا تقيس الاتساق أو المعنى. يمكن أن يحصل تلخيص على درجة ROUGE عالية ولا يزال يكون غير منطقي.

الformula ل ROUGE-N هي:

ROUGE-N=∑∈{Reference Summaries}∑∑�∈{Reference Summaries}∑

حيث:

  • Count_{match}(gram_n) هو عدد n-grams في كل من التلخيص الذي تم إنشاؤه بواسطة النموذج والتلخيص المرجعي.
  • Count(gram_n) هو عدد n-grams في التلخيص المرجعي.

على سبيل المثال، ل ROUGE-1 (unigrams):

  • التلخيص الذي تم إنشاؤه: “The cat sat.”
  • التلخيص المرجعي: “The cat sat on the mat.”
  • ن-غرامات متداخلة: “The”, “cat”, “sat”
  • درجة ROUGE-1 = 3/5 = 0.6

ROUGE-L يستخدم أطول تسلسل مشترك (LCS). وهو أكثر مرونة في ترتيب الكلمات. الصيغة هي:

ROUGE-L=���(generated,reference)max(length(generated), length(reference))

حيث LCS هو طول أطول تسلسل مشترك.

ROUGE-W يوزن التطابقات LCS. يعتبر أهمية كل تطابق في LCS.

الترجمة

对于 مهام الترجمة، BLEU (الترجمة الثنائية تحت الدراسة) هو معيار شائع. يقيس BLEU التشابه بين خرج النموذج وترجمات الإنسان المهنية، باستخدام دقة n-gram و جزاء للاختصار.

الجوانب الرئيسية لكيفية عمل BLEU:

  • يقارن الت重疊 بين n-grams ل n حتى 4 (unigrams، bigrams، trigrams، 4-grams).
  • يحسب متوسطًا هندسيًا ل n-gram precisions.
  • يطبق جزاء للاختصار إذا كانت الترجمة أقصر بكثير من المرجعية.
  • عادة ما تتراوح من 0 إلى 1، مع 1 كتطابق مثالي للمرجعية.

BLEU يرتبط بشكل معقول مع أحكام الإنسان لجودة الترجمة. لكنه لا يزال لديه قيود:

  • يقيس فقط الدقة مقابل المراجع، وليس الاستدلال أو F1.
  • يصعب عليه التعامل مع الترجمات الإبداعية باستخدام كلمات مختلفة.
  • مستعد للعب مع حيل الترجمة.

معايير ترجمة أخرى مثل METEOR و TER تحاول تحسين نقاط الضعف في BLEU. لكن بشكل عام، المعايير الآلية لا تقيس جودة الترجمة بشكل كامل.

مهام أخرى

بالإضافة إلى التلخيص والترجمة، يمكن استخدام معايير مثل F1 و الدقة و MSE و المزيد لتقييم أداء LLM على مهام مثل:

  • التصنيف النصي
  • استخراج المعلومات
  • الإجابة على الأسئلة
  • تحليل المشاعر
  • كشف الأخطاء النحوية

ميزة معايير المهام هي أن التقييم يمكن أن يكون полностью آليًا باستخدام مجموعات بيانات معيارية مثل SQuAD لQA و GLUE benchmark لمجموعة من المهام. يمكن تتبع النتائج بسهولة مع مرور الوقت كما تحسن النماذج.

然而، هذه المعايير محددة النطاق ولا يمكنها قياس جودة اللغة بشكل عام. LLMs التي تؤدي جيدًا على معايير مهام فردية قد تفشل في توليد نص منطقي ومتسق ومفيد بشكل عام.

معايير البحث

طريقة شائعة لتقييم LLMs هي اختبارها على معايير بحث واسعة النطاق تغطي مواضيع ومهارات متنوعة. تسمح هذه المعايير بنموذج سريع الاختبار على نطاق واسع.

بعض المعايير الشهيرة تشمل:

  • SuperGLUE – مجموعة من 11 مهام لغة متنوعة.
  • GLUE – مجموعة من 9 مهام فهم الجملة. أسهل من SuperGLUE.
  • MMLU – 57 مهام مختلفة في العلوم والتكنولوجيا والعلوم الاجتماعية والعلوم الإنسانية. يختبر المعرفة والقدرة على الاستدلال.
  • Winograd Schema Challenge – مشاكل حل Pronoun تتطلب استدلالًا بالعقل السليم.
  • ARC – مهام استدلال لغة طبيعية صعبة.
  • Hellaswag – استدلال بالعقل السليم حول المواقف.
  • PIQA – أسئلة فيزياء تتطلب رسومات.

من خلال تقييم هذه المعايير، يمكن للباحثين اختبار النماذج بسرعة علىقدرتهم على أداء الرياضيات والمنطق والاستدلال والبرمجة والاستدلال بالعقل السليم والمزيد. يصبح نسبة الإجابات الصحيحة معيارًا لمقارنة النماذج.

然而، هناك مشكلة كبيرة مع المعايير هي تلوث بيانات التدريب. تحتوي العديد من المعايير على أمثلة تم رؤيتها بالفعل بواسطة النماذج خلال التدريب المسبق. هذا يسمح للنماذج “تذكر” الإجابات على أسئلة محددة ويتفوق على قدراتها الحقيقية.

يتم إجراء محاولات ل “تنقية” المعايير عن طريق إزالة الأمثلة المتداخلة. لكن هذا يصعب القيام به بشكل شامل، خاصة عندما قد تكون النماذج قد رأت نسخًا معبرة أو مترجمة من الأسئلة.

لذلك، بينما يمكن للمعايير اختبار مجموعة واسعة من المهارات بفعالية، لا يمكنها قياس قدرات الاستدلال الحقيقية أو تجنب التضخم في الدرجات بسبب التلوث. يتم الحاجة إلى طرق تقييم مكملة.

تقييم LLM ذاتي

نهج مثير للاهتمام هو تقييم LLM لخرج LLM آخر. الفكرة هي استغلال مفهوم “المهمة الأسهل”:

  • إنتاج خرج عالي الجودة قد يكون صعبًا ل LLM.
  • لكن تحديد ما إذا كان الخرج معين هو عالي الجودة يمكن أن يكون مهمة أسهل.

على سبيل المثال، بينما قد يصعب على LLM توليد فقرة واقعية ومتسقة من الصفر، يمكنه بسهولة الحكم على ما إذا كانت الفقرة المعطاة منطقية وتناسب السياق.

لذلك، يتم اتباع العملية التالية:

  1. تمرير الدخول إلى LLM الأول لتوليد الخرج.
  2. تمرير الدخول + الخرج الذي تم إنشاؤه إلى LLM “المقيم” الثاني.
  3. سؤال LLM المقيم عن جودة الخرج. على سبيل المثال، “هل الاستجابة السابقة منطقية؟”

هذا النهج سريع التنفيذ وآلي لتقيم LLM. لكن هناك بعض التحديات:

  • الأداء يعتمد بشكل كبير على اختيار LLM المقيم وكتابة الدخول.
  • محدود بصعوبة المهمة الأصلية. تقييم الاستدلال المعقد لا يزال صعبًا بالنسبة للنماذج.
  • يمكن أن يكون مكلفًا من الناحية الحسابية إذا تم استخدام API-based LLMs.

التقييم الذاتي واعد بشكل خاص لتقدير المعلومات المستخرجة في أنظمة RAG (الاستخراج المعزز بالتوليد). يمكن أن تؤكد استفسارات LLM إضافية ما إذا تم استخدام السياق المستخرج بشكل مناسب.

بشكل عام، يظهر التقييم الذاتي وعدًا، لكنه يتطلب عناية في التنفيذ. إنه يكمّل، بدلاً من استبدال، التقييم البشري.

التقييم البشري

نظرًا للقيود في المعايير الآلية والمعايير، يظل التقييم البشري هو المعيار الذهبي لتقييم جودة LLM بدقة.

يمكن للخبراء تقديم تقييمات نوعية مفصلة حول:

  • الدقة والصحة الواقعية
  • المنطق والاستدلال والاستدلال بالعقل السليم
  • الاتساق والتناسق والقراءة
  • appropriateness of tone، style and voice
  • النحوية والسيولة
  • الابتكار وال细微

Để تقييم نموذج، يتم إعطاء البشر مجموعة من الدخول والاستجابات التي تم توليدها بواسطة LLM. يقيمون جودة الاستجابات، غالبًا باستخدام مقاييس التقييم والقوائم.

الجانب السلبي هو أن التقييم البشري اليدوي مكلف وبطيء وصعب للتوسيع. كما يتطلب تطوير معايير معيارية وتدريب المقييمين لتطبيقها بشكل متسق.

قام بعض الباحثين باستكشاف طرق مبتكرة لتوجيه تقييمات LLM البشرية باستخدام أنظمة بطولة حيث يراهن الناس ويحكمون على مواجهات بين النماذج. لكن التغطية لا تزال محدودة مقارنة بالتقييمات اليدوية الكاملة.

对于 حالات استخدام الأعمال حيث يهم الجودة أكثر من الحجم الخام، يظل التقييم البشري الخبير هو المعيار الذهبي على الرغم من تكاليفه. هذا صحيح بشكل خاص للتطبيقات الأكثر خطورة للنماذج.

الختام

تقييم نماذج اللغة الكبيرة بدقة يتطلب استخدام أداة متنوعة من الأساليب المكملة، بدلاً من الاعتماد على تقنية واحدة.

من خلال الجمع بين النهج الآلي السريع مع الإشراف البشري الدقيق، يمكننا تطوير أساليب اختبار موثوقة للنماذج. مع التقييم الشامل، يمكننا فتح إمكانيات النماذج بشكل مسؤول.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.