نماذج ومنصات الذكاء الاصطناعي

إطار GLM-130B: نموذج لغة مفتوح ثنائي اللغة مدرب مسبقًا

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

إطار GLM-130B هو نموذج لغة كبير مدرب مسبقًا ثنائي اللغة يحتوي على أكثر من 130 مليار معامل قادر على توليد خرج النص في كل من اللغة الإنجليزية والصينية. إطار GLM-130B هو محاولة لفتح مصدر نموذج لغة بمقياس يزيد عن 100 مليار معامل، ومناقشة كيف يمكن أن تكون الإطارات من هذا الحجم الكبير مدربة مسبقًا لأن تدريب نموذج من هذا الحجم الكبير غالبًا ما يصاحبه مشاكل مثل الانحراف والانخفاضات في الخسارة.

في هذه المقالة، سنناقش إطار GLM-130B، الذي يحاول وضع طريقة لتدريب نماذج لغة كبيرة بشكل فعال مع مئات المليارات من المعامل. سننظر بشكل أعمق في عمل إطار GLM-130B وتركيبه، إلى جانب عملية التدريب واختيارات التصميم التي تساعد ليس فقط في زيادة الكفاءة ولكن أيضًا في الاستقرار.

مقدمة في إطار GLM-130B

نماذج اللغة الكبيرة القادرة على العمل في إعدادات القليل من الشوت و零 الشوت، خاصة تلك التي تحتوي على أكثر من 100 مليار معامل، توفر قوانين масштабية جذابة، ومن بينها إطار GPT-3 هو واحد من أفضل الأداء الإطارات التي توفر تحسينات كبيرة في الأداء مقارنة بسلفها، إطار BERT. ومع ذلك، على الرغم من شعبية إطار GPT-3 وتطبيقاته الواسعة، فإن عملية التدريب، وفي بعض النواحي، إطار GPT-3 نفسه لم يكن شفافًا للجمهور.

النقطة السابقة تجعل مشاركة عمل وعمليات التدريب لنماذج لغة كبيرة الحجم مثل GPT-3 ذات قيمة حرجة، ومع مراعاة المخاوف الأخلاقية، فإن إطار GLM-130B هو محاولة لتدريب نموذج لغة دقيق ومتوفر بمصدر مفتوح مع أكثر من 100 مليار معامل.

خلال محاولة الفريق لتطوير إطار GLM-130B، لاحظوا أن تدريب نموذج لغة كبير الحجم غالبًا ما يرافقه مجموعة واسعة من التحديات الهندسية والفنية من حيث استقرار التدريب والكفاءة والتقارب.

GLM-130B: الهندسة المعمارية

الانحياز الاستدلالي لنموذج التعلم الآلي يتم وصفها بواسطة بنيته، ولا يأتي على أنه مفاجئ عندما لا يستطيع المطورون استكشاف تصاميم معمارية مختلفة لنماذج اللغة الكبيرة نظرًا للقابلية الحسابية والفعالية.

نماذج اللغة الكبيرة مثل PaLM وGPT ومزيد من النماذج تحتوي على أكثر من 100 مليار معامل، وهي مبنية على بنية GPT التقليدية لنمذجة اللغة التوليدية. من ناحية أخرى، يبحث إطار GLM-130B في إمكانية استخدام نموذج لغة عام ثنائي الاتجاه أو GLM، وهو نموذج لغة قائم على المحول الذي يهدف إلى الاستفادة من أهداف التعبئة التوليدية التلقائية كغرض تدريبي.

التطبيع الطبقي

أحد التحديات الرئيسية التي يواجهها المطورون عند تدريب إطار لغة كبير هو عدم استقرار التدريب، ويمكن أن يساعد استخدام تطبيع طبقي مناسب في تدريب نماذج اللغة الكبيرة.

الشبكات العصبية التغذية الأمامية والترميز الموضعي

الشبكات العصبية التغذية الأمامية والترميز الموضعي هما نهجان يستخدمهما إطار GLM-130B لتقديم أداء متقدم في المهام الجانبية والاستقرار في التدريب.

GLM-130B: استقرار التدريب

استقرار التدريب هو عاملاً هاماً عند تحديد جودة نموذج اللغة، ويؤثر استقرار التدريب بشكل كبير على عدد الرموز التي يمر بها.

ال精度 المختلطة

为了提高 دقة التدريب وتقليل استخدام الذاكرة، يتبع إطار GLM-130B الممارسة الشائعة لاستخدام دقة مختلطة، أي FP16 للامام والخلف، وFP32 للوزن الرئيسي وحالة المُحسِّن.

تقليل التدرج في طبقة التضمين

لقد وجد المطورون أن معامل التدرج يمكن أن يكون مؤشراً مفيداً لانهيار التدريب، وغالبًا ما يسبق انهيار التدريب ارتفاعاً في معامل التدرج.

GLM-130B: النتائج والأداء

为了 تقييم أداء إطار GLM-130B في المهام الإنجليزية، يتم تطبيق نفس الإعدادات التي تتبعها الإطارات الشائعة مثل PaLM وGPT-3، و由于 إطار GLM-130B هو إطار ثنائي اللغة، يتم أيضًا تقييمه عبر مجموعة من الاختبارات الصينية.

نمذجة اللغة

اختبار نمذجة اللغة على إطار GLM-130B يتم عبر مجموعتين من البيانات: LAMBADA وPile.

فهم اللغة الكبير المتعدد

MMLU أو فهم اللغة الكبير المتعدد هو مجموعة متنوعة من الاختبارات التي تتضمن أكثر من 50 سؤالاً متعدداً الاختيارات حول الذكاء البشري والمعرفة، وتتراوح من المستوى المدرسي إلى المستوى الخبير، ويتم إطلاقه بعد爬行 مجموعة اختبار Pile، وبالتالي، فهو اختبار مثالي لتقييم قدرات التعلم القليل في نموذج اللغة.

BIG-Bench أو اختبار ما وراء لعبة التقليد

BIG-Bench أو اختبار ما وراء لعبة التقليد هو مجموعة من المهام الصعبة التي تختبر قدرة النموذج على المعرفة والاستدلال والمنطق الشائع.

CLUE أو تقييم فهم اللغة الصينية

أداء إطار GLM-130B في اختبارات فهم اللغة الصينية يتم تقييمه على مجموعة من المهام المعيارية، بما في ذلك CLUE وFewCLUE، ويتم مقارنته مع نموذج ERNIE Titan 3.0 البالغ 260 مليار معامل، وهو أكبر نموذج لغة صينية موجود.

الخلاصة

في هذه المقالة، ناقشنا إطار GLM-130B، وهو نموذج لغة كبير مدرب مسبقًا ثنائي اللغة يهدف إلى تعزيز البحث الشامل في نماذج اللغة الكبيرة. الهندسة المعمارية والتقنيات الفنية تهدف إلى تقديم رؤية أفضل للمجتمع الاصطناعي حول بنية إطارات نماذج اللغة الكبيرة، وكفاءة التدريب والاستقرار، وأهداف التدريب المسبق، والتدخل الميسور.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.