نماذج ومنصات الذكاء الاصطناعي

صعود تقنية خليط الخبراء لتعزيز كفاءة النماذج اللغوية الكبيرة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في عالم معالجة اللغة الطبيعية (NLP)، كان السعي ل بناء نماذج لغوية أكبر وأكثر قدرة دافعًا وراء العديد من التقدمات الحديثة. ومع ذلك،随着 نمو هذه النماذج في الحجم، أصبحت المتطلبات الحاسوبية لتدريبها واستدعائها أكثر طموحًا، مما دفع الحدود المتاحة لموارد الأجهزة.

دخلت تقنية خليط الخبراء (MoE) ، وهي تقنية واعدة لتخفيف هذا العبء الحاسوبي وتحقيق تدريب نماذج لغوية أكبر وأكثر قوة. سنناقش فيما يلي MoE، واستكشاف أصولها، وآلياتها الداخلية، وتطبيقاتها في نماذج اللغة القائمة على المحولات.

أصول خليط الخبراء

يمكن تتبع مفهوم خليط الخبراء (MoE) إلى أوائل التسعينيات عندما قام الباحثون بفحص فكرة الحساب الشرطي، حيث يتم تنشيط أجزاء من شبكة عصبية بشكل انتقائي بناءً على بيانات الإدخال. واحدة من الأعمال الرائدة في هذا المجال كانت ورقة “خليط محلي من الخبراء التكيفي” بواسطة جاكوبس وآخرون في عام 1991، والتي提出了 إطارًا للتعلم الإشرافي لمجموعة من الشبكات العصبية، كل منها يختص بمنطقة مختلفة من فضاء الإدخال.

الفكرة الأساسية وراء MoE هي وجود شبكات خبيرة متعددة، كل منها مسؤول عن معالجة جزء من بيانات الإدخال. آلية التوجيه، عادةً شبكة عصبية بنفسها، تحدد أي خبير (خبراء) يجب معالجته لإدخال معين. هذا النهج يسمح للنموذج بتخصيص موارده الحاسوبية بشكل أكثر كفاءة من خلال تنشيط خبراء ذوي الصلة فقط لكل إدخال، بدلاً من توظيف القدرة الكاملة للنموذج لكل إدخال.

على مر السنين، قام العديد من الباحثين بفحص وفهم فكرة الحساب الشرطي، مما أدى إلى تطورات مثل هياكل MoE الهيئرارشية، والتقريبات منخفضة الرتبة للحساب الشرطي، وطرق لتقدير التدرجات من خلال العصبونات العشوائية والدوائر التوجيهية الصلبة.

خليط الخبراء في المحولات

خليط الخبراء

خليط الخبراء

في حين أن فكرة خليط الخبراء (MoE) قد تمت مناقشتها لعدة عقود، تطبيقها على نماذج اللغة القائمة على المحولات هو أمر نسبيًا حديث. المحولات، التي أصبحت المعيار الفعلي لنماذج اللغة المتقدمة، تتكون من طبقات متعددة، كل منها يحتوي على آلية انتباه ذاتي وشبكة عصبية تغذية إلى الأمام (FFN).

الابتكار الرئيسي في تطبيق MoE على المحولات هو استبدال طبقات FFN الكثيفة بطبقات MoE النادرة، كل منها يتكون من خبراء متعددين وآلية توجيه. آلية التوجيه تحدد أي خبير (خبراء) يجب معالجته لكل رمز إدخال، مما يسمح للنموذج بالتنشيط الانتقائي لخبراء معينين فقط لكل تسلسل إدخال.

أحد الأعمال المبكرة التي أظهرت إمكانيات MoE في المحولات كان ورقة “الشبكات العصبية الكبيرة بشكل مفرط: طبقة خليط الخبراء المحددة بشكل نادر” بواسطة شيزير وآخرون في عام 2017. هذه العمل أدخل مفهوم طبقة MoE المحددة بشكل نادر، والتي تستخدم آلية توجيه إضافتها ندرة وضوضاء إلى عملية اختيار الخبير، مما يضمن تنشيط خبراء معينين فقط لكل إدخال.

منذ ذلك الحين، تم تقديم أعمال أخرى لتعزيز تطبيق MoE على المحولات، مما يعالج تحديات مثل عدم استقرار التدريب، وتكامل الحمل، والاستدعاء الفعال. أمثلة ملحوظة تشمل محول التبديل (فيدوس وآخرون، 2021)، ST-MoE (زوف وآخرون، 2022)، و GLaM (دو وآخرون، 2022).

فوائد خليط الخبراء لنماذج اللغة

المنفعة الرئيسية لاستخدام MoE في نماذج اللغة هي القدرة على توسيع حجم النموذج مع الحفاظ على تكلفة حاسوبية متواضعة نسبيًا أثناء الاستدعاء. من خلال تنشيط خبراء معينين فقط لكل رمز إدخال، يمكن لنماذج MoE تحقيق القوة التعبيرية لنماذج كثيفة أكبر بكثير مع الحاجة إلى كمية أقل من الحساب.

على سبيل المثال، لنفترض نموذج لغوي يحتوي على طبقة FFN كثيفة مع 7 مليارات معامل. إذا استبدلنا هذه الطبقة بطبقة MoE تتكون من ثمانية خبراء، كل منها يحتوي على 7 مليارات معامل، يزيد عدد المعاملات الإجمالي إلى 56 مليارًا. ومع ذلك، أثناء الاستدعاء، إذا كاننا ننشط فقط خبراءين لكل رمز، تكون التكلفة الحاسوبية مكافئة لنموذج كثيف يحتوي على 14 مليار معامل، حيث يتم حساب ضربات المصفوفة 7 مليارات معامل مرتين.

هذه الكفاءة الحاسوبية أثناء الاستدعاء هي قيمة خاصة في سيناريوهات التوزيع حيث تكون الموارد محدودة، مثل الأجهزة المحمولة أو بيئات الحوسبة على الحافة. بالإضافة إلى ذلك، يمكن أن يؤدي تقليل المتطلبات الحاسوبية أثناء التدريب إلى وفورات كبيرة في الطاقة وخفض بصمة الكربون، مما يتوافق مع التركيز المتزايد على ممارسات الذكاء الاصطناعي المستدامة.

التحديات والاعتبارات

في حين أن نماذج MoE تقدم منافع مقنعة، فإن اعتمادها وتوزيعها يأتيان مع تحديات واعتبارات عديدة:

  1. عدم استقرار التدريب: تعرف نماذج MoE بأنها أكثر عرضة لعدم استقرار التدريب مقارنة بنماذجها الكثيفة. ينتج هذا المشكلة من الطبيعة النادرة والشرطية لتنشيط الخبراء، مما قد يؤدي إلى تحديات في انتشار التدرج والتقارب. تم اقتراح تقنيات مثل خسارة التوجيه z (زوف وآخرون، 2022) لتخفيف هذه عدم الاستقرار، ولكن لا يزال البحث ضروريًا.
  2. التحسين الدقيق والتجاوز: تميل نماذج MoE إلى التجاوز بسهولة أثناء التحسين الدقيق، خاصة عندما يكون لديها مجموعة بيانات صغيرة نسبيًا. يُعزى هذا السلوك إلى زيادة القدرة والندرة في نماذج MoE، مما قد يؤدي إلى التخصص المفرط على بيانات التدريب. تتطلب استراتيجيات التحسين الدقيق والتنظيم الحذر لتحقيق التوازن.
  3. متطلبات الذاكرة: في حين أن نماذج MoE يمكن أن تقلل من التكاليف الحاسوبية أثناء الاستدعاء، غالبًا ما يكون لديها متطلبات ذاكرة أعلى مقارنة بنماذج كثيفة مماثلة. هذا يرجع إلى أن جميع أوزان الخبراء تحتاج إلى تحميلها في الذاكرة، حتى لو تم تنشيطها فقط لبعض الإدخالات. يمكن أن تقيد قيود الذاكرة من قابلية توسيع نماذج MoE على أجهزة محدودة الموارد.
  4. توازن الحمل: لتحقيق الكفاءة الحاسوبية المثلى، من المهم تحقيق توازن الحمل عبر الخبراء، مما يضمن عدم تحميل خبير واحد بشكل مفرط بينما يبقى الآخرون غير مستخدمين. يتم تحقيق هذا التوازن عادةً من خلال خسائر مساعدة أثناء التدريب وضبط العامل السعة بدقة، الذي يحدد أقصى عدد من الرموز التي يمكن تعيينها لكل خبير.
  5. التواصل الزائد: في سيناريوهات التدريب والاستدعاء الموزعة، يمكن لنماذج MoE أن تُدخل تواصلًا إضافيًا بسبب الحاجة إلى تبادل معلومات التنشيط وتدرج الخبراء عبر الأجهزة أو المعززات المختلفة. استراتيجيات التواصل الفعالة وتصميم النموذج الحساس للأجهزة ضروريان لتخفيف هذا العبء.

على الرغم من هذه التحديات، فإن الإمكانات المحتملة لنماذج MoE في تمكين نماذج لغوية أكبر وأكثر قدرة قد حفزت جهود بحثية كبيرة لمعالجة وتخفيف هذه القضايا.

مثال: Mixtral 8x7B و GLaM

لتوضيح التطبيق العملي ل MoE في نماذج اللغة، دعونا ننظر إلى مثالين ملحوظين: Mixtral 8x7B و GLaM.

Mixtral 8x7B هو متغير MoE من نموذج اللغة Mistral، طوره Anthropic. يتكون من ثمانية خبراء، كل منها يحتوي على 7 مليارات معامل، مما يؤدي إلى إجمالي 56 مليار معامل. ومع ذلك، أثناء الاستدعاء، يتم تنشيط خبراء فقط لكل رمز، مما يقلل التكلفة الحاسوبية إلى نموذج كثيف يحتوي على 14 مليار معامل.

أظهر Mixtral 8x7B أداءً مثيرًا للإعجاب، متجاوزًا نموذج Llama 70 مليار معامل مع تقديم أوقات استدعاء أسرع بكثير. تم إصدار نسخة من Mixtral 8x7B محسنة لتعليمات اللغة، تسمى Mixtral-8x7B-Instruct-v0.1، مما يعزز من قدراته في اتباع تعليمات اللغة الطبيعية.

مثال آخر ملحوظ هو GLaM (نموذج اللغة من جوجل)، وهو نموذج MoE كبير النطاق طوره جوجل. يستخدم GLaM هيكلًا قائمًا على المحول فقط وتم تدريبه على مجموعة بيانات ضخمة تضم 1.6 تريليون رمز. يحقق النموذج أداءً مثيرًا للإعجاب في التقييمات القليلة والواحدة، مما يطابق جودة GPT-3 مع استخدام فقط ثلث الطاقة اللازمة لتدريب GPT-3.

يمكن أن يُعزى نجاح GLaM إلى هيكله الفعال من MoE، الذي سمح بتدريب نموذج يحتوي على عدد هائل من المعاملات مع الحفاظ على متطلبات حاسوبية معقولة. أظهر النموذج أيضًا إمكانية نماذج MoE لتكون أكثر كفاءة في استخدام الطاقة وأكثر استدامة بيئيًا مقارنة بنماذجها الكثيفة.

هيكل Grok-1

GROK MIXTURE OF EXPERT

GROK MIXTURE OF EXPERT

Grok-1 هو نموذج MoE قائم على المحول مع هيكل فريد مصمم لتحقيق أقصى كفاءة وأداء. دعونا ننظر إلى المواصفات الرئيسية:

  1. المعاملات: مع 314 مليار معامل، Grok-1 هو أكبر نموذج لغة مفتوح حتى الآن. ومع ذلك، بفضل هيكل MoE، يتم تنشيط فقط 25% من الأوزان (حوالي 86 مليار معامل) في أي وقت معين، مما يعزز القدرات المعالجية.
  2. الهيكل: يعتمد Grok-1 على هيكل خليط من 8 خبراء، حيث يتم معالجة كل رمز بواسطة خبراء اثنين أثناء الاستدعاء.
  3. الطبقات: يتكون النموذج من 64 طبقة محول، كل منها يدمج انتباه متعدد الرؤوس وكتلة كثيفة.
  4. تحويل الرموز: يستخدم Grok-1 معالج تحويل الرموز SentencePiece مع حجم قاموس 131,072 رمز.
  5. التضمين والترميز الموضعي: يحتوي النموذج على تضمين بعرض 6,144 ويعتمد على تضمين موضعي دوار، مما يسمح بتفسير أكثر ديناميكية للبيانات مقارنة بالتضمين الموضعي الثابت.
  6. الانتباه: يستخدم Grok-1 48 رأس انتباه للاستفسارات و 8 رؤوس انتباه للمفاتيح والقيم، كل منها بحجم 128.
  7. طول السياق: يمكن للنموذج معالجة تسلسلات تصل إلى 8,192 رمز في الطول، باستخدام دقة bfloat16 للحساب الفعال.

أداء و تفاصيل التنفيذ

أظهر Grok-1 أداءً مثيرًا للإعجاب، متجاوزًا LLaMa 2 70B و Mixtral 8x7B بنتيجة MMLU 73%، مما يظهر كفاءته ودقته عبر مختلف الاختبارات.

然而، من المهم ملاحظة أن Grok-1 يتطلب موارد GPU كبيرة بسبب حجمه الهائل. التركيز الحالي في الإصدار المفتوح على التحقق من صحة النموذج ويستخدم تنفيذًا غير فعال لطبقة MoE لتجنب الحاجة إلى نواة مخصصة.

على الرغم من ذلك، يدعم النموذج تجزئة التنشيط وكمية 8 بت، مما يمكن أن يحد من المتطلبات الحاسوبية.

في خطوة ملحوظة، أصدر xAI Grok-1 تحت رخصة Apache 2.0، مما يجعل أوزانه وهيكله متاحين للمجتمع العالمي للاستخدام والمساهمة.

يتضمن الإصدار المفتوح مخزنًا لجاكس يُظهر كيفية تحميل وتشغيل نموذج Grok-1. يمكن للمستخدمين تحميل أوزان النقاط باستخدام عميل تورنت أو مباشرة عبر هاب هوجينج فايس، مما يسهل الوصول إلى هذا النموذج الرائد.

مستقبل خليط الخبراء في نماذج اللغة

مع استمرار الطلب على نماذج لغوية أكبر وأكثر قدرة، من المتوقع أن يكتسب اعتماد تقنيات MoE زخمًا أكبر. تُركز الجهود البحثية الجارية على معالجة التحديات المتبقية، مثل تحسين استقرار التدريب، وتخفيف التجاوز أثناء التحسين الدقيق، وتنظيم المتطلبات الحاسوبية والتواصل.

اتجاه واعد هو استكشاف هياكل MoE الهيئرارشية، حيث يتكون كل خبير من خبراء فرعيين. يمكن أن يسمح هذا النهج بتمكين أكبر للنمو وتحقيق كفاءة حاسوبية أكبر مع الحفاظ على القوة التعبيرية للنماذج الكبيرة.

بالإضافة إلى ذلك، يعتبر تطوير الأنظمة البرمجية والأجهزة المثلى لنماذج MoE مجالًا نشطًا للبحث. يمكن أن تعزز المعززات المخصصة وأطر التدريب الموزعة المصممة لتعامل أنماط الحساب النادر والشرطي لنماذج MoE أداءها وقابلية التوسع.

علاوة على ذلك، يمكن أن يؤدي دمج تقنيات MoE مع تقدم آخر في نمذجة اللغة، مثل آليات الانتباه النادر، واستراتيجيات التحويل الفعالة، وتمثيلات متعددة الوسائط، إلى نماذج لغوية أكثر قوة وتنوعًا قادرة على معالجة مجموعة واسعة من المهام.

الختام

تعتبر تقنية خليط الخبراء أداة قوية في السعي ل بناء نماذج لغوية أكبر وأكثر قدرة. من خلال تنشيط خبراء بناءً على بيانات الإدخال، تقدم نماذج MoE حلاً واعداً للتحديات الحاسوبية المرتبطة بتوسيع نماذج كثيفة. على الرغم من وجود تحديات يجب التغلب عليها، مثل عدم استقرار التدريب، والتجاوز، ومتطلبات الذاكرة، فإن الفوائد المحتملة لنماذج MoE من حيث الكفاءة الحاسوبية، والتوسع، والاستدامة البيئية تجعلها مجالًا مثيرًا للبحث والتطوير.

مع استمرار مجال معالجة اللغة الطبيعية في دفع الحدود لما هو ممكن، من المحتمل أن يلعب اعتماد تقنيات MoE دورًا حاسمًا في تمكين الجيل التالي من نماذج اللغة. من خلال الجمع بين MoE مع تقدم آخر في هيكل النموذج، تقنيات التدريب، وتنظيم الأجهزة، يمكننا النظر إلى الأمام ل نماذج لغوية أكثر قوة وتنوعًا قادرة على الفهم والتواصل مع البشر بطريقة طبيعية و سلسة.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.