نماذج ومنصات الذكاء الاصطناعي

نموذج Mistral AI المخلوط من الخبراء (MoE) 8x7B الأخير

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Mistral AI

وهي شركة ناشئة مفتوحة المصدر مقرها باريس، تحدت المعايير من خلال إصدار أحدث نموذج لغة كبير (LLM)، MoE 8x7B، من خلال وصلة تورنت بسيطة торрент ссылка. هذا يتناقض مع نهج جوجل التقليدي مع إصدار Gemini، مما أثار محادثات واهتمامًا داخل مجتمع الذكاء الاصطناعي.

كان نهج Mistral AI دائمًا غير تقليدي. غالبًا ما يتخلى عن المرافقات العادية للأوراق أو المدونات أو إعلانات الصحافة، كانت استراتيجيتهم فريدة من نوعها في جذب انتباه مجتمع الذكاء الاصطناعي.

حقق الشركة مؤخرًا تقييمًا ممتازًا يصل إلى $2 مليار بعد جولة تمويل بقيادة Andreessen Horowitz. كانت هذه الجولة التاريخية تسجيلًا جديدًا مع جولة بذور تبلغ 118 مليون دولار، وهي أكبر جولة بذور في تاريخ أوروبا. بالإضافة إلى نجاحات التمويل، شاركت Mistral AI بنشاط في المناقشات حول قانون الاتحاد الأوروبي للذكاء الاصطناعي، ودعت إلى تخفيف التنظيم في الذكاء الاصطناعي مفتوح المصدر.

لماذا يلفت MoE 8x7B الانتباه

يُوصف بأنه “GPT-4 مصغر”، يستخدم Mixtral 8x7B إطارًا مخلوطًا من الخبراء (MoE) مع ثمانية خبراء. لكل خبير 111B معامل، مقترنًا بـ 55B معامل انتباه مشترك، ليصل إجمالي المعاملات إلى 166B لكل نموذج. هذا الاختيار التصميمي مهم لأنه يسمح لمشاركة خبيرين فقط في الاستدلال لكل رمز، مما يسلط الضوء على التحول نحو معالجة الذكاء الاصطناعي الأكثر كفاءة والتركيز.

من بين المزايا الرئيسية لMixtral قدرته على إدارة سياق واسع يصل إلى 32,000 رمز، مما يوفر نطاقًا كافيًا لمعالجة المهام المعقدة. تشمل القدرات متعددة اللغات لدى النموذج دعمًا قويًا للغة الإنجليزية والفرنسية والإيطالية والألمانية والإسبانية، مما يلبي احتياجات مجتمع المطورين العالمي.

يتضمن التدريب المسبق للميكسترا بيانات مصدرة من الويب المفتوح، مع نهج تدريب متزامن للخبراء والمرشدين. يضمن هذا الأسلوب أن النموذج ليس فقط واسعًا في فضاء المعاملات ولكن أيضًا متوافقًا بدقة مع دقة البيانات الكبيرة التي تعرض عليها.

يحقق Mixtral 8x7B نتائج مثيرة للإعجاب

Mixtral 8x7B يحقق نتائج مثيرة للإعجاب

يتفوق Mixtral 8x7B على LLaMA 2 70B وGPT-3.5، خاصة في مهمة MBPP بنسبة نجاح 60.7٪، وهي أعلى بكثير من نظرائها. حتى في اختبار MT-Bench القاسي المخصص لنمذجة اتباع الإرشادات، يحقق Mixtral 8x7B نتائج مثيرة للإعجاب، تقترب من GPT-3.5

فهم إطار المixture of Experts (MoE)

نموذج المixture of Experts (MoE)، بينما يكتسب الانتباه الأخير بسبب دمجه في نماذج اللغة المتقدمة مثل MoE 8x7B من Mistral AI، هو في الواقع مستند إلى مفاهيم أساسية تعود إلى عدة سنوات. دعونا نستعيد أصول هذه الفكرة من خلال الأبحاث الهامة.

مفهوم MoE

يمثل المixture of Experts (MoE) تحولًا في بنية الشبكة العصبية. على عكس النماذج التقليدية التي تستخدم شبكة متجانسة واحدة لمعالجة جميع أنواع البيانات، يتبنى MoE نهجًا أكثر تخصصًا ووحداتًا. يتكون من شبكات خبيرة متعددة، كل منها مصمم لمعالجة أنواع معينة من البيانات أو المهام، تحت إشراف شبكة بوابة توجيه البيانات动ينًا إلى الخبير الأكثر ملاءمة.

طبقة المixture of Experts (MoE) المدمجة في نموذج لغة متكرر

طبقة المixture of Experts (MoE) المدمجة في نموذج لغة متكرر (المصدر)

 

تُظهر الصورة أعلاه نظرة عامة على طبقة MoE المدمجة في نموذج اللغة. في جوهره، تتكون طبقة MoE من شبكات فرعية متقدمة، تسمى “خبراء”، كل منها لديه إمكانية التخصص في معالجة جوانب مختلفة من البيانات. تُحدد شبكة البوابة، المُIGHLIGHT في الرسم، أي مجموعة من هؤلاء الخبراء يتم تشغيلها لمُدخل معين. يسمح التنشيط الشرطي هذا للشبكة بزيادة سعتها بشكل كبير دون زيادة متوافقة في الطلب الحسابي.

وظائف طبقة MoE

في الممارسة، تقيم شبكة البوابة الإدخال (مُشار إليه باسم G(x) في الرسم) وتنือก مجموعة نادرة من الخبراء لمعالجته. يتم تعديل هذا الاختيار بواسطة مخرجات شبكة البوابة، مما يحدد بشكل فعال “التصويت” أو المساهمة لكل خبير في الإخراج النهائي. على سبيل المثال، كما هو موضح في الرسم، قد يتم اختيار خبيرين فقط لحساب الإخراج لكل رمز معين، مما يجعل العملية فعالة من خلال تركيز الموارد الحسابية حيث هي أكثر حاجة.

 

محول Transformer مع طبقات MoE (المصدر)

تُظهر التعبير الثانية أعلاه محول Transformer تقليدي مع محول معدل بطبقات MoE. يتكون هيكل Transformer، المعروف جيدًا بفعاليةه في مهام اللغة، تقليديًا من طبقات الانتباه الذاتي والشبكات المتقدمة المتراكمة بالتسلسل. يسمح إدخال طبقات MoE باستبدال بعض هذه الطبقات المتقدمة، مما يسمح للنموذج بالتوسع فيما يتعلق بالسعة بشكل أكثر فعالية.

في النموذج المعدل، يتم توزيع طبقات MoE عبر أجهزة متعددة، مما يُظهر نهجًا متوازيًا للنموذج. هذا أمر حاسم عند التوسع في نماذج كبيرة جدًا، حيث يسمح بتوزيع الحمل الحسابي والمتطلبات الذاكرة عبر مجموعة من الأجهزة، مثل وحدات المعالجة الرسومية (GPUs) أو وحدات المعالجة التكتيكية (TPUs). هذا التوزيع ضروري لتدريب وتنفيذ نماذج ذات مليارات المعاملات بشكل فعال، كما هو موضح في تدريب نماذج ذات مئات المليارات إلى أكثر من تريليون معامل على مجموعات حسابية كبيرة.

نهج MoE النادر مع ضبط الإرشادات على LLM

يناقش الورقة بعنوان “المixture of Experts النادر (MoE) لنمذجة اللغة القابلة للتطوير” نهجًا مبتكرًا لتحسين نماذج اللغة الكبيرة (LLMs) عن طريق دمج هيكل المixture of Experts مع تقنيات ضبط الإرشادات.

يُسلط الضوء على تحدي شائع حيث يؤدي نماذج MoE أداءً أسوأ مقارنة بنماذج كثيفة متساوية القدرة الحسابية عند ضبطها لمهام معينة بسبب الاختلافات بين التدريب المسبق العام والتدريب الدقيق المحدد للمهمة.

يُعد ضبط الإرشادات منهجية تدريب حيث يتم تعديل النماذج لاتباع تعليمات اللغة الطبيعية بشكل أفضل، مما يعزز أداء المهمة بشكل فعال. تشير الورقة إلى أن نماذج MoE تظهر تحسنًا ملحوظًا عند دمجها مع ضبط الإرشادات، أكثر من نظرائها الكثيفة. هذه التقنية تتوافق مع تمثيلات النموذج المُتدربة لمتابعة الإرشادات بشكل أكثر فعالية، مما يؤدي إلى تحسينات كبيرة في الأداء.

أجرى الباحثون دراسات عبر ثلاثة إعدادات تجريبية، مما كشف عن أن نماذج MoE تؤدي أداءً أسوأ في开始 ضبط المهمة المحددة. ومع ذلك، عندما يتم تطبيق ضبط الإرشادات، تتفوق نماذج MoE، خاصة عند تعزيزها بضبط المهمة المحددة. هذا يشير إلى أن ضبط الإرشادات هو خطوة حيوية لنماذج MoE لتتفوق على نماذج كثيفة في مهام أسفل النهر.

تأثير ضبط الإرشادات على MOE

تأثير ضبط الإرشادات على MOE

كما تقدم FLAN-MOE32B، نموذجًا يُظهر تطبيق هذه المفاهيم بنجاح. يُلاحظ أنه يتفوق على FLAN-PALM62B، نموذج كثيف، في مهام المرجع، بينما يستخدم فقط ثلث الموارد الحسابية. هذا يُظهر إمكانية نماذج MoE النادرة المدمجة مع ضبط الإرشادات لتأسيس معايير جديدة لэффективية واداء LLM.

تنفيذ المixture of Experts في السيناريوهات الواقعية

تُعتبر نماذج MoE مثالية لمجموعة من التطبيقات:

  • معالجة اللغة الطبيعية (NLP): يمكن لنماذج MoE التعامل مع دقة و复雑ية اللغة البشرية بشكل أكثر فعالية، مما يجعلها مثالية للمهام المتقدمة في NLP.
  • معالجة الصور والفيديو: في المهام التي تتطلب معالجة عالية الدقة، يمكن لMoE التعامل مع جوانب مختلفة من الصور أو إطارات الفيديو، مما يعزز كلاً من الجودة وسرعة المعالجة.
  • حلول الذكاء الاصطناعي المخصصة: يمكن للمؤسسات والباحثين تخصيص نماذج MoE لمهام محددة، مما يؤدي إلى حلول ذكاء اصطناعي أكثر استهدافًا وفعالية.

التحديات والاعتبارات

على الرغم من أن نماذج MoE تقدم العديد من الفوائد، إلا أنها تطرح أيضًا تحديات فريدة:

  • تعقيد التدريب والضبط: يمكن لطبيعة توزيع نماذج MoE أن يُ复ّع عملية التدريب، مما يتطلب توازنًا وضبطًا دقيقًا للخبراء وشبكة البوابة.
  • إدارة الموارد: من المهم إدارة الموارد الحسابية بشكل فعال عبر الخبراء المتعددين لتحقيق الفوائد القصوى لنماذج MoE.

تُعتبر دمج طبقات MoE في الشبكات العصبية، خاصة في مجال نماذج اللغة، مسارًا لتحقيق نماذج أكبر وأكثر قدرة كانت سابقًا غير ممكنة بسبب القيود الحسابية. يسمح الحساب الشرطي الذي تمكّنه طبقات MoE بتوزيع الموارد الحسابية بشكل أكثر فعالية، مما يجعل من الممكن تدريب نماذج أكبر وأكثر قدرة. مع استمرارنا في الطلب المزيد من أنظمة الذكاء الاصطناعي، من المرجح أن تصبح هياكل مثل Transformer المجهزة بMoE معيارًا لمعالجة المهام المعقدة والكبيرة النطاق عبر مجالات متعددة.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.