نماذج ومنصات الذكاء الاصطناعي
MoE-LLaVA: مزيج من الخبراء لتحسين نماذج اللغة والرؤية الكبيرة
أظهرت التطورات الحديثة في نماذج اللغة والرؤية الكبيرة (LVLMs) أن تحسين هذه الإطارات بشكل كبير يزيد من الأداء عبر مجموعة متنوعة من المهام التنازلية. وقد حققت نماذج مثل MiniGPT و LLaMA وقدرات ملحوظة من خلال دمج طبقات المشروع البصري ومشفر الصورة في هيكلها. من خلال تنفيذ هذه المكونات، تعزز نماذج LVLMs القدرات الإدراكية البصرية لنماذج اللغة الكبيرة (LLMs). يمكن تحسين الأداء بشكل أكبر من خلال زيادة حجم النموذج وعدد المعاملات، بالإضافة إلى توسيع نطاق مجموعة البيانات.
نماذج مثل InternVL قد وسعت مشفر الصورة إلى أكثر من 6 مليارات معامل، في حين وسعت نماذج أخرى الجزء الخلفي من LVLMs إلى 13 مليار معامل، مما أدى إلى أداء متفوق على مجموعة واسعة من المهام. وقد درب IDEFICS نموذج LVLM مع أكثر من 80 مليار معامل. وقد توافقت هذه الطرق مع الأداء الذي حققته نماذج LLMs المسبقة على أكثر من 34 مليار أو 70 مليار أو حتى 100 مليار معامل. ومع ذلك، فإن التحسين له جانب سلبي: إنه يزيد بشكل كبير من تكاليف التدريب والاستدلال. هذا لأنها تتطلب جميع المعاملات لتكون نشطة لكل رمز في الحساب، مما يؤدي إلى احتياجات حسابية عالية وبالتالي تكاليف أعلى.
يناقش هذا المقال MoE-LLaVA، وهي هيكلة LVLM خفيفة تستند إلى مزيج من الخبراء (MoE) مع استراتيجية تدريب فعالة، MoE-Tuning، للنماذج LVLM. ويتمثل MoE-Tuning في معالجة تدهور الأداء في تعلم الندرة المتعددة الأوضاع بطريقة مبتكرة، مما يؤدي إلى نموذج مع عدد كبير من المعاملات ولكن مع تكاليف تدريب واستدلال متسقة. وقد تم تصميم هيكل MoE-LLaVA لتنشيط فقط الخبراء الأعلى -k خلال النشر، مع إبقاء الخبراء الآخرين غير نشطين.
سنناقش إطار عمل MoE-LLaVA، مع التركيز على آليته وطريقة عمله وهيكله وكيفية مقارنته مع الإطارات الرائدة لتوليد الصور والفيديو.
MoE-LLaVA: تحسين نماذج اللغة والرؤية الكبيرة بأسعار معقولة
بالإضافة إلى استخدام طبقات المشروع البصري ومشفر الصورة، فإن نماذج اللغة والرؤية الكبيرة تتوسع في حجم النموذج من خلال زيادة عدد المعاملات لتحسين أداء النموذج. ومن الأمثلة البارزة على نماذج اللغة والرؤية الكبيرة التي اتبعت هذا النهج لتحسين أدائها MiniGPT-4 و InternGPT و InternVL وغيرها. في التطبيقات العملية، غالبًا ما يصبح توسيع نموذج اللغة الكبيرة أو نموذج اللغة والرؤية الكبيرة مع بيانات تدريب عالية الجودة ضرورة لتحسين أداء النموذج. على الرغم من أن توسيع حجم النموذج يزيد من الأداء، إلا أنه يزيد أيضًا من التكاليف الحسابية لتدريب ونشر النموذج، ويزيد من تعقيدات ونفاذية نشر النموذج على أجهزة متوازية في نفس الوقت. السبب الرئيسي وراء زيادة تكاليف التدريب والاستدلال مع متطلبات الحوسبة هو أن كل رمز في الإطار يتطلب حسابًا مع كل معامل في النموذج، والمعروفة باسم النموذج الكثيف.
من ناحية أخرى، أظهرت نماذج MoE أو مزيج الخبراء فعالية في تحسين الإطارات من خلال معالجة البيانات بمساعدة معاملات محددة، وهو نهج تم تبنيه على نطاق واسع في مجال معالجة اللغة الطبيعية. ومع ذلك، فإن استخدام مزيج الخبراء لتدريب نماذج LVLMs الخفيفة مباشرةً يعد تحديًا، لأن تحويل LLMs إلى LVLMs وتخفيضها في نفس الوقت يؤدي إلى تدهور كبير في الأداء. لتنفيذ مزيج النماذج لتحسين LLMs و LVLMs، من الضروري أولًا تهيئة LVLMs للتخفيض. ولتحقيق ذلك، يقدم إطار عمل MoE-LLaVA MoE-Tuning، وهي استراتيجية تدريب بسيطة وفعالة تتكون من ثلاث مراحل.

كما هو موضح في الشكل أعلاه، يتم تدريب MoE-Tuning أولًا على Multilayer Perceptron الذي يعدل الرموز البصرية إلى نموذج اللغة الكبيرة في المرحلة الأولى. ثم يتم تدريب جميع معاملات LLM لتمكين نموذج اللغة والرؤية الكبيرة بمقدرات فهم متعددة الأوضاع عامة. وأخيرًا، في المرحلة الثالثة، يتم تكرار FFN أو شبكة العصبية المتقدمة كأوزان 초기 للخبراء، ويتدرب فقط على طبقات مزيج الخبراء. بشكل عام، يساعد عملية التدريب في الانتقال التدريجي للنموذج الخفيف من تهيئة LVLM إلى مزيج من نماذج الخبراء.
مع تغطية عملية التدريب، دعونا نلقي بعض الضوء على MoE-LLaVA، وهو نموذج أساسي لنماذج اللغة والرؤية الكبيرة مع مزيج من نماذج الخبراء التي تتضمن مسارات خفيفة قابلة للتعلم ومزيج من نماذج الخبراء. في جوهره، يتكون نموذج MoE-LLaVA من مسارات خفيفة متعددة، ويستخدم الإطار هذه المسارات لنقل كل رمز إلى خبراء مختلفين من خلال مسار قابل للتعلم. ثم يتم معالجة الرموز بشكل جماعي من قبل الخبراء النشطين مع إبقاء المسارات غير النشطة صامتة. ثم يتم تكرار طبقات مزيج الخبراء بشكل متكرر لتوفير مسار خفيف نحو نموذج LVLM أكبر وأقوى.

بفضل النهج المتبع في إطار عمل MoE-LLaVA، يتمكن من تجاوز النماذج التي لديها عدد مماثل من المعاملات النشطة، وتفوقها بفرق كبير في اختبار POPE لتحويل الكائنات، على الرغم من وجوده فقط 2.2 مليار معامل. بالإضافة إلى ذلك، يمكن لنموذج MoE-LLaVA مع 2.2 مليار معامل تحقيق أداء قابل للمقارنة مع إطار InternVL-Chat-19B مع ما يقرب من 8 أضعاف عدد المعاملات النشطة.
نماذج اللغة الكبيرة القوية مع قدرات عامة قوية ومتابعة تعليمات قوية تم تنفيذها على نماذج اللغة والرؤية الكبيرة. النماذج الأولى مثل BLIP قامت بتشفير الإشارات البصرية إلى تسلسل من الرموز البصرية، مما مكنها من التكيف مع الرؤية بنجاح باستخدام طبقات المشروع المتعددة. في الوقت نفسه، تركز الأعمال الحديثة على تحسين أداء النموذج من خلال تنفيذ أساليب مثل توسيع مجموعة بيانات تعليم التعليمات، وزيادة دقة الصورة، وتنظيم استراتيجيات التدريب، وتنظيم الإدخال، وتحسين مشفرات الصورة، وغيرها. ساهمت هذه الأساليب في تمكين نماذج LVLMs من قدرات فهم بصرية قوية من خلال توسيع مجموعة بيانات تعليم التعليمات البصرية ومقياس النموذج. بالإضافة إلى ذلك، تمتلك بعض نماذج LVLMs قدرات فهم بصرية دقيقة مثل فهم المنطقة ومتعددة المناطق، بالإضافة إلى قدرات توجيه بيكسيلية. ومع ذلك، فإن التكلفة الحسابية المرافقة لتوسيع البيانات البصرية والنموذج غالبًا ما تكون عالية جدًا، مما يجعلها تحديًا. من ناحية أخرى، يهدف إطار عمل MoE-LLaVA إلى جعل أبحاث LVLMs أكثر ميسورة التكلفة من خلال الاستفادة من قدرات نماذج MoE.
MoE-LLaVA : الطريقة والهيكل
في جوهره، يتكون إطار عمل MoE-LLaVA من طبقة مشروع بصرية (مulty-layer perceptron)، و مشفر بصرية، وكتلة MoE، وكتلة LLM متعددة، وطبقة تضمين الكلمات.

الهيكل
الجدول التالي يلخص التكوين المفصّل لإطار عمل MoE-LLaVA.

对于 صورة RGB معينة، يتم معالجة الصور بواسطة مشفر الصورة لتحصل على تسلسل من الرموز البصرية، ويتوافق طبقة المشروع البصري مع تسلسل الرموز البصرية إلى الصور الإدخالية. يتم معالجة الإدخالات النصية بواسطة طبقة تضمين الكلمات التي تعيد توجيهها لتحصل على تسلسل الرموز. وفي الوقت نفسه، يربط إطار عمل MoE-LLaVA بين الرموز النصية والبصرية، ويغذيها إلى LLM. ومع ذلك، يتم تدريب الإطار فقط على طبقة المشروع البصري مع نموذج اللغة الكبيرة الذي يتكون من FFN أو شبكات عصبية متقدمة وطبقات الانتباه الذاتي المتعددة. وأخيرًا، يتم تطبيق الاتصالات المتبقية وتطبيقات التطبيع لكل كتلة.
يتابع إطار عمل MoE-LLaVA بتكرار FFN أو شبكات العصبية المتقدمة عدة مرات لتهيئة الخبراء كإجراء تهيئة. يتنبأ الموجه، وهو طبقة خطية، بالاحتمال لكل رمز لتخصيصه إلى كل خبير. يتم معالجة كل رمز بواسطة الخبراء الأعلى -k مع أقصى احتمال، ويتم حساب المجموع المرجح وفقًا لنتائج softmax للاحتمالات. بمجرد تنشيط الخبراء الأعلى -k، يتم إغلاق الخبراء المتبقية، وهو نهج يزود إطار عمل MoE-LLaVA بمسارات خفيفة ممكنة لا حصر لها، وبالتالي يزود النموذج بمجموعة واسعة من القدرات.
MoE-Tuning
MoE-Tuning هي استراتيجية تدريب بسيطة وفعالة تتكون من ثلاث مراحل. يتم تدريب Multilayer Perceptron أو شبكة عصبية متعددة الطبقات التي ت điều chỉnh الرموز البصرية إلى نموذج اللغة الكبيرة في المرحلة الأولى. ثم يتم تدريب جميع معاملات LLM لتمكين نموذج اللغة والرؤية الكبيرة بمقدرات فهم متعددة الأوضاع عامة. وأخيرًا، في المرحلة الثالثة، يتم تكرار FFN أو شبكة العصبية المتقدمة كأوزان ابتدائية للخبراء، ويتدرب فقط على طبقات مزيج الخبراء.
المرحلة 1
في المرحلة الأولى، الهدف الرئيسي هو تعديل الرموز البصرية إلى نموذج اللغة الكبيرة الذي يسمح للنموذج بفهم المثيلات في الصورة. يستخدم إطار عمل MoE-LLaVA Multilayer Perceptron لتعيين الرموز البصرية إلى مجال الإدخال لنموذج اللغة الكبيرة، ويعامل الصور على أنها رموز نصية وهمية. في هذه المرحلة، يتم تدريب LLM على وصف الصور، ولا يتم تطبيق طبقات MoE على LLM خلال هذه المرحلة.
المرحلة 2
في المرحلة الثانية، يحاول إطار عمل MoE-LLaVA تعزيز قدرات الإطار وتحكمه من خلال ضبط النموذج مع بيانات تعليم متعددة الأوضاع. يحقق إطار عمل MoE-LLaVA ذلك من خلال تعديل LLM لتصبح نموذجًا للرؤية واللغة مع قدرات فهم متعددة الأوضاع. يستخدم الإطار تعليمات أكثر تعقيدًا، بما في ذلك التعرف على النص والمنطق البصري، والتي تتطلب من النموذج امتلاك قدرات متعددة الأوضاع أقوى. تقليديًا، يعتبر عملية التدريب للنماذج الكثيفة مكتملة في هذه الخطوة. ومع ذلك، واجه إطار عمل MoE-LLaVA تحديات في تحويل LLM إلى LVLM مع تخفيض LVLM في نفس الوقت. لتحقيق ذلك، يستخدم الإطار أوزان المرحلة كأوزان ابتدائية للمرحلة التالية في محاولة لتخفيف صعوبة تعلم النموذج الخفيف.
المرحلة 3
في المرحلة الثالثة، يتم تكرار شبكة العصبية المتقدمة عدة مرات لتهيئة الخبراء كإجراء تهيئة. ثم يتم تغذية الرموز النصية والبصرية إلى طبقات مزيج الخبراء، ويحسب الموجه الأوزان المطابقة بين الخبراء وكل رمز. يتم معالجة كل رمز بواسطة الخبراء الأعلى -k مع حساب المجموع المرجح وفقًا لنتائج softmax للاحتمالات. بمجرد تنشيط الخبراء الأعلى -k، يتم إغلاق الخبراء المتبقية، وهو نهج يزود إطار عمل MoE-LLaVA بمسارات خفيفة ممكنة لا حصر لها، وبالتالي يزود النموذج بمجموعة واسعة من القدرات.
MoE-LLaVA : النتائج والتحеримات
يستخدم إطار عمل MoE-LLaVA CLIP-Large كمشفر بصرية، مع Multilayer Perceptron يتكون من طبقتين مع طبقة تنشيط GELU تفصل بينهما. افتراضيًا، يستخدم الإطار بديلًا متبادلًا لشبكات العصبية المتقدمة مع طبقات مزيج الخبراء، مما يعني أن طبقات مزيج الخبراء تشكل 50% من إجمالي عدد الطبقات. الجدول التالي يحتوي على مجموعات البيانات المختلفة مع حجم العينة المستخدمة لتدريب وتقييم إطار عمل MoE-LLaVA.

الاستدلال البصري بدون تدريب مسبق
الشكل التالي يظهر أن MoE-LLaVA هو نموذج خفيف مع موجه ناعم يعتمد على LVLM. يتم تقييم الإطار على 5 اختبارات للاستدلال على الصور، ويمكن ملاحظة أن إطار عمل MoE-LLaVA يظهر قدرات فهم بصرية ملحوظة، ويقدم أداءً قابلًا للمقارنة مع نموذج LLaVA 1.5 الحالي على 5 اختبارات مختلفة.

تقييم تحويل الكائنات
للتقييم، يستخدم إطار عمل MoE-LLaVA خط أنابيب تقييم POPE، وهي طريقة استطلاع قائم على التصويت، والنتائج موضحة في الجدول التالي. كما يمكن ملاحظة أن إطار عمل MoE-LLaVA ي 제공 نتائج أقوى من بين جميع الإطارات، مما يشير إلى قدرة الإطار على توليد كائنات متوافقة مع الصورة الإدخالية. بالإضافة إلى ذلك، يُلاحظ أن إطار عمل MoE-LLaVA يوازن بين نسبة النعم جيدًا، مما يشير إلى قدرة النموذج الخفيف على تقديم تغذية راجعة دقيقة للأسئلة المعروضة.

الصورة التالية تحتوي على توزيع أحمال الخبراء، حيث تمثل الخطوط غير المتواصلة توزيعًا متوازنًا للرموز بين الخبراء. يُظهر الشكل الأول حمولة الخبراء، بينما تُظهر الصور المتبقية أداء الخبراء تجاه أوضاع مختلفة.

علاوة على ذلك، يُظهر الشكل التالي توزيع الأوضاع عبر الخبراء المختلفين.

أفكار ختامية
في هذه المقالة، ناقشنا MoE-LLaVA، وهو نموذج أساسي لنماذج اللغة والرؤية الكبيرة مع مزيج من نماذج الخبراء التي تتضمن مسارات خفيفة قابلة للتعلم ومزيج من نماذج الخبراء. في جوهره، يتكون نموذج MoE-LLaVA من مسارات خفيفة متعددة، ويستخدم الإطار هذه المسارات لنقل كل رمز إلى خبراء مختلفين من خلال مسار قابل للتعلم. ثم يتم معالجة الرموز بشكل جماعي بواسطة الخبراء النشطين مع إبقاء المسارات غير النشطة صامتة. ثم يتم تكرار طبقات مزيج الخبراء بشكل متكرر لتوفير مسار خفيف نحو نموذج LVLM أكبر وأقوى. استراتيجية MoE-Tuning تعالج مشكلة تدهور الأداء في تعلم الندرة المتعددة الأوضاع بطريقة مبتكرة، مما يؤدي إلى بناء نموذج مع عدد كبير من المعاملات ولكن مع تكاليف تدريب واستدلال متسقة. وقد تم تصميم هيكل إطار عمل MoE-LLaVA لتنشيط فقط الخبراء الأعلى -k خلال النشر، مع إبقاء الخبراء الآخرين غير نشطين.












