نماذج ومنصات الذكاء الاصطناعي

Uni-MoE: توسيع نماذج اللغة الكبيرة المتعددة الوسائط الموحدة باستخدام مزيج من الخبراء

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أبرز التطورات الحديثة في بنية وأداء نماذج اللغة الكبيرة المتعددة الوسائط أو MLLMs أهمية البيانات والنماذج القابلة للتوسيع لتحسين الأداء. على الرغم من أن هذا النهج يعزز الأداء ، إلا أنه يتطلب تكاليف حسابية كبيرة تقلل من الواقعية والقابلية للاستخدام لهذه النهج. على مدار السنوات ، ظهرت نماذج مزيج من الخبراء أو MoE كنهج بديل ناجح لتوسيع نماذج الصور والنصوص واللغة الكبيرة بشكل فعال ، حيث أن نماذج مزيج من الخبراء لديها تكاليف حسابية منخفضة وأداء قوي. ومع ذلك ، على الرغم من مزاياها ، لا تعتبر نماذج مزيج من الخبراء نهجًا مثاليًا لتوسيع نماذج اللغة الكبيرة ، لأنها غالبًا ما تتضمن خبراء أقل ووسائط محدودة ، مما يحد من التطبيقات.

لمواجهة العوائق التي تواجه النهج الحالية ، وتوسيع نماذج اللغة الكبيرة بشكل فعال ، في هذه المقالة ، سنناقش Uni-MoE ، وهو نموذج لغة كبير متعددة الوسائط موحد مع بنية مزيج من الخبراء أو MoE قادرة على التعامل مع مجموعة واسعة من الوسائط والخبراء. كما يطبق إطار Uni-MoE بنية مزيج من الخبراء النشطة داخل نماذج اللغة الكبيرة في محاولة لجعل عملية التدريب والاستدلال أكثر كفاءة من خلال توظيف موازاة الخبراء على مستوى النموذج وموازاة البيانات. بالإضافة إلى ذلك ، لتعزيز التعميم وتعاون الخبراء المتعددين ، يقدم إطار Uni-MoE استراتيجية تدريبية تدريجية وهي مزيج من ثلاثة عمليات مختلفة. في الأولى ، يتحقق إطار Uni-MoE من محاذاة الوسائط المتعددة باستخدام موصلات مختلفة مع بيانات الوسائط المتعددة المختلفة. ثانيًا ، يactivate إطار Uni-MoE تفضيل مكونات الخبراء من خلال تدريب خبراء محددين بالوسائط مع بيانات تعليمية متعددة الوسائط. أخيرًا ، يطبق نموذج Uni-MoE تقنية التعلم التكيفي منخفض الرتبة أو LoRA على بيانات تعليمية متعددة الوسائط مختلطة لتعديل النموذج. عند تقييم إطار Uni-MoE المعدل على مجموعة شاملة من مجموعات بيانات متعددة الوسائط ، أظهرت النتائج التجريبية الواسعة المزايا الرئيسية لإطار Uni-MoE في تقليل انحياز الأداء في التعامل مع مجموعات بيانات متعددة الوسائط المختلطة بشكل كبير. كما أشارت النتائج إلى تحسن كبير في تعاون الخبراء المتعددين والتعميم.

يهدف هذا المقال إلى تغطية إطار Uni-MoE بالتفصيل ، ونستكشف آليته و منهجيته وهندسته جنبًا إلى جنب مع مقارنته بالنهج الحالية. لذا دعونا نبدأ.

Uni-MoE: توسيع نماذج اللغة الكبيرة المتعددة الوسائط الموحدة

أبرز ظهور نماذج اللغة الكبيرة المتعددة الوسائط المفتوحة ، بما في ذلك LLama و InstantBlip ، النجاح الملحوظ والتقدم في المهام المتعلقة بفهم الصور والنصوص على مدار السنوات القليلة الماضية. بالإضافة إلى ذلك ، تعمل مجتمع الذكاء الاصطناعي بنشاط على بناء نموذج لغة كبير متعددة الوسائط موحد يمكنه استيعاب مجموعة واسعة من الوسائط ، بما في ذلك الصور والنصوص والصوت والفيديو والمزيد ، متجاوزًا نمط الصور والنصوص التقليدي. يتبع مجتمع المصدر المفتوح نهجًا شائعًا لتعزيز قدرات نماذج اللغة الكبيرة المتعددة الوسائط ، وهو زيادة حجم نماذج الأساس الرؤية وتكاملها مع نماذج اللغة الكبيرة ذات مليارات المعلمات ، واستخدام مجموعات بيانات متعددة الوسائط المتنوعة لتعزيز تعليم التوجيه. أبرزت هذه التطورات القدرة المتزايدة لنماذج اللغة الكبيرة المتعددة الوسائط على التفكير ومعالجة الوسائط المتعددة ، مما يظهر أهمية توسيع بيانات التوجيه المتعددة الوسائط وقابلية نمذجة.

على الرغم من أن توسيع نموذج هو نهج مجرب يولد نتائج ملحوظة ، فإن توسيع نموذج هو عملية حسابية مكلفة للغاية لكل من عمليات التدريب والاستدلال.

لمواجهة مشكلة التكاليف الحسابية العالية ، يتجه مجتمع المصدر المفتوح إلى دمج هندسة مزيج من الخبراء أو MoE في نماذج اللغة الكبيرة لتعزيز كفاءة التدريب والاستدلال. على عكس نماذج اللغة الكبيرة المتعددة الوسائط ونماذج اللغة الكبيرة التي تستخدم جميع المعلمات المتاحة لمعالجة كل إدخال ، مما يؤدي إلى نهج حسابي كثيف ، فإن هندسة مزيج من الخبراء تتطلب من المستخدمين فقط تنشيط مجموعة فرعية من معلمات الخبراء لكل إدخال. وبالتالي ، يظهر نهج مزيج من الخبراء كطريق قابل للتوسيع لتعزيز كفاءة النماذج الكبيرة دون تنشيط معلمات واسعة النطاق وتكاليف حسابية عالية.

Uni-MoE هو نموذج لغة كبير متعددة الوسائط يعتمد على نماذج مزيج من الخبراء النشطة لتحليل وإدارة الوسائط المتعددة في محاولة لاستكشاف توسيع نماذج اللغة الكبيرة المتعددة الوسائط الموحدة مع هندسة مزيج من الخبراء. كما هو موضح في الصورة التالية ، يحصل إطار Uni-MoE على ترميز الوسائط المختلفة باستخدام مشفرات محددة بالوسائط ، ثم ي ánhة هذه الترميزات إلى مساحة التمثيل اللغوي لنماذج اللغة الكبيرة باستخدام موصلات مصممة مختلفة. تحتوي هذه الموصلات على نموذج تحويل قابل للتدريب مع مشاريع خطية لاحقة لاستخراج ومشروع تمثيلات الإخراج للمشفر المجمد. ثم يقدم إطار Uni-MoE طبقات مزيج من الخبراء النشطة داخل الكتلة الداخلية لنموذج اللغة الكبيرة الكثيف. ونتيجة لذلك ، يحتوي كل كتلة مزيج من الخبراء على طبقة انتباه ذاتي مشتركة قابلة للتطبيق على جميع الوسائط ، ومتحكم تنشيط الخبراء على مستوى الرمز ، وخبراء متنوعين بناءً على شبكة تغذية إلى الأمام. بفضل هذا النهج ، يمكن لإطار Uni-MoE فهم الوسائط المتعددة ، بما في ذلك الكلام والصوت والنص والفيديو والصورة ، ويتطلب فقط تنشيط معلمات جزئية أثناء الاستدلال.

علاوة على ذلك ، لتعزيز تعاون الخبراء المتعددين والتعميم ، يطبق إطار Uni-MoE استراتيجية تدريبية ثلاثية المراحل. في المرحلة الأولى ، يستخدم الإطار أزواج صورة / صوت / كلام إلى لغة لتدريب الموصلات المقابلة بسبب التمثيل الموحد للوسائط في مساحة اللغة من نموذج اللغة الكبيرة. ثانيًا ، يتدرب نموذج Uni-MoE خبراء محددين بالوسائط باستخدام مجموعات بيانات متعددة الوسائط بشكل منفصل في محاولة لتعدين مهارات كل خبير داخل نطاقه. في المرحلة الثالثة ، يدمج إطار Uni-MoE الخبراء المدربين في طبقة مزيج من الخبراء من نموذج اللغة الكبيرة ، ويدرب إطار Uni-MoE الكامل مع بيانات تعليمية متعددة الوسائط مختلطة. لتعزيز التكلفة التدريبية بشكل أكبر ، يطبق إطار Uni-MoE نهج التعلم LoRA لتعديل طبقات الانتباه الذاتي وخبراء ما قبل التعدين.

Uni-MoE : منهجية وهندسة

الدافع الأساسي وراء إطار Uni-MoE هو التكلفة الحسابية العالية لنمذجة نماذج اللغة الكبيرة المتعددة الوسائط ، بالإضافة إلى كفاءة نماذج مزيج من الخبراء ، واستكشاف إمكانية إنشاء نموذج لغة كبير متعددة الوسائط موحد فعال وقوي باستخدام هندسة مزيج من الخبراء. يظهر الشكل التالي تمثيلاً لهندسة المطبقة في إطار Uni-MoE ، مع تصميم يضم مشفرات فردية للوسائط المختلفة جنبًا إلى جنب مع موصلاتها المقابلة.

يدمج إطار Uni-MoE بعد ذلك هندسة مزيج من الخبراء مع كتل نموذج اللغة الكبيرة الأساسية ، وهو عملية حاسمة لتعزيز كفاءة التدريب والاستدلال بشكل عام. يتحقق إطار Uni-MoE من ذلك من خلال تطبيق آلية التوجيه النشطة. يمكن تقسيم عملية التدريب الكلية لإطار Uni-MoE إلى ثلاث مراحل: محاذاة الوسائط المتعددة ، وتدريب خبراء محددين بالوسائط ، وضبط Uni-MoE باستخدام مجموعة متنوعة من مجموعات بيانات التوجيه المتعددة الوسائط. لتحويل مدخلات الوسائط المتنوعة بشكل فعال إلى تنسيق لغوي ، يبني إطار Uni-MoE على LLaVA ، وهو إطار لغوي مرئي مسبق التدريب. يدمج نموذج LLaVA الأساسي CLIP كمشفر مرئي ، جنبًا إلى جنب مع طبقة مشروع خطي يُستخدم لتحويل ميزات الصورة إلى رموز صورة ناعمة. بالإضافة إلى ذلك ، لمعالجة المحتوى المرئي ، يختار إطار Uni-MoE ثماني إطارات ممثلة من كل فيديو ، ويتحولها إلى رموز فيديو عن طريق التجميع المتوسط لدمج تمثيلها القائم على الصورة أو الإطار. لأداء المهام الصوتية ، يُشرع إطار Uni-MoE مشفرين ، BEATs ومشفر Whisper ، لتعزيز استخراج الميزات. ثم يُستخلص نموذج Uni-MoE متجه ميزات الصوت وخطاب ثابت الطول ، ويتحولها إلى رموز كلام ورموز صوت ناعمة من خلال طبقة مشروع خطي.

استراتيجية التدريب

يقدم إطار Uni-MoE استراتيجية تدريبية تدريجية لتطوير نموذج متزايد. تهدف استراتيجية التدريب التدريجي إلى استغلال القدرات الفريدة للخبراء المختلفين ، وتعزيز كفاءة تعاون الخبراء المتعددين ، وزيادة قابلية نموذج الإطار العام. يتم تقسيم عملية التدريب إلى ثلاث مراحل في محاولة لتحقيق هيكل MLLM مبني على مزيج من الخبراء المتكاملين.

المرحلة 1 : محاذاة الوسائط المتعددة

في المرحلة الأولى ، ي попыт إطار Uni-MoE إلى إنشاء اتصال بين اللغويات والوسائط المختلفة. يتحقق إطار Uni-MoE من ذلك عن طريق ترجمة بيانات الوسائط إلى رموز ناعمة من خلال بناء موصلات. الهدف الرئيسي للمرحلة الأولى من التدريب هو تقليل فقدان الترميز التوليدي. في إطار Uni-MoE ، يتم تحسين نموذج اللغة الكبيرة لإنشاء وصفات للمدخلات عبر الوسائط المختلفة ، ويتعرض النموذج فقط للموصلات للتدريب ، وهو استراتيجية تمكن إطار Uni-MoE من دمج الوسائط المختلفة في إطار لغوي موحد.

المرحلة 2: تدريب خبراء محددين بالوسائط

في المرحلة الثانية ، يركز إطار Uni-MoE على تطوير خبراء منفردون بالوسائط من خلال تدريب النموذج بشكل مكرس على بيانات الوسائط المتعددة المحددة. الهدف الرئيسي هو تعدين مهارات كل خبير داخل نطاقه ، وبالتالي تعزيز الأداء العام لنظام مزيج من الخبراء على مجموعة واسعة من البيانات المتعددة الوسائط. بالإضافة إلى ذلك ، يُعد إطار Uni-MoE شبكات التغذية إلى الأمام لتحاذيها بشكل أوثق مع خصائص الوسائط ، مع الحفاظ على فقدان الترميز التوليدي كعامل تدريب رئيسي.

المرحلة 3: ضبط Uni-MoE

في المرحلة الثالثة والأخيرة ، يدمج إطار Uni-MoE الأوزان المعدلة من قبل الخبراء خلال المرحلة 2 في طبقات مزيج من الخبراء. ثم يُعد إطار Uni-MoE نموذج MLLM باستخدام بيانات تعليمية متعددة الوسائط مختلطة بشكل مشترك. المنحنيات الفقد في الصورة التالية تعكس تقدم عملية التدريب.

أظهرت التحليلات المقارنة بين تكوينات مزيج من الخبراء أن الخبراء الذين قام النموذج بتعدينهم خلال المرحلة التدريبية 2 أظهرت استقرارًا محسّنًا ووصلت إلى الانحدار بشكل أسرع على مجموعات بيانات متعددة الوسائط. بالإضافة إلى ذلك ، في المهام التي تتضمن بيانات متعددة الوسائط معقدة ، بما في ذلك النص والصور والصوت والفيديو ، أظهر إطار Uni-MoE أداء تدريبي أكثر ثباتًا وتنوعًا في الفقدان عند استخدام أربعة خبراء أكثر من استخدام خبراء اثنين.

Uni-MoE : التجارب والنتائج

يوجز الجدول التالي المواصفات المعمارية لإطار Uni-MoE. الهدف الرئيسي لإطار Uni-MoE ، الذي يعتمد على هيكل LLaMA-7B ، هو توسيع حجم النموذج.

يوجز الجدول التالي تصميم وتنظيم إطار Uni-MoE كما هو موضح في المهام التدريبية المتخصصة. هذه المهام حاسمة في تعدين قدرات طبقات MLP ، وبالتالي استغلال معرفتهم المتخصصة لتحسين أداء النموذج. يقوم إطار Uni-MoE بثمانية مهام خبراء منفردة لتوضيح الآثار المختلفة لأساليب التدريب المختلفة.

يُقيم النموذج أداء متغيرات النموذج المختلفة عبر مجموعة شاملة من المعايير التي تشمل مهام فهم الفيديو ، وثلاثة مهام فهم الصوت ، وخمسة مهام متعلقة بالكلام. أولًا ، يُختبر النموذج على قدرته على فهم المهام المتعلقة بالكلام والصورة والنص ، والنتائج محتواة في الجدول التالي.

كما يمكن ملاحظة أن نماذج الأساس السابقة تُنتج نتائج أقل على مهام فهم الكلام ، مما يؤثر على أداء المهام المتعلقة بفهم الصورة والكلام. تشير النتائج إلى أن إدخال هندسة مزيج من الخبراء يمكن أن يعزز قابلية نمذجة MLLM على مهام منطقية غير مرئية للصور والصوت.

أفكار ختامية

في هذه المقالة ، ناقشنا إطار Uni-MoE ، وهو نموذج لغة كبير متعددة الوسائط موحد مع بنية مزيج من الخبراء أو MoE قادرة على التعامل مع مجموعة واسعة من الوسائط والخبراء. كما يطبق إطار Uni-MoE بنية مزيج من الخبراء النشطة داخل نماذج اللغة الكبيرة في محاولة لجعل عملية التدريب والاستدلال أكثر كفاءة. بالإضافة إلى ذلك ، لتعزيز التعميم وتعاون الخبراء المتعددين ، يقدم إطار Uni-MoE استراتيجية تدريبية تدريجية وهي مزيج من ثلاثة عمليات مختلفة. في الأولى ، يتحقق إطار Uni-MoE من محاذاة الوسائط المتعددة باستخدام موصلات مختلفة مع بيانات الوسائط المتعددة المختلفة. ثانيًا ، يactivate إطار Uni-MoE تفضيل مكونات الخبراء من خلال تدريب خبراء محددين بالوسائط مع بيانات تعليمية متعددة الوسائط. أخيرًا ، يطبق نموذج Uni-MoE تقنية التعلم التكيفي منخفض الرتبة أو LoRA على بيانات تعليمية متعددة الوسائط مختلطة لتعديل النموذج.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.