نماذج ومنصات الذكاء الاصطناعي
BlackMamba: خليط من الخبراء لنمذجة الفضاء الحكومي
لقد لعبت تطوير نماذج اللغة الكبيرة (LLMs) المبنية على نماذج الترانسفورمر فقط للفك التشفيري دورًا حاسمًا في تحويل مجال معالجة اللغة الطبيعية (NLP) ، بالإضافة إلى تقدم التطبيقات العميقة المتعددة بما في ذلك تعلم التعزيز ، وتحليل السلاسل الزمنية ، ومعالجة الصور ، وغيرها الكثير. ومع ذلك ، على الرغم من قابليتها للتوسيع وأدائها القوي ، لا تزال نماذج LLMs المبنية على نماذج الترانسفورمر فقط تواجه قيودًا كبيرة. على الرغم من التعبير ، يتطلب آلية الانتباه في نماذج LLMs المشتقة من الترانسفورمر موارد حسابية مكثفة خلال كل من الاستدلال والتدريب ، مما يتطلب ذاكرة تزداد مع طول التسلسل وعمليات حسابية (FLOPs) تزيد بشكل مربع. تُحد هذه المتطلبات الحسابية الكبيرة من طول السياق للنماذج ، وتزيد من تكلفة المهام التوليدية التتابعية مع تصعيد النموذج ، وت妨ئ قدرة النماذج على التعلم من تدفقات البيانات المستمرة ومعالجة تسلسلات بطول غير محدود بكفاءة.
في الآونة الأخيرة ، أظهرت نماذج الفضاء الحكومي (SSMs) قدرات و أداءً ملحوظًا ، حيث تنافست مع نماذج الترانسفورمر في بنanches كبيرة للتطوير ، وتحقيق تعقيد حسابي خطي مع طول التسلسل ووقت خطي. بالإضافة إلى ذلك ، أظهرت نماذج الفضاء الحكومي الحديثة ، بما في ذلك Mamba و RetNet وغيرها ، كفاءة في الاستدلال والتدريب للتسلسلات الطويلة ، إلى جانب أداء تنافسي في مهام نمذجة اللغة مع خصائص تصعيد مماثلة للترانسفورمر. في نفس الوقت ، أظهرت نماذج خليط الخبراء أداءً مبهرًا ، حيث خفضت بشكل كبير من التأخير وتكلفة الحسابات للاستدلال ، على حساب زيادة في بصمة الذاكرة. تعمل نماذج MoE عن طريق تنشيط مجموعة فرعية فقط من المعاملات الإجمالية خلال تمرير واحد إلى الأمام. تستخدم وظيفة التوجيه لتحديد “الخبراء” الذين يتم استدعاؤهم بناءً على السياق المحدد. هذا النهج يخلق فصلًا بين تكلفة الحسابات للاستدلال وعدد المعاملات الإجمالي ، مما يسمح بأداء محسن داخل ميزانية استدلال ثابتة ، على الرغم من زيادة في عدد المعاملات ومتطلبات الذاكرة.
تهدف هذه المقالة إلى تغطية إطار العمل BlackMamba بعمق. سنستكشف آليته و منهجيته و هيكله ، إلى جانب مقارنته بإطارات توليد الصور و الفيديو الحالية. دعونا نبدأ.
BlackMamba : مقدمة في خليط الخبراء لنمذجة الفضاء الحكومي
تطور نماذج اللغة الكبيرة (LLMs) ، وخاصة تلك المبنية على نماذج الترانسفورمر فقط للفك التشفيري ، قد أثر بشكل ملحوظ على مجال معالجة اللغة الطبيعية (NLP) ، وأยาย إلى تطبيقات تعلم sâu متعددة ، بما في ذلك تعلم التعزيز ، وتحليل السلاسل الزمنية ، ومعالجة الصور ، وغيرها. ومع ذلك ، على الرغم من قابليتها للتوسيع وأدائها القوي ، لا تزال نماذج LLMs المبنية على نماذج الترانسفورمر فقط تواجه تحديات ملحوظة. آلية الانتباه ، وهي ميزة رئيسية في نماذج LLMs المبنية على الترانسفورمر ، تتطلب موارد حسابية مكثفة خلال كل من الاستدلال والتدريب.
تم بذل جهود كبيرة في السنوات القليلة الماضية لمواجهة هذه القيود ، وتم تحويل الانتباه إلى وضع بديل للهياكل الكثيفة للترانسفورمر مع نماذج الفضاء الحكومي و نماذج خليط الخبراء. الفائدة الرئيسية التي تتمتع بها نماذج الفضاء الحكومي على نماذج الترانسفورمر هي التعقيد الحسابي الخطي مع طول التسلسل ، على عكس التعقيد المربع الذي تقدمه الترانسفورمر. نظريًا ، يسمح التعقيد الحسابي الخطي بنماذج الفضاء الحكومي بمعالجة تسلسلات أطول من نماذج الترانسفورمر لميزانية معينة من العمليات الحسابية ، و يجعلهم قادرون على توليد تتابعي ثابت الحجم بدون ذاكرة KV.
في الآونة الأخيرة ، تم تطوير نماذج الفضاء الحكومي مثل RWKV و Mamba ، والتي تستخدم نوى مسح متوازي لتحويل العمليات التكرارية بكفاءة إلى وحدات معالجة الرسومات (GPUs) ، وبالتالي تسهل تدريب هياكل جديدة بكفاءة مماثلة لما تحققه نماذج الترانسفورمر. ومع ذلك ، فإن الطبيعة التكرارية لنماذج الفضاء الحكومي كانت السبب في أن هذه النماذج لم تُعتمد بعد على وحدات معالجة الرسومات عالية التماثل.
BlackMamba : الهيكل و المنهجية
نماذج الفضاء الحكومي
تنتمي نماذج الفضاء الحكومي إلى مجموعة من نماذج التسلسلات ذات التعقيد الخطي مع طول التسلسل. يتوافق هيكل نماذج الفضاء الحكومي أكثر مع الشبكات العصبية التكرارية والشبكات العصبية التوليدية بدلاً من هيكل الانتباه ، ويستلهم من نظام ديناميكي مستمر يخلق مساحة 潜伏ية ضمنية. يسمح النظام الديناميكي الخطي بالحسابات المتوازيّة باستخدام مسح ترابطي أو مسح متوازي.
نماذج خليط الخبراء
ت实现 نماذج خليط الخبراء فصلًا بين تكلفة الاستدلال وعدد المعاملات الإجمالي عن طريق تنشيط معاملات فرعية فقط خلال تمرير واحد إلى الأمام. بدلاً من استخدام جميع المعاملات ، توجّه هذه النماذج الرموز إلى خبراء معينين من الشبكات العصبية متعددة الطبقات (MLPs). يُعتقد أن كل خبير يتم تخصيصه لمعالجة نوع معين من الإدخال ، مع آلية توجيه ، وهي شبكة عصبية مضغوطة ، لتحديد الخبير الأكثر ملاءمة لكل رمز.
الهيكل
في جوهره ، يستخدم إطار العمل BlackMamba نموذج ترانسفورمر قياسي يتكون من كتل متداخلة من الشبكات العصبية متعددة الطبقات و كتل الانتباه ، بالإضافة إلى طبقات الانتباه. يُستبدل إطار العمل BlackMamba كتلة الشبكة العصبية متعددة الطبقات في الترانسفورمر بطبقة خبير موجه ، ويستبدل طبقة الانتباه بطبقة نموذج الفضاء الحكومي من Mamba.
التدريب و البيانات
يتم تدريب نموذج BlackMamba على أكثر من 300 مليار رمز في مجموعة بيانات مخصصة ، و يستخدم دالة تنشيط SwiGLU للشبكات العصبية متعددة الطبقات الخبراء. يُتدرب الإطار مع 8 خبراء ، وهو عدد وجدته المطورون أنه التوازن الصحيح بين بصمة الذاكرة وتكلفة الاستدلال للنموذج.
BlackMamba : النتائج
لضمان مقارنة عادلة بين Mamba و BlackMamba ، قام المطورون بتدريب كلا النموذجين بمتغيرات التدريب نفسها على نفس البيانات التدريبية. يمكن لإطار العمل BlackMamba أن يتفوق على كلاً من إطار العمل Mamba و نماذج الترانسفورمر في كل من تدريب FLOPs و استدلال مع حجم نموذج تمرير إلى الأمام متطابق.
الخاتمة
في هذه المقالة ، تحدثنا عن BlackMamba ، وهي هيكلة جديدة تجمع بين نموذج الفضاء الحكومي من Mamba و نماذج خليط الخبراء للاستفادة من الفوائد التي تقدمها كلا الإطارين. أظهرت التجارب على BlackMamba khảيته على تفوق إطار العمل Mamba الحالي و نماذج الترانسفورمر في كل من تدريب FLOPs و استدلال. الأداء الاستثنائي لإطار العمل BlackMamba يظهر أنه يمكنه دمج قدرات إطار العمل Mamba و نماذج خليط الخبراء بشكل استثنائي ، حيث يجمع بين الاستدلال السريع و الرخيص من نماذج خليط الخبراء مع التوليد الخطي التعقيد من Mamba.












