أساسيات الذكاء الاصطناعي

صعود المixture-of-Experts: كيف تقوم نماذج الذكاء الاصطناعي النادرة بتشكيل مستقبل التعلم الآلي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Mixture-of-Experts (MoE) هي نماذج تقوم بثورة في طريقة توسيع نطاق الذكاء الاصطناعي. من خلال تفعيل جزء فقط من مكونات النموذج في أي وقت معين، تقدم MoEs نهجًا جديدًا لإدارة التبادل بين حجم النموذج وэффективية الحوسبة. على عكس النماذج الكثيفة التقليدية التي تستخدم جميع المعاملات لكل إدخال، تحقق MoEs أعدادًا هائلة من المعاملات مع الحفاظ على تكاليف الاستدلال والتدريب تحت السيطرة. هذا الابتكار أطلق موجة من البحث والتطوير، مما أدى إلى استثمار كلاً من العمالقة التكنولوجية والشركات الناشئة بشكل كبير في الهياكل القائمة على MoE.

كيف تعمل نماذج Mixture-of-Experts

في جوهرها، تتكون نماذج MoE من شبكات فرعية متخصصة متعددة تسمى “خبراء”، تتم إدارتها بواسطة آلية بوابة تقرر أي خبراء يجب أن يتعاملوا مع كل إدخال. على سبيل المثال، قد يتم تمرير جملة إلى نموذج لغة قد يتعامل فقط مع خبراء اثنين من بين ثمانية خبراء، مما يقلل بشكل كبير من عبء الحوسبة.

تم تقديم هذا المفهوم إلى السوق الرئيسية مع نماذج Switch Transformer و GLaM من جوجل، حيث استبدل الخبراء الطبقات الأمامية التقليدية في النماذج Transformer. على سبيل المثال، نموذج Switch Transformer يقوم بتوجيه الرموز إلى خبير واحد لكل طبقة، بينما يستخدم نموذج GLaM التوجيه الأعلى لتحسين الأداء. أظهرت هذه التصاميم أن MoEs يمكن أن تتطابق أو تتفوق على النماذج الكثيفة مثل GPT-3 بينما تستخدم كمية أقل بكثير من الطاقة والحوسبة.

الابتكار الرئيسي يكمن في الحوسبة الشرطية. بدلاً من تشغيل النموذج كله، تقوم MoEs بتشغيل فقط الأجزاء الأكثر صلة، مما يعني أن نموذجًا به مئات المليارات أو حتى تريليونات المعاملات يمكن أن يعمل بفعالية نموذج أصغر بكثير. هذا يسمح للباحثين بتوسيع القدرة دون زيادة الحوسبة بشكل خطي، وهو إنجاز غير قابل للتحقيق مع طرق التوسيع التقليدية.

التطبيقات العملية لنماذج MoE

لقد تركت نماذج MoE بالفعل بصمتها عبر عدة مجالات. أظهرت نماذج GLaM و Switch Transformer من جوجل نتائج على مستوى الدولة في نمذجة اللغة مع تكاليف تدريب واستدلال أقل. نموذج Z-Code MoE من مايكروسوفت يعمل في أداة الترجمة، حيث يتعامل مع أكثر من 100 لغة بدقة وأمان أفضل من النماذج السابقة. هذه ليست مشاريع بحثية فحسب، بل هي تقنيات تعمل في الخدمات الحية.

في رؤية الكمبيوتر، تحسنت دقة التصنيف في بنى مثل V-MoE و LIMoE في مهام متعددة مثل الصور والنص. القدرة على تخصيص الخبراء – بعضهم يتعامل مع النص والآخر مع الصور – تضيف طبقة جديدة من القدرة على أنظمة الذكاء الاصطناعي.

كما استفادت أنظمة التوصية و منصات التعلم المتعددة من نماذج MoE. على سبيل المثال، استخدم محرك التوصية على يوتيوب بنية تشبه MoE لتعامل مع أهداف مثل وقت المشاهدة و معدل النقر بشكل أكثر كفاءة. من خلال تعيين خبراء مختلفين لمهام أو سلوكيات مستخدم مختلفة، تساعد MoEs في بناء محركات شخصيّة أكثر متانة.

الفوائد والتحديات

الميزة الرئيسية لنماذج MoE هي الفعالية. تسمح بتدريب و نشر نماذج ضخمة مع تقليل الحوسبة بشكل كبير. على سبيل المثال، نموذج Mixtral 8×7B من Mistral AI يحتوي على 47 مليار معامل، لكنه يفعّل فقط 12.9 مليار معامل لكل رمز، مما يمنحه فعالية تكلفة نموذج 13 مليار معامل بينما يتنافس مع نماذج مثل GPT-3.5 في الجودة.

نماذج MoE تعزز التخصص. بسبب khảية خبراء مختلفين لتعلم أنماط مختلفة، يصبح النموذج ككل أفضل في التعامل مع إدخالات متنوعة. هذا مفيد بشكل خاص في المهام متعددة اللغات أو المجالات أو الوسائط حيث قد يؤدي نموذج كثيف واحد الحجم إلى الأداء الضعيف.

然而، تأتي نماذج MoE مع تحديات هندسية. يتطلب تدريبها توازن دقيق لضمان استخدام جميع الخبراء بشكل فعال. كما أن الحمل الزائد على الذاكرة هو mối quan ngại أخرى – بينما يتم تفعيل جزء فقط من المعاملات لكل استدلال، يجب تحميل جميع المعاملات إلى الذاكرة. توزيع الحوسبة بفعالية عبر وحدات معالجة الرسومات أو وحدات معالجة التنسور ليست بسيطة وقد أدت إلى تطوير إطارات عمل متخصصة مثل DeepSpeed من مايكروسوفت و GShard من جوجل.

尽管 هذه العوائق، فإن الفوائد في الأداء والتكلفة كبيرة بما يكفي لجعل MoEs تعتبر الآن مكونًا حاسمًا في تصميم الذكاء الاصطناعي على نطاق كبير. مع نضج المزيد من الأدوات والبنية التحتية، يتم التغلب على هذه التحديات تدريجيًا.

كيف تقارن MoE بالطرق الأخرى لتوسيع النطاق

توسيع النماذج الكثيفة التقليدية يزيد من حجم النموذج والحوسبة بشكل متناسب. تقوم MoEs بتقسيم هذه الخطية من خلال زيادة المعاملات الإجمالية دون زيادة الحوسبة لكل إدخال. هذا يسمح بنماذج تحتوي على تريليونات المعاملات أن تتدرب على نفس الأجهزة التي كانت مقيدة سابقًا بالعشرات من المليارات.

بالمقارنة مع تمثيل النماذج، الذي يقدم أيضًا تخصصًا ولكنه يتطلب عدة تمريرات كاملة للموديل، فإن MoEs أكثر فعالية. بدلاً من تشغيل عدة نماذج بالتوازي، تقوم MoEs بتشغيل نموذج واحد فقط – ولكن مع فائدة مسارات الخبراء المتعددة.

نماذج MoE cũng تكمّل استراتيجيات مثل توسيع بيانات التدريب (مثل طريقة Chinchilla). في حين تؤكد Chinchilla على استخدام المزيد من البيانات مع نماذج أصغر، تقوم MoEs بتوسيع سعة النموذج مع الحفاظ على استقرار الحوسبة، مما يجعلها مثالية للحالات التي تكون فيها الحوسبة هي العائق.

أخيرًا، في حين تقنيات مثل التقليم و الكمية تقلل من حجم النماذج بعد التدريب، تقوم MoEs بزيادة سعة النموذج خلال التدريب. إنها ليست بديلاً عن الانضغاط، بل أداة متعامدة لنمو فعال.

الشركات التي تقود ثورة MoE

العمالقة التكنولوجية

جوجل رائدة في البحث الحالي حول MoE. نموذجي Switch Transformer و GLaM قد توسعا إلى 1.6 تريليون و 1.2 تريليون معامل على التوالي. نموذج GLaM قد متطابق مع أداء GPT-3 بينما يستخدم فقط ثلث الطاقة. جوجل قد طبقت MoEs أيضًا على الرؤية (V-MoE) و المهام متعددة الوسائط (LIMoE)، مما يتوافق مع رؤية Pathways الأوسع لنماذج الذكاء الاصطناعي الشاملة.

مايكروسوفت قد دمجت MoE في الإنتاج من خلال نموذج Z-Code في مترجم مايكروسوفت. كما طورت DeepSpeed-MoE، مما يسمح بتدريب سريع و استدلال منخفض التأخير لنماذج تحتوي على تريليونات المعاملات. مساهماتهم تشمل خوارزميات التوجيه و مكتبة Tutel للحوسبة الفعالة على MoE.

ميتا قد استكشفت MoEs في نماذج اللغة الكبيرة و أنظمة التوصية. نموذج MoE 1.1 تريليون معامل قد أظهر أنه يمكن أن يتطابق مع جودة النموذج الكثيف باستخدام 4 أضعاف أقل من الحوسبة. بينما نماذج LLaMA كثيفة، يستمر بحث ميتا في MoE لتقديم معلومات إلى المجتمع الأوسع.

أمازون تدعم MoEs من خلال منصة SageMaker و الجهود الداخلية. ساهمت في تدريب نموذج Mixtral و يُزعم أنها تستخدم MoEs في خدمات مثل Alexa AI. توثيق AWS يروج بنشاط لـ MoEs لتدريب النماذج على نطاق كبير.

هواوي و BAAI في الصين قد طورا أيضًا نماذج MoE سجلت أرقامًا قياسية مثل PanGu-Σ (1.085 تريليون معامل). هذا يبرز إمكانات MoE في اللغة و المهام متعددة الوسائط و يسلط الضوء على جاذبيتها العالمية.

الشركات الناشئة و المتحدين

Mistral AI هي الرائدة في الابتكار في MoE في المصدر المفتوح. نماذجها Mixtral 8×7B و 8×22B قد أثبتت أن MoEs يمكن أن تتفوق على النماذج الكثيفة مثل LLaMA-2 70B بينما تعمل عند جزء من التكلفة. مع أكثر من 600 مليون يورو في التمويل، Mistral ت đặt رهان كبير على الهياكل النادرة.

xAI، التي أسسها إيلون ماسك، تُreported أن تكون تستكشف MoEs في نموذج Grok. بينما تكون التفاصيل محدودة، تقدم MoEs وسيلة للشركات الناشئة مثل xAI للتنافس مع اللاعبين الأكبر بدون الحاجة إلى حوسبة ضخمة.

Databricks، من خلال استحواذها على MosaicML، قد أطلقت DBRX، نموذج MoE مفتوح المصدر مصمم للفعالية. كما تقدم البنية التحتية و وصفات لتدريب MoE، مما يقلل من عتبة الاستخدام.

لاعبون آخرون مثل Hugging Face قد دمجوا دعم MoE في مكتباتهم، مما يجعل من السهل على المطورين بناء نماذج عليها. حتى لو لم يبنوا MoEs بأنفسهم، المنصات التي تمكنهم هي أساسية للنظام البيئي.

الخلاصة

نماذج Mixture-of-Experts ليست مجرد اتجاه – إنها تمثل تحولًا جوهريًا في كيفية بناء ونطاق أنظمة الذكاء الاصطناعي. من خلال تفعيل أجزاء فقط من الشبكة، تقدم MoEs قوة نماذج ضخمة دون التكلفة المحظورة. مع تقدم البنية التحتية و تحسين خوارزميات التوجيه، فإن MoEs في وضع جيد لتصبح الهيكل القائم افتراضيًا لأنظمة الذكاء الاصطناعي متعددة المجالات و اللغات و الوسائط.

سواء كنت باحثًا أو مهندسًا أو مستثمرًا، فإن MoEs تقدم نظرة على مستقبل حيث يكون الذكاء الاصطناعي أكثر قوة و فعالية و مرونة من أي وقت مضى.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.