نماذج ومنصات الذكاء الاصطناعي
أقوى نموذج لغة مفتوح المصدر حتى الآن: ميتا لاما 3.1-405B
لاما 3.1-405B، الذي تم تطويره بواسطة ميتا آي آي، يمثل قفزة كبيرة إلى الأمام في نماذج اللغة المفتوحة المصدر. مع 405 مليار معامل، يُعتبر أكبر نموذج لغة متاح بشكل عام حتى الآن، ويتجاوز بعض النماذج المملوكة الأكثر تقدمًا في بعض الاختبارات.
الميزات الرئيسية:
- 405 مليار معامل
- طول سياق 128 كيلو توكن
- دعم متعدد اللغات (8 لغات)
- إصدار محسّن للتعليمات
- مفتوح المصدر برخصة مرنة
إطلاق نموذج قوي مثل هذا في المجال المفتوح المصدر هو مغير للعبة، ويمكّن الوصول إلى قدرات الذكاء الاصطناعي المتقدمة، ويعزز الابتكار في جميع أنحاء الصناعة.
هيكل النموذج و التدريب
العمليات تبدأ بتحويل رموز الإدخال إلى تمثيلات رموز. تمر هذه التمثيلات عبر طبقات متعددة من الانتباه الذاتي وشبكات التغذية الأمامية، مما يسمح للنموذج بتقاط العلاقات المعقدة والاعتماديات داخل النص. آليّة التشفير التلقائي ثم توليد رموز النص الإخراج، مما يكمّل العملية.

-
انتباه الاستعلام المجمّع (GQA)
يستخدم لاما 3.1 انتباه الاستعلام المجمّع، وهو تقنية تحسين importante لا يتم تغطيتها بشكل كامل في الإجابة السابقة. دعونا نستكشف ذلك بالتفصيل:
انتباه الاستعلام المجمّع (GQA) هو متغير من انتباه متعدد الرؤوس يهدف إلى تقليل التكاليف الحسابية واستخدام الذاكرة أثناء الاستدلال، خاصة للتسلسلات الطويلة. في نموذج لاما 3.1 405B، يتم تنفيذ GQA مع 8 رؤوس قيمة-مفتاح.
هنا كيف يعمل GQA:
- بدلاً من وجود مشاريع مفتاح وقيمة منفصلة لكل رأس انتباه، يتم تجميع GQA لمجموعة من رؤوس الاستعلام لمشاركة نفس الرؤوس المفتاحية والقيمة.
- يقلّل هذا التجميع بشكل كبير من عدد المعاملات في مشاريع المفتاح والقيمة، مما يؤدي إلى حجم نموذج أصغر وسرعة استدلال أسرع.
- يمكن التعبير عن حساب الانتباه على النحو التالي:
انتباه(Q, K, V) = softmax(QK^T / sqrt(d_k))Vحيث Q يتم تجميعها في g مجموعات، وK وV لها رؤوس أقل من Q.
المنافع من GQA في لاما 3.1 405B تشمل:
- تقليل بصمة الذاكرة: معاملات مفتاح وقيمة أقل تعني ذاكرة أقل مطلوبة لتخزين معاملات النموذج.
- استدلال أسرع: مع حسابات أقل مطلوبة لمشاريع المفتاح والقيمة، يتم تحسين سرعة الاستدلال.
- اداء محفوظ: على الرغم من تقليل المعاملات، تم إثبات أن GQA يحافظ على أداء مماثل لانتباه متعدد الرؤوس في العديد من المهام.
-
التدريب المسبق بمرحلتين لسياق موسّع
يُذكر المقال عملية تدريب مسبق بمرحلتين لتحقيق نافذة سياق 128 كيلو توكن. هذا هو جانب حاسم من قدرات لاما 3.1 405B:
المرحلة 1: التدريب المسبق الأولي على 8 كيلو توكن
- يتم تدريب النموذج أولاً على تسلسلات تصل إلى 8 كيلو توكن.
- تسمح هذه المرحلة للنموذج بتعلم فهم اللغة العامة وخصائص التوليد.
المرحلة 2: استمرار التدريب المسبق لتوسيع السياق
- بعد التدريب الأولي، يخضع النموذج لتدريب مسبق مستمر لزيادة طول السياق إلى 128 كيلو توكن.
- تتضمن هذه المرحلة نظم تدريب محسّنة بعناية لمساعدة النموذج على تعميم التسلسلات الأطول دون فقدان القدرة على التعامل مع السياقات الأقصر.
-
القدرات المتعددة الوسائط
في حين تطرق الإجابة السابقة إلى القدرات المتعددة الوسائط، يمكننا التوسع في كيفية تنفيذ لاما 3.1 405B لهذا:
نهج تركيبي:
- يستخدم لاما 3.1 405B مشفرات منفصلة للوسائط المختلفة (مثل الصور، الكلام).
- تتحول هذه المشفرات الإدخال من مختلف الوسائط إلى مساحة تعبير مشتركة يمكن للنموذج اللغوي فهمها.
التكامل مع النموذج اللغوي:
- تُغذى مخرجات هذه المشفرات المتخصصة إلى النموذج اللغوي الرئيسي.
- يسمح هذا لاما 3.1 405B بمعالجة وفهم أنواع مختلفة من البيانات في نفس الوقت، مما يُمكّنه من أداء مهام تتضمن عدة وسائط.
آليات الانتباه المتقاطع:
- من المحتمل أن يستخدم لاما 3.1 405B آليات انتباه متقاطع للتعامل مع دمج الوسائط المختلفة.
- تسمح هذه الآليات للنموذج بالانتباه إلى المعلومات ذات الصلة من الوسائط المختلفة عند توليد النص أو أداء مهام أخرى.
تفتح القدرات المتعددة الوسائط لاما 3.1 405B مجالات تطبيق واسعة، مثل:
- تعريف الصور والاستفسار البصري
- نص إلى كلام مع فهم سياقي
- مهام المنطق المتعددة الوسائط التي تجمع بين النص والصور وربما أنواع بيانات أخرى
تفاصيل التدريب
- تم تدريبه على أكثر من 15 تريليون توكن
- مجموعة معالجات رسومات مخصصة مع 39.3 مليون ساعة معالج رسومات للنموذج 405B
- تحضير بيانات متنوع لتحقيق القدرات متعددة اللغات
خضع الإصدار المحسّن للتعليمات لتدريب إضافي:
- تم ضبطه على مجموعات بيانات تعليمية متاحة بشكل عام
- أكثر من 25 مليون مثال تم إنشاؤه اصطناعيًا
- التدريب المحدد الخفيف (التعلم بالتعزيز مع ملاحظات بشرية)
مقاييس الأداء
الجدول يقارن لاما 3.1 405B، Nemotron 4 340B Instruct، GPT-4 (0125)، GPT-4 Omni، وClaude 3.5 Sonnet. تشمل المقاييس الرئيسية مهام عامة مثل MMLU وIFEval، مهام برمجية مثل HumanEval وGSM8K، و مهام منطقية مثل ARC Challenge. يعكس كل نمط مقياس أداء النموذج في فهم وتوليد نص شبيه بالبشر، وحل المشكلات المعقدة، وتنفيذ البرمجيات. يُظهر لاما 3.1 405B وClaude 3.5 Sonnet أداء متقدم في العديد من المقاييس، مما يُظهر قدراتهم المتقدمة في المهام العامة والمحددة بالمنطقة.
اتجاهات المستقبل
إطلاق لاما 3.1-405B من المرجح أن يعزز الابتكار في عدة مجالات:
- تحسين تقنيات الضبط الدقيق للمجالات المتخصصة
- تطوير أساليب استدلال أكثر كفاءة
- تقدّم في ضغط النموذج والتبخير
الخلاصة
يمثل لاما 3.1-405B علامة فارقة في الذكاء الاصطناعي المفتوح المصدر، ويوفر قدرات كانت حصرية للنماذج المملوكة.
عندما نواصل استكشاف قوة هذا النموذج، من المهم أن ننظر إلى استخدامه بمسؤولية واعتبار أخلاقي. الأدوات والضمانات المقدمة مع النموذج توفر إطارًا لتنفيذه بشكل مسؤول، لكن اليقظة المستمرة وتعاون المجتمع سيكونان حاسمين لضمان استخدام هذه التكنولوجيا القوية لصالح المجتمع.














