نماذج ومنصات الذكاء الاصطناعي
MPT-30B: mosaicml تتفوق على GPT-3 مع نموذج لغة جديد لتحقيق حدود معالجة اللغة الطبيعية
MosaicML هي شركة ذكاء اصطناعي توليدية توفر حلول لتنفيذ الذكاء الاصطناعي وضمان سرعته. النموذج الأخير للغة الكبيرة (LLM) MPT-30B يخلق موجات عبر مجتمع الذكاء الاصطناعي.
بدأت رحلة MosaicML مع نموذج LLM مع إصدار MPT-7B (موزايك مسبق التدريب للتحويل) في مايو 2023، والذي جاء مع ثلاثة متغيرات:
- MPT-7B-StoryWriter-65k+ (لгенерация القصص الطويلة)
- MPT-7B-Instruct (للمتابعة القصيرة للأوامر)
- MPT-7B-Chat (لгенерация الحوار)
شهدت النماذج نجاحًا كبيرًا في مجتمع ML بسبب طبيعتها المفتوحة المصدر وملاءمتها للتطبيقات التجارية وقدرتها الاستثنائية على التعامل مع نوافذ السياق الممتدة.
وأهم ما في الأمر، كان النموذج على قدم المساواة، وفي بعض الحالات، يتفوق على النماذج الأخرى القابلة للمقارنة (LLaMA-7B، StableLM 7B، إلخ). بحلول يونيو، تم تحميل سلسلة MPT-7B أكثر من 3 ملايين مرة. في 22 يونيو، أصدرت MosaicML MPT-30B، مما رفع مستوى النماذج الأساسية المفتوحة المصدر إلى مستوى أعلى.
MPT-30B: نموذج لغة قوي يتجاوز GPT-3
MPT-30B هو نموذج لغة كبير مفتوح المصدر ومرخص تجاريًا يستند إلى فك التشفير، وأكثر قوة من GPT-3-175B مع 17٪ فقط من 매개 변수 GPT-3، أي 30B. يتفوق على GPT-3 في العديد من المهام. هنا مقارنة بين MPT-30B و GPT-3.
MPT-30B يبني على نموذج MPT-7B السابق. وهو كفء حسابيًا للتدريب مقارنة بالنماذج ذات الأحجام المماثلة. على سبيل المثال، استخدم LLaMA-30B ما يقرب من 1.44 مرة أكثر من ميزانية FLOPs من MPT-30B، بينما كان لدى Falcon-40B ميزانية FLOPs أعلى 1.27 مرة من MPT-30B. هنا توضيح لتحسين MPT-30B على مهام مختلفة على خلاف سابقه.
بعض الميزات الخاصة ل MPT-30B هي كما يلي:
نافذة سياق 8k توكن
نافذة السياق في نماذج اللغة الكبيرة تشير إلى مدى التوكينات التي يمكن للنموذج مراعاتها قبل توليد الإخراج. كان لموديل MPT-30B نافذة سياق من 8000 توكن في وقت التدريب. تم تدريبه أولاً على 1T توكن باستخدام تسلسلات 2k توكن، ثم 50B توكن إضافية من تسلسلات 8k توكن (حوالي 6000 كلمة).
دعم ALiBi
لشرح هذه الميزة، دعونا نعتبر سؤالاً:
كيف يمكن لـ MPT-30B فهم التنبؤات لتسلسلات أطول مما تم تدريبه عليه؟
يستخدم MPT-30B تقنية ALiBi لفهم التسلسلات الأطول وتوسيع نافذة السياق إلى ما وراء 8k توكن أثناء التخصيص أو الاستدلال.
بدلاً من حساب التضمين الموضعي الذي نخصص فيه متجهًا لكل كلمة في التسلسل، يحسب ALiBi درجات الانتباه بين التوكينات الرئيسية والاستفسار. عندما تكون التوكينات الرئيسية والاستفسار قريبة من بعضها، يكون الجزاء منخفضًا، ولكن أعلى في الحالات الأخرى. وبالتالي، يمكن للعمارة التحويلية الأساسية الاستدلال على الإدخالات الشكل الطويل.
ادخال كفء واداء تدريبي عبر FlashAttention
الانتباه، أي التركيز على أجزاء الإدخال ذات الصلة، هو مكون حرج من التحويلات، ولكنه يمكن أن يكون بطيئًا ومتطلبًا للذاكرة، خاصة عند معالجة تسلسلات نصية طويلة.
FlashAttention هو نهج مقترح من قبل الباحثين في جامعة كورنيل يعالج هذه المشكلة من أجل MPT-30B. باستخدام تقنية تسمى التايлинغ، يقلل FlashAttention من عدد المرات التي يحتاج فيها النموذج إلى قراءة من أو كتابة إلى الذاكرة، مما يسرع المعالجة. وبالتالي، يستخدم النموذج تقنية FlashAttention الحائزة على الجوائز ومتحف الفاستر ترانسفورمر من شركة إنفيديا لمكتبة التحسين لتحقيق أداء تدريبي وادخال كفء.
سهولة التدريب والتشغيل
يمكن للمطورين تدريب MPT-30B من الصفر أو استخدام نقاط التفتيش من MosaicML لتشغيل أسرع. كما يمكن تخصيصها لاستخدامات محددة للنطاق على مجموعة بيانات معينة.
تم اختيار حجم النموذج لتمكين التشغيل بلا مشاكل على وحدة معالجة رسومات واحدة، تحديدًا 1xA100-80GB بدقة 16 بت أو 1xA100-40GB بدقة 8 بت. هذا يعني أن النموذج تم تصميمه ليتناسب مع قيود الذاكرة لوحدات معالجة الرسومات هذه.
قدرات البرمجة
يوفر MPT-30B أيضًا قدرات برمجة استثنائية. HumanEval هو مجموعة بيانات صدرت من OpenAI تحتوي على 164 مشكلة برمجة مصممة يدويًا. على مجموعة بيانات HumanEval، يتفوق النموذج على نماذج LLM المصممة خصيصًا، مثل سلسلة StarCoder.
المرتجعات المحددة: MPT-30B-Instruct و MPT-30B-Chat
MPT-30B-Instruct
تستخدم نماذج اللغة الكبيرة بشكل أساسي للأوامر مثل الإجابة على الأسئلة و تلخيص النص و ترجمة اللغة و غيرها. MPT-30B-Instruct هو متغير من MPT-30B يُستخدم تجاريًا (يحافظ على ترخيص CC-By-SA-3.0) ومحدد لاستخدامات متابعة الأوامر. لتحسينه، تم استخدام مجموعات البيانات التالية:
- FLAN
- P3
- Alpaca
- Dolly-15k
تم تعزيز مجموعة بيانات Dolly مع مجموعة بيانات Anthropic Helpful and Harmless لتحسين الأوامر. بالإضافة إلى ذلك، تم استخدام مجموعة متنوعة من مجموعات البيانات للتوسيع، وهي كما يلي:
- CompetitionMath
- GradeSchoolMath
- DialogSum
- DuoRC
- QASPER
- QuALITY
- SummScreen
- Spider
MPT-30B-Chat
MPT-30B-Chat هو نسخة محسنة من MPT-30B لتنمية الحوار. إنه منفذ أبحاث يصدر تحت ترخيص CC-By-NC-SA-4.0، مما يسمح فقط بالاستخدام غير التجاري. تم تحسين النموذج باستخدام مجموعات بيانات لغة مختلفة، بما في ذلك:
- Airoboros/GPT4-1.2
- Baize
- Camel
- GPTeacher
- Guanaco
- LongCoversations
- ShareGPT
- WizardLM
تشارك نماذج اللغة الكبيرة حصة كبيرة من سوق الذكاء الاصطناعي التوليدي المتعددة المليارات من الدولارات، الذي شهد نموًا كبيرًا في فترة زمنية قصيرة بعد ثورة ChatGPT على المناظر الطبيعية في العام الماضي. عائلة MPT هي جزء أساسي من هذه الثورة. في المستقبل القريب، يمكننا期待 رؤية نماذج مفتوحة المصدر متاحة تجاريًا أكثر قوة و كفاءة من عائلة MPT.
لأحدث أخبار الذكاء الاصطناعي، زوروا unite.ai.















