نماذج ومنصات الذكاء الاصطناعي

Mistral AI: تحديد معايير جديدة في الفضاء المفتوح

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أصبحت نماذج اللغة الكبيرة (LLMs) حديث الساعة مؤخرًا، بفضل أداء بعض النماذج مثل ChatGPT. عندما قدمت Meta نماذج Llama، أثار ذلك اهتمامًا جديدًا بنماذج اللغة المفتوحة المصدر. الهدف هو إنشاء نماذج اللغة المفتوحة المصدر بأسعار معقولة، والتي تكون جيدة مثل النماذج الرائدة مثل GPT-4، ولكن بدون التكلفة العالية أو التعقيد.

هذا المزيج من التكلفة والكفاءة لا يفتح فقط طرقًا جديدة للباحثين والمطورين، بل يضع أيضًا الأساس لera جديدة من التطورات التكنولوجية في معالجة اللغة الطبيعية.

最近، استثمرت الشركات الناشئة في مجال الذكاء الاصطناعي بشكل كبير. جمعوا معًا 20 مليون دولار لإنشاء نماذج الذكاء الاصطناعي المفتوحة المصدر. كما جمع Anthropic 450 مليون دولار، وشراكة Cohere مع Google Cloud، وحصلت على 270 مليون دولار في يونيو من هذا العام.

مقدمة إلى Mistral 7B: الحجم والتوافر

mistral AI

أعلنت Mistral AI، التي تتخذ من باريس مقرًا لها، عن نموذج اللغة الكبير الأول لها: Mistral 7B. يمكن تحميل هذا النموذج بسهولة من قبل أي شخص من GitHub ومن خلال رابط تورنت بحجم 13.4 غيغابايت.

استطاعت هذه الشركة الحصول على تمويل بذور قياسي قبل إطلاق منتجاتها. يتفوق نموذج Mistral 7B على نموذج Llama 2 13B في جميع الاختبارات، ويتفوق على نموذج Llama 1 34B في العديد من المعايير.

بالنسبة إلى المهام البرمجية، يمنح Mistral 7B فرصة قوية لمنافسة CodeLlama 7B. بالإضافة إلى ذلك، يتميز Mistral 7B بحجم صغير نسبيًا، حيث يبلغ 13.4 غيغابايت، مما يسمح بتشغيله على أجهزة معيارية.

كما أظهر Mistral 7B Instruct أداءً جيدًا، حيث تم تحسينه بشكل خاص لبيانات تعليمية على منصة Hugging Face. يتفوق على نماذج أخرى بحجم 7B في اختبار MT-Bench، ويتساوي مع نماذج الدردشة بحجم 13B.

اختبار الأداء

في تحليل أداء مفصل، تم قياس Mistral 7B مقابل نماذج Llama 2. كانت النتائج واضحة: يتفوق Mistral 7B بشكل كبير على Llama 2 13B في جميع الاختبارات. كما يتساوي مع أداء Llama 34B، خاصة في اختبارات البرمجة والاستدلال.

تم تنظيم الاختبارات في فئات متعددة، مثل الاستدلال العادي، والمعرفة العالمية، وفهمنا القراءة، والرياضيات، والبرمجة، وغيرها. كان أحد الملاحظات البارزة هو معيار التكلفة والأداء لشركة Mistral 7B، والذي يُسمى “حجم النموذج المكافئ”. في مجالات مثل الاستدلال والفهم، أظهر Mistral 7B أداءً مشابهًا لنموذج Llama 2 ثلاث مرات حجمه، مما يشير إلى توفيرات محتملة في الذاكرة وزيادة في الإنتاجية. ومع ذلك، في اختبارات المعرفة، كان Mistral 7B متساويًا مع Llama 2 13B، وهو ما يُعزى على الأرجح إلى قيود المعلمات التي تؤثر على ضغط المعرفة.

ما الذي يجعل نموذج Mistral 7B أفضل من معظم نماذج اللغة الأخرى؟

تسهيل آليات الانتباه

على الرغم من أن دقائق آليات الانتباه هي تقنية، فإن الفكرة الأساسية هي بسيطة نسبيًا. تخيل أنك تقرأ كتابًا وتhighlight جمل مهمة؛ هذا مشابه لطريقة عمل آليات الانتباه في إعطاء أهمية لنقاط البيانات في التسلسل.

في سياق نماذج اللغة، تمكن هذه الآليات النموذج من التركيز على أجزاء البيانات الأكثر صلة، مما يضمن أن تكون الإخراج متسقة ودقيقة سياقيًا.

في المحولات القياسية، يتم حساب درجات الانتباه باستخدام الصيغة:

Transformers attention Formula

Transformers Attention Formula

تتضمن صيغة هذه الدرجات خطوة حاسمة – الضرب Матрикс للقيم Q و K. التحدي هنا هو أن مع نمو طول التسلسل، تتوسع كلا Матриكسين بشكل متناسب، مما يؤدي إلى عملية حسابية مكثفة. هذا القلق من حيث القابلية للتوسيع هو أحد الأسباب الرئيسية التي تجعل المحولات القياسية بطيئة، خاصة عند التعامل مع تسلسلات طويلة.

transformerتمكن آليات الانتباه النموذج من التركيز على أجزاء معينة من البيانات. عادة ما تستخدم هذه الآليات “رؤوس” لإدارة الانتباه. كلما زاد عدد الرؤوس، زادت دقة الانتباه، ولكنها стала أيضًا أكثر تعقيدًا وبطئًا. يمكنك الغوص في تفاصيل المحولات وآليات الانتباه هنا.

تسرع آليات الانتباه المتعددة (MQA) الأمور عن طريق استخدام مجموعة واحدة من “رؤوس القيم”، ولكنها في بعض الأحيان تضحي بالجودة. الآن، قد تتساءل، لماذا لا تجمع بين سرعة MQA وجودة الانتباه المتعدد الرؤوس؟ هذا هو المكان الذي تأتي فيه آليات الانتباه المجمعة (GQA).

آليات الانتباه المجمعة (GQA)

Grouped-query attention

Grouped-query attention

تعتبر GQA حلًا وسطًا. بدلاً من استخدام رأس قيم واحد أو متعدد، يتم تجميعها. بهذه الطريقة، تتحقق GQA أداءً قريبًا من الانتباه المتعدد الرؤوس، ولكن بسرعة MQA. بالنسبة لنماذج مثل Mistral، يعني هذا الأداء الفعال بدون التضحية الكبيرة بالجودة.

آليات الانتباه بالنافذة المتحركة (SWA)

longformer transformers sliding window

تستخدم طريقة النافذة المتحركة في معالجة تسلسلات الانتباه. هذه الطريقة تستخدم نافذة انتباه ثابتة الحجم حول كل رمز في التسلسل. مع تكرار هذه النافذة في طبقات متعددة، تكتسب الطبقات العليا في النهاية منظورًا أوسع، مما يشمل المعلومات من tüm الإدخال. هذه الآلية مشابهة لحقول الاستقبال في شبكات النقل المتعممة (CNNs).

من ناحية أخرى، تستخدم طريقة “النافذة المتحركة الممددة” في نموذج Longformer، والتي تشبه концептуально طريقة النافذة المتحركة، حساب القطر فقط من ماتريكس QKT. يؤدي هذا التغيير إلى زيادة استخدام الذاكرة بشكل خطي بدلاً من التربيعي، مما يجعلها طريقة أكثر كفاءة لتسلسلات أطول.

شفافية Mistral AI مقابل مخاوف الأمان في التحرير

في إعلانها، شددت Mistral AI على الشفافية بالبيان: “لا خدع، لا بيانات مملوكة”. ومع ذلك، النموذج المتاح حاليًا هو Mistral-7B-v0.1، وهو نموذج قاعدي مسبق التدريب، ويمكنه توليد استجابة لأي استفسار بدون تعديل، مما يثير مخاوف أمان محتملة. بينما تملك نماذج مثل GPT و Llama آليات للتمييز عند الاستجابة، قد يُستغل التحرير الكامل لنماذج اللغة الكبيرة من قبل الأفراد الضارين.

然而، يملك التحرير لنماذج اللغة الكبيرة فضائل. بينما قد يسيء بعض الأفراد استخدامها، يمكن للأفراد استخدامها من أجل الخير الاجتماعي وجعل الذكاء متاحًا للجميع.

مرونة النشر

تتميز Mistral 7B بأنها متاحة تحت رخصة Apache 2.0. هذا يعني أنه لا توجد عوائق حقيقية لاستخدامها – سواء كنت تستخدمها لأغراض شخصية أو شركة كبيرة أو حتى كيان حكومي. كل ما تحتاجه هو نظام مناسب لتشغيلها، أو قد تحتاج إلى استثمار في الموارد السحابية.

توجد رخص أخرى، مثل رخصة MIT البسيطة و رخصة CC BY-SA-4.0 التعاونية، التي تتطلب الإعتراف والترخيص المماثل للمشتقات، توفر رخصة Apache 2.0 أساسًا قويًا للمشاريع الكبيرة.

أفكار ختامية

ترمز صعود نماذج اللغة الكبيرة المفتوحة المصدر مثل Mistral 7B إلى تحول حاسم في صناعة الذكاء الاصطناعي، مما يجعل نماذج اللغة عالية الجودة متاحة لفئة أوسع. تpromises Mistral AI مناهجها المبتكرة، مثل الانتباه المجمّع وآليات الانتباه بالنافذة المتحركة، أداءً فعالًا دون المساس بالجودة.

في حين أن الطبيعة المفتوحة لنماذج اللغة مثل Mistral تطرح تحديات معينة، فإن مرونتها وترخيصها المفتوح يؤكدان على إمكانية ديمقراطية الذكاء الاصطناعي. مع تطور المشهد، سيكون التركيز في النهاية على موازنة قوة هذه النماذج مع الاعتبارات الأخلاقية وآليات الأمان.

ماذا يأتي بعد ذلك لمستقبل Mistral؟ كان نموذج 7B فقط البداية. يهدف الفريق إلى إطلاق نماذج أكبر قريبًا. إذا كانت هذه النماذج الجديدة تتوافق مع أداء 7B، قد يصعد Mistral بسرعة إلى مرتبة لاعب رائد في الصناعة، كل ذلك في أول عام لها.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.