نماذج ومنصات الذكاء الاصطناعي
كل ما تحتاج إلى معرفته عن Llama 3 | أقوى نموذج مفتوح المصدر حتى الآن | المفاهيم إلى الاستخدام
أعلنت Meta مؤخرًا عن Llama 3، الجيل التالي من نموذج اللغة الكبيرة مفتوح المصدر الحائز على جوائز. بناءً على الأسس التي وضعتها سابقة لها، تهدف Llama 3 إلى تعزيز القدرات التي جعلت Llama 2 منافسًا مفتوح المصدر هامًا لمنافسة ChatGPT، كما هو موضح في المراجعة الشاملة في المقال Llama 2: غوص عميق في المنافس مفتوح المصدر لChatGPT.
في هذا المقال سنناقش المفاهيم الأساسية وراء Llama 3، واستكشاف هيكله المبتكر وعمليته التدريبية، وتقديم إرشادات عملية حول كيفية الوصول إلى هذا النموذج الرائد واستخدامه ونشره بشكل مسؤول. سواء كنت باحثًا أو مطورًا أو متحمسًا للذكاء الاصطناعي، فإن هذا المنشور سوف يزودك بالمعرفة والموارد اللازمة لاستخدام قوة Llama 3 لمشاريعك وتطبيقاتك.
تطور Llama: من Llama 2 إلى Llama 3
أعلن مارك زوكربيرغ، الرئيس التنفيذي لشركة Meta، عن ظهور Llama 3، أحدث نموذج ذكاء اصطناعي تم تطويره بواسطة Meta AI. هذا النموذج المتقدم، والذي تم إطلاقه مفتوح المصدر الآن، من المقرر أن يعزز منتجات Meta المختلفة، بما في ذلك Messenger وInstagram. وأشار زوكربيرغ إلى أن Llama 3 يضع Meta AI في صدارة النماذج الذكية المتاحة مجانًا.
قبل أن نتحدث عن تفاصيل Llama 3، دعونا نلقي نظرة سريعة على سابقة لها. تم تقديم Llama 2 في عام 2022، وكان إنجازًا مهمًا في مشهد النماذج اللغوية الكبيرة مفتوحة المصدر، حيث قدم نموذجًا قويًا وفعالًا يمكن تشغيله على الأجهزة الاستهلاكية.
然而، على الرغم من أن Llama 2 كان إنجازًا ملحوظًا، إلا أنه كان لديه قيود. أبلغ المستخدمون عن مشاكل مع رفضات خاطئة (رفض النموذج للاستجابة لتحفيزات غير ضارة)، وقدرة محدودة على المساعدة، وفرص للتحسين في مجالات مثل الاستدلال وتوليد الشفرة.
دخلت Llama 3: استجابة Meta لهذه التحديات وآراء المجتمع. مع Llama 3، تسعى Meta إلى بناء أفضل النماذج مفتوحة المصدر على قدم المساواة مع أفضل النماذج الاحتكارية المتاحة اليوم، مع الأولوية للتنمية والاستخدام المسؤولين.
Llama 3: الهيكل والتدريب
أحد الابتكارات الرئيسية في Llama 3 هو معالجها، الذي يتميز بمفردات متوسعة بشكل كبير تصل إلى 128,256 رمز (مقارنة بـ 32,000 في Llama 2). تسمح هذه المفردة الأكبر بترميز النص بشكل أكثر كفاءة، سواء لل输入 أو الإخراج، مما قد يؤدي إلى تحسين القدرة على التعامل مع اللغات المتعددة وإجمالي التحسينات في الأداء.
تدمج Llama 3 أيضًا انتباه الاستعلام المجموع (GQA)، تقنية تمثيل فعالة تعزز القابلية للتوسع وتساعد النموذج على التعامل مع سياقات أطول بشكل أكثر فعالية. يستخدم الإصدار 8B من Llama 3 GQA، بينما يمكن للنماذج 8B و 70B معالجة تسلسلات تصل إلى 8,192 رمز.
بيانات التدريب والتوسع
بيانات التدريب المستخدمة في Llama 3 هي عامل حاسم في أدائها المحسّن. قامت Meta بتحضير مجموعة بيانات ضخمة تصل إلى أكثر من 15 تريليون رمز من مصادر متاحة بشكل عام عبر الإنترنت، وهي سبع مرات أكبر من مجموعة البيانات المستخدمة في Llama 2. وتشمل هذه المجموعة أيضًا جزءًا كبيرًا (أكثر من 5%) من بيانات غير إنجليزية عالية الجودة، تغطي أكثر من 30 لغة، استعدادًا للتطبيقات متعددة اللغات في المستقبل.
为了 ضمان جودة البيانات، استخدمت Meta تقنيات تصفية متقدمة، بما في ذلك مرشحات استدلالية، ومرشحات NSFW، وازدواجية семантиكية، وتصنيفات نصية مدربة على Llama 2 للتنبؤ بجودة البيانات. كما أجرت الفريق تجارب واسعة لتحديد مزيج البيانات الأمثل للتدريب المسبق، مما يضمن أن Llama 3 تؤدي بشكل جيد عبر مجموعة واسعة من الحالات، بما في ذلك الأسئلة، والعلوم والتكنولوجيا والهندسة والرياضيات، والبرمجة، والمعرفة التاريخية.
كان توسيع التدريب المسبق جانبًا حاسمًا آخر في تطوير Llama 3. قامت Meta بتطوير قوانين للتوسع التي ermögليتها توقع أداء أكبر نماذجها في المهام الرئيسية، مثل توليد الشفرة، قبل تدريبها فعليًا. وقد أثر هذا في قرارات مزيج البيانات وتخصيص الحوسبة، مما أدى في النهاية إلى تدريب أكثر كفاءة وفعالية.
تم تدريب نماذج Llama 3 الأكبر على مجموعتين مخصصتين من 24,000 кластерات GPU، مستخدمة مزيجًا من موازاة البيانات، وتمثيل النموذج، وتمثيل الأنابيب. قامت مجموعة تدريب Meta المتقدمة بتحليل الأخطاء وتحديد الأخطاء وضبط الصيانة، مما أدى إلى زيادة وقت تشغيل GPU ثلاث مرات تقريبًا مقارنةً بـ Llama 2.
تعدين التعليمات والأداء
为了 فتح كامل إمكانيات Llama 3 لتطبيقات المحادثة والحوار، ابتكرت Meta نهجًا جديدًا لتعدين التعليمات. يجمع نهجها بين التعدين الدقيق الموجه (SFT)، وتصفية الرفض، و تحسين السياسة القريبة (PPO)، و تحسين التفضيل المباشر (DPO).
لعب جودة التحفيزات المستخدمة في SFT وترتيب التفضيلات المستخدمة في PPO وDPO دورًا حاسمًا في أداء النماذج الموجهة. قامت فريق Meta بتحضير هذه البيانات بعناية و أجرت جولات متعددة من ضمان الجودة على التعليقات المقدمة من المُحَكّين البشريين.
كما أدى التدريب على ترتيبات التفضيل عبر PPO وDPO إلى تحسين كبير في أداء Llama 3 على مهام الاستدلال والبرمجة. وجدت Meta أن حتى عندما يجد النموذج صعوبة في الإجابة على سؤال استدلال مباشر، قد ينتج هنوز مسار استدلال صحيح. وقد أتاح التدريب على ترتيبات التفضيل للنموذج تعلم كيفية اختيار الإجابة الصحيحة من هذه المسارات.
تتكلم النتائج عن نفسها: Llama 3 تتفوق على العديد من نماذج المحادثة مفتوحة المصدر المتاحة على معايير الصناعة الشائعة، مما يؤسس أداءً جديدًا على مستوى الدولة للنماذج اللغوية الكبيرة عند مستويات المعاملات 8B و 70B.
التنمية المسؤولة والاعتبارات الأمنية
في حين سعي Meta لتحقيق أداء متقدم، قامت أيضًا بتحديد الأولويات للتنمية والاستخدام المسؤولين لنماذج Llama 3. اعتمدت الشركة نهجًا على مستوى النظام، حيث تتصور نماذج Llama 3 كجزء من نظام أوسع يضع المطورين في مقعد القيادة، مما يسمح لهم بتصميم وتخصيص النماذج لاحتياجاتهم وأمانهم المحددة.
أجرت Meta تمارين اختبار شاملة، وأجرت تقييمات معادية، وطبقت تقنيات تحفيز الأمان لتقليل المخاطر المتبقية في نماذجها الموجهة بالتعليمات. ومع ذلك، تعترف الشركة بأن المخاطر المتبقية قد تظل موجودة، وتوصي المطورين بتقييم هذه المخاطر في سياق استخدامهم المحدد.
为了 دعم التنمية المسؤولة، قامت Meta بتحديث دليل الاستخدام المسؤول، مما يوفر موردًا شاملاً للمطورين لتنفيذ أفضل الممارسات الأمنية على مستوى النموذج والنظام لتطبيقاتهم. يغطي الدليل مواضيع مثل تعديل المحتوى، وتقييم المخاطر، واستخدام أدوات الأمان مثل Llama Guard 2 وCode Shield.
Llama Guard 2، الذي تم بناؤه على تصنيف MLCommons، مصمم لتصنيف مدخلات ونتائج النماذج اللغوية الكبيرة، واكتشاف المحتوى الذي قد يُعتبر غير آمن أو ضارًا. CyberSecEval 2 يوسع على سلفه بإضافة إجراءات لمنع إساءة استخدام مفسّر الشفرة، والقدرات الأمنية الهجومية، والتعرض للهجمات القائمة على التحفيز.
Code Shield، وهو مقدمة جديدة مع Llama 3، يضيف تصفية زمن الاستدلال للشفرة غير الآمنة التي تنتجها النماذج اللغوية الكبيرة، مما يخفف من المخاطر المرتبطة بالشفرة غير الآمنة، وإساءة استخدام مفسّر الشفرة، وتنفيذ الأوامر الآمنة.
الوصول إلى Llama 3 والاستفادة منها
بعد إطلاق Llama 3 من Meta AI، تم إتاحة أدوات مفتوحة المصدر عديدة للنشر المحلي على أنظمة تشغيل مختلفة، بما في ذلك Mac وWindows وLinux. هذا القسم يحتوي على ثلاثة أدوات ملحوظة: Ollama، وOpen WebUI، وLM Studio، كل واحدة منها تقدم ميزات فريدة لاستخدام قدرات Llama 3 على الأجهزة الشخصية.
Ollama: متاح على Mac وLinux وWindows، Ollama يبسط تشغيل Llama 3 والنماذج اللغوية الكبيرة الأخرى على أجهزة الكمبيوتر الشخصية، حتى تلك التي تتمتع بأجهزة أقل قوة. يحتوي على مدير حزم لسهولة إدارة النماذج، ويدعم الأوامر عبر المنصات لتنزيل وتشغيل النماذج.
Open WebUI مع Docker: يوفر هذا الأداة واجهة مستخدم友ية قائمة على Docker متوافقة مع Mac وLinux وWindows. يدمج بشكل متكامل مع نماذج من سجل Ollama، مما يسمح للمستخدمين بنشر وتفاعل مع نماذج مثل Llama 3 داخل واجهة ويب محلية.
LM Studio: يهدف إلى المستخدمين على Mac وLinux وWindows، LM Studio يدعم مجموعة من النماذج ويتم بناؤه على مشروع llama.cpp. يوفر واجهة محادثة ويسهل التفاعل المباشر مع نماذج مختلفة، بما في ذلك نموذج Llama 3 8B Instruct.
تضمن هذه الأدوات أن المستخدمين يمكنهم استخدام Llama 3 بكفاءة على أجهزتهم الشخصية، مع تلبية مجموعة من المهارات الفنية والمتطلبات.
نشر Llama 3 على نطاق واسع
除了 توفير وصول مباشر إلى أوزان النموذج، قامت Meta بالشراكة مع مقدمي خدمات السحابة، وخدمات واجهة برمجة التطبيقات، ومنصات الأجهزة لتسهيل نشر Llama 3 على نطاق واسع.
أحد المزايا الرئيسية لـ Llama 3 هو كفاءته في الترميز، بفضل معالج جديد. تظهر البenchmarks أن Llama 3 يتطلب ما يصل إلى 15% أقل رموز مقارنة بـ Llama 2، مما يؤدي إلى استدلال أسرع وأكثر كفاءة.
تساهم تقنية الانتباه المجموع (GQA) في الإصدار 8B من Llama 3 في الحفاظ على كفاءة الاستدلال على قدم المساواة مع الإصدار 7B من Llama 2، على الرغم من زيادة عدد المعاملات.
ماذا يأتي بعد Llama 3؟
في حين أن نماذج 8B و 70B تُشكل بداية إطلاق Llama 3، فإن Meta لديها خطط طموحة للمستقبل لهذا النموذج الرائد.
في الأشهر القادمة، يمكننا期待 رؤية قدرات جديدة، بما في ذلك متعدد الوسائط (القدرة على معالجة وتوليد أنواع مختلفة من البيانات، مثل الصور والفيديوهات)، واللغات المتعددة (دعم اللغات المتعددة)، ونوافذ سياق أطول لتحسين الأداء على المهام التي تتطلب سياقًا واسعًا.
بالإضافة إلى ذلك، تخطط Meta لإطلاق أحجام نموذج أكبر، بما في ذلك نماذج تصل إلى أكثر من 400 مليار معامل، وهي حاليًا في مرحلة التدريب وتظهر اتجاهات واعدة فيما يتعلق بالأداء والقدرات.
为了 تعزيز التقدم في هذا المجال، ستُنشر Meta ورقة بحثية مفصلة حول Llama 3، حيث ستشارك اكتشافاتها وآراءها مع مجتمع الذكاء الاصطناعي الأوسع.
الختام
تمثل Llama 3 علامة فارقة في تطور النماذج اللغوية الكبيرة مفتوحة المصدر، حيث تدفع حدود الأداء والقدرات والممارسات التنموية المسؤولة.
ومع ذلك، Llama 3 ليس فقط نموذج لغة قويًا؛ إنه شهادة على التزام Meta بتعزيز نظام ذكاء اصطناعي مفتوح ومسؤول. من خلال توفير الموارد الشاملة وأدوات الأمان وأفضل الممارسات، تمكن Meta المطورين من استخدام كامل إمكانيات Llama 3 مع ضمان التنمية والنشر المسؤولين المخصصين لاستخدامهم المحدد وجماهيرهم.
随着 استمرار رحلة Llama 3، مع قدرات جديدة وأحجام نموذجية واكتشافات بحثية على الأفق، ينتظر مجتمع الذكاء الاصطناعي بفارغ الصبر التطبيقات المبتكرة والانجازات التي سوف تظهر بدون شك من هذا النموذج الرائد.
سواء كنت باحثًا يدفع حدود معالجة اللغة الطبيعية، أو مطورًا يبني الجيل التالي من التطبيقات الذكية، أو متحمسًا للذكاء الاصطناعي مهتم بالتقدم الأخير، فإن Llama 3 يعد أداة قوية في ترسانتك، فتح أبواب جديدة وتفتح عالمًا من الإمكانيات.















