نماذج ومنصات الذكاء الاصطناعي

OLMo: تعزيز علم نماذج اللغة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

شهدت السنوات القليلة الماضية تطورًا كبيرًا في نماذج اللغة، ليس فقط في أبحاث معالجة اللغة الطبيعية، ولكن أيضًا في العروض التجارية والتطبيقات الواقعية. ومع ذلك، فإن الطلب المتزايد على نماذج اللغة في السوق قد حدد إلى حد ما نمو المجتمع. هذا لأن معظم النماذج القوية والحديثة محمية بموجب واجهات خاصة، مما يجعل من الصعب على مجتمع التطوير الوصول إلى تفاصيل هامة من بنية التدريب وبيانات العمليات. ومن غير القابل للإنكار الآن أن هذه التفاصيل الهامة للتدريب والهيكل ضرورية للدراسات البحثية، بما في ذلك الوصول إلى المخاطر والتحيزات المحتملة، مما يخلق حاجة لمجتمع البحث للوصول إلى نموذج لغة مفتوح وقوي حقًا.

لتحقيق هذه المتطلبات، قام المطورون بإنشاء OLMo، وهو إطار عمل نموذج لغة مفتوح ومبتكر. يسمح هذا الإطار للباحثين باستخدام OLMo لبناء ودراسة نماذج اللغة. على عكس معظم نماذج اللغة الحديثة، التي تم إصدارها فقط مع واجهة التعليمات ووزن النموذج، فإن إطار OLMo مفتوح المصدر تمامًا، مع رمز تقييم عام وطرق تدريب وبيانات تدريب متاحة للجمهور. الهدف الرئيسي لOLMo هو تمكين وتعزيز مجتمع البحث المفتوح والتنمية المستمرة لنماذج اللغة.

في هذه المقالة، سنناقش إطار OLMo بالتفصيل، مع دراسة هيكله وطريقة عمله وأدائه مقارنةً بإطارات أخرى حديثة. لذا، دعونا نبدأ.

OLMo: تعزيز علم نماذج اللغة

يمكن القول إن نموذج اللغة كان الأبرز في السنوات القليلة الماضية، ليس فقط داخل مجتمع الذكاء الاصطناعي والتعلم الآلي، ولكن أيضًا عبر الصناعة التكنولوجية، بسبب قدراته الرائعة في أداء المهام الواقعية بأداء يشبه الإنسان. ChatGPT هو مثال رئيسي على الإمكانيات التي تتمتع بها نماذج اللغة، مع كبراء الصناعة التكنولوجية يبحثون عن دمج نماذج اللغة مع منتجاتهم.

معالجة اللغة الطبيعية، أو NLP، هي واحدة من الصناعات التي استخدمت نماذج اللغة على نطاق واسع في السنوات القليلة الماضية. ومع ذلك، منذ أن بدأت الصناعة في استخدام التعليقات البشرية للتركيب والتدريب المسبق على نطاق كبير، شهدت نماذج اللغة تحسينًا سريعًا في قيمتها التجارية، مما أدى إلى أن معظم نماذج اللغة والاطار النموذجي لها واجهات خاصة مقيدة، مع عدم وجود وصول لمجتمع التطوير إلى التفاصيل الهامة.

لضمان تقدم نماذج اللغة، يقدم OLMo، وهو نموذج لغة مفتوح ومبتكر، إطارًا للمطورين لبناء ودراسة وتطوير نماذج اللغة. كما يوفر للباحثين وصولًا إلى رمز التدريب والتقييم وطريقة التدريب وبيانات التدريب وسجلات التدريب و نقاط التفتيش الوسيطية للنموذج. النماذج الحديثة لها درجات مختلفة من الانفتاح، بينما أطلق إطار OLMo الإطار بالكامل، من التدريب إلى البيانات إلى أدوات التقييم، مما يقلل من الفجوة في الأداء عند المقارنة مع نماذج حديثة مثل نموذج LLaMA2.

للبناء والتدريب، يتضمن إطار OLMo رمز التدريب ووزن النموذج الكامل والتحليلات وبيانات التدريب ووسائل التقييم. للتحليل وبناء القاعدة البيانية، يتضمن إطار OLMo البيانات الكاملة المستخدمة لتدريب نموذج AI2’s Dolma و WIMBD، جنبًا إلى جنب مع رمز إنتاج البيانات. لأغراض التقييم، يتضمن إطار OLMo نموذج AI2’s Catwalk لتقييم المجرى الأساسي، ونموذج Paloma لتقييم الارتباك.

OLMo : النموذج والهيكل

يتبنى نموذج OLMo هيكلًا محولًا فحسب للترميز القائم على نظام معالجة المعلومات العصبية، ويقدم نموذجين بمتغيرين 1 مليار و 7 مليارات معامل على التوالي، مع نموذج 65 مليار معامل قيد التطوير حاليًا.

الهيكل الذي يقدمه إطار OLMo يقدم عدة تحسينات على الإطارات الأخرى، بما في ذلك مكون التランスفورمر الفانيلي في هيكله، بما في ذلك النماذج الحديثة مثل OpenLM و Falcon و LLaMA و PaLM. الشكل التالي يقارن نموذج OLMo ب 7 مليارات معامل مع النماذج الحديثة الأخرى.

يختار إطار OLMo المعاملات Hyperparameter من خلال تحسين النموذج لزيادة الإنتاجية على الأجهزة مع تقليل خطر الانحراف البطيء والانخفاضات الفجائية. مع ذلك، التغييرات الرئيسية التي يطبقها إطار OLMo والتي تميزه عن هيكل التランスفورمر الفانيلي هي كما يلي:

لا تحيزات

على عكس Falcon و PaLM و LLaMA وغيرها من نماذج اللغة، لا يتضمن إطار OLMo أي تحيز في هيكله لتعزيز استقرار التدريب.

معايير الطبقة غير المعلمة

يطبق إطار OLMo صياغة غير معلمة لمعيار الطبقة في هيكله. معيار الطبقة غير المعلم لا يقدم أي تحويل متأثر في المعيار، أي أنه لا يقدم أي مكسب أو تحيز قابل للتعديل. معايير الطبقة غير المعلمة لا تقدم فقط أمانًا أكبر من معايير الطبقة المعلمة، ولكنها أيضًا أسرع.

دالة تنشيط SwiGLU

مثل معظم نماذج اللغة مثل PaLM و LLaMA، يتضمن إطار OLMo دالة تنشيط SwiGLU في هيكله بدلاً من دالة تنشيط ReLU، ويزيد من حجم التنشيط الخفي إلى أقرب مضاعف لـ 128 لتحسين الإنتاجية.

التضمين الموضعي الدوراني أو RoPE

ينماذج OLMo يتبع نموذج LLaMA و PaLM ويتبادل التضمين الموضعي المطلق مع التضمين الموضعي الدوراني أو RoPE.

التدريب المسبق مع Dolma

على الرغم من أن مجتمع التطوير لديه الآن وصول محسّن إلى معاملات النموذج، لا تزال أبواب الوصول إلى مجموعات بيانات التدريب المسبق مغلقة، حيث لا يتم إصدار بيانات التدريب المسبق جنبًا إلى جنب مع النماذج المغلقة ولا جنبًا إلى جنب مع النماذج المفتوحة. بالإضافة إلى ذلك، غالبًا ما تفتقر الوثائق الفنية التي تغطي هذه البيانات إلى التفاصيل الأساسية المطلوبة لفهم وتكرار النموذج بالكامل. يصعب هذا الحاجز على التقدم في بعض مجالات أبحاث نماذج اللغة، بما في ذلك فهم كيفية تأثير بيانات التدريب على قدرات وقيود النموذج. لإزالة هذا الحاجز، قام إطار OLMo ببناء وإصدار مجموعة بيانات التدريب المسبق الخاصة به، Dolma، لتسهيل البحث المفتوح على تدريب نماذج اللغة. مجموعة بيانات Dolma هي مجموعة متعددة ومتنوعة من أكثر من 3 تريليون رمز عبر 5 مليارات وثائق تم جمعها من 7 مصادر مختلفة شائعة الاستخدام من قبل نماذج اللغة الكبيرة والمفتوحة للجمهور. يُوجز تركيب مجموعة بيانات Dolma في الجدول التالي.

تم بناء مجموعة بيانات Dolma باستخدام خط أنابيب يتكون من 5 مكونات: تصفية اللغة وتصفية الجودة وتصفية المحتوى وخلط متعدد المصادر وإزالة التكرار والتعرف على الرموز. كما أصدر OLMo تقرير Dolma الذي يوفر رؤى أعمق في مبادئ التصميم و تفاصيل البناء جنبًا إلى جنب مع ملخص محتوى أكثر تفصيلًا. كما يفتح النموذج أدواته عالية الأداء لتنقية البيانات لتسهيل وتسريع تنقية مجموعات بيانات التدريب المسبق. التقييم يتبع استراتيجية من مرحلتين، تبدأ بالتقييم عبر الإنترنت لاتخاذ القرارات خلال تدريب النموذج، ثم التقييم النهائي غير المتصل لتقييم مجتمع من نقاط التفتيش للنموذج. لأغراض التقييم غير المتصل، يستخدم OLMo إطار Catwalk، أداة تقييمنا العامة المتاحة والتي تتيح الوصول إلى تنوع كبير من مجموعات البيانات وأشكال المهام. يستخدم الإطار Catwalk لتقييم المجرى الأساسي وكذلك تقييم نمذجة اللغة الداخلية على معيار الارتباك الجديد، Paloma. ثم يقارن OLMo بينه وبين عدة نماذج عامة باستخدام خط أنابيب التقييم الثابت، لكل من التقييمات الأساسية والارتباك.

تدريب OLMo

من المهم أن نلاحظ أن نماذج إطار OLMo يتم تدريبها باستخدام استراتيجية محسّن AdamW، التي يتم توفيرها من خلال إطار FSDP عبر PyTorch، مما يقلل بشكل كبير من استهلاك ذاكرة GPU. بهذه الطريقة، يمكن إجراء التدريب عند مقياس 7B باستخدام حجم دفعة معالجة صغيرة من 4096 رمز لكل GPU على الأجهزة الخاصة بنا. إطار التدريب لنماذج OLMo-1B و -7B يستخدم حجم دفعة معالجة ثابت يبلغ حوالي 4M رمز (2048 مثيلًا مع طول تسلسل 2048 رمز). بالنسبة للنموذج OLMo-65B (قيد التدريب حاليًا)، يستخدم المطورون حجم دفعة معالجة يبدأ عند حوالي 2M رمز (1024 مثيلًا)، ويزيد بشكل مضاعف كل 100B رمز حتى حوالي 16M رمز (8192 مثيلًا).

لتحسين الإنتاجية، نستخدم التدريب المخلوط الدقة (Micikevicius et al., 2017) من خلال إعدادات FSDP المدمجة ووحدة amp في PyTorch. الوحدة الأخيرة تضمن أن يتم تشغيل بعض العمليات مثل softmax دائمًا بدقة كاملة لتحسين الاستقرار، بينما يتم تشغيل جميع العمليات الأخرى بدقة نصفية مع تنسيق bfloat16. في إعداداتنا المحددة، يتم الاحتفاظ بأوزان النموذج المقطعة و状態 المحسّن المحلية على كل GPU بدقة كاملة. يتم تحويل أوزان النموذج داخل كل كتلة محول فقط إلى تنسيق bfloat16 عند تمثيل المعاملات الكاملة على كل GPU خلال المراحل الأمامية والخلفية. يتم تقليل التدرجات عبر GPUs بدقة كاملة.

المحسّن

يستخدم إطار OLMo محسّن AdamW مع المعاملات التالية.

لجميع أحجام النموذج، يزيد معدل التعلم بشكل خطي خلال أول 5000 خطوة (∼21B رمز) إلى قيمة أقصى، ثم ينخفض بشكل خطي مع عكس الجذر التربيعي لعدد الخطوات إلى معدل التعلم الأدنى المحدد. بعد فترة التسخين، يقوم النموذج بتقليم التدرجات بحيث لا يتجاوز المجموع الكلي ل معاملات التدرج 1.0. الجدول التالي يعطي مقارنة لإعدادات المحسّن لدينا عند مقياس 7B مع إعدادات أخرى من النماذج الحديثة التي استخدمت AdamW.

بيانات التدريب

يتضمن التدريب تحويل رموز التدريب إلى كلمات ورموز BPE للنموذج القطاعي بعد إضافة رمز EOS خاص في نهاية كل وثيقة، ثم يتم تجميع قطع متتالية من 2048 رمز لتشكيل مثيلات التدريب. يتم خلط مثيلات التدريب بنفس الطريقة لكل تشغيل تدريب. يمكن إعادة بناء ترتيب البيانات وتكوين كل دفعة تدريب بدقة من الملفات التي ننشرها. جميع نماذج OLMo المنشورة تم تدريبها على الأقل 2T رمز (دورة واحدة على بيانات التدريب)، وبعضها تم تدريبه بعد ذلك من خلال بدء دورة ثانية على البيانات بدقة مختلفة.

النتائج

نقطة التفتيش المستخدمة لتقييم OLMo-7B تم تدريبها حتى 2.46T رمز على مجموعة بيانات Dolma مع جدول انخفاض معدل التعلم الخطي المذكور سابقًا. المزيد من ضبط هذه النقطة على مجموعة بيانات Dolma ل 1000 خطوة مع انخفاض معدل التعلم الخطي إلى 0 يزيد من أداء النموذج على الارتباك وتقييمات المهام النهائية الموصوفة سابقًا. لأغراض التقييم النهائي، قام المطورون بمقارنة OLMo مع النماذج العامة المتاحة الأخرى – LLaMA-7B و LLaMA2-7B و Pythia-6.9B و Falcon-7B و RPJ-INCITE-7B.

التقييم المجرى الأساسي

يتم تلخيص مجموعة التقييم الأساسية في الجدول التالي.

نقوم بالتقييم بدون تدريب من خلال نهج تصنيف الترتيب في جميع الحالات. في هذا النهج، يتم تصنيف الإكمالات النصية المرشحة (على سبيل المثال، خيارات متعددة) حسب الاحتمالية (عادةً بعد تعديل بعض معامل التطبيع)، ويتم الإبلاغ عن دقة التنبؤ.

بينما يستخدم إطار Catwalk عدة طرق لتطبيع الاحتمالية، مثل تطبيع الرمز الواحد وتطبيع الرمز لكل حرف، يتم اختيار استراتيجيات التطبيع المطبقة بشكل منفصل لكل مجموعة بيانات، ويشمل ذلك الاحتمالية غير المشروطة للإجابة. بشكل أكثر تحديدًا، كان ذلك لا يحتاج إلى تطبيع لمهام arc و openbookqa، وتطبيع لكل رمز لمهام hellaswag و piqa و winogrande، ولا تطبيع لمهام boolq و copa و sciq (أي مهام في صيغة قريبة من مهام التنبؤ الفردي).

الرسم التالي يظهر تقدم درجة الدقة للمهام التسع الأساسية. يمكن استنتاج أن هناك اتجاهًا عامًا متزايدًا في رقم الدقة لجميع المهام، باستثناء OBQA، حيث يتم تدريب OLMo-7B على المزيد من الرموز. يظهر قفزة صعودية حادة في دقة العديد من المهام بين الخطوة الأخيرة والثانية الأخيرة تدريبًا يظهر فوائد خفض معدل التعلم الخطي إلى 0 خلال الخطوات 1000 النهائية من التدريب. على سبيل المثال، في حالة التقييمات الداخلية، يجادل Paloma من خلال سلسلة من التحليلات، من فحص الأداء في كل مجال على حدة إلى نتائج أكثر تلخيصًا على مجموعات من المجالات. نقدم نتائج على مستويين من التفصيل: الأداء المجتمعي على 11 من 18 مصدر في Paloma، وكذلك نتائج أكثر تفصيلًا على كل من هذه المصادر بشكل فردي.

أفكار نهائية

في هذه المقالة، تحدثنا عن OLMo، وهو نموذج لغة مفتوح ومبتكر يقدم إطارًا للمطورين لبناء ودراسة وتطوير نماذج اللغة، مع تقديم وصول للباحثين إلى رمز التدريب وطريقة التدريب وبيانات التدريب وسجلات التدريب ونقاط التفتيش الوسيطية للنموذج. النماذج الحديثة لها درجات مختلفة من الانفتاح، بينما أطلق إطار OLMo الإطار بالكامل، من التدريب إلى البيانات إلى أدوات التقييم، مما يقلل من الفجوة في الأداء عند المقارنة مع نماذج حديثة مثل نموذج LLaMA2.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.