نماذج ومنصات الذكاء الاصطناعي
هل يمكن بناء نماذج اللغة الكبيرة مثل ChatGPT بنصف التكلفة؟
نماذج اللغة الكبيرة (LLMs) مثل GPT-3 و ChatGPT قد ثورتا الذكاء الاصطناعي من خلال تقديم فهم اللغة الطبيعية وقدرات إنشاء المحتوى. ولكن تطويرها يأتي بتكلفة باهظة، مما يحد من الوصول إليها ويحد من البحثさらに. وتشير التقديرات أن تدريب GPT-3 قد كلف OpenAI حوالي $5 مليون. ومع ذلك، أدرك Microsoft (MSFT ) الإمكانات واستثمر $1 مليار في عام 2019 و $10 مليار في عام 2023 في مشروع GPT-3 و ChatGPT التابع لشركة OpenAI.
نماذج اللغة الكبيرة هي نماذج تعلم الآلة مدربة على بيانات نصية واسعة النطاق لتطبيقات معالجة اللغة الطبيعية. وهي تستند إلى هندسة الترانسفورمر وتستخدم آليات الانتباه لمهام معالجة اللغة مثل الإجابة على الأسئلة والترجمة الآلية وتحليل المشاعر، وغيرها.
يتساءل الناس: هل يمكن زيادة كفاءة هذه النماذج الكبيرة مع تقليل التكلفة الحسابية ووقت التدريب؟
تم تطوير عدة طرق، مثل الشبكات العصبية التدريجية و التنسيق الشبكي و التوازي داخل الطبقات و وراثة المعرفة، لتقليل التكلفة الحسابية لتدريب الشبكات العصبية. وتقنية LiGO (مشغل النمو الخطي) الجديدة التي سنناقشها هي عبارة عن معيار جديد. وهي تقنية تقلل التكلفة الحسابية لتدريب نماذج اللغة الكبيرة بنسبة 50%.
قبل مناقشة هذه التقنية، من المهم التحقق من العوامل التي تساهم في ارتفاع تكلفة بناء نماذج اللغة الكبيرة.
تكلفة بناء نماذج اللغة الكبيرة
هناك ثلاثة نفقات رئيسية لتطوير نماذج اللغة الكبيرة:
1. الموارد الحسابية
بناء نماذج اللغة الكبيرة يتطلب موارد حسابية ضخمة لتدريبها على مجموعات بيانات كبيرة. يجب أن تتم معالجة مليارات المعلمات وتعلم الأنماط المعقدة من البيانات النصية الكبيرة.
يتطلب الاستثمار في الأجهزة المتخصصة مثل وحدات معالجة الرسومات (وحدات معالجة الرسومات) ووحدات معالجة التنسور لبناء وتدريب نماذج اللغة الكبيرة لتحقيق الأداء المثالي.
على سبيل المثال، تم تدريب GPT-3 على siêuكومبيوتر مع 10000 وحدة معالجة رسومات من فئة H100 و A100 و 285000 نواة معالجة.
2. استهلاك الطاقة
الموارد الحسابية الكثيفة المطلوبة لبناء نماذج اللغة الكبيرة تؤدي إلى استهلاك كبير للطاقة. على سبيل المثال، استغرق تدريب 175 مليار معلمة GPT-3 14.8 يومًا باستخدام 10000 وحدة معالجة رسومات V100، ما يعادل 3.55 مليون ساعة وحدة معالجة رسومات. هذا المستوى العالي من استهلاك الطاقة له آثار بيئية كبيرة أيضًا.
3. تخزين البيانات وإدارتها
نماذج اللغة الكبيرة مدربة على مجموعات بيانات كبيرة. على سبيل المثال، تم تدريب GPT-3 على مجموعة كبيرة من البيانات النصية، بما في ذلك Common Crawl و WebText2 و Books1 و Books2 و ويكيبيديا، وغيرها. يتطلب ذلك استثمارًا كبيرًا في البنية التحتية لجمع البيانات وتنقيحها وتخزينها.
كما يتطلب تخزين البيانات السحابي لخزن البيانات والخبرة البشرية لمعالجة البيانات ومراقبة الإصدارات. بالإضافة إلى ذلك، يضيف التأكد من أن استراتيجية البيانات تتوافق مع اللوائح مثل GDPR إلى التكلفة.
تقنية LiGO: تقليل تكلفة بناء نماذج اللغة الكبيرة إلى النصف
LiGO (مشغل النمو الخطي) هي تقنية جديدة طورتها الباحثون في معهد ماساتشوستس للتكنولوجيا لتقليل التكلفة الحسابية لتدريب نماذج اللغة الكبيرة بنسبة 50%. تتضمن هذه الطريقة تهيئة أوزان النماذج الأكبر من نماذج أصغر مدربة مسبقًا، مما يسمح بتوسيع الشبكات العصبية بفعالية.
يون كيم، المؤلف الرئيسي للورقة، يقول:
“تم تقدير أن تدريب النماذج بمقياس ما يُعتقد أن ChatGPT يعمل عليه قد يستغرق ملايين الدولارات فقط لتدريب واحد. هل يمكننا تحسين كفاءة هذه طرق التدريب حتى نتمكن من الحصول على نماذج جيدة في وقت أقصر وبمبلغ أقل؟ نقترح القيام بذلك بالاستفادة من نماذج اللغة الصغيرة التي تم تدريبها مسبقًا.”
تحافظ هذه الطريقة على فوائد الأداء لنماذج أكبر مع تقليل التكلفة الحسابية ووقت التدريب مقارنة بتدريب نموذج كبير من البداية. تستخدم LiGO مشغل نمو خطي مدفوع بالبيانات يجمع بين مشغلي العمق والعرض لتحقيق الأداء الأمثل.
استخدمت الورقة مجموعات بيانات مختلفة لإجراء تجارب قائمة على النص، بما في ذلك مجموعة ويكيبيديا الإنجليزية لتدريب نماذج BERT و RoBERTa، ومجموعة C4 لتدريب نموذج GPT2.
شملت تجربة تقنية LiGO توسيع BERT-Small إلى BERT-Base، و BERT-Base إلى BERT-Large، و RoBERTa-Small إلى RoBERTa-Base، و GPT2-Base إلى GPT2-Medium، و CaiT-XS إلى CaiT-S.
قارن الباحثون نهجهم بأسس أخرى عديدة، بما في ذلك التدريب من البداية، والتدريب التدريجي، و bert2BERT، و KI.
قدمت تقنية LiGO توفيرات بنسبة 44.7% في عمليات النقطة العائمة في الثانية (FLOPs) و 40.7% في وقت الجدار مقارنة بتدريب BERT-Base من البداية باستخدام نموذج BERT-Small. يتفوق مشغل نمو LiGO على StackBERT و MSLT و bert2BERT و KI في التدريب الفعال.
فوائد استخدام تقنية تحسين التدريب مثل LiGO
LiGO هي طريقة تدريب شبكات عصبية فعالة لها فوائد عديدة، وهي:
1. التدريب الأسرع
كما ذكرنا سابقًا، التدريب الأسرع هو الميزة الرئيسية لتقنية LiGO. يتدرب نماذج اللغة الكبيرة في نصف الوقت، مما يزيد من الإنتاجية ويقلل التكاليف.
2. كفاءة الموارد
LiGO كفاءة في الموارد لأنها تقلل من وقت الجدار و FLOPs، مما يؤدي إلى نهج أكثر كفاءة في التكلفة وصداقة البيئة لتدريب نماذج الترانسفورمر الكبيرة.
3. التعميم
تحسنت تقنية LiGO من أداء نماذج اللغة والرؤية، مما يشير إلى أنها تقنية قابلة للتعميم يمكن تطبيقها على مهام مختلفة.
بناء المنتجات التجارية هو جانب واحد فقط من التكاليف الإجمالية المرتبطة بأنظمة الذكاء الاصطناعي. ومكون آخر مهم من التكاليف يأتي من العمليات اليومية. على سبيل المثال، يكلف OpenAI حوالي $700,000 كل يوم للاستجابة للاستفسارات باستخدام ChatGPT. ومن المتوقع أن يواصل الباحثون استكشاف نهجج لجعل نماذج اللغة الكبيرة فعالة من حيث التكلفة أثناء التدريب وأكثر سهولة الوصول إليها في وقت التشغيل.
لمزيد من المحتوى المتعلق بالذكاء الاصطناعي، زوروا unite.ai.












