زاوية Anderson

إنشاء نموذج لغة مثل GPT لاسئلة واحدة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قام باحثون من الصين بتطوير طريقة اقتصادية لإنشاء أنظمة معالجة اللغة الطبيعية من نوع GPT-3 بينما يتجنبون التكلفة المتزايدة للوقت والمال في تدريب مجموعات بيانات كبيرة الحجم – وهو اتجاه متزايد يهدد في النهاية بتحويل هذا القطاع من الذكاء الاصطناعي إلى لاعبين من FAANG ومستثمرين من المستوى العالي.

ال_framework المقترح يسمى Task-Driven Language Modeling (TLM). بدلاً من تدريب نموذج كبير ومعقد على مجموعة كبيرة من مليارات الكلمات وألفات التسميات والفئات ، يتدرب TLM نموذجًا أصغر بكثير الذي يدمج في الواقع استفسارًا مباشرًا داخل النموذج.

المنتصف ، نهج hyperscale لنمذجة اللغة عالية الحجم ؛ اليمين ، طريقة TLM المضغوطة لاستكشاف مجموعة كبيرة من اللغة على أساس موضوع أو سؤال.

المنتصف ، نهج hyperscale لنمذجة اللغة عالية الحجم ؛ اليمين ، طريقة TLM المضغوطة لاستكشاف مجموعة كبيرة من اللغة على أساس موضوع أو سؤال. مصدر: https://arxiv.org/pdf/2111.04130.pdf

بصورة فعالة ، يتم إنتاج خوارزمية أو نموذج NLP فريد من أجل الإجابة على سؤال واحد ، بدلاً من إنشاء نموذج لغة عام كبير وعديم الشكل يمكنه الإجابة على مجموعة واسعة من الأسئلة.

في اختبار TLM ، وجد الباحثون أن النهج الجديد يحقق نتائج مشابهة أو أفضل من نماذج اللغة المسبقة مثل RoBERTa-Large ، ونظم NLP متوسطة الحجم مثل GPT-3 من OpenAI ، و TRILLION Parameter Switch Transformer Model من Google ، و HyperClover من Naver ، و Jurassic 1 من AI21 Labs ، و Megatron-Turing NLG 530B من Microsoft.

في تجارب TLM على ثمانية مجموعات بيانات عبر أربعة مجالات ، وجد المؤلفون أيضًا أن النظام يقلل من تدريب FLOPs (عمليات النقطة العائمة في الثانية) المطلوبة بنحو两个 أُمر من حيث الحجم. يأمل الباحثون أن يتمكن TLM من “دمقرطة” قطاع يصبح متزايدًا في النخبة ، مع نماذج NLP كبيرة جدًا بحيث لا يمكن تثبيتها بشكل واقعي محليًا ، وبدلاً من ذلك تقع ، في حالة GPT-3 ، خلف واجهات برمجة التطبيقات المكلفة وذات الوصول المحدود من OpenAI و Microsoft Azure.

يذكر المؤلفون أن تقليل وقت التدريب بنحو两个 أُمر من حيث الحجم يقلل من تكلفة التدريب على أكثر من 1000 وحدة معالجة رسومات لمدة يوم إلى 8 وحدات معالجة رسومات لمدة 48 ساعة.

التقرير الجديد يسمى NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework ، ويأتي من ثلاثة باحثين من جامعة تسينغهوا في بكين ، وباحث من شركة Recurrent AI ، Inc. في الصين.

إجابات غير قابلة للتكلفة

تكلفة تدريب نماذج لغة فعالة ومتعددة الأغراض تزداد بشكل متزايد وتوصف بأنها “حد حراري” محتمل على مدى الذي يمكن أن يصبح فيه NLP دقيقًا ومتوزعًا في الثقافة.

إحصائيات عن نمو الجوانب في هياكل نماذج NLP ، من تقرير 2020 من A121 Labs. مصدر: https://arxiv.org/pdf/2004.08900.pdf

إحصائيات عن نمو الجوانب في هياكل نماذج NLP ، من تقرير 2020 من A121 Labs. مصدر: https://arxiv.org/pdf/2004.08900.pdf

في عام 2019 ، حسب باحث أن تكلفة تدريب نموذج XLNet (الذي تم الإبلاغ عنه في ذلك الوقت بأنه يتفوق على BERT في مهام NLP) على 512 نواة عبر 64 جهازًا لمدة 2.5 يوم يبلغ 61,440 دولارًا أمريكيًا ، في حين أن GPT-3 يُقدر أنه قد كلف 12 مليون دولار لتدريبه – 200 مرة التكلفة التي كان من المفترض أن تكون لتدريب سابقه GPT-2 (على الرغم من أن التقديرات الحديثة تدعي أنه يمكن تدريبه الآن مقابل 4,600,000 دولار فقط على أقل معالجات رسومات السحابة تكلفة).

مجموعات بيانات بناءً على احتياجات الاستفسار

بدلاً من ذلك ، يسعى الإطار المعماري المقترح إلى الحصول على تصنيفات دقيقة وتصنيفات وعاملة باستخدام استفسارًا كفيلتر لتحديد مجموعة فرعية من المعلومات من قاعدة بيانات لغة كبيرة سيتم تدريبها ، جنبًا إلى جنب مع الاستفسار ، من أجل تقديم إجابات حول موضوع محدود.

يذكر المؤلفون:

‘TLM  هو  مدفوع  بفكرتين  رئيسيتين.   أولاً ،  يستخدم  البشر  مهارة  واحدة  باستخدام  جزء  صغير  فقط  من  معرفة  العالم  (على  سبيل  المثال ،  يحتاج  الطلاب  فقط  إلى  استعراض  بعض  الفصول ،  من  بين  جميع  الكتب  في  العالم ،  للتحضير  للاختبار). 

‘نفترض  أن  هناك  الكثير  من  التكرار  في  القاعدة  الكبيرة  لمهمة  محددة.   ثانياً ،  التدريب  على  بيانات  مسبقة  التصنيف  أكثر  كفاءة  في  البيانات  من  تحسين  هدف  نمذجة  اللغة  على  بيانات  غير  مسبقة  التصنيف.   بناءً  على  هذه  الدوافع ،  يستخدم  TLM  بيانات  المهمة  كاستفسارات  لاسترجاع  مجموعة  فرعية  صغيرة  من  القاعدة  العامة.   يتبع  ذلك  تحسين  مشترك  لهدف  مهمة  خاضعة  للإشراف  وهدف  نمذجة  اللغة  باستخدام  البيانات  المسترجعة  وبيانات  المهمة.’

إلى جانب جعل تدريب نموذج NLP فعالًا متاحًا ، يرى المؤلفون عددًا من المزايا لاستخدام نماذج NLP مدفوعة بالمهام. من بينها ، يمكن للباحثين الاستمتاع بمرونة أكبر ، مع استراتيجيات مخصصة لطول التسلسل وتنسيق البيانات وتحسين المعلمات وتمثيل البيانات.

يتوقع الباحثون أيضًا تطوير أنظمة هجينة مستقبلية تتنازل عن التدريب المسبق المحدود لنموذج PLM (الذي لا يتوقع في التنفيذ الحالي) مقابل مرونة أكبر وعاملة أكبر ضد أوقات التدريب. يعتبرون النظام خطوة إلى الأمام لتطوير أساليب التعمية من الصفر في المجال.

التجارب والنتائج

تم اختبار TLM على تحديات التصنيف في ثمانية مهام عبر أربعة مجالات – العلوم البيولوجية ، والأخبار ، والاستعراضات ، والعلوم الحاسوبية. تم تقسيم المهام إلى فئات عالية الموارد ومنخفضة الموارد. كانت المهام عالية الموارد تشمل أكثر من 5000 بيانات مهمة ، مثل AGNews و RCT ، من بين آخرين؛ المهام منخفضة الموارد تشمل ChemProt و ACL-ARC ، بالإضافة إلى مجموعة بيانات HyperPartisan لاكتشاف الأخبار.

قام الباحثون بتطوير مجموعتين تدريبيتين بعنوان Corpus-BERT و Corpus-RoBERTa ، حيث كانت الأخيرة أكبر بعشر مرات من الأولى. قارنت التجارب بين نماذج اللغة المسبقة العامة BERT و RoBERTA مع الهيكل الجديد.

يشير الورقة إلى أن TLM ، على الرغم من كونه نهجًا عامًا ، يجب أن يكون محدودًا في نطاقه وتطبيقه أكثر من نماذج الدولة الفنية الأكثر شمولاً والأكثر حجمًا ، إلا أنه قادر على أداء قريب من أساليب التخصيص المجال.

النتائج من مقارنة أداء TLM مع مجموعات BERT و RoBERTa. تُظهر النتائج متوسط درجة F1 عبر ثلاثة مقاييس تدريبية مختلفة ، وتُظهر عدد المعاملات ، وكمية الحساب الإجمالي (FLOPs) ، وحجم قاعدة التدريب.

النتائج من مقارنة أداء TLM مع مجموعات BERT و RoBERTa. تُظهر النتائج متوسط درجة F1 عبر ثلاثة مقاييس تدريبية مختلفة ، وتُظهر عدد المعاملات ، وكمية الحساب الإجمالي (FLOPs) ، وحجم قاعدة التدريب.

يختم المؤلفون بأن TLM قادر على تحقيق نتائج قابلة للمقارنة أو أفضل من PLMs ، مع تقليل كبير في FLOPs المطلوبة ، ويتطلب فقط 1/16 من حجم قاعدة التدريب. على المقاييس المتوسطة والكبيرة ، يبدو أن TLM يمكن أن يحسن الأداء بمتوسط 0.59 و 0.24 نقطة ، مع تقليل حجم بيانات التدريب بنحو两个 أُمر من حيث الحجم.

‘تؤكد هذه النتائج أن TLM دقيق جدًا وأكثر كفاءة من PLMs. علاوة على ذلك ، يكسب TLM مزايا أكبر في الكفاءة عند مقياس أكبر. يشير هذا إلى أن PLMs الأكبر قد تم تدريبها لتخزين معرفة عامة أكثر لا تُستخدم لمهمة محددة.’

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai