هندسة المحفزات
تدريب تعبئة النصوص المحسنة باستخدام نماذج اللغة الكبيرة

تعبئة النصوص هي تمثيلات متجهية للكلمات أو الجمل أو الفقرات أو المستندات التي تُحافظ على المعنى الدلالي. وتُعتبر هذه التعبئة حجر الزاوية في العديد من تطبيقات معالجة اللغة الطبيعية (NLP) اليوم، بما في ذلك استرجاع المعلومات وطرح الأسئلة والبحث الدلالي والمزيد.
أظهر التقدم الأخير في نماذج اللغة الكبيرة (LLMs) مثل GPT-3 القدرة على التعلم بسرعة وكفاءة في توليد اللغة الطبيعية. هل يمكننا الاستفادة من نماذج LLMs لتحسين حالة تعبئة النصوص؟ في ورقتهم البحثية “تحسين تعبئة النصوص بنماذج اللغة الكبيرة“، يقترح الباحثون من مايكروسوفت طريقة جديدة تحقق نتائج متفوقة من خلال توليد بيانات تدريبية اصطناعية باستخدام نماذج LLMs وضبطها الدقيق.
تحديات الطرق الحالية
تكنولوجيا تعبئة النصوص التقليدية مثل المتوسط المرجح لمتجهات الكلمات أو TF-IDF تفشل في 捕获 المعلومات السياقية الغنية في النص. وتقنيات أكثر حداثة تستند إلى نماذج لغة مسبقة التدريب مثل BERT تحصل على تعبئة السياق أكثر دقة.
然而، تتطلب خطوط أنابيب تدريبية معقدة متعددة المراحل:
- التدريب المسبق على مليارات من الأزواج النصية الضعيفة التسمية أو الاصطناعية
- التحسين الدقيق على مجموعات بيانات محدودة ومُعدّة يدوياً
هذا يتطلب موارد حاسوبية ضخمة وجهود بشرية لجمع البيانات. البيانات التدريبية مقيدة في التنوع والتغطية اللغوية. على سبيل المثال، يتكون إطار بيير فقط من مجموعات بيانات لمدة 15 مهمة استرجاع باللغة الإنجليزية.
الطرق الحالية تستخدم في الغالب نماذج بنية أقل مثل BERT كنموذج أساسي. لا تستطيع الاستفادة من نماذج LLMs الأكثر تقدمًا والتقنيات ذات الصلة.
منهجية: توليد بيانات اصطناعية بنماذج LLMs
للتغلب على هذه القيود، يقترح الباحثون منهجية تدريب جديدة من مرحلة واحدة تستفيد من نماذج LLMs مثل GPT-3 وGPT-4 لتوليد بيانات تدريبية اصطناعية متنوعة.
الخطوات الرئيسية هي:
- تصنيف المهام: تعريف تصنيف يصنف مهام تعبئة النصوص إلى:
- مهام غير متماثلة (الاستعلام والوثيقة ليست عبارات متشابهة، على سبيل المثال البحث)
- مهام متماثلة (الاستعلام والوثيقة عبارات متشابهة، على سبيل المثال التشابه الدلالي)
- تصميم الاستعلام: إنشاء قوالب استعلام مخصصة لكل نوع من أنواع المهام توجيه نماذج LLMs لتوليد أمثلة تدريبية ذات صلة.
- توليد البيانات الاصطناعية: استعلام نماذج LLMs باستخدام القوالب المصممة لتوليد مئات الآلاف من أزواج (استعلام، وثيقة) تغطي مجموعة واسعة من المهام الدلالية عبر 93 لغة.
- تدريب النموذج: ضبط نموذج LLM مفتوح المصدر قوي مثل Mistral على البيانات الاصطناعية باستخدام خسارة تقاربية.
تسمح هذه المنهجية بإنشاء بيانات تدريبية وافرة لمهام متنوعة باللغات المتعددة دون أي جهد تسمية بشري. من خلال الاستفادة من المعرفة المدمجة في نماذج LLMs من خلال التدريب المسبق على مجموعات بيانات كبيرة، يمكننا توليد بيانات عالية الجودة مخصصة بدقة لتعبئة النصوص.
النتائج
قيم الباحثون نموذجهم على إطار MTEB، الذي يغطي مهام متنوعة عبر التصنيف والتشبيه والتشابه الدلالي والتلخيص و استرجاع المعلومات.
تفوق نموذجهم على أفضل النتائج السابقة بفارق 2.4 نقطة في متوسط الدرجات، مما يحدد سجلات جديدة لمعظم الفئات:
| النموذج | الأفضل السابق | النموذج المقترح |
|---|---|---|
| التصنيف | 76.0 | 78.5 |
| التشبيه | 46.1 | 50.3 |
| التصنيف الزوجي | 87.1 | 88.3 |
| إعادة الترتيب | 60.0 | 60.2 |
| استرجاع | 54.3 | 56.9 |
| STS | 83.1 | 84.6 |
| التلخيص | 31.6 | 31.4 |
| المتوسط | 64.2 | 66.6 |
من المثير للاهتمام أن النموذج، حتى بدون استخدام أي بيانات مسماة وبتدريب فقط على البيانات الاصطناعية، حقق دقة تنافسية – فقط 3.5 نقطة خلف النموذج الخاضع للإشراف الكامل. هذا يظهر جدوى توليد تعبئة النصوص فقط باستخدام نماذج LLMs، دون جهد تسمية بشري.
التحليل
يقدم هذا العمل عدة استنتاجات قيمة:
- نماذج LLMs مثل GPT-3 وGPT-4 لها القدرة على توليد بيانات تدريبية عالية الجودة لمهام NLP متنوعة عند التوجيه بشكل مناسب. يمكن أن يقلل هذا من الاعتماد على البيانات المسماة يدوياً.
- للتعبئة النصوص، توفر التدريب المسبق بالتقارن مكاسب زهيدة مقارنة بضبط نماذج مثل Mistral التي تم تدريبها مسبقًا على مجموعات بيانات كبيرة. هذا هو استكشاف هام لэффективية التدريب.
- أساليب توليد المحتوى المدعومة بالاسترجاع تمكن نماذج LLMs من الوصول ديناميكيًا إلى المعرفة الخارجية. ومن ثم، تحسين تعبئة النصوص هو مفيد لتعزيز هذه النماذج.
- هناك فرصة كبيرة للتحسين في اللغات منخفضة الموارد. يمكن أن تساعد نماذج LLMs متعددة اللغات المُتدربة على بيانات أكثر تمثيلاً في إغلاق هذه الفجوة.
- مفهوميًا، النمذجة اللغوية وتعبئة النصوص هما وجهان لعملة واحدة – فهم معاني اللغة. مع التوجيه بالبيانات الاصطناعية، يمكن ضبط نماذج LLMs بشكل عضوي إلى تعبئة دون خطوط أنابيب معقدة.
التخصيص والسيطرة
من المزايا الرئيسية للبيانات الاصطناعية القدرة على توليد أمثلة مبرمجة لتلبية احتياجات محددة. كما أظهرت الورقة، يسمح تصميم التوجيه بإنشاء بيانات تدريبية لمئات الآلاف من مهام التعبئة.
التدريب على النطاق الواسع
في حين أن نماذج LLMs المُتدربة مسبقًا تحمل بالفعل معارف لغوية كبيرة، من المحتمل أن تتحسن مهارات توليد البيانات لديها مع زيادة الحجم. النماذج مثل GPT-4 المُتدربة على تريليونات من الرموز النصية تظهر تعلمًا قويًا بسرعة، ولكنها لم تُختبر بشكل خاص لتوليد بيانات تدريبية.
الوظائف المتعددة والمتعددة اللغات
كما لاحظت الورقة، تحسين الأداء على اللغات منخفضة الموارد لا يزال مشكلة. بدلاً من التدريب على نموذج LLMs كبير واحد، يمكن تدريب أسطول من نماذج أصغر متخصصة في نماذج بيانات أو مجالات لغوية معينة.
يمكن أن يساعد هذا النهج في تحسين التغطية على مهام ولغات نادرة من خلال مشاركة التمثيلات المُكتسبة عبر الخبراء. التعلم المستمر لتوسيع الخبرة اللغوية والمهام مع مرور الوقت هو أيضًا منظور مثير.
في الختام، تقدم هذه الورقة مفهومًا مبتكرًا لتوليد بيانات تدريبية من نماذج LLMs لإنشاء تعبئة نصوص قوية. تُظهر نتائجهم فعالية هذه المنهجية، متغلبة على المعايير السابقة. مع تقدم نماذج LLMs و تقنيات البيانات الاصطناعية، يمكن أن يصبح الاستفادة من معرفتهم لتدريب تعبئة النصوص اتجاهًا واعدًا.













