نماذج ومنصات الذكاء الاصطناعي
تعزيز النماذج اللغوية الكبيرة من خلال التنبؤ المتعدد الرموز
النماذج اللغوية الكبيرة (LLMs) مثل GPT و LLaMA وغيرها قد أثاروا ضجة كبيرة بفضل قدرتهم الرائعة على فهم وتوليد نصوص تشبه النصوص البشرية. ومع ذلك، على الرغم من قدراتها المذهلة، فإن الطريقة التقليدية لتدريب هذه النماذج، المعروفة باسم “التنبؤ بالرمز التالي”، لها بعض القيود المتأصلة.
في التنبؤ بالرمز التالي، يتم تدريب النموذج على التنبؤ بالرمز التالي في التسلسل المعطى السابق. بينما أثبتت هذه الطريقة نجاحها، يمكن أن تؤدي إلى نماذج تعاني من صعوبة في التعامل مع التبعيات على المدى الطويل والمهام المعقدة. بالإضافة إلى ذلك، يمكن أن يؤدي عدم التطابق بين نظام التدريب (التدريب القسري) وعملية التوليد أثناء الاستدلال (التوليد التكراري) إلى أداء غير مثالي.
في ورقة بحثية حديثة بواسطة Gloeckle et al. (2024) من Meta AI، تم تقديم نموذج تدريب جديد يسمى “التنبؤ المتعدد الرموز” يهدف إلى معالجة هذه القيود وتعزيز النماذج اللغوية الكبيرة. في هذه المقالة، سنغوص في المفاهيم الأساسية والتفاصيل الفنية والآثار المحتملة لهذا البحث الرائد.
التنبؤ بالرمز الفردي: النهج التقليدي
قبل الغوص في تفاصيل التنبؤ المتعدد الرموز، من المهم فهم النهج التقليدي الذي كان حجر الزاوية في تدريب النماذج اللغوية الكبيرة لسنوات – التنبؤ بالرمز الفردي، المعروف أيضًا باسم التنبؤ بالرمز التالي.
مفاهيم التنبؤ بالرمز التالي
في نموذج التنبؤ بالرمز التالي، يتم تدريب النماذج اللغوية على التنبؤ بالرمز التالي في التسلسل المعطى السابق. بشكل正式، يتم تكليف النموذج بتعظيم احتمال الرمز التالي xt+1، معطية الرموز السابقة x1، x2، …، xt. يتم ذلك عادةً عن طريق تقليل خسارة التباين المتقاطع:
L = -Σt log P(xt+1 | x1, x2, …, xt)
هذا الهدف التدريبي البسيط ولكن القوي كان أساسًا لنجاح العديد من النماذج اللغوية الكبيرة الناجحة، مثل GPT (Radford et al.، 2018) و BERT (Devlin et al.، 2019) وأشكالها.
التدريب القسري والتوليد التكراري
يعتمد التنبؤ بالرمز التالي على تقنية تدريب تسمى “التدريب القسري”، حيث يتم تزويد النموذج بالحقيقة الأرضية لكل رمز مستقبلي خلال التدريب. هذا يسمح للنموذج بالتعلم من السياق الصحيح والتسلسلات المستهدفة، مما يسهل التدريب الأكثر استقرارًا والكفاءة.
然而، أثناء الاستدلال أو التوليد، يعمل النموذج بطريقة تكرارية، حيث يتنبأ برمز واحد في كل مرة بناءً على الرموز المولدة مسبقًا. يمكن أن يؤدي هذا عدم التطابق بين نظام التدريب (التدريب القسري) ونظام الاستدلال (التوليد التكراري) إلى أداء غير مثالي، خاصةً للتسلسلات الأطول أو المهام المعقدة.
قيود التنبؤ بالرمز التالي
على الرغم من نجاح التنبؤ بالرمز التالي، إلا أنه يوجد بعض القيود المتأصلة:
- التركيز القصير الأمد: من خلال التنبؤ فقط بالرمز التالي، قد يجد النموذج صعوبة في التقاط التبعيات على المدى الطويل والهيكل العام والاتساق للنص، مما قد يؤدي إلى تعارضات أو توليد غير متسق.
- الاعتماد على الأنماط المحلية: يمكن أن يعتمد نموذج التنبؤ بالرمز التالي على الأنماط المحلية في بيانات التدريب، مما يجعل من الصعب تعميمها إلى سيناريوهات خارج التوزيع أو المهام التي تتطلب استدلالًا أكثر تجريدًا.
- القدرات الاستدلالية:对于 المهام التي تتطلب استدلالًا متعددي الخطوات أو عمليات منطقية معقدة، قد لا يوفر التنبؤ بالرمز التالي التحيزات الاستدلالية أو التمثيلات الكافية لدعم هذه القدرات بشكل فعال.
- عدم الكفاءة في العينة: بسبب الطبيعة المحلية للتنبؤ بالرمز التالي، قد يحتاج النماذج إلى مجموعات بيانات أكبر لاكتساب المعرفة وال مهارات الاستدلالية اللازمة، مما يؤدي إلى عدم كفاءة العينة المحتملة.
هذه القيود دفعت الباحثين إلى استكشاف أنماط تدريب بديلة، مثل التنبؤ المتعدد الرموز، الذي يهدف إلى معالجة بعض من هذه القيود وفتح قدرات جديدة للنماذج اللغوية الكبيرة.
من خلال مقارنة نهج التنبؤ بالرمز التالي التقليدي مع تقنية التنبؤ المتعدد الرموز الجديدة، يمكن للقراء تقدير أفضل لدوافع وفوائد الأخير، مما يضع الأساس لمزيد من الاستكشاف لهذا البحث الرائد.
ما هو التنبؤ المتعدد الرموز؟
الفكرة الرئيسية وراء التنبؤ المتعدد الرموز هي تدريب النماذج اللغوية على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت، بدلاً من التنبؤ فقط بالرمز التالي. بشكل محدد، خلال التدريب، يتم تكليف النموذج بالتنبؤ بالرموز n المستقبلية التالية في كل موضع في مجموعة التدريب، باستخدام n رؤوس خرج مستقلة تعمل على قمة جذع نموذج مشترك.
على سبيل المثال، مع إعداد التنبؤ ب 4 رموز، سيتم تدريب النموذج على التنبؤ بالرموز 4 المستقبلية في نفس الوقت، معطية السياق السابق. هذا النهج يشجع النموذج على التقاط التبعيات على المدى الأطول وتطوير فهم أفضل للهيكل العام والاتساق للنص.
مثال بسيط
للفهم أفضل لمفهوم التنبؤ المتعدد الرموز، دعونا نعتمد على مثال بسيط. افترض أن لدينا الجملة:
“السرعة السريعة البني الثعلب ي 跳ع على الكلب الكسول.”
في نهج التنبؤ بالرمز التالي التقليدي، يتم تدريب النموذج على التنبؤ بالرمز التالي معطية السياق السابق. على سبيل المثال، مع السياق “السرعة السريعة البني الثعلب ي 跳ع على”، يتم تكليف النموذج بالتنبؤ بالرمز التالي، “الكسول”.
مع التنبؤ المتعدد الرموز، ومع ذلك، يتم تدريب النموذج على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت. على سبيل المثال، إذا قمنا بتعيين n=4، يتم تدريب النموذج على التنبؤ بالتسلسل “الكسول” في نفس الوقت. مع نفس السياق “السرعة السريعة البني الثعلب ي 跳ع على”، يتم تكليف النموذج بالتنبؤ بالتسلسل “الكسول ” (ملاحظة الفضاء بعد “الكسول” لتحديد نهاية الجملة).
من خلال تدريب النموذج على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت، يتم تشجيع النموذج على التقاط التبعيات على المدى الأطول وتطوير فهم أفضل للهيكل العام والاتساق للنص.
ال细节 الفنية
يقترح المؤلفون هيكلاً بسيطًا وفعالًا لتنفيذ التنبؤ المتعدد الرموز. يتكون النموذج من جذع تحويل مشترك ينتج تمثيلًا كامنًا للسياق الإدخالي، يليها n طبقات تحويل مستقلة (رؤوس خرج) تتنبأ بالرموز المستقبلية المقابلة.
خلال التدريب، يتم تنسيق المرور الأمامي والخلفي بعناية لتحقيق الحد الأدنى من استخدام ذاكرة GPU. يقوم الجذع المشترك بحساب التمثيل الكامن، ثم تقوم كل رأس خرج على حدة بأداء المرور الأمامي والخلفي، مع تجميع التدرجات على مستوى الجذع. هذا النهج يمنع مادية جميع متجهات اللوجيت ومتجهات التدرج في نفس الوقت، مما يقلل من استخدام ذاكرة GPU الأقصى من O(nV + d) إلى O(V + d)، حيث V هو حجم القاموس و d هو بعد التمثيل الكامن.
التنفيذ ذو الكفاءة الذاكرية
أحد التحديات في تدريب المنبئين المتعددين الرموز هو تقليل استخدامهم لذاكرة GPU. منذ أن يكون حجم القاموس (V) عادةً أكبر بكثير من بعد التمثيل الكامن (d)، تصبح متجهات اللوجيت حجر الزاوية لاستخدام ذاكرة GPU.
للمعالجة مع هذا التحدي، يقترح المؤلفون تنفيذًا ذا كفاءة ذاكرية يعدل بعناية تسلسل العمليات الأمامية والخلفية. بدلاً من مادية جميع متجهات اللوجيت ومتجهات التدرج في نفس الوقت، يتم حساب المرور الأمامي والخلفي لكل رأس خرج مستقل على حدة، مع تجميع التدرجات على مستوى الجذع.
هذا النهج يمنع تخزين جميع متجهات اللوجيت ومتجهات التدرج في الذاكرة في نفس الوقت، مما يقلل من استخدام ذاكرة GPU الأقصى من O(nV + d) إلى O(V + d)، حيث n هو عدد الرموز المستقبلية التي يتم التنبؤ بها.
ميزات التنبؤ المتعدد الرموز
يقدم البحث عدة مزايا مقنعة لاستخدام التنبؤ المتعدد الرموز لتدريب النماذج اللغوية الكبيرة:
- تحسين كفاءة العينة: من خلال تشجيع النموذج على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت، يؤدي التنبؤ المتعدد الرموز إلى تحسين كفاءة العينة. يظهر المؤلفون تحسينات كبيرة في الأداء على مهام فهم و توليد الشفرة، مع نماذج تصل إلى 13 مليار معلمة تحل حوالي 15% أكثر من المشاكل في المتوسط.
- التوليد الأسرع: يمكن استخدام الرؤوس الخروجية الإضافية المدربة بالتنبؤ المتعدد الرموز لتعزيز التوليد الذاتي التكهن، وهو متغير من التوليد التكهن يسمح بالتنبؤ المتوازي للرموز. هذا يؤدي إلى تحسينات في وقت التوليد تصل إلى 3 أضعاف عبر مجموعة واسعة من أحجام الدفعة، حتى بالنسبة للنماذج الكبيرة.
- تعزيز التبعيات على المدى الطويل: يشجع التنبؤ المتعدد الرموز النموذج على التقاط التبعيات على المدى الأطول والأنماط في البيانات، وهو ما يفيد بشكل خاص في المهام التي تتطلب فهمًا واستدلالًا على سياقات أوسع.
- الاستدلال الخوارزمي: يقدم المؤلفون تجارب على مهام اصطناعية تظهر تفوق نماذج التنبؤ المتعدد الرموز في تطوير رؤوس استدلالية وخوارزمية، خاصةً لحجم النماذج الأصغر.
- الاتساق والاستمرارية: من خلال تدريب النموذج على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت، يشجع التنبؤ المتعدد الرموز على تطوير تمثيلات متسقة ومستمرة. هذا يفيد بشكل خاص في المهام التي تتطلب توليد نصوص أطول وأكثر اتساقًا، مثل القصص أو الكتابة الإبداعية أو إعداد الدورات التعليمية.
- تحسين التعميم: تشير تجارب المؤلفين على المهام الاصطناعية إلى أن نماذج التنبؤ المتعدد الرموز تظهر قدرات تعميم أفضل، خاصةً في الإعدادات خارج التوزيع. قد يكون هذا نتيجة قدرة النموذج على التقاط أنماط أوسع وتبعيات على المدى الأطول، مما يساعده على التعميم بشكل أكثر فعالية إلى سيناريوهات غير موضحة.

أمثلة وفرضيات
للمزيد من الفرضيات حول سبب فعالية التنبؤ المتعدد الرموز، دعونا نعتمد على بعض الأمثلة:
- توليد الشفرة: في سياق توليد الشفرة، يمكن أن يساعد التنبؤ بالرموز المتعددة في نفس الوقت النموذج على فهم وتوليد هياكل شفرة أكثر تعقيدًا. على سبيل المثال، عند توليد تعريف دالة، قد لا يوفر التنبؤ فقط بالرمز التالي السياق الكافي للنموذج لتوليد التوقيع الدقيق للدالة. ومع ذلك، بالتنبؤ بالرموز المتعددة في نفس الوقت، يمكن للنموذج التقاط التبعيات بين اسم الدالة والمعاملات ونوع الإرجاع بشكل أفضل، مما يؤدي إلى توليد شفرة أكثر دقة واتساقًا.
- الاستدلال اللغوي: في سيناريو حيث يتم تكليف نموذج لغوي ب回答 سؤال يتطلب استدلالًا على عدة خطوات أو قطع من المعلومات، يمكن أن يساعد التنبؤ بالرموز المتعددة في نفس الوقت النموذج على التقاط التبعيات بين مكونات عملية الاستدلال، مما يؤدي إلى استجابات أكثر اتساقًا ودقة.
- توليد النص الطويل: عند توليد نص طويل، مثل القصص أو المقالات أو التقارير، يمكن أن يكون الحفاظ على الاتساق والاستمرارية عبر فترة زمنية أطول تحديًا للنماذج اللغوية المدربة بالتنبؤ بالرمز التالي. يشجع التنبؤ المتعدد الرموز النموذج على تطوير تمثيلات تقاطع الهيكل العام وflux للنص، مما قد يؤدي إلى توليد نصوص أطول وأكثر اتساقًا.
القيود والمسارات المستقبلية
على الرغم من النتائج المثيرة التي قدمها البحث، هناك بعض القيود والأسئلة المفتوحة التي تستحق المزيد من الاستكشاف:
- العدد الأمثل للرموز: يبحث البحث في قيم مختلفة من n (عدد الرموز المستقبلية للتنبؤ) ووجد أن n=4 يعمل جيدًا للعديد من المهام. ومع ذلك، قد يعتمد القيمة المثالية من n على المهمة المحددة ومجموعة البيانات وحجم النموذج. يمكن أن يؤدي تطوير طرق منهجية لتحديد القيمة المثالية من n إلى تحسينات إضافية في الأداء.
- حجم القاموس والتحويل اللغوي: يلاحظ المؤلفون أن حجم القاموس الأمثل و استراتيجية التحويل اللغوي لنموذج التنبؤ المتعدد الرموز قد تختلف عن تلك المستخدمة لنموذج التنبؤ بالرمز التالي. يمكن أن يؤدي استكشاف هذا الجانب إلى تحسينات في التبادل بين طول التسلسل المضغوط والكفاءة الحاسوبية.
- خسائر التنبؤ المساعدة: يقترح المؤلفون أن عملهم قد يثير اهتمامًا بتطوير خسائر تنبؤ مساعدة جديدة للنماذج اللغوية الكبيرة، بخلاف التنبؤ بالرمز التالي التقليدي. يمكن أن يؤدي استكشاف خسائر التنبؤ البديلة وتركيباتها مع التنبؤ المتعدد الرموز إلى اتجاه بحثي مثير.
- الفهم النظري: على الرغم من أن البحث يقدم بعض الفرضيات والبراهين التجريبية لفعالية التنبؤ المتعدد الرموز، فإن الفهم النظري الأعمق لسبب وطريقة عمل هذا النهج سيكون قيمًا.
الخلاصة
يقدم البحث ورقة بحثية بعنوان “نماذج لغوية كبيرة أفضل وأسرع من خلال التنبؤ المتعدد الرموز” بواسطة Gloeckle et al. نموذج تدريب جديد يهدف إلى تحسين الأداء والقدرات للنماذج اللغوية الكبيرة. من خلال تدريب النماذج على التنبؤ بالرموز المستقبلية المتعددة في نفس الوقت، يشجع التنبؤ المتعدد الرموز على تطوير التبعيات على المدى الأطول والقدرات الاستدلالية والكفاءة في العينة.
التنفيذ الفني المقترح من قبل المؤلفين هو أنيق وذو كفاءة حاسوبية، مما يجعله قابلاً للتطبيق على تدريب النماذج اللغوية الكبيرة. بالإضافة إلى ذلك، القدرة على استخدام التوليد الذاتي التكهن للوصول إلى أوقات توليد أسرع هي ميزة عملية كبيرة.
على الرغم من وجود أسئلة مفتوحة ومسارات بحثية مستقبلية، يمثل هذا البحث خطوة مثيرة في مجال النماذج اللغوية الكبيرة. مع استمرار الطلب على نماذج لغوية أكثر قدرة وكفاءة، يمكن أن يصبح التنبؤ المتعدد الرموز مكونًا رئيسيًا في الجيل التالي من هذه الأنظمة الذكية.















