نماذج ومنصات الذكاء الاصطناعي
نماذج اللغة الكبيرة القائمة على الفكاك: دليل كامل
نماذج اللغة الكبيرة (LLMs) قد ثورة في مجال معالجة اللغة الطبيعية (NLP) من خلال إظهار قدرات مذهلة في توليد نص يشبه الإنسان ، والإجابة على الأسئلة ، والمساعدة في مجموعة واسعة من المهام المتعلقة باللغة. في قلب هذه النماذج القوية تقع هندسة الفكاك فقط ، وهي نسخة من هندسة الفكاك الأصلية التي اقترحها الورقة العلمية “الانتباه هو كل ما تحتاجه” بواسطة Vaswani وآخرون.
في هذا الدليل الشامل ، سنستكشف الأعمال الداخلية لنماذج LLMs القائمة على الفكاك ، ونتعمق في الكتل الأساسية ، والابتكارات الهندسية ، والتفاصيل التطبيقية التي دفعت هذه النماذج إلى الطليعة في بحوث NLP والتطبيقات.
هندسة الفكاك: تحديث
قبل الغوص في تفاصيل نماذج LLMs القائمة على الفكاك ، من المهم إعادة زيارة هندسة الفكاك ، والتي تقوم عليها هذه النماذج. قدم الفكاك نهجًا جديدًا لنمذجة التسلسل ، معتمدًا فقط على آليات الانتباه لالتقاط التبعيات على المدى الطويل في البيانات ، دون الحاجة إلى طبقات متكررة أو محسنة.
تتكون هندسة الفكاك الأصلية من مكونين رئيسيين: فكاك و فكاك. يعالج الفكاك التسلسل المدخل ويولد تمثيلًا سياقيًا ، الذي يستهلكه الفكاك لإنتاج التسلسل الخروج.
الانتباه الذاتي: مفتاح نجاح الفكاك
في قلب الفكاك تقع آليات الانتباه الذاتي ، وهي تقنية قوية تسمح للنموذج بوزن وتجميع المعلومات من مواقع مختلفة في التسلسل المدخل. على عكس نماذج التسلسل التقليدية ، التي تعالج رموز التسلسل بشكل متسلسل ، يسمح الانتباه الذاتي للنموذج بتقاط التبعيات بين أي زوج من الرموز ، بغض النظر عن موقعه في التسلسل.
يمكن تقسيم عملية الانتباه الذاتي إلى ثلاث خطوات رئيسية:
- مشاريع الاستفسار والключ والقيمة: يُحول التسلسل المدخل إلى ثلاث تمثيلات منفصلة: استفسارات (Q) ، مفاتيح (K) ، و قيم (V). يتم الحصول على هذه المشاريع عن طريق ضرب المدخل في مصفوفات وزن متعلمة.
- حساب درجات الانتباه: لكل موقع في التسلسل المدخل ، تُحسب درجات الانتباه عن طريق أخذ حاصل الضرب النقطي بين متجه الاستفسار المقابل ومتاهب المفتاح. تمثل هذه الدرجات أهمية كل موقع بالنسبة للموقع الحالي المعالج.
- مجموع القيم المرجحة: تُطبيق دالة الصوت على درجات الانتباه ، ويُستخدم الوزن الناتج لحساب مجموع قيم مرجح ، مما ينتج تمثيل الإخراج للموقع الحالي.
الانتباه متعدد الرؤوس ، وهو متغير من آليات الانتباه الذاتي ، يسمح للنموذج بتقاط أنواع مختلفة من العلاقات عن طريق حساب درجات الانتباه عبر رؤوس متعددة بالتوازي ، كل منها بمجموعته الخاصة من مشاريع الاستفسار والключ والقيمة.
المراجعات الهندسية والتهيئات
في حين أن المبادئ الأساسية لنماذج LLMs القائمة على الفكاك تظل متسقة ، قام الباحثون باستكشاف مراجعات هندسية وتهيئات مختلفة لتحسين الأداء والكفاءة والقدرات العامة.
أنواع الهندسة
يمكن تصنيف نماذج LLMs القائمة على الفكاك إلى ثلاثة أنواع رئيسية: فكاك-فكاك ، فكاك سببي ، وفكاك بادئة. لكل نوع هندسي أنماط انتباه مميزة.
هندسة الفكاك-الفكاك
بناءً على نموذج الفكاك الفانيلي ، تتكون هندسة الفكاك-الفكاك من صفيين: فكاك و فكاك. يستخدم الفكاك طبقات انتباه ذاتي متعددة الرؤوس لمعالجة التسلسل المدخل وتوليد تمثيلات كامنة. ثم يقوم الفكاك بتقاط انتباه متقاطع على هذه التمثيلات لتوليد التسلسل الهدف. على الرغم من فعاليتها في مهام NLP المختلفة ، فإن عددًا قليلاً من نماذج LLMs ، مثل Flan-T5 ، تتبنى هذه الهندسة.
هندسة الفكاك السببي
تتضمن هندسة الفكاك السببي قناع انتباه واحد الاتجاه ، مما يسمح لكل رمز مدخل بالانتباه فقط إلى الرموز السابقة له وله. يتم معالجة رموز المدخل والإخراج داخل نفس الفكاك. نماذج ملحوظة مثل GPT-1 و GPT-2 و GPT-3 مبنية على هذه الهندسة ، مع أن GPT-3 أظهرت قدرات تعلم سياقية رائعة. وقد اعتمدت العديد من نماذج LLMs ، بما في ذلك OPT و BLOOM و Gopher ، على فكاك سببي على نطاق واسع.
هندسة الفكاك البادئة
تُعرف أيضًا باسم الفكاك غير السببي ، تعديل هندسة الفكاك السببي آليتها القناع لتمكين الانتباه ثنائي الاتجاه على رموز البادئة و الانتباه غير السببي على الرموز المولدة. مثل هندسة الفكاك-الفكاك ، يمكن لفكاك البادئة ترميز التسلسل البادئ بشكل ثنائي الاتجاه وتوقع رموز الإخراج بشكل تكراري باستخدام معلمات مشتركة. تشمل نماذج LLMs القائمة على فكاك البادئة GLM130B و U-PaLM.
يمكن تمديد جميع أنواع الهندسة الثلاث باستخدام تقنية خليط الخبراء (MoE) ، والتي تنشط باختصار مجموعة فرعية من أوزان الشبكة العصبية لكل مدخل. هذا النهج تم تطبيقه في نماذج مثل Switch Transformer و GLaM ، مع زيادة عدد الخبراء أو حجم المعلمات الإجمالي أظهر تحسينات كبيرة في الأداء.
فكاك فقط: تبني الطبيعة التكرارية
في حين أن هندسة الفكاك الأصلية تم تصميمها في الأصل لمهام التسلسل إلى التسلسل مثل الترجمة الآلية ، يمكن إطار العديد من مهام NLP ، مثل نمذجة اللغة وتوليد النص ، كمسائل تكرارية ، حيث يولد النموذج رمزًا واحدًا في كل مرة ، مشروطًا بالرموز المولدة مسبقًا.
ادخل فكاك فقط ، وهو متغير مبسط من هندسة الفكاك ، الذي يحتفظ فقط بمكون الفكاك. هذه الهندسة مناسبة بشكل خاص لمهام التكرار ، حيث يولد رموز الإخراج واحدة تلو الأخرى ، مستفيدًا من الرموز المولدة مسبقًا كسياق مدخل.
الفرق الرئيسي بين فكاك فقط وفكاك الفكاك الأصلي يكمن في آليته الانتباه الذاتي. في إعداد فكاك فقط ، يتم تعديل عملية الانتباه الذاتي لمنع النموذج من الانتباه إلى الرموز المستقبلية ، وهي خاصية تعرف باسم السببية. يتم تحقيق ذلك من خلال تقنية تسمى “انتباه ذاتي مقنّع” ، حيث يتم تعيين درجات الانتباه المقابلة لمواقع مستقبلية إلى سالب اللانهاية ، مما يؤدي إلى تقنيعها بشكل فعال خلال خطوة تطبيع الصوت.
المكونات الهندسية لنماذج LLMs القائمة على الفكاك
في حين أن المبادئ الأساسية للانتباه الذاتي والانتباه الذاتي المقنّع تظل متسقة ، قام نماذج LLMs الحديثة القائمة على الفكاك بتقديم ابتكارات هندسية عديدة لتحسين الأداء والكفاءة والقدرات العامة. دعونا نستكشف بعض المكونات والتقنيات الرئيسية المستخدمة في نماذج LLMs الرائدة.
تمثيل المدخل
قبل معالجة التسلسل المدخل ، تستخدم نماذج LLMs القائمة على الفكاك تقنيات التجزئة والتحويل إلى تمثيلات رقمية لتحويل النص الخام إلى تمثيل مناسب للنموذج.
التجزئة: عملية التجزئة تحول النص المدخل إلى تسلسل من الرموز ، والتي يمكن أن تكون كلمات أو شظايا كلمات أو حتى رموز فردية ، اعتمادًا على استراتيجية التجزئة المستخدمة. تشمل تقنيات التجزئة الشائعة لنماذج LLMs التشفير بالكتل ، و SentencePiece ، و WordPiece. تهدف هذه الأساليب إلى تحقيق توازن بين حجم القاموس ودقة التمثيل ، مما يسمح للنموذج بمعالجة الكلمات النادرة أو غير الموجودة في القاموس بشكل فعال.
تحويل الرموز إلى متجهات: بعد التجزئة ، يتم ánh لكل رمز إلى تمثيل متجهي كثيف يسمى تحويل الرمز. يتم تعلم هذه التحويلات خلال عملية التدريب وتحصل على العلاقات الدلالية والصرفية بين الرموز.
تحويلات vị trí: نظرًا لأن نماذج الفكاك تعالج التسلسل بأكمله في وقت واحد ، فإنها تفتقر إلى مفهوم موقع الرمز المتأصل في النماذج المتكررة. لدمج المعلومات الموقعية ، يتم إضافة تحويلات vị trí إلى تحويلات الرموز ، مما يسمح للنموذج بالتمييز بين الرموز بناءً على مواقعها في التسلسل. استخدمت نماذج LLMs المبكرة تحويلات vị trí ثابتة dựa على دوال جيبية ، في حين استكشفت نماذج أحدث تحويلات vị trí قابلة للتعلم أو تقنيات ترميز vị trí بديلة مثل تحويلات vị trí الدورانية.
كتل الانتباه متعددة الرؤوس
المكونات الأساسية لنماذج LLMs القائمة على الفكاك هي طبقات الانتباه متعددة الرؤوس ، التي تقوم بعمليات الانتباه الذاتي المقنّعة الموصوفة سابقًا. يتم تكرار هذه الطبقات عدة مرات ، مع كل طبقة تنتباه إلى إخراج الطبقة السابقة ، مما يسمح للنموذج بتقاط تبعيات وتمثيلات متزايدة التعقيد.
رؤوس الانتباه: تتكون كل طبقة من الانتباه متعددة الرؤوس من عدة “رؤوس انتباه” ، كل منها بمجموعته الخاصة من مشاريع الاستفسار والключ والقيمة. هذا يسمح للنموذج بالانتباه إلى جوانب مختلفة من المدخل في وقت واحد ، مما يتيح له التقاط علاقات ونمطين متنوعين.
الروابط المتبقية والتعديل الطبقي: لتحسين تدريب الشبكات العصبية العميقة وتخفيف مشكلة التدرج الافتراضي ، تستخدم نماذج LLMs القائمة على الفكاك روابط متبقية و تقنيات تعديل الطبقي. الروابط المتبقية تضيف مدخل الطبقة إلى إخراجها ، مما يسمح للتدرجات بالتدفق بسهولة أكبر خلال التدرج العكسي. يساعد تعديل الطبقي في تثبيت التنشيطات والتدرجات ، مما يزيد من استقرار التدريب والأداء.
طبقات التغذية الأمامية
إضافة إلى طبقات الانتباه متعددة الرؤوس ، تتضمن نماذج LLMs القائمة على الفكاك طبقات تغذية أمامية ، والتي تطبق شبكة عصبية بسيطة إلى كل موقع في التسلسل. هذه الطبقات تroduce غير خطي وتسمح للنموذج بتعلم تمثيلات أكثر تعقيدًا.
دالات التنشيط: يمكن أن تؤثر اختيار دالة التنشيط في طبقات التغذية الأمامية بشكل كبير على أداء النموذج. في حين اعتمدت نماذج LLMs المبكرة على دالة التنشيط ReLU ، فإن نماذج أحدث اعتمدت دوال تنشيط أكثر تطورًا مثل الوحدة الخطية المعززة (GELU) أو دالة SwiGLU ، والتي أظهرت أداءً محسّنًا.
انتباه نادر وكفاءة الفكاك
على الرغم من قوة آليته الانتباه ، فإنها تأتي مع تعقيد حسابي تربيعي بالنسبة إلى طول التسلسل ، مما يجعلها مكلفة حسابيًا للتسلسلات الطويلة. لتلبية هذا التحدي ، تم اقتراح عدة تقنيات لتحسين كفاءة الانتباه وتقليل المتطلبات الحسابية والذاكرة ، مما يسمح بمعالجة تسلسلات أطول.
انتباه نادر: تقنيات الانتباه النادر ، مثل تلك المستخدمة في نموذج GPT-3 ، تنتباه إلى جزء من المواقع في التسلسل المدخل ، بدلاً من حساب درجات الانتباه لجميع المواقع. هذا يمكن أن يقلل بشكل كبير من التعقيد الحسابي مع الحفاظ على أداء معقول.
انتباه نافذة الانزلاق: تم تقديم انتباه نافذة الانزلاق (SWA) في نموذج Mistral 7B ، وهو تقنية بسيطة وفعالة تقصر نطاق الانتباه لكل رمز إلى حجم نافذة محدد. هذا النهج يستفيد من قدرة طبقات الفكاك على نقل المعلومات عبر الطبقات المتعددة ، مما يزيد من نطاق الانتباه دون تعقيدات الانتباه الكامل.
مخزن ذاكرة التخزين المتحرك: لتقليل المتطلبات الذاكرة ، خاصة للتسلسلات الطويلة ، يستخدم نموذج Mistral 7B مخزن ذاكرة التخزين المتحرك. هذه التقنية تخزن وستخدم متجهات المفتاح والقيمة المحسوبة ل حجم نافذة محدد ، مما يمنع الحسابات الزائدة ويقلل من استخدام الذاكرة.
انتباه الاستفسار المجموع: تم تقديم انتباه الاستفسار المجموع (GQA) في نموذج LLaMA 2 ، وهو متغير من آليته الانتباه المتعددة ، يقسم رؤوس الانتباه إلى مجموعات ، كل مجموعة تشترك في متجهات المفتاح والقيمة المشتركة. هذا النهج يجد توازنًا بين كفاءة انتباه الاستفسار المتعدد وأداء الانتباه الذاتي القياسي ، مما يوفر أوقات استدلال محسنة مع الحفاظ على نتائج عالية الجودة.
















