نماذج ومنصات الذكاء الاصطناعي

نماذج اللغة الكبيرة القائمة على الفكاك: دليل كامل

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

نماذج اللغة الكبيرة (LLMs) قد ثورة في مجال معالجة اللغة الطبيعية (NLP) من خلال إظهار قدرات مذهلة في توليد نص يشبه الإنسان ، والإجابة على الأسئلة ، والمساعدة في مجموعة واسعة من المهام المتعلقة باللغة. في قلب هذه النماذج القوية تقع هندسة الفكاك فقط ، وهي نسخة من هندسة الفكاك الأصلية التي اقترحها الورقة العلمية “الانتباه هو كل ما تحتاجه” بواسطة Vaswani وآخرون.

في هذا الدليل الشامل ، سنستكشف الأعمال الداخلية لنماذج LLMs القائمة على الفكاك ، ونتعمق في الكتل الأساسية ، والابتكارات الهندسية ، والتفاصيل التطبيقية التي دفعت هذه النماذج إلى الطليعة في بحوث NLP والتطبيقات.

هندسة الفكاك: تحديث

قبل الغوص في تفاصيل نماذج LLMs القائمة على الفكاك ، من المهم إعادة زيارة هندسة الفكاك ، والتي تقوم عليها هذه النماذج. قدم الفكاك نهجًا جديدًا لنمذجة التسلسل ، معتمدًا فقط على آليات الانتباه لالتقاط التبعيات على المدى الطويل في البيانات ، دون الحاجة إلى طبقات متكررة أو محسنة.

هندسة الفكاك

هندسة الفكاك

تتكون هندسة الفكاك الأصلية من مكونين رئيسيين: فكاك و فكاك. يعالج الفكاك التسلسل المدخل ويولد تمثيلًا سياقيًا ، الذي يستهلكه الفكاك لإنتاج التسلسل الخروج.

الانتباه الذاتي: مفتاح نجاح الفكاك

في قلب الفكاك تقع آليات الانتباه الذاتي ، وهي تقنية قوية تسمح للنموذج بوزن وتجميع المعلومات من مواقع مختلفة في التسلسل المدخل. على عكس نماذج التسلسل التقليدية ، التي تعالج رموز التسلسل بشكل متسلسل ، يسمح الانتباه الذاتي للنموذج بتقاط التبعيات بين أي زوج من الرموز ، بغض النظر عن موقعه في التسلسل.

انتباه متعدد الاستفسارات

انتباه متعدد الاستفسارات

يمكن تقسيم عملية الانتباه الذاتي إلى ثلاث خطوات رئيسية:

  1. مشاريع الاستفسار والключ والقيمة: يُحول التسلسل المدخل إلى ثلاث تمثيلات منفصلة: استفسارات (Q) ، مفاتيح (K) ، و قيم (V). يتم الحصول على هذه المشاريع عن طريق ضرب المدخل في مصفوفات وزن متعلمة.
  2. حساب درجات الانتباه: لكل موقع في التسلسل المدخل ، تُحسب درجات الانتباه عن طريق أخذ حاصل الضرب النقطي بين متجه الاستفسار المقابل ومتاهب المفتاح. تمثل هذه الدرجات أهمية كل موقع بالنسبة للموقع الحالي المعالج.
  3. مجموع القيم المرجحة: تُطبيق دالة الصوت على درجات الانتباه ، ويُستخدم الوزن الناتج لحساب مجموع قيم مرجح ، مما ينتج تمثيل الإخراج للموقع الحالي.

الانتباه متعدد الرؤوس ، وهو متغير من آليات الانتباه الذاتي ، يسمح للنموذج بتقاط أنواع مختلفة من العلاقات عن طريق حساب درجات الانتباه عبر رؤوس متعددة بالتوازي ، كل منها بمجموعته الخاصة من مشاريع الاستفسار والключ والقيمة.

المراجعات الهندسية والتهيئات

في حين أن المبادئ الأساسية لنماذج LLMs القائمة على الفكاك تظل متسقة ، قام الباحثون باستكشاف مراجعات هندسية وتهيئات مختلفة لتحسين الأداء والكفاءة والقدرات العامة.

أنواع الهندسة

يمكن تصنيف نماذج LLMs القائمة على الفكاك إلى ثلاثة أنواع رئيسية: فكاك-فكاك ، فكاك سببي ، وفكاك بادئة. لكل نوع هندسي أنماط انتباه مميزة.

هندسة الفكاك-الفكاك

بناءً على نموذج الفكاك الفانيلي ، تتكون هندسة الفكاك-الفكاك من صفيين: فكاك و فكاك. يستخدم الفكاك طبقات انتباه ذاتي متعددة الرؤوس لمعالجة التسلسل المدخل وتوليد تمثيلات كامنة. ثم يقوم الفكاك بتقاط انتباه متقاطع على هذه التمثيلات لتوليد التسلسل الهدف. على الرغم من فعاليتها في مهام NLP المختلفة ، فإن عددًا قليلاً من نماذج LLMs ، مثل Flan-T5 ، تتبنى هذه الهندسة.

هندسة الفكاك السببي

تتضمن هندسة الفكاك السببي قناع انتباه واحد الاتجاه ، مما يسمح لكل رمز مدخل بالانتباه فقط إلى الرموز السابقة له وله. يتم معالجة رموز المدخل والإخراج داخل نفس الفكاك. نماذج ملحوظة مثل GPT-1 و GPT-2 و GPT-3 مبنية على هذه الهندسة ، مع أن GPT-3 أظهرت قدرات تعلم سياقية رائعة. وقد اعتمدت العديد من نماذج LLMs ، بما في ذلك OPT و BLOOM و Gopher ، على فكاك سببي على نطاق واسع.

هندسة الفكاك البادئة

تُعرف أيضًا باسم الفكاك غير السببي ، تعديل هندسة الفكاك السببي آليتها القناع لتمكين الانتباه ثنائي الاتجاه على رموز البادئة و الانتباه غير السببي على الرموز المولدة. مثل هندسة الفكاك-الفكاك ، يمكن لفكاك البادئة ترميز التسلسل البادئ بشكل ثنائي الاتجاه وتوقع رموز الإخراج بشكل تكراري باستخدام معلمات مشتركة. تشمل نماذج LLMs القائمة على فكاك البادئة GLM130B و U-PaLM.

يمكن تمديد جميع أنواع الهندسة الثلاث باستخدام تقنية خليط الخبراء (MoE) ، والتي تنشط باختصار مجموعة فرعية من أوزان الشبكة العصبية لكل مدخل. هذا النهج تم تطبيقه في نماذج مثل Switch Transformer و GLaM ، مع زيادة عدد الخبراء أو حجم المعلمات الإجمالي أظهر تحسينات كبيرة في الأداء.

فكاك فقط: تبني الطبيعة التكرارية

في حين أن هندسة الفكاك الأصلية تم تصميمها في الأصل لمهام التسلسل إلى التسلسل مثل الترجمة الآلية ، يمكن إطار العديد من مهام NLP ، مثل نمذجة اللغة وتوليد النص ، كمسائل تكرارية ، حيث يولد النموذج رمزًا واحدًا في كل مرة ، مشروطًا بالرموز المولدة مسبقًا.

ادخل فكاك فقط ، وهو متغير مبسط من هندسة الفكاك ، الذي يحتفظ فقط بمكون الفكاك. هذه الهندسة مناسبة بشكل خاص لمهام التكرار ، حيث يولد رموز الإخراج واحدة تلو الأخرى ، مستفيدًا من الرموز المولدة مسبقًا كسياق مدخل.

الفرق الرئيسي بين فكاك فقط وفكاك الفكاك الأصلي يكمن في آليته الانتباه الذاتي. في إعداد فكاك فقط ، يتم تعديل عملية الانتباه الذاتي لمنع النموذج من الانتباه إلى الرموز المستقبلية ، وهي خاصية تعرف باسم السببية. يتم تحقيق ذلك من خلال تقنية تسمى “انتباه ذاتي مقنّع” ، حيث يتم تعيين درجات الانتباه المقابلة لمواقع مستقبلية إلى سالب اللانهاية ، مما يؤدي إلى تقنيعها بشكل فعال خلال خطوة تطبيع الصوت.

المكونات الهندسية لنماذج LLMs القائمة على الفكاك

في حين أن المبادئ الأساسية للانتباه الذاتي والانتباه الذاتي المقنّع تظل متسقة ، قام نماذج LLMs الحديثة القائمة على الفكاك بتقديم ابتكارات هندسية عديدة لتحسين الأداء والكفاءة والقدرات العامة. دعونا نستكشف بعض المكونات والتقنيات الرئيسية المستخدمة في نماذج LLMs الرائدة.

تمثيل المدخل

قبل معالجة التسلسل المدخل ، تستخدم نماذج LLMs القائمة على الفكاك تقنيات التجزئة والتحويل إلى تمثيلات رقمية لتحويل النص الخام إلى تمثيل مناسب للنموذج.

تحويل متجهي

تحويل متجهي

التجزئة: عملية التجزئة تحول النص المدخل إلى تسلسل من الرموز ، والتي يمكن أن تكون كلمات أو شظايا كلمات أو حتى رموز فردية ، اعتمادًا على استراتيجية التجزئة المستخدمة. تشمل تقنيات التجزئة الشائعة لنماذج LLMs التشفير بالكتل ، و SentencePiece ، و WordPiece. تهدف هذه الأساليب إلى تحقيق توازن بين حجم القاموس ودقة التمثيل ، مما يسمح للنموذج بمعالجة الكلمات النادرة أو غير الموجودة في القاموس بشكل فعال.

تحويل الرموز إلى متجهات: بعد التجزئة ، يتم ánh لكل رمز إلى تمثيل متجهي كثيف يسمى تحويل الرمز. يتم تعلم هذه التحويلات خلال عملية التدريب وتحصل على العلاقات الدلالية والصرفية بين الرموز.

تحويلات vị trí: نظرًا لأن نماذج الفكاك تعالج التسلسل بأكمله في وقت واحد ، فإنها تفتقر إلى مفهوم موقع الرمز المتأصل في النماذج المتكررة. لدمج المعلومات الموقعية ، يتم إضافة تحويلات vị trí إلى تحويلات الرموز ، مما يسمح للنموذج بالتمييز بين الرموز بناءً على مواقعها في التسلسل. استخدمت نماذج LLMs المبكرة تحويلات vị trí ثابتة dựa على دوال جيبية ، في حين استكشفت نماذج أحدث تحويلات vị trí قابلة للتعلم أو تقنيات ترميز vị trí بديلة مثل تحويلات vị trí الدورانية.

كتل الانتباه متعددة الرؤوس

المكونات الأساسية لنماذج LLMs القائمة على الفكاك هي طبقات الانتباه متعددة الرؤوس ، التي تقوم بعمليات الانتباه الذاتي المقنّعة الموصوفة سابقًا. يتم تكرار هذه الطبقات عدة مرات ، مع كل طبقة تنتباه إلى إخراج الطبقة السابقة ، مما يسمح للنموذج بتقاط تبعيات وتمثيلات متزايدة التعقيد.

رؤوس الانتباه: تتكون كل طبقة من الانتباه متعددة الرؤوس من عدة “رؤوس انتباه” ، كل منها بمجموعته الخاصة من مشاريع الاستفسار والключ والقيمة. هذا يسمح للنموذج بالانتباه إلى جوانب مختلفة من المدخل في وقت واحد ، مما يتيح له التقاط علاقات ونمطين متنوعين.

الروابط المتبقية والتعديل الطبقي: لتحسين تدريب الشبكات العصبية العميقة وتخفيف مشكلة التدرج الافتراضي ، تستخدم نماذج LLMs القائمة على الفكاك روابط متبقية و تقنيات تعديل الطبقي. الروابط المتبقية تضيف مدخل الطبقة إلى إخراجها ، مما يسمح للتدرجات بالتدفق بسهولة أكبر خلال التدرج العكسي. يساعد تعديل الطبقي في تثبيت التنشيطات والتدرجات ، مما يزيد من استقرار التدريب والأداء.

طبقات التغذية الأمامية

إضافة إلى طبقات الانتباه متعددة الرؤوس ، تتضمن نماذج LLMs القائمة على الفكاك طبقات تغذية أمامية ، والتي تطبق شبكة عصبية بسيطة إلى كل موقع في التسلسل. هذه الطبقات تroduce غير خطي وتسمح للنموذج بتعلم تمثيلات أكثر تعقيدًا.

دالات التنشيط: يمكن أن تؤثر اختيار دالة التنشيط في طبقات التغذية الأمامية بشكل كبير على أداء النموذج. في حين اعتمدت نماذج LLMs المبكرة على دالة التنشيط ReLU ، فإن نماذج أحدث اعتمدت دوال تنشيط أكثر تطورًا مثل الوحدة الخطية المعززة (GELU) أو دالة SwiGLU ، والتي أظهرت أداءً محسّنًا.

انتباه نادر وكفاءة الفكاك

على الرغم من قوة آليته الانتباه ، فإنها تأتي مع تعقيد حسابي تربيعي بالنسبة إلى طول التسلسل ، مما يجعلها مكلفة حسابيًا للتسلسلات الطويلة. لتلبية هذا التحدي ، تم اقتراح عدة تقنيات لتحسين كفاءة الانتباه وتقليل المتطلبات الحسابية والذاكرة ، مما يسمح بمعالجة تسلسلات أطول.

انتباه نادر: تقنيات الانتباه النادر ، مثل تلك المستخدمة في نموذج GPT-3 ، تنتباه إلى جزء من المواقع في التسلسل المدخل ، بدلاً من حساب درجات الانتباه لجميع المواقع. هذا يمكن أن يقلل بشكل كبير من التعقيد الحسابي مع الحفاظ على أداء معقول.

انتباه نافذة الانزلاق: تم تقديم انتباه نافذة الانزلاق (SWA) في نموذج Mistral 7B ، وهو تقنية بسيطة وفعالة تقصر نطاق الانتباه لكل رمز إلى حجم نافذة محدد. هذا النهج يستفيد من قدرة طبقات الفكاك على نقل المعلومات عبر الطبقات المتعددة ، مما يزيد من نطاق الانتباه دون تعقيدات الانتباه الكامل.

مخزن ذاكرة التخزين المتحرك: لتقليل المتطلبات الذاكرة ، خاصة للتسلسلات الطويلة ، يستخدم نموذج Mistral 7B مخزن ذاكرة التخزين المتحرك. هذه التقنية تخزن وستخدم متجهات المفتاح والقيمة المحسوبة ل حجم نافذة محدد ، مما يمنع الحسابات الزائدة ويقلل من استخدام الذاكرة.

انتباه الاستفسار المجموع: تم تقديم انتباه الاستفسار المجموع (GQA) في نموذج LLaMA 2 ، وهو متغير من آليته الانتباه المتعددة ، يقسم رؤوس الانتباه إلى مجموعات ، كل مجموعة تشترك في متجهات المفتاح والقيمة المشتركة. هذا النهج يجد توازنًا بين كفاءة انتباه الاستفسار المتعدد وأداء الانتباه الذاتي القياسي ، مما يوفر أوقات استدلال محسنة مع الحفاظ على نتائج عالية الجودة.

انتباه استفسار المجموع

انتباه استفسار المجموع

حجم النموذج والتمكين

إحدى السمات المحددة لنماذج LLMs الحديثة هي حجمها الهائل ، حيث تتراوح عدد المعلمات من مليارات إلى مئات المليارات. كان زيادة حجم النموذج عاملاً حاسمًا في تحقيق أداء رائد ، حيث يمكن للنماذج الأكبر التقاط أنماط وأعلاق أكثر تعقيدًا في البيانات.

عدد المعلمات: يتم تحديد عدد المعلمات في نموذج LLMs القائم على الفكاك في الغالب بواسطة بعد التمثيل (d_model) ، وعدد رؤوس الانتباه (n_heads) ، وعدد الطبقات (n_layers) ، و حجم القاموس (vocab_size). على سبيل المثال ، نموذج GPT-3 يحتوي على 175 مليار معلمة ، مع d_model = 12288 ، n_heads = 96 ، n_layers = 96 ، و vocab_size = 50257.

تزامن النموذج: يتطلب تدريب وتنفيذ نماذج بهذا الحجم موارد حسابية كبيرة وأجهزة متخصصة. لتجاوز هذا التحدي ، تم استخدام تقنيات تزامن النموذج ، حيث يتم تقسيم النموذج عبر عدة وحدات معالجة رسومات (GPUs) أو وحدات معالجة tensor (TPUs) ، مع كل جهاز مسؤول عن جزء من الحسابات.

خليط الخبراء: نهج آخر لتمكين نماذج LLMs هو هندسة خليط الخبراء (MoE) ، التي تجمع بين عدة نماذج خبير ، كل منها متخصص في جزء معين من البيانات أو المهمة. نموذج Mixtral 8x7B هو مثال على نموذج MoE يستخدم نموذج Mistral 7B كنموذج قاعدة ، يحقق أداءً متفوقًا مع الحفاظ على الكفاءة الحسابية.

الاستدلال وتوليد النص

إحدى الحالات الرئيسية لاستخدام نماذج LLMs القائمة على الفكاك هي توليد النص ، حيث يولد النموذج نصًا متسقًا وطبيعيًا بناءً على سؤال أو سياق معين.

التوليد التكراري: خلال الاستدلال ، توليد نماذج LLMs القائمة على الفكاك النص بطريقة تكرارية ، حيث يتوقع رمزًا واحدًا في كل مرة بناءً على الرموز المولدة مسبقًا والمدخل. يستمر هذا العملية حتى يتم بلوغ معيار إيقاف معين ، مثل الوصول إلى طول تسلسل أقصى أو توليد رمز نهاية التسلسل.

استراتيجيات العينة: لتحقيق تنوع وواقعية في النص المولدة ، يمكن استخدام استراتيجيات عينة مختلفة ، مثل عينة الأعلى k ، أو عينة الأعلى p (المعروفة أيضًا باسم عينة النواة) ، أو تحجيم درجة الحرارة. هذه التقنيات تتحكم في التبادل بين التنوع والاتساق للنص المولدة عن طريق تعديل توزيع الاحتمال على القاموس.

هندسة السؤال: يمكن أن تؤثر جودة وخصوصية السؤال المدخل بشكل كبير على النص المولدة. أصبحت هندسة السؤال فنًا حاسمًا في استخدام نماذج LLMs لمهام مختلفة ، مما يسمح للمستخدمين بتحديد عملية التوليد وتحقيق مخرجات مرغوبة.

التشفير البشري في الحلقة: لتحسين جودة و اتساق النص المولدة ، تم استخدام تقنيات مثل التعلم بالتعزيز من التغذية الراجعة البشرية (RLHF). في هذا النهج ، يقدم المُحكِّمون البشريون تغذية راجعة على النص المولدة بواسطة النموذج ، والتي يتم استخدامها بعد ذلك لتعديل النموذج ، مما يجعله يتطابق مع تفضيلات الإنسان ويحسن من مخرجاته.

التقدمات والتوجيهات المستقبلية

مجال نماذج LLMs القائمة على الفكاك يتطور بسرعة ، مع أبحاث جديدة و اختراقات مستمرة ت推د حدود ما يمكن أن تنجزه هذه النماذج. هنا بعض التقدمات والتوجيهات المستقبلية المهمة:

مراجعات الفكاك الكفية: في حين أن الانتباه النادر و انتباه نافذة الانزلاق قد حققا تقدمًا كبيرًا في تحسين كفاءة نماذج LLMs ، يبحث الباحثون بنشاط عن مراجعات بديلة للفكاك و آليات انتباه لتحسين الكفاءة الحسابية مع الحفاظ على الأداء أو تحسينه.

نماذج LLMs متعددة الوسائط: توسيع قدرات نماذج LLMs إلى ما وراء النص ، تهدف نماذج متعددة الوسائط إلى دمج عدة وسائط ، مثل الصور أو الصوت أو الفيديو ، في إطار موحد. هذا يفتح إمكانيات مثيرة للاهتمام لتطبيقات مثل توليد تعليقات الصور ، و الاستجابة للأسئلة البصرية ، و توليد المحتوى المتعددة الوسائط.

التوليد القابل للتحكم: تمكين التحكم الدقيق في النص المولدة هو اتجاه مهم لنماذج LLMs. تقنيات مثل التوليد الموجه و تعديل السؤال تهدف إلى توفير للمستخدمين تحكم أكثر دقة في سمات مختلفة للنص المولدة ، مثل الأسلوب أو النبرة أو متطلبات المحتوى المحددة.

الخلاصة

نماذج LLMs القائمة على الفكاك ظهرت كقوة تحويلية في مجال معالجة اللغة الطبيعية ، دفعا حدود ما هو ممكن في توليد اللغة و فهمها. من بداياتها المتواضعة كمتغير مبسط من هندسة الفكاك ، تطورت هذه النماذج إلى أنظمة قوية ومعقدة ، تستفيد من تقنيات وابتكارات هندسية متقدمة.

مع استمرارنا في استكشاف وتطوير نماذج LLMs القائمة على الفكاك ، يمكننا توقع تحقيق إنجازات أكثر إثارة في مهام اللغة ، بالإضافة إلى دمج هذه النماذج في مجموعة واسعة من التطبيقات والمجالات. ومع ذلك ، من الحاسم معالجة الاعتبارات الأخلاقية ، و تحديات القابلية للتفسير ، و الانحيازات المحتملة التي قد تنشأ من نشر هذه النماذج القوية على نطاق واسع.

من خلال البقاء في طليعة البحث ، وتعزيز التعاون المفتوح ، والحفاظ على التزام قوي بالتنمية المسؤولة للذكاء الاصطناعي ، يمكننا unfetter إمكانيات نماذج LLMs القائمة على الفكاك ، مع ضمان تطويرها واستخدامها بطريقة آمنة و أخلاقية و مفيدة للمجتمع.

لقد قمت بإنفاق الخمس سنوات الماضية في غمرة العالم المثير للاهتمام من التعلم الآلي والتعلم العميق. وقد أدت شغفي وخبرتي إلى المساهمة في أكثر من 50 مشروعًا متنوعًا في هندسة البرمجيات، مع التركيز بشكل خاص على الذكاء الاصطناعي والتعلم الآلي. كما أدت فضولي المستمر إلى جذبي نحو معالجة اللغة الطبيعية، وهو مجال أنا متحمس لاستكشافه بشكل أكبر.