أساسيات الذكاء الاصطناعي
ما هي الشبكات العصبية للتحويلات؟
وصف شبكات التحويلات العصبية
المحولات هي نوع من أنواع التعلم الآلي التي تختص بمعالجة وتفسير البيانات المتسلسلة، مما يجعلها مثالية للمهام المتعلقة بمعالجة اللغة الطبيعية. لكي نفهم ما هي محول التعلم الآلي وكيف تعمل، دعونا نلقي نظرة أقرب على نماذج المحولات وألياتها.
سيغطي هذا المقال ما يلي:
- نماذج التسلسل إلى التسلسل
- هيكل شبكة المحول العصبي
- آلية الانتباه
- الفرق بين المحولات و RNNs/LSTMs
نماذج التسلسل إلى التسلسل
نماذج التسلسل إلى التسلسل هي نوع من نماذج معالجة اللغة الطبيعية التي تستخدم لتحويل تسلسلات من نوع إلى تسلسلات من نوع آخر. هناك أنواع مختلفة من نماذج التسلسل إلى التسلسل، مثل نماذج الشبكات العصبية المتكررة و نماذج الذاكرة القصيرة المدى الطويلة (LSTM) .
النماذج التقليدية للتسلسل إلى التسلسل مثل RNNs و LSTMs ليست محور هذا المقال، ولكن فهمها ضروري لتقدير كيف تعمل نماذج المحولات وكيف هي أفضل من النماذج التقليدية للتسلسل إلى التسلسل.
باختصار، تتكون نماذج RNN و LSTM من شبكات مشفرة وشبكات فك التشفير التي تحلل البيانات الإدخالية في خطوات زمنية مختلفة. تعمل شبكة المشفر على تشكيل تمثيل مشفر للكلمات في البيانات الإدخالية. في كل خطوة زمنية، تأخذ شبكة المشفر تسلسل إدخال و状態 مخفي من الخطوة الزمنية السابقة في السلسلة. يتم تحديث قيم الحالة المخفية أثناء تحرك البيانات عبر الشبكة، حتى الخطوة الزمنية الأخيرة، حيث يتم إنشاء “متجه سياق”. ثم يتم تمرير متجه السياق إلى شبكة فك التشفير، التي تستخدم لإنشاء تسلسل هدف عن طريق التنبؤ بالكلمة الأكثر احتمالاً التي تتوافق مع الكلمة الإدخالية لكل خطوة زمنية.
يمكن تعزيز هذه النماذج من خلال استخدام “آلية الانتباه”. تعرف آلية الانتباه الأجزاء من متجه الإدخال التي يجب على الشبكة التركيز عليها لإنشاء الإخراج الصحيح. وبعبارة أخرى، تسمح آلية الانتباه لمحول التعلم الآلي بمعالجة كلمة إدخال واحدة مع الانتباه إلى المعلومات ذات الصلة الموجودة في الكلمات الإدخالية الأخرى. كما تقوم آليات الانتباه بتعطيل الكلمات التي لا تحتوي على معلومات ذات صلة.
هيكل شبكة المحول العصبي
سنناقش آلية الانتباه بالتفصيل لاحقًا، ولكن دعونا نلقي نظرة على هيكل شبكة المحول العصبي على مستوى أعلى.
بشكل عام، تظهر شبكة المحول العصبي على النحو التالي:

尽管 قد تتغير الهياكل العامة بين الشبكات، سيبقى الجزء الأساسي نفسه: الترميزات الموضعية، متجهات الكلمات، آلية الانتباه، شبكة عصبية متعددة الطبقات.
الترميزات الموضعية ومتجهات الكلمات
تعمل شبكة المحول العصبي عن طريق أخذ تسلسل إدخال و تحويله إلى تسلسلين آخرين. تنتج المحول تسلسلاً من متجهات الكلمات وترميزات موضعية.
متجهات الكلمات هي مجرد تمثيل نصي في شكل رقمي يمكن للشبكة العصبية معالجته. في حين أن الترميزات الموضعية هي تمثيلات متجهية تحتوي على معلومات حول موقع الكلمة الحالية في الجملة الإدخالية، بالنسبة إلى الكلمات الأخرى.
تستخدم نماذج الشبكات العصبية النصية الأخرى مثل RNNs و LSTMs متجهات لتمثيل الكلمات في البيانات الإدخالية. هذه التمثيلات المتجهية تخطط الكلمات إلى قيم ثابتة، ولكن هذا محدود لأن الكلمات يمكن استخدامها في سياقات مختلفة. تحل شبكة المحول هذه المشكلة عن طريق جعل قيم الكلمات أكثر مرونة، باستخدام دوال جيبية لتمكين متجهات الكلمات من أخذ قيم مختلفة اعتمادًا على موقع الكلمة في الجملة.
هذا يسمح للنموذج العصبي بالحفاظ على المعلومات المتعلقة بموقع الكلمات الإدخالية النسبية، حتى بعد مرور المتجهات عبر طبقات شبكة المحول.
تتم إضافة الترميزات الموضعية ومتجهات الكلمات معًا ثم تمريرها إلى شبكات المشفر والفك التشفير. بينما تستخدم شبكات المحولات مخططات مشفرة وفك تشفير مثل RNNs و LSTMs، فإن الفرق الرئيسي بينهم هو أن جميع البيانات الإدخالية يتم إدخالها إلى الشبكة في نفس الوقت، في حين أن في RNNs/LSTMs، يتم إدخال البيانات بشكل متسلسل.
تكون شبكات المشفر مسؤولة عن تحويل الإدخالات إلى تمثيلات يمكن للشبكة التعلم منها، بينما تعمل شبكات فك التشفير على العكس، وتحول التمثيلات إلى توزيع احتمالي يستخدم لإنشاء الكلمات الأكثر احتمالاً في الجملة الإخراج. ومن المهم أن كلا شبكات المشفر وفك التشفير تحتويان على آلية انتباه.
بسبب قدرة وحدات المعالجة الرسومية (GPUs) على المعالجة الموازية، يتم استخدام آليات انتباه متعددة بشكل موازي، لحساب المعلومات ذات الصلة لجميع الكلمات الإدخالية. هذه القدرة على الانتباه إلى كلمات متعددة في نفس الوقت، تسمى “الانتباه المتعدد الرؤوس”، تساعد الشبكة العصبية على تعلم سياق الكلمة في الجملة، وهي واحدة من المزايا الرئيسية التي تمتلكها شبكات المحولات على RNNs و LSTMs.
آلية الانتباه
آلية الانتباه هي الجزء الأكثر أهمية في شبكة المحول. إنها ما يمكّن نماذج المحولات من تجاوز حدود الانتباه لنماذج RNN و LSTM التقليدية. النماذج التقليدية للتسلسل إلى التسلسل تتخلص من جميع الحالات الوسيطة وتستخدم فقط الحالة النهائية / متجه السياق عند 초기 شبكة فك التشفير لإنشاء تنبؤات حول تسلسل إدخال.
تعتبر هذه الطريقة جيدة عندما تكون تسلسلات الإدخال قصيرة. ومع ذلك، عندما تزيد طول تسلسل الإدخال، سيتدهور أداء النموذج باستخدام هذه الطريقة. هذا لأن من الصعب تلخيص تسلسل إدخال طويل كمتجه واحد. الحل هو زيادة “انتباه” النموذج واستخدام الحالات الوسيطة للمشفر لإنشاء متجهات سياق للفك التشفير.
تعرف آلية الانتباه بأهمية الرموز الإدخالية الأخرى للنموذج عند إنشاء التمثيلات لرمز معين. على سبيل المثال، “هو” ضمير عام، غالبًا ما يستخدم للإشارة إلى الحيوانات عندما لا يكون جنسها معروفًا. آلية الانتباه تسمح لمحول التعلم الآلي بتحديد أن “هو” يشير إلى السنجاب في السياق الحالي، لأنها يمكنها فحص جميع الكلمات الإدخالية ذات الصلة.
يمكن استخدام آلية الانتباه بثلاث طرق مختلفة: من المشفر إلى فك التشفير، فقط المشفر، فقط فك التشفير.
الانتباه من المشفر إلى فك التشفير يسمح للفك التشفير بالنظر إلى تسلسلات الإدخال عند إنشاء الإخراج، بينما يسمح الانتباه فقط للمشفر والفك التشفير بالنظر إلى جميع أجزاء التسلسلات السابقة والحالية على التوالي.
يمكن تقسيم بناء آلية الانتباه إلى خمس خطوات:
- حساب درجة لجميع حالات المشفر.
- حساب أوزان الانتباه
- حساب متجهات السياق
- تحديث متجه السياق مع إخراج الخطوة الزمنية السابقة
- إنشاء الإخراج مع الفك التشفير
الخطوة الأولى هي計算 درجة لجميع حالات المشفر. يتم هذا عن طريق تدريب شبكة الفك التشفير، والتي هي شبكة عصبية متعددة الطبقات الأساسية. عندما يتم تدريب الفك التشفير على الكلمة الأولى في تسلسل الإدخال، لم يتم إنشاء حالة داخلية / مخفية بعد، لذلك يتم استخدام حالة المشفر الأخيرة كحالة سابقة للفك التشفير.
لحساب أوزان الانتباه، يتم استخدام دالة softmax لإنشاء توزيع احتمالي لأوزان الانتباه.
بعد حساب أوزان الانتباه، يتعين حساب متجه السياق. يتم هذا عن طريق ضرب أوزان الانتباه والحالة المخفية معًا لكل خطوة زمنية.
بعد حساب متجه السياق، يتم استخدامه جنبًا إلى جنب مع الكلمة المنبعثة في الخطوة الزمنية السابقة لإنشاء الكلمة التالية في تسلسل الإخراج. لأن الفك التشفير لا يحتوي على إخراج سابق للرجوع إليه في الخطوة الزمنية الأولى، غالبًا ما يتم استخدام رمز “بدء” خاص بدلاً من ذلك.
الفرق بين المحولات و RNNs/LSTMs
دعونا نغطي بعض الفرق بين RNNs و LSTMs بسرعة.
تعمل RNNs على معالجة الإدخالات بشكل تسلسلي، بينما يتم الحفاظ على متجه حالة مخفي وتنقيحه بواسطة الكلمات الإدخالية أثناء تحركها عبر الشبكة. عادةً ما تحتوي حالات RNN على معلومات قليلة ذات صلة حول الإدخالات السابقة. الإدخالات الجديدة غالبًا ما تحذف الحالة الحالية، مما يؤدي إلى فقدان المعلومات وتدهور الأداء مع مرور الوقت.
في المقابل، تعمل نماذج المحولات على معالجة تسلسل الإدخال كله في نفس الوقت. تسمح آلية الانتباه لكل كلمة إخراج بالاستفادة من كل كلمة إدخال وحالة مخفية، مما يجعل الشبكة أكثر موثوقية للنصوص الطويلة.
تعد LSTMs نسخة معدلة من RNNs، تم تعديلها لمعالجة تسلسلات إدخال أطول. تستخدم هيكلًا يسمى “أبوابًا”، مع “أبواب إدخال” و “أبواب إخراج” و “أبواب نسيان”. يعالج التصميم المبني على البوابات فقدان المعلومات الشائع في نماذج RNN. يتم معالجة البيانات بشكل تسلسلي، ويجعل تصميم الشبكة المتكرر من الصعب تدريب نماذج LSTM باستخدام الحوسبة الموازية، مما يطيل وقت التدريب بشكل عام.
غالبًا ما كان مهندسو LSTMs يضيفون آليات انتباه إلى الشبكة، مما كان معروفًا بتحسين أداء النموذج. ومع ذلك، تم اكتشاف في النهاية أن آلية الانتباه وحدها تحسنت من الدقة. أدى هذا الاكتشاف إلى إنشاء شبكات المحولات التي تستخدم آليات الانتباه والحوسبة الموازية بفضل وحدات المعالجة الرسومية.












