أساسيات الذكاء الاصطناعي

ما هي الشبكات العصبية المتحوّلة؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

المحوّل هو بنية شبكة عصبية تعالج العلاقات بين الرموز باستخدام الانتباه. على عكس الشبكة المتكررة التي يجب أن تنقل حالة مخفية من موضع إلى آخر، يمكن للمحوّل حساب تفاعلات متعددة بين الرموز بشكل متوازي أثناء التدريب.

المحوّلات تشغّل العديد من أنظمة اللغة والرؤية والصوت والوسائط المتعددة، لكن البنية ليست قاعدة بيانات ولا ضمانًا للتفكير. تظل مخرجاتها تنبؤات مشروطة بالمعلمات المتعلمة، والسياق المزوّد، وإجراء فك الترميز.

النقاط الأساسية

  • يسمح الانتباه الذاتي لكل رمز ببناء تمثيل يعتمد على السياق من الرموز المسموح بها.
  • تُضاف معلومات الموضع لأن الانتباه وحده لا يُشفّر ترتيب الرموز.
  • المحوّلات التي تقتصر على المشفر، أو على المفكك، أو على المشفر‑المفكك تخدم أهدافًا مختلفة.
  • طول السياق، والحوسبة، وبيانات التدريب، والتقييم — وليس الانتباه وحده — يشكّلان القدرة والموثوقية.
What Are Transformer Neural Networks? diagram showing tokens, embed + position, self-attention, feed-forward, stack blocks, output
يبني الانتباه تمثيلات سياقية؛ القناع والأهداف تحددان ما هي المعلومات المتاحة.

الرموز، التضمينات والموضع

يُقسم النص أولًا إلى رموز، قد تكون كلمات أو أجزاء كلمات أو أحرف. كل معرف رمز يختار متجه تضمين متعلم. يمكن لمحوّل الرؤية أن يضمّن قطعًا من الصورة؛ ويمكن لمحوّل الصوت أن يضمّن إطارات أو وحدات صوتية متعلمة.

نظرًا لأن عملية الانتباه العارية متكافئة مع تبديل الترتيب، يحتاج النموذج إلى معلومات الموضع. قد تضيف التطبيقات ترميزات موضعية متعلمة أو ثابتة، أو تعدّل درجات الانتباه بآليات موضعية نسبية أو دوارة. النتيجة تجمع ما هو الرمز مع مكان حدوثه.

النقطة النقطية المقاسة والاهتمام متعدد الرؤوس

لكل موضع، تُنشئ الإسقاطات المتعلمة استعلامًا ومفتاحًا وقيمة. ينتج التشابه بين الاستعلام والمفاتيح المسموح بها أوزان انتباه؛ تُشكل القيم الموزونة الناتج. يساعد مقياس النقطة النقطية على إبقاء الدالة softmax مستقرة عددياً مع زيادة أبعاد المتجه.

يكرر الانتباه متعدد الرؤوس هذه العملية في عدة فضاءات فرعية متعلمة. يمكن للرؤوس المختلفة أن تتخصص في علاقات مختلفة، رغم أن نمط الانتباه البصري الجذاب لا يجب أن يُعامل تلقائيًا كتفسير موثوق لقرار النموذج.

كتلة المحوّل

يتبع طبقة فرعية للانتباه شبكة تغذية أمامية موضعية. تحمل الاتصالات المتبقية التمثيلات السابقة حول كل طبقة فرعية، بينما يدعم التطبيع والتنظيم عملية التحسين. يكوّن تجميع العديد من الكتل ميزات سياقية متزايدة عبر التعلم العميق.

أثناء التوليد السببي، يمنع القناع الموضع من قراءة الرموز المستقبلية. في وقت الاستدلال، يتنبأ المفكك برمز واحد، يضيفه، ويعيد العملية. تُقلل ذاكرة التخزين المؤقت للمفتاح‑القيمة الحاجة لإعادة حساب كل إسقاط انتباه سابق، مما يخفض تكلفة التوليد دون إلغائها تمامًا.

عائلات المشفر، المفكك والمشفّر‑المفكك

النماذج التي تقتصر على المشفر تتعلم تمثيلات ثنائية الاتجاه مناسبة للتصنيف والاسترجاع وتوسيم الرموز. النماذج التي تقتصر على المفكك تستخدم انتباهًا سببيًا لتوليد الرمز التالي. نماذج المشفر‑المفكك تسمح للمفكك بالانتباه إلى مدخل مشفر، وهو مفيد للترجمة ومهام التحويل التسلسلي الأخرى.

غالبًا ما تبدأ الأنظمة الحديثة بتدريب شامل ثم تستخدم التعلم النقلي، أو ضبط التعليمات، أو تحسين التفضيلات. لذا يمكن لنفس البنية أن تدعم سلوكًا مختلفًا تمامًا اعتمادًا على الهدف والبيانات.

الحدود، الكفاءة والتقييم

الانتباه الكامل على تسلسل ينتج تفاعلات زوجية تربيعية مع طول التسلسل، ما يخلق ضغطًا على الذاكرة والحوسبة. الانتباه المتناثر أو الخطي، والتجزئة، والاسترجاع، والكمّية، والتخزين المؤقت تُوازن بين الدقة، وإمكانية الوصول إلى السياق، والكمون، وتعقيد التنفيذ.

زيادة نافذة السياق لا تضمن أن كل حقيقة مُزودة ستُستَخدم بشكل صحيح. قيّم الحقيقة، والصلابة، والمعايرة، والكمون، والتكلفة، وأنماط الفشل الخاصة بالمهمة. بالنسبة للأنظمة التفاعلية، يمكن لـ هندسة المطالبات تشكيل السلوك، لكنها لا تحول نموذجًا احتماليًا إلى مصدر لا يخطئ.

حساب المحوّل من الرموز إلى السياق

يحوّل المحوّل الرموز إلى متجهات، يضيف معلومات الموضع، ويمرّره عبر كتل متكررة من الانتباه والشبكة التغذوية الأمامية. في الانتباه الذاتي، تُنشئ الإسقاطات المتعلمة استعلامات ومفاتيح وقيم. تقارن النقاط النقطية المقاسة كل استعلام بالمفاتيح، ينتج softmax أوزانًا، وتُكوّن القيم الموزونة السياق. تتعلم الرؤوس المتعددة فضاءات إسقاط مختلفة. تُثبّت الاتصالات المتبقية والتطبيع الأكوام العميقة، بينما تُحوّل الشبكة التغذوية الأمامية كل رمز بشكل مستقل بين طبقات الانتباه.

النماذج التي تقتصر على المشفر تستخدم سياقًا ثنائي الاتجاه وتناسب مهام التصنيف أو التمثيل. النماذج التي تقتصر على المفكك تطبق قناعًا سببيًا بحيث يتنبأ كل موضع من الرموز السابقة وتهيمن على نمذجة اللغة التوليدية. نماذج المشفر‑المفكك تسمح للمفكك بالانتباه إلى مدخل مشفر للترجمة والتوليد المهيكل. تكلفة الانتباه تنمو تربيعيًا مع طول التسلسل في الشكل القياسي، ما يدفع إلى بدائل متناثرة، خطية، مجزأة، متكررة، أو فضاءات حالة. يزيد السياق الأطول من الأدلة المتاحة، لكنه لا يضمن استرجاعًا أو استدلالًا مضمونًا.

التدريب، التكيّف، والاستدلال

تشمل أهداف ما قبل التدريب توقع الرمز التالي، وإعادة بناء الرموز المقنّعة، وتلفيق تسلسل‑إلى‑تسلسل. يحدد مزيج البيانات، وإزالة التكرار، وأداة الترميز، وتعبئة السياق، والمُحسّن، والجدول الزمني، والحوسبة قدرة النموذج. يمكن للتخصيص الدقيق تحديث جميع المعلمات أو استخدام محولات منخفضة الرتبة؛ تعديل التعليمات وتفضيلات الضبط يغيّر السلوك. غالبًا ما يكون الاسترجاع أفضل للحقائق المتغيرة، بينما يُفيد الضبط لتنسيق السلوك والمهام. احتفظ بمجموعة تقييم غير ملوّثة واختبر التلوث من المعايير العامة.

يخزن الاستدلال التلقائي إسقاطات المفتاح‑القيمة للرموز السابقة لتجنب إعادة الحساب. يعتمد الكمون على معالجة المطالبة وفك الترميز المتسلسل؛ وتعتمد الإنتاجية على التجميع، والذاكرة، وإدارة التخزين المؤقت، والدقة، والعتاد. تتبادل طرق الجشع، والحرارة، وأعلى‑k، وأعلى‑p، والشعاع بين الحتمية والتنوع. تقلل الكمّية الذاكرة لكنها قد تؤثر على القدرات النادرة. تحقق من النموذج المُنَشَّر، وأداة الترميز، وقالب المطالبة، وعينة الاختيار، ووقت التشغيل بأطوال تسلسل واقعية.

التقييم والضوابط

يمكن للمحوّلات أن تُولّد معلومات زائفة، أو تتبع تعليمات مسترجعة خبيثة، أو تكشف بيانات مخزنة، أو تتدهور عبر اللغات والسياقات الطويلة. قيّم نجاح المهمة، والدعم الواقعي، والمعايرة، والرفض، والصلابة، والسلامة، والكمون، والتكلفة؛ افحص الأدلة وإجراءات الأدوات بشكل منفصل. استخدم استرجاعًا واعيًا بالأذونات، وأدوات مكتوبة، وتفويضًا خارجيًا، وحدودًا للسرعة، وموافقة بشرية للإجراءات ذات العواقب. راقب إصدارات النموذج والمطالبة، وتوزيع المدخلات، وأخطاء الأدوات، وتصحيحات المستخدم. المحوّل هو بنية حساب تسلسلي، لا دليل على الفهم أو ضمان إخراج صادق.

مثال عملي: مساعد مستندات بالمحوّل

شركة تُفهرس كتيبات معتمدة بمعرف المستند، والإصدار، والقسم، والأذونات، وتاريخ السريان. يسترجع مساعد مبني على المحوّل الأدلة ويعيد ترتيبها، ثم يجيب فقط من المقاطع المسموح بها مع الاستشهادات. تشمل مجموعة التقييم أسئلة قابلة للإجابة، وغير قابلة للإجابة، غامضة، ومتضاربة عبر الأدوار وأنواع المستندات. تُقَيَّم استدعاءات الاسترجاع، ودقة الاستشهاد، وصحة الإجابة المستندة، والرفض، وسلوك السياق الطويل، والكمون، والتكلفة بشكل منفصل.

تُعامل المستندات المسترجعة كبيانات غير موثوقة، لذا لا يمكن لتعليمات مضمّنة أن تتجاوز سياسة النظام أو تخوّل الأدوات. يُوثق المستخدمون قبل الاسترجاع، وتبقى الإجراءات ذات العواقب خارج النموذج. تحتفظ السجلات بمعرفات الأدلة وإصداراتها دون محتوى المستند غير الضروري. يكتشف الرصد تغيّر المجموعة، والإجابات غير المدعومة، وأخطاء الأذونات، وتصحيحات المستخدم. يُعاد تشغيل أي تغيير في النموذج أو أداة الترميز ضد مجموعة الاختبار الكاملة، وتظل التكوينات السابقة متاحة حتى يثبت النظام الجديد مساواة أو تفوق في السلامة والجودة.

دليل التنفيذ والاستعداد التشغيلي

يتطلب قرار الإنتاج أكثر من إظهار ناجح. حدّد المستخدمين المستهدفين، وبيئة التشغيل، والمدخلات، والمخرجات، والاعتمادات، والمالك، وعواقب كل فشل مهم. أنشئ خط أساس قابل لإعادة الإنتاج ومجموعة تقييم مُصدَّرة قبل الضبط. اختبر الحالات العادية، والحدود، والمدخلات المعيبة أو المفقودة، وتحول التوزيع، وانقطاع الاعتماد، وسوء الاستخدام، والمجموعات أو البيئات الأكثر احتمالًا لتكون غير مخدومة. قِس جودة المهمة مع المعايرة أو عدم اليقين، والكمون، والإنتاجية، وتكلفة الموارد، وإمكانية الوصول، والخصوصية، والأمان. سجّل كل تحويل وعتبة بحيث يستطيع مراجع مستقل إعادة إنتاج النتيجة وتمييز الأدلة عن النموذج الجذاب.

قبل الإطلاق، عيّن سلطة للإصدار، والاستثناءات، والتغييرات، والعودة، والتقاعد. استخدم نشرًا مرحليًا، واحفظ نسخة احتياطية آمنة، وتحقق من الرصد عبر فشل مُحقَّق عمدًا. يجب أن تكشف القياسات التشغيلية عن جودة المدخلات، وسلوك المخرجات، وإصدار النموذج أو القاعدة، وصحة الاعتماد، وتجاوزات البشر، والنتائج المؤكدة دون جمع بيانات حساسة غير ضرورية. حدّد عتبات الإنذار ومسؤول الاستجابة، ثم راجع الأدلة الواقعية بعد النشر بدلاً من افتراض استمرار الأداء غير المتصل. أعد التقييم كلما تغيرت مصادر البيانات أو المستخدمون أو النماذج أو البائعون أو السياسات أو العتاد أو الأهداف. النظام المُحافظ يحتاج أيضًا إلى إجراءات موثقة للاسترداد، وتعلم الحوادث، والحذف والاحتفاظ، ونقطة واضحة يجب فيها إيقافه أو استبداله.

الأسئلة المتكررة

هل كل نموذج لغة كبير هو محوّل؟

تستخدم معظم نماذج اللغة الكبيرة الحالية متغيّرات من المحوّل، لكن يمكن بناء نماذج اللغة باستخدام بنى متكررة أو فضاءات حالة أو هجين.

هل يعني الانتباه الذاتي أن النموذج يفهم النص مثل الإنسان؟

لا. الانتباه هو آلية وزن متعلمة. سلوك اللغة الشبيه بالبشر لا يثبت بحد ذاته الفهم البشري أو الصدق أو النية.

المراجع الأساسية

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.