أساسيات الذكاء الاصطناعي

ما هي الشبكات العصبية؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

الشبكة العصبية الاصطناعية هي نموذج رياضي مُعَدل يتكوّن من طبقات من العمليات المتصلة. أثناء التدريب، تقوم الشبكة بضبط معلماتها بحيث يتم ربط المدخلات بالمخرجات المفيدة. يمكن للشبكات العصبية تقريب العلاقات غير الخطية المعقدة وتعلم التمثيلات مباشرةً من النصوص، الصور، الصوت، السلاسل الزمنية، وغيرها من البيانات.

الاسم مستوحى تاريخيًا من الخلايا العصبية البيولوجية، لكن الشبكات الحديثة هي أنظمة هندسية لا تمثل محاكاة واقعية للدماغ. مصطلحات مثل “الخلية العصبية” و“التعلم” هي اختصارات مفيدة ولا ينبغي الخلط بينها وبين دليل على إدراك شبيه بالبشر.

النقاط الرئيسية

  • تحسب الخلية العصبية مجموعًا مرجّحًا، وتضيف انحيازًا قابلًا للتدريب، وتطبق دالة تنشيط.
  • تمرير أمامي يُنتج توقعات؛ يُقيس الخسارة الخطأ؛ تُحسب الانتشار العكسي (Backpropagation) التدرجات؛ يقوم المُحسّن بتحديث المعلمات.
  • تنظّم الشبكات متعددة الطبقات (MLPs) والشبكات التلافيفية (CNNs) والشبكات المتكررة (RNNs) والمحولات (Transformers) الاتصالات بطرق مختلفة.
  • وجود طبقات أو معلمات أكثر لا يضمن تلقائيًا نموذجًا أفضل أو أكثر موثوقية.
Annotated neural network with inputs, weighted connections, hidden activations, output, loss, and backward gradient arrows
يتم تدريب الشبكة العصبية عبر تمرير أمامي، حساب الخسارة، حساب التدرجات، وتحديث المعلمات.

من خلية عصبية اصطناعية واحدة إلى شبكة

بالنسبة لمتجه الإدخال x، تحسب الوحدة الأساسية:

z = Wx + b
output = activation(z)

يحتوي W على أوزان قابلة للتدريب وb هو انحياز قابل للتدريب. تُدخل دالة التنشيط عدم الخطية. لا “تمر” الأوزان عبر الدالة بمفردها؛ تُطبق الدالة على المجموع المرجّح والانحياز.

تُرصّ الشبكة متعددة الطبقات (MLP) طبقات كثيفة. تمثل طبقة الإدخال الخصائص، وتحوّل الطبقات المخفية هذه الخصائص، وتُصمم طبقة الإخراج لتلبية المهمة—مثل مخرجات الفئات (logits) أو قيمة الانحدار.

كيف تتعلم الشبكات العصبية

  1. يقوم النموذج بتهيئة المعلمات القابلة للتدريب.
  2. يقوم التمرير الأمامي بمعالجة دفعة من البيانات ويُنتج توقعات.
  3. تقارن دالة الخسارة التوقعات مع هدف التدريب.
  4. Backpropagation يستخدم قاعدة السلسلة لحساب التدرجات.
  5. يقوم مُحسّن مثل الانحدار العشوائي المتدرج (SGD) أو AdamW بتحديث الأوزان والانحيازات.

أصبح Backpropagation محورًا أساسيًا لتدريب الشبكات العصبية نتيجة لأعمال تم تطويرها وشهرتها على مدى عدة عقود؛ لم يُخلق لأول مرة في عصر التعلم العميق الحديث. تُنفّذ الأطر الحديثة التفاضل التلقائي بنمط العكسي بحيث لا يضطر الممارسون إلى اشتقاق كل تدرج يدويًا.

لماذا تُعد دوال التنشيط مهمة

بدون دوال تنشيط غير خطية، تتدمّر عدة طبقات خطية عادية إلى تحويل خطي واحد. يُستخدم ReLU على نطاق واسع لأنه بسيط وفعّال. تُعدّ GELU وSiLU شائعة في البُنى الحديثة. لا يزال كل من Sigmoid وsoftmax مفيدين لتفسيرات مخرجات معينة، لكن Sigmoid قد يُشبَع في الطبقات المخفية ويساهم في تلاشي التدرجات.

البُنى الرئيسية للشبكات العصبية

الشبكات العصبية التلافيفية

CNNs تطبق مرشحات مُتعلمة عبر الأحياء المحلية وتشارك المعلمات عبر المواقع. تجعل هذه الخصائص منها فعّالة للصور والإشارات الشبيهة بالشبكات.

الشبكات المتكررة

RNNs, LSTMs, and GRUs تُحدّث حالة مخفية عبر تسلسل. لا تزال مفيدة للمهام المتدفقة وسلاسل الزمن، رغم أن التكرار يحدّ من المعالجة المتوازية وقد يواجه صعوبة مع الاعتمادات الطويلة.

المحوّلات

Transformers تستخدم آلية الانتباه لإنشاء تمثيلات تعتمد على السياق. الاتصالات المتبقية (Residual)، والتطبيع، ومعلومات الموضع، والكتل المتتابعة هي أجزاء أساسية من البنية. تُعتمد Transformers الآن في العديد من نماذج اللغة الكبيرة والنماذج متعددة الوسائط.

المشفّرات الذاتية والشبكات التوليدية

Autoencoders تتعلم تمثيلات عبر إعادة البناء. تُولّد GANs ونماذج الانتشار والشبكات الذاتية الانحدارية عينات جديدة باستخدام أهداف وإجراءات تدريب مختلفة.

المكوّنات التي تجعل الشبكات العميقة قابلة للتدريب

تستخدم الأنظمة الحديثة أكثر من الطبقات والدوال التنشيطية. تسمح الاتصالات المتبقية بمرور المعلومات والتدرجات حول الكتل. يُثبّط التطبيع الدالات التنشيطية. يمكن للتنظيم، وتوسيع البيانات، وإسقاط الوحدات (dropout)، وتخفيف الوزن (weight decay) تقليل الإفراط في التكيّف. تُحوّل طبقات التضمين العناصر المتقطعة مثل الرموز إلى متجهات. يتيح الانتباه أن يعتمد التمثيل ديناميكيًا على عناصر أخرى.

القوى والقيود

يمكن للشبكات العصبية تعلم الخصائص من بيانات خام عالية الأبعاد وتوسيع نطاقها مع البيانات والحوسبة. قد تتطلب أيضًا مجموعات بيانات ضخمة، عتادًا متخصصًا، وضبطًا دقيقًا. قد تكون توقعاتها غير مُعَدَّة بشكل جيد، هشةً عند تغير التوزيع، معرضةً للتلاعب العدائي، أو صعبة الشرح.

يجب أن تتماشى البنية مع المهمة وقيود النشر. بالنسبة للعديد من المشكلات الجدولية، يمكن أن يكون نموذج شجرة التجميع أو النموذج الخطي أسرع وأسهل في التحقق. في التطبيقات ذات المخاطر العالية، يجب تقييم أداء النموذج حسب الفئات الفرعية وأنماط الفشل، وليس فقط وفق معيار إجمالي.

الطبقات، الدوال التنشيطية، وتدفق المعلومات

تُركّب الشبكة العصبية دوالًا مُعَدلَة. تُكوّن كل وحدة مزيجًا مرجّحًا من المدخلات، وتضيف انحيازًا، وتمرّر النتيجة عبر دالة تنشيط مثل ReLU أو sigmoid أو tanh أو GELU. يسمح تكديس الطبقات بميزات هرمية وحدود قرار غير خطية. يتحكم العرض في عدد الوحدات لكل طبقة؛ يتحكم العمق في التحولات المتتالية؛ تُشفّر الاتصال ومشاركة الأوزان البنية. يعتمد مخرجات الشبكة على ما قبل المعالجة، المعلمات، التطبيع، ووضع الاستدلال معًا. الخلية العصبية هي عملية رياضية، ليست خلية بيولوجية حرفية أو مفهومًا مستقلًا ذا معنى.

تحسب الانتشار الأمامي التوقعات؛ تُقَيِّم الخسارة الخطأ؛ يطبّق الانتشار العكسي قاعدة السلسلة على التدرجات؛ يُحدّث المُحسّن المعلمات. تؤثر التهيئة، ومعدل التعلم، وإحصاءات الدفعة، والمسارات المتبقية، والتطبيع على ما إذا كانت التدرجات تختفي أو تنفجر أو تظل مفيدة. تشمل التنظيمات تخفيف الوزن، وإسقاط الوحدات، وتوسيع البيانات، وإيقاف التدريب المبكر، والقيود المعمارية. يُرسم سلوك التدريب والتحقق، وتُفحص إحصاءات التدرجات والتنشيط، وتُقارن التجارب المتكررة. يمكن لشبكة كبيرة أن تحفظ بيانات التدريب، بينما قد يُقصر نموذج صغير أو يفتقد البنية اللازمة.

اختيار البنية، التقييم، والنشر

تُعالج الشبكات متعددة الطبقات المتجهات الثابتة؛ تستغل الشبكات التلافيفية البنية المحلية؛ تعالج النماذج المتكررة ونماذج الفضاء الحالة السلاسل؛ تستخدم Transformers الانتباه؛ تتبادل شبكات الرسم البياني المعلومات عبر الحواف. تُعدّ الأنواع المختلطة شائعة. يُختار بناءً على الانحياز الاستقرائي، والبيانات، وحجم السلسلة أو الصورة، والكمون، والذاكرة، وقابلية الفهم، والعتاد المتاح. يُقَيَّم مقابل نموذج خطي أو شجرة أساسية وتُجرى إلغاء مكونات لتحديد أي تعقّب مهم. لا يُتنبأ بجودة النموذج أو تكلفة الاستدلال أو متطلبات البيانات من عدد المعلمات وحده.

يتطلب النشر تجميد ما قبل المعالجة، وتصدير أو تجميع الرسم البياني، والتحقق الرقمي، واختبارات الموارد تحت حمل واقعي. يمكن للكمّية (quantization) والاقتطاع (pruning) تقليل الحجم لكن قد يغيّران سلوك الفئات النادرة. راقب المدخلات، والمخرجات، والمعايرة، والكمون، والنتائج المؤكدة؛ اختبر البيانات العدائية والمتغيرة. احمِ النماذج والاعتمادات والبيانات عبر قطع مُوقعة، وضبط الوصول، ومراجعة سلسلة التوريد. تتطلب التفسيرات من تنشيطات فردية أو خريطة الأهمية (saliency) تحققًا سببيًا وسلوكيًا. تُعدّ الشبكات العصبية مُقَرِّبات دوال مرنة، ليست ضمانًا للفهم أو الحقيقة أو المتانة.

مثال عملي: متنبئ طلب عصبي

يتنبأ تاجر تجزئة بالطلب الأسبوعي للسلع استنادًا إلى المبيعات، والعروض الترويجية، والسعر، والعطلات، والتوافر، والطقس. تُقارن الشبكة مع نماذج أساسية سائدة موسمية، ونموذج خطي، ونموذج شجرة باستخدام تقسيمات زمنية متداولة. تُضمّن العروض المستقبلية فقط عندما تكون معروفة فعليًا في وقت التنبؤ، بينما تُنمذج حالات النفاد لأن المبيعات الملاحظة قد تقلل من الطلب. يستخدم التقييم الخطأ المطلق الموزون، والتحيّز، وتغطية الفترات، والنتائج حسب سرعة السلعة والمتجر.

تُصدِر خطوط أنابيب النشر إصدارات تشمل التوافر، والنموذج، والأفق، وتُرفض التنبؤات عندما تكون المدخلات المطلوبة قديمة. يرى المخططون الفواصل الزمنية ويمكنهم التجاوز بأسباب مسجلة. يكتشف المراقبة التغذيات المفقودة، وتغيّر الخطأ، والتحيّز، والتنبؤات غير المعتادة؛ تُفصل نتائج الأعمال عن دقة التنبؤ لأن سياسة الطلب تؤثر أيضًا على المخزون. يُظلّ تحديث النموذج ظلًا عبر عدة دورات، وتظل أداة التنبؤ السابقة متاحة للعودة إلى الوضع السابق خلال اضطراب موسمي أو توريد.

دليل التنفيذ والاستعداد التشغيلي

يتطلب قرار الإنتاج أكثر من عرض ناجح. عرّف المستخدمين المستهدفين، وبيئة التشغيل، والمدخلات، والمخرجات، والاعتمادات، والمالك، وعواقب كل فشل مهم. أنشئ خط أساس قابل لإعادة الإنتاج ومجموعة تقييم مُصدَّرة قبل الضبط. اختبر الحالات العادية، وظروف الحدود، ومدخلات غير صالحة أو مفقودة، وتحول التوزيع، وانقطاع الاعتمادات، وسوء الاستخدام، والمجموعات أو البيئات التي قد تُهمل. قِس جودة المهمة مع المعايرة أو عدم اليقين، والكمون، ومعدل النقل، وتكلفة الموارد، وإمكانية الوصول، والخصوصية، والأمان. سجّل كل تحويل وعَتبة حتى يتمكن مراجع مستقل من إعادة إنتاج النتيجة والتمييز بين الأدلة والنموذج الأولي الجذاب.

قبل الإطلاق، عيّن السلطة المسؤولة عن الإصدار، والاستثناءات، والتغييرات، والعودة إلى الحالة السابقة، وإيقاف الخدمة. استخدم نشرًا متدرجًا، واحفظ نسخة احتياطية آمنة، وتحقق من المراقبة عبر إدخال أخطاء متعمدة. يجب أن تُظهر بيانات التتبع التشغيلية جودة المدخلات، وسلوك المخرجات، وإصدار النموذج أو القاعدة، وصحة الاعتمادات، وتجاوزات البشر، والنتائج المؤكدة دون جمع بيانات حساسة غير ضرورية. عرّف عتبات التنبيه ومسؤول الاستجابة، ثم راجع الأدلة الواقعية بعد النشر بدلاً من افتراض استمرار الأداء غير المتصل. أعد التقييم كلما تغيرت مصادر البيانات أو المستخدمون أو النماذج أو البائعون أو السياسات أو العتاد أو الأهداف. يحتاج النظام المُصان إلى وثائق استعادة، وتعلم من الحوادث، وإجراءات حذف واحتفاظ، ونقطة واضحة يجب عندها إيقافه أو استبداله.

الأسئلة المتكررة

هل كل شبكة عصبية تُعدّ تعلمًا عميقًا؟

لا. الشبكة الصغيرة ذات طبقة مخفية واحدة هي شبكة عصبية، بينما يشير التعلم العميق عمومًا إلى البُنى التي تحتوي على عدة مراحل معالجة مُتعلمة. الحد الفاصل تقليدي وليس عتبة علمية صارمة.

هل تخزن الشبكات العصبية بيانات التدريب الخاصة بها؟

إنها تخزن المعلمات المتعلمة، وليس نسخة قابلة للبحث من مجموعة البيانات. ومع ذلك، يمكن للنماذج الكبيرة أن تحفظ وتعيد إنتاج أمثلة تدريبية فردية، مما يخلق مخاطر على الخصوصية وحقوق النشر يجب اختبارها.

المراجع الأساسية

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.