أساسيات الذكاء الاصطناعي

ما هي تقليص الأبعاد؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

ما هي تقليص الأبعاد؟

تقليص الأبعاد هو عملية تستخدم لتقليل أبعاد مجموعة بيانات، حيث يتم أخذ العديد من الميزات وتمثيلها كميزات أقل. على سبيل المثال، يمكن استخدام تقليص الأبعاد لتقليل مجموعة بيانات من двадة ميزة إلى بضع ميزات فقط. يتم استخدام تقليص الأبعاد بشكل شائع في مهام التعلم غير الموجه لإنشاء فئات تلقائيًا من العديد من الميزات. من أجل فهم أفضل لماذا وكيف يتم استخدام تقليص الأبعاد، سننظر إلى المشاكل المرتبطة بالبيانات عالية الأبعاد وأشهر طرق تقليل الأبعاد.

المزيد من الأبعاد يؤدي إلى التأثير الزائد

الأبعاد تشير إلى عدد الميزات / الأعمدة داخل مجموعة البيانات.

غالبًا ما يُفترض أن المزيد من الميزات في التعلم الآلي هو أفضل، حيث يخلق نموذجًا أكثر دقة. ومع ذلك، لا تعني المزيد من الميزات بالضرورة نموذجًا أفضل.

يمكن أن تختلف ميزات مجموعة البيانات بشكل كبير فيما يتعلق بمدى فائدتها للنموذج، مع وجود العديد من الميزات التي تكون أهمية قليلة. بالإضافة إلى ذلك، كلما زادت عدد الميزات في مجموعة البيانات، زادت العينات المطلوبة لضمان تمثيل التوليفات المختلفة للميزات جيدًا في البيانات. لذلك، يزداد عدد العينات مع زيادة عدد الميزات. المزيد من العينات والمزيد من الميزات يعني أن النموذج يحتاج إلى أن يكون أكثر تعقيدًا، و随着 تعقيد النماذج، يصبح أكثر حساسية للتأثير الزائد. يتعلم النموذج الأنماط في بيانات التدريب جيدًا جدًا ويفشل في تعميمها إلى بيانات خارج العينة.

تقليل أبعاد مجموعة البيانات له العديد من الفوائد. كما ذكرنا، فإن النماذج البسيطة أقل عرضة للتأثير الزائد، حيث لا يحتاج النموذج إلى افتراضات حول كيفية ارتباط الميزات ببعضها البعض. بالإضافة إلى ذلك، فإن أقل عدد من الأبعاد يعني أن هناك حاجة إلى طاقة حسابية أقل لتدريب الخوارزميات. بشكل مماثل، يتم تقليل مساحة التخزين المطلوبة لمجموعة بيانات ذات أبعاد أصغر. يمكن أن يسمح تقليل أبعاد مجموعة البيانات باستخدام خوارزميات غير مناسبة لمجموعات البيانات ذات العديد من الميزات.

طرق تقليل الأبعاد الشائعة

يمكن أن يكون تقليل الأبعاد عن طريق اختيار الميزات أو هندسة الميزات. اختيار الميزات هو حيث يتم تحديد الميزات الأكثر صلة لمجموعة البيانات من قبل المهندس، في حين أن هندسة الميزات هي عملية إنشاء ميزات جديدة عن طريق الجمع أو تحويل ميزات أخرى.

يمكن إجراء اختيار الميزات وهندستها بشكل برمجي أو يدوي. عند اختيار الميزات وهندستها يدويًا، يتم استخدام التصور البياني للبيانات لاكتشاف العلاقات بين الميزات والفئات. يمكن أن يكون إجراء تقليل الأبعاد بهذه الطريقة وقتياً جدًا، وبالتالي فإن بعض أكثر الطرق شيوعًا لتقليل الأبعاد تتضمن استخدام الخوارزميات المتاحة في المكتبات مثل Scikit-learn لPYTHON. تشمل هذه الخوارزميات الشائعة لتقليل الأبعاد تحليل المكونات الرئيسية (PCA)، تحليل القيمة المنفردة (SVD)، و تحليل التمييز الخطي (LDA).

الخوارزميات المستخدمة في تقليل الأبعاد لمهام التعلم غير الموجه عادة ما تكون PCA و SVD، في حين أن الخوارزميات المستخدمة في تقليل الأبعاد لمهام التعلم الموجه عادة ما تكون LDA و PCA. في حالة نماذج التعلم الموجه، يتم إطعام الميزات الجديدة المولدة إلى مصنف التعلم الآلي. لاحظ أن الاستخدامات الموضحة هنا هي مجرد حالات استخدام عامة وليست الشروط الوحيدة التي يمكن استخدام هذه التقنيات فيها. إن خوارزميات تقليل الأبعاد الموضحة أعلاه هي مجرد طرق إحصائية وتستخدم خارج نماذج التعلم الآلي.

تحليل المكونات الرئيسية

صورة: مصفوفة مع تحديد المكونات الرئيسية

تحليل المكونات الرئيسية (PCA) هو طريقة إحصائية تحليلخصائص / ميزات مجموعة البيانات و تلخيص الميزات الأكثر تأثيرًا. يتم الجمع بين ميزات مجموعة البيانات معًا في تمثيلات تحتفظ بالمعظم من خصائص البيانات ولكنها موزعة على أبعاد أقل. يمكنك التفكير في هذا على أنه “ضغط” البيانات من تمثيل بأبعاد أعلى إلى تمثيل بأبعاد قليلة فقط.

على سبيل المثال، يمكن استخدام PCA في حالة حيث يمكن وصف النبيذ باستخدام العديد من الميزات المحددة مثل مستويات ثاني أكسيد الكربون، مستويات التهوية، إلخ. ومع ذلك، قد تكون هذه الميزات المحددة أقل فائدة عند محاولة تحديد نوع النبيذ. بدلاً من ذلك، سيكون من الأفضل تحديد النوع بناءً على ميزات أكثر عمومية مثل الطعم، اللون، والعمر. يمكن استخدام PCA لدمج ميزات أكثر تحديداً وإنشاء ميزات أكثر عمومية وفائدة وأقل عرضة للتأثير الزائد.

يتم إجراء PCA عن طريق تحديد كيف تختلف الميزات الإدخالية عن المتوسط بالنسبة لبعضها البعض، وتحديد ما إذا كانت هناك علاقات بين الميزات. من أجل القيام بذلك، يتم إنشاء مصفوفة التباين، مما يؤدي إلى إنشاء مصفوفة تتكون من تباين بالنسبة للأزواج المحتملة من ميزات مجموعة البيانات. يتم استخدام هذا لتحديد العلاقات بين المتغيرات، مع تباين سالب يُظهر علاقة عكسية وتباين إيجابي يُظهر علاقة إيجابية.

تتم إنشاء المكونات الرئيسية (الأكثر تأثيرًا) لمجموعة البيانات عن طريق إنشاء مجموعات خطية من المتغيرات الأولية، يتم ذلك بمساعدة مفاهيم الجبر الخطي تسمى القيم الذاتية والمتجهات الذاتية. يتم إنشاء المجموعات بحيث تكون المكونات الرئيسية غير مترابطة ببعضها البعض. يتم ضغط معظم المعلومات الموجودة في المتغيرات الأولية في أول المكونات الرئيسية، مما يعني أن الميزات الجديدة (المكونات الرئيسية) قد تم إنشاؤها تحتوي على المعلومات من مجموعة البيانات الأصلية في مساحة أبعاد أصغر.

تحليل القيمة المنفردة

صورة: بواسطة Cmglee – عمل自己的، CC BY-SA 4.0, https://commons.wikimedia.org/w/index.php?curid=67853297

تحليل القيمة المنفردة (SVD) هو يستخدم لتبسيط القيم داخل مصفوفة، وتقليل المصفوفة إلى مكوناتها الأساسية، مما يجعل الحسابات مع تلك المصفوفة أسهل. يمكن استخدام SVD لتمثيلات قيم حقيقية ومركبة، ولكن في حالة هذا الشرح، سننظر إلى كيفية تفكيك مصفوفة قيم حقيقية.

افترض أن لدينا مصفوفة تتكون من بيانات قيم حقيقية وهدفنا هو تقليل عدد الأعمدة / الميزات داخل المصفوفة، مشابهة لهدف PCA. مثل PCA، سوف يضغط SVD أبعاد المصفوفة مع الحفاظ على معظم تباين المصفوفة. إذا كنا نريد العمل على مصفوفة A، يمكننا تمثيل مصفوفة A على أنها ثلاث مصفوفات أخرى تسمى U و D و V. المصفوفة A تتكون من عناصر x * y الأصلية، في حين أن مصفوفة U تتكون من عناصر X * X (وهي مصفوفة متعامدة). مصفوفة V هي مصفوفة متعامدة مختلفة تحتوي على عناصر y * y. تحتوي مصفوفة D على عناصر x * y وهي مصفوفة قطرية.

من أجل تفكيك قيم مصفوفة A، نحتاج إلى تحويل القيم المنفردة الأصلية إلى القيم القطرية الموجودة في مصفوفة جديدة. عند العمل مع مصفوفات متعامدة، لا تتغير خصائصها إذا تم ضربها بعدد آخر. لذلك، يمكننا تقريب مصفوفة A عن طريق الاستفادة من هذه الخاصية. عند ضرب مصفوفات المتعامدة معًا مع транспونة مصفوفة V، النتيجة هي مصفوفة مكافئة لمصفوفة A الأصلية.

عندما يتم تفكيك مصفوفة A إلى مصفوفات U و D و V، تحتوي هذه المصفوفات على البيانات الموجودة في مصفوفة A. ومع ذلك، ستحتوي الأعمدة اليسرى من المصفوفات على معظم البيانات. يمكننا أخذ هذه الأعمدة القليلة الأولى وتمثيل مصفوفة A بتمثيل له أبعاد أقل بكثير ومعظم البيانات في A.

تحليل التمييز الخطي

 

左: مصفوفة قبل LDA، يمين: محور بعد LDA، الآن يمكن الفصل</caption]

تحليل التمييز الخطي (LDA) هو عملية تأخذ بيانات من مخطط متعدد الأبعاد و إسقاطها على مخطط خطي. يمكنك تصور ذلك بالتفكير في مخطط ثنائي الأبعاد يحتوي على نقاط بيانات تنتمي إلى فئتين مختلفتين. افترض أن النقاط موزعة بحيث لا يمكن رسم خط يفصل بين الفئتين بشكل جيد. من أجل التعامل مع这种 الحالة، يمكن تقليل نقاط المخطط ثنائي الأبعاد إلى مخطط أحادي البعد (خط). سيكون هذا الخط يحتوي على جميع نقاط البيانات موزعة عليه ويمكن أن يتم تقسيمه إلى قسمين يمثلان أفضل فصل للبيانات.

عند إجراء LDA، هناك هدفان رئيسيان. الهدف الأول هو تقليل التباين للفئات، في حين أن الهدف الثاني هو تعظيم المسافة بين متوسطات الفئتين. يتم تحقيق هذه الأهداف عن طريق إنشاء محور جديد سوف يفصل بين الفئتين بناءً على الأهداف المذكورة. بعد إنشاء المحور، يتم وضع نقاط المخطط ثنائي الأبعاد على طول المحور.

هناك ثلاث خطوات مطلوبة لنقل النقاط الأصلية إلى موقع جديد على المحور الجديد. في الخطوة الأولى، يتم استخدام المسافة بين متوسطات الفئات الفردية (التباين بين الفئات) لحساب قابلية الفصل بين الفئات. في الخطوة الثانية، يتم حساب التباين داخل الفئات المختلفة، يتم ذلك عن طريق تحديد المسافة بين العينة ومتوسط الفئة المعنية. في الخطوة الثالثة، يتم إنشاء مساحة أبعاد أقل تعظيم التباين بين الفئات.

تحقق تقنية LDA أفضل النتائج عندما تكون متوسطات الفئات المستهدفة بعيدة عن بعضها البعض. لا يمكن لـ LDA فصل الفئات بفعالية باستخدام محور خطي إذا كانت متوسطات التوزيعات تتداخل.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.