أساسيات الذكاء الاصطناعي

ما هو مصفوفة الارتباك؟

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

واحدة من أكثر الأدوات التحليلية قوة في تعلم الآلة وعلوم البيانات هي مصفوفة الارتباك. يمكن لمصفوفة الارتباك تقديم معلومات مفصلة للباحثين حول أداء مصنف تعلم الآلة مع respecto إلى الفئات المستهدفة في مجموعة البيانات. ستظهر مصفوفة الارتباك أمثلة تم تصنيفها بشكل صحيح مقابل الأمثلة التي تم تصنيفها بشكل خاطئ. دعونا نلقي نظرة أعمق على كيفية بناء مصفوفة الارتباك وكيف يمكن تفسيرها.

ما هو مصفوفة الارتباك؟

دعونا نبدأ بتقديم تعريف بسيط لمصفوفة الارتباك. مصفوفة الارتباك هي أداة تحليلية للتنبؤ. تحديدًا، إنها جدول يعرض ويقارن القيم الفعلية مع القيم المتوقعة للنموذج. في سياق تعلم الآلة، يتم استخدام مصفوفة الارتباك كمتغير لتحليل أداء مصنف تعلم الآلة على مجموعة بيانات. تُولد مصفوفة الارتباك تمثيلاً لتقديرات مثل الدقة والprecision والspecificity والاستدعاء.

السبب في أن مصفوفة الارتباك مفيدة بشكل خاص هو أنها، على عكس أنواع أخرى من معايير التصنيف مثل الدقة البسيطة، تُ生成 صورة أكثر اكتمالاً لأداء النموذج. استخدام معيار مثل الدقة فقط يمكن أن يؤدي إلى وضع حيث يتم تصنيف النموذج لفئة واحدة بشكل كامل ومستمر، ولكن يظل غير ملاحظ بسبب الأداء الجيد بشكل عام. في حين أن مصفوفة الارتباك تقدم مقارنةً لقيم مختلفة مثل السلبيات الكاذبة والسلبيات الحقيقية والإيجابيات الكاذبة والإيجابيات الحقيقية.

دعونا نحدد المقاييس المختلفة التي تمثلها مصفوفة الارتباك.

الاستدعاء في مصفوفة الارتباك

الاستدعاء هو عدد الأمثلة الإيجابية الحقيقية مقسومًا على عدد السلبيات الكاذبة والأمثلة الإيجابية الكلية. بعبارة أخرى، الاستدعاء يمثل نسبة الأمثلة الإيجابية الحقيقية التي صنفها نموذج تعلم الآلة. يُعبّر عن الاستدعاء كنسبة مئوية للأمثلة الإيجابية التي كان نموذج تعلم الآلة قادرًا على تصنيفها من بين جميع الأمثلة الإيجابية في مجموعة البيانات. قد يُشار إلى هذا القيمة أيضًا باسم “معدل الإصابة”، ويتعلق بها قيمة أخرى هي “الحساسية”، التي تصف احتمال الاستدعاء أو معدل التنبؤات الإيجابية الحقيقية.

الدقة في مصفوفة الارتباك

مثل الاستدعاء، الدقة هي قيمة تتبع أداء النموذج فيما يتعلق بتصنيف الأمثلة الإيجابية. ومع ذلك، على عكس الاستدعاء، تهتم الدقة بمدى صحة الأمثلة التي صنفها النموذج على أنها إيجابية. من أجل حساب هذا، يتم تقسيم عدد الأمثلة الإيجابية الحقيقية على عدد السلبيات الكاذبة بالإضافة إلى الإيجابيات الحقيقية.

لجعل الفرق بين الاستدعاء والدقة أوضح، تهدف الدقة إلى تحديد نسبة جميع الأمثلة المصنفة على أنها إيجابية التي كانت في الواقع إيجابية، بينما يتبع الاستدعاء نسبة جميع الأمثلة الإيجابية الحقيقية التي كان نموذج تعلم الآلة قادرًا على التعرف عليها.

النوعية في مصفوفة الارتباك

في حين أن الاستدعاء والدقة هما قيمتان تتبعان الأمثلة الإيجابية ومعدل الإيجابيات الحقيقية، تُقيم النوعية معدل السلبيات الحقيقية أو عدد الأمثلة التي صنفها النموذج على أنها سلبية والتي كانت في الواقع سلبية. يتم حساب هذا من خلال قسمة عدد الأمثلة المصنفة على أنها سلبية على عدد السلبيات الكاذبة بالإضافة إلى السلبيات الحقيقية.

فهم مصفوفة الارتباك

صورة: Jackverr via Wikimedia Commons, (https://commons.wikimedia.org/wiki/File:ConfusionMatrix.png), CC BY SA 3.0

مثال على مصفوفة الارتباك

بعد تعريف المصطلحات الضرورية مثل الدقة والاستدعاء والحساسية والنوعية، يمكننا النظر في كيفية تمثيل هذه القيم المختلفة في مصفوفة الارتباك. تُنشأ مصفوفة الارتباك في حالات التصنيف، وتطبق عندما هناك فئتان أو أكثر. يمكن أن تكون مصفوفة الارتباك التي تُ_generated عالية وواسعة كما هو مطلوب، تحتوي على أي عدد من الفئات، ولكن لأغراض البساطة، سننظر إلى مصفوفة ارتباك 2×2 لمهمة تصنيف ثنائية.

على سبيل المثال، افترض أن مصنفًا يستخدم لتحديد ما إذا كان المريض مصابًا bằng مرض أم لا. ستُدخل الميزات إلى المصنف، وسيعود المصنف بتصنيفين مختلفين – إما أن المريض لا يعاني من المرض أو يعانيه.

دعونا نبدأ من الجانب الأيسر من المصفوفة. يمثل الجانب الأيسر من مصفوفة الارتباك التصنيفات التي قدمها المصنف للفئات الفردية. سيكون هناك صفان في الجزء العلوي من المصفوفة لمهمة التصنيف الثنائية. فيما يتعلق بالجزء العلوي من المصفوفة، فإنه يتبع القيم الحقيقية، التسميات الفعلية للفئات، لمثيلات البيانات.

يمكن تفسير مصفوفة الارتباك من خلال النظر إلى哪里 تقاطع الصفوف والأعمدة. قم بتحديد تنبؤات النموذج مع التسميات الحقيقية للنموذج. في هذه الحالة، يتم العثور على قيم الإيجابيات الحقيقية، أو عدد التنبؤات الإيجابية الصحيحة، في الزاوية العلوية اليسرى. يتم العثور على السلبيات الكاذبة في الزاوية العلوية اليمنى، حيث يتم تصنيف الأمثلة على أنها إيجابية ولكنها في الواقع سلبية.

يظهر الجزء السفلي الأيسر من الشبكة الأمثلة التي صنفها المصنف على أنها سلبية ولكنها في الواقع إيجابية. أخيرًا، يوجد الجزء السفلي الأيمن من مصفوفة الارتباك حيث يتم العثور على قيم السلبيات الحقيقية، أو حيث يتم تصنيف الأمثلة على أنها سلبية بشكل حقيقي.

عندما تحتوي مجموعة البيانات على أكثر من فئتين، تزيد المصفوفة بحجم هذه الفئات. على سبيل المثال، إذا كانت هناك ثلاث فئات، تكون المصفوفة مصفوفة 3×3. بغض النظر عن حجم مصفوفة الارتباك، يتم تفسيرها بنفس الطريقة. يحتوي الجانب الأيسر على القيم المتوقعة، وتجري التسميات الفعلية للفئات عبر الجزء العلوي. توجد الحالات التي تم تصنيفها بشكل صحيح بشكل متقطع من الزاوية العلوية اليسرى إلى الزاوية السفلى اليمنى. من خلال النظر إلى المصفوفة، يمكنك تحديد المقاييس التنبؤية الأربع المذكورة أعلاه.

على سبيل المثال، يمكنك حساب الاستدعاء من خلال أخذ الإيجابيات الحقيقية والسلبيات الكاذبة، وإضافتها معًا، وقسمتهما على عدد الإيجابيات الحقيقية. في غضون ذلك، يمكن حساب الدقة من خلال الجمع بين السلبيات الكاذبة والإيجابيات الحقيقية، ثم قسمة القيمة على إجمالي عدد الإيجابيات الحقيقية.

في حين يمكن أن ينفق المرء وقتًا في حساب يدوى لمقاييس مثل الدقة والاستدعاء والنوعية، يتم استخدام هذه المقاييس بشكل شائع لدرجة أن معظم مكتبات تعلم الآلة تحتوي على طرق لعرضها. على سبيل المثال، يحتوي Scikit-learn على وظيفة تُنشئ مصفوفة ارتباك.

مدون وبرمجي متخصص في مواضيع Machine Learning و Deep Learning. يأمل دانيال في مساعدة الآخرين على استخدام قوة الذكاء الاصطناعي من أجل الخير الاجتماعي.