أساسيات الذكاء الاصطناعي
ما هي مصفوفة الالتباس؟
مصفوفة الالتباس هي جدول يحصي عدد المرات التي تتطابق أو تختلف فيها تنبؤات المصنف مع التسميات المعروفة. تُظهر الفئات التي يحدث بينها الالتباس وتوفر الأعداد المستخدمة لحساب مقاييس مثل الدقة، الاستدعاء، النوعية، وF1. وهي واحدة من الأدوات التشخيصية الأساسية لتصنيف التعلم الخاضع للإشراف.
المصفوفة نفسها ليست مقياس أداء واحد. إنها عرض منظم للنتائج عند عتبة قرار معينة، ومجموعة بيانات، وتعريف الفئة.
النقاط الرئيسية
- في التصنيف الثنائي، الأربعة نتائج هي الإيجاب الحقيقي (TP)، الإيجاب الزائف (FP)، السلب الزائف (FN)، والسلب الحقيقي (TN).
- دائمًا ضع تسميات على المحاور: لا تضع جميع المكتبات والمنشورات الفئات الفعلية والمتوقعة في نفس الاتجاه.
- يمكن للدقة إخفاء أخطاء جسيمة عندما تكون الفئات غير متوازنة.
- تغيير عتبة التصنيف يغيّر مصفوفة الالتباس والتوازن بين الدقة والاستدعاء.

الأربعة نتائج في التصنيف الثنائي
- الإيجاب الحقيقي (TP): المثال إيجابي والنموذج يتنبأ بإيجابي.
- الإيجاب الزائف (FP): المثال سالب لكن النموذج يتنبأ بإيجابي.
- السلب الزائف (FN): المثال إيجابي لكن النموذج يتنبأ بسالب.
- السلب الحقيقي (TN): المثال سالب والنموذج يتنبأ بسالب.
وفقًا لاتفاقية scikit-learn، تكون الصفوف هي الفئات الحقيقية والأعمدة هي الفئات المتوقعة. قد تقوم تصورات أخرى بتبديل هذا الترتيب، لذا يجب أن تُرشد التسميات—وليس مواضع الزوايا—التفسير.
المقاييس المستمدة من مصفوفة الالتباس
الدقة
Precision = TP / (TP + FP)
الدقة تجيب: من بين الأمثلة التي تم توقعها إيجابية، ما النسبة التي كانت فعلًا إيجابية؟
الاستدعاء أو الحساسية
Recall = TP / (TP + FN)
الاستدعاء يجيب: من بين جميع الأمثلة الإيجابية الفعلية، ما النسبة التي حددها النموذج؟ في التصنيف الثنائي، يُطلق على استدعاء الفئة الإيجابية أيضًا اسم الحساسية أو معدل الإيجاب الحقيقي.
النوعية
Specificity = TN / (TN + FP)
النوعية هي الاستدعاء للفئة السلبية: من بين السالبين الفعليين، ما النسبة التي رفضها النموذج بشكل صحيح؟
الدقة
Accuracy = (TP + TN) / (TP + TN + FP + FN)
الدقة مفيدة عندما تكون الفئات وتكاليف الأخطاء متوازنة إلى حد ما. يمكن أن تكون مضللة عندما تهيمن فئة واحدة.
مؤشر F1
F1 = 2 × (Precision × Recall) / (Precision + Recall)
يُلخّص مؤشر F1 الدقة والاستدعاء بمتوسط هندسي. يتجاهل السلبيات الحقيقية، لذا فهو ليس الملخص المناسب لكل مهمة.
مثال عملي
لنفترض أن مجموعة اختبار تحتوي على 1,000 معاملة. خمسون منها احتيالية. يجد النموذج 40 من تلك الاحتيالات لكنه يعلّق علامة على 30 معاملة شرعية:
- TP = 40
- FN = 10
- FP = 30
- TN = 920
يحقق النموذج دقة بنسبة 96٪، لكن دقته حوالي 57٪ والاستدعاء 80٪. تُعزى الدقة العالية إلى العدد الكبير من المعاملات الشرعية. ما إذا كان هذا النموذج مقبولًا يعتمد على تكلفة الاحتيال الفائت، قدرة التحقيق، ومدى معايرة درجات المخاطر الخاصة به.
العتبات تغير المصفوفة
تُخرج العديد من المصنفات درجة بدلاً من إجابة نعم/لا حتمية. خفض عتبة الإيجاب عادةً يزيد الاستدعاء والإيجابيات الزائفة؛ رفعها عادةً يزيد الدقة أو النوعية مع فقدان المزيد من الإيجابيات. يجب اختيار العتبة باستخدام بيانات التحقق وتكاليف الأخطاء الفعلية، وليس تثبيتها تلقائيًا عند 0.5.
تلخّص منحنيات الدقة‑الاستدعاء ومنحنيات ROC الأداء عبر العتبات. غالبًا ما تكون منحنيات الدقة‑الاستدعاء أكثر إفادة عندما تكون الفئة الإيجابية نادرة.
مصفوفات الالتباس متعددة الفئات
لـ K فئات، تكون المصفوفة K × K. التنبؤات الصحيحة تقع على القطر؛ الخلايا خارج القطر تُظهر أي أزواج الفئات التي يحدث بينها الالتباس. يمكن متوسط المقاييس لكل فئة بطرق مختلفة:
- المتوسط الكلي (Macro): يعطي كل فئة وزنًا متساويًا.
- المتوسط المرجّح: يوزن كل فئة بحسب عدد أمثلتها.
- المتوسط الصغري (Micro): يجمع عدد النتائج قبل حساب المقياس.
الإبلاغ عن متوسط واحد فقط قد يُخفي ضعف الأداء على الفئات الصغيرة. أدرج عدد الدعم والنتائج لكل فئة حيث تكون الاختلافات مهمة.
الأخطاء الشائعة
- قراءة مصفوفة منقولة دون التحقق من تسميات المحاور.
- حساب المقاييس من بيانات التدريب بدلاً من مجموعة اختبار مناسبة.
- تجاهل انتشار الفئات، استراتيجية العينة، أو الكيانات المكررة عبر التقسيمات.
- مقارنة المصفوفات المنتجة عند عتبات مختلفة دون الإشارة إلى التغيير.
- معاملة جميع الإيجابيات الزائفة والسلبيات الزائفة على أنها ذات تكلفة متساوية.
وبالتالي، تُعد مصفوفة الالتباس أداة تشخيصية، ليست تقييمًا كاملاً. كما يجب تضمين المعايرة، تحليل الفئات الفرعية، المتانة، والعواقب اللاحقة في مراجعة التصنيف.
قراءة كل خلية واستخلاص المقاييس المفيدة
في التصنيف الثنائي، تُحصي مصفوفة الالتباس الإيجابيات الحقيقية، الإيجابيات الزائفة، السلبيات الزائفة، والسلبيات الحقيقية لفئة إيجابية مختارة وعتبة معينة. تُقسم الدقة التنبؤات الصحيحة على جميع الحالات؛ تسأل الدقة ما النسبة من الإيجابيات المتوقعة التي كانت صحيحة؛ يسأل الاستدعاء ما النسبة من الإيجابيات الفعلية التي تم العثور عليها؛ تقيس النوعية السلبيات الفعلية التي رُفضت بشكل صحيح. مؤشر F1 هو المتوسط الهندسي بين الدقة والاستدعاء. لا يوجد ما هو الأفضل بطبيعة الحال: فحص الاحتيال، والفرز الطبي، وتصنيف البريد المزعج تُعطي عواقب مختلفة لنفس الخلايا.
في مشاكل متعددة الفئات، عادةً ما تمثل الصفوف الفئات الفعلية والأعمدة الفئات المتوقعة، رغم أن الاتفاقيات قد تختلف، لذا يجب أن تكون التسميات صريحة. تُنتج حسابات الواحد ضد البقية دقة واستدعاء لكل فئة. يُعطي المتوسط الكلي وزنًا متساويًا للفئات؛ يجمع المتوسط الصغري القرارات ويفضل الفئات الشائعة؛ يتبع المتوسط المرجّح دعم الفئة. تسمح مهام تعدد التسميات بعدة تسميات لكل عنصر وتحتاج إلى تعريفات على مستوى التسميات أو العينات. يمكن التطبيع حسب الصف لتفحص أنماط الاستدعاء أو حسب العمود لتفحص تركيبة التنبؤات، لكن يجب الاحتفاظ بالأعداد الخام حتى لا تُبالغ المجموعات النادرة بصريًا.
العتبات، عدم اليقين، والقرارات التشغيلية
تلخّص مصفوفة الالتباس القرارات الصارمة عند عتبة واحدة. استخدم منحنيات الدقة‑الاستدعاء أو ROC لمقارنة العتبات، ثم اختر نقطة تشغيل بناءً على السعة، الانتشار، وتكلفة الخطأ. تسأل المعايرة ما إذا كانت الاحتمالات المتوقعة تتطابق مع التردد الملاحظ وتكون منفصلة عن الترتيب. عندما يتغير الانتشار، قد تتغير الدقة حتى لو ظلت الحساسية والنوعية ثابتة. أبلغ عن فواصل الثقة أو تباين التمهيد، وتجنب استنتاجات من عدد قليل من الأخطاء في مجموعة فرعية صغيرة.
قم بتدقيق المصفوفات حسب الوقت، الموقع، الجهاز، اللغة، والمجموعات المتأثرة ذات الصلة للعثور على الأخطاء المتراكمة. قارن النموذج مع عملية اتخاذ القرار الحالية، بما في ذلك المراجعة البشرية. بالنسبة للسلاسل المتتابعة، سجّل الأخطاء في كل مرحلة: الاسترجاع، التصنيف، تحديد العتبة، والإجراء. راقب تسميات النتائج الحية مع تأخيرها وعملية التصحيح. قد يزيد مؤشر F1 المحسّن ظاهريًا من السلبيات الزائفة الضارة أو يتجاوز سعة المراجعة. تُعد مصفوفة الالتباس سجلًا للقرارات؛ اربط كل خلية بمن يواجه الخطأ وما هو الرد المتبع.
مثال عملي: اختيار عتبة الفحص الطبي
يُصدر نموذج الفحص التعلم الآلي درجة خطر لحالة ذات انتشار منخفض. تُنشئ الفريقة مصفوفات الالتباس عبر العتبات وتُبلغ عن الحساسية، النوعية، الدقة، الإحالات الزائفة، والحالات الفائتة مع فواصل الثقة. نظرًا لأن القيمة التنبؤية الإيجابية تعتمد على الانتشار، فإنها تُنمذج السكان المستهدفين بدلاً من اقتباس دقة مجموعة بيانات واحدة. تُقسم النتائج حسب الجهاز، الموقع، العمر، الجنس، ومجموعات أخرى مبررة سريريًا.
يختار الأطباء نقطة تشغيل تحافظ على الحساسية المطلوبة دون إغراق الاختبارات التأكيدية. تُحوَّل المصفوفة إلى أعداد متوقعة لكل 10,000 شخص مُفحوص لتكون العواقب مفهومة. لا تُنتج الدرجات خارج الشروط المُتحققة أي استنتاج آلي. يَقارن الرصد التنبؤات مع التشخيصات المؤكدة المتأخرة، يتتبع السعة والمعايرة، ويُفعِّل المراجعة عندما يتغير الانتشار أو الاكتساب. تظل مصفوفة الالتباس مرتبطة بالنموذج والعتبة والسكان المحددين.
دليل التنفيذ والاستعداد التشغيلي
يتطلب اتخاذ قرار إنتاجي أكثر من مجرد عرض ناجح. عرّف المستخدمين المستهدفين، بيئة التشغيل، المدخلات، المخرجات، الاعتماديات، المالك، وعواقب كل فشل مهم. أنشئ خط أساس قابل لإعادة الإنتاج ومجموعة تقييم مُصدّرة قبل الضبط. اختبر الحالات العادية، ظروف الحد، المدخلات المشوهة أو المفقودة، تحول التوزيع، انقطاع الاعتماديات، سوء الاستخدام، والمجموعات أو البيئات الأكثر احتمالًا لتكون غير مُخدَّمة. قس جودة المهمة جنبًا إلى جنب مع المعايرة أو عدم اليقين، الكمون، الإنتاجية، تكلفة الموارد، الوصول، الخصوصية، والأمان. سجّل كل تحويل وعتبة حتى يتمكن مراجع مستقل من إعادة إنتاج النتيجة وتمييز الأدلة عن نموذج أولي جذاب.
قبل الإطلاق، عيّن سلطة للإصدار، الاستثناءات، التغييرات، الاسترجاع، والتقاعد. استخدم نشرًا مرحليًا، حافظ على خيار احتياطي آمن، وتحقق من المراقبة عبر إدخال أعطال متعمدة. يجب أن تكشف قياسات التشغيل جودة المدخلات، سلوك المخرجات، نسخة النموذج أو القاعدة، صحة الاعتماديات، التدخلات البشرية، والنتائج المؤكدة دون جمع بيانات حساسة غير ضرورية. عرّف عتبات التنبيه ومسؤول الاستجابة، ثم راجع الأدلة الواقعية بعد النشر بدلاً من افتراض استمرار الأداء غير المتصل. أعد التقييم كلما تغيرت مصادر البيانات أو المستخدمون أو النماذج أو البائعون أو السياسات أو الأجهزة أو الأهداف. يحتاج النظام المُصان أيضًا إلى وثائق استعادة، تعلم من الحوادث، إجراءات حذف واحتفاظ، ونقطة واضحة يجب عندها تعطيله أو استبداله.
الأسئلة المتكررة
ما هي مصفوفة الالتباس المُعَدَّلة؟
يقوم التطبيع بقسمة الأعداد على إجمالي الفئة الحقيقية، إجمالي الفئة المتوقعة، أو جميع الملاحظات. يجعل المعدلات أسهل للمقارنة بين الفئات، لكن يجب أن يحتفظ التقرير أيضًا بأعداد الدعم الخام حتى لا تُخطئ المجموعات الصغيرة على أنها ذات حجم متساوٍ.
هل يمكن لمصفوفة الالتباس تقييم الانحدار؟
ليس مباشرة. تتطلب مصفوفة الالتباس فئات منفصلة. يؤدي تجميع هدف مستمر إلى فقدان المعلومات؛ عادةً ما يُستخدم تحليل البواقي ومقاييس مصممة للقيم المستمرة في الانحدار، مثل MAE أو RMSE.












