Βασικές αρχές της AI

Τι είναι ένας Πίνακας Σύγχυσης;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ένας πίνακας σύγχυσης είναι ένας πίνακας που μετρά πόσο συχνά οι προβλέψεις ενός ταξινομητή συμφωνούν ή διαφωνούν με τις γνωστές ετικέτες. Αποκαλύπτει ποιες κατηγορίες συγχέονται και παρέχει τις μετρήσεις που χρησιμοποιούνται για τον υπολογισμό δεικτών όπως η ακρίβεια, η ανάκληση, η ειδικότητα και το F1. Είναι ένα από τα βασικά διαγνωστικά εργαλεία για επιβλεπόμενης μάθησης προβλήματα ταξινόμησης.

Ο ίδιος ο πίνακας δεν αποτελεί μία ενιαία βαθμολογία απόδοσης. Παρέχει μια δομημένη άποψη των αποτελεσμάτων σε ένα συγκεκριμένο όριο λήψης απόφασης, σύνολο δεδομένων και ορισμό κατηγορίας.

Βασικά σημεία

  • Για δυαδική ταξινόμηση, τα τέσσερα αποτελέσματα είναι αληθής θετικό, ψευδές θετικό, ψευδές αρνητικό και αληθής αρνητικό.
  • Πάντα να επισημαίνετε τους άξονες: βιβλιοθήκες και δημοσιεύσεις δεν τοποθετούν πάντα τις πραγματικές και προβλεπόμενες κατηγορίες στην ίδια διάταξη.
  • Η ακρίβεια μπορεί να κρύβει σοβαρά σφάλματα όταν οι κατηγορίες είναι μη ισορροπημένες.
  • Η αλλαγή του ορίου ταξινόμησης αλλάζει τον πίνακα σύγχυσης και την ανταλλαγή μεταξύ ακρίβειας και ανάκλησης.
Labeled binary confusion matrix with actual classes on rows, predicted classes on columns, and formulas for precision, recall, specificity, accuracy, and F1
Ένας πίνακας σύγχυσης παρέχει τις μετρήσεις από τις οποίες προκύπτουν διάφοροι δείκτες ταξινόμησης.

Τα τέσσερα αποτελέσματα της δυαδικής ταξινόμησης

  • Αληθής θετικό (TP): το παράδειγμα είναι θετικό και το μοντέλο προβλέπει θετικό.
  • Ψευδές θετικό (FP): το παράδειγμα είναι αρνητικό αλλά το μοντέλο προβλέπει θετικό.
  • Ψευδές αρνητικό (FN): το παράδειγμα είναι θετικό αλλά το μοντέλο προβλέπει αρνητικό.
  • Αληθής αρνητικό (TN): το παράδειγμα είναι αρνητικό και το μοντέλο προβλέπει αρνητικό.

Σύμφωνα με τη σύμβαση του scikit-learn, οι γραμμές αντιπροσωπεύουν τις πραγματικές κατηγορίες και οι στήλες τις προβλεπόμενες. Άλλες απεικονίσεις μπορεί να μεταθέσουν αυτή τη διάταξη, επομένως οι ετικέτες — όχι οι γωνιακές θέσεις — πρέπει να καθοδηγούν την ερμηνεία.

Δείκτες που προέρχονται από έναν πίνακα σύγχυσης

Ακρίβεια

Precision = TP / (TP + FP)

Η ακρίβεια απαντά: μεταξύ των παραδειγμάτων που προβλέπτηκαν θετικά, ποιο ποσοστό ήταν πραγματικά θετικό;

Ανάκληση ή ευαισθησία

Recall = TP / (TP + FN)

Η ανάκληση απαντά: μεταξύ όλων των πραγματικά θετικών παραδειγμάτων, ποιο ποσοστό εντόπισε το μοντέλο; Στη δυαδική ταξινόμηση, η ανάκληση της θετικής κατηγορίας ονομάζεται επίσης ευαισθησία ή ποσοστό αληθών θετικών.

Ειδικότητα

Specificity = TN / (TN + FP)

Η ειδικότητα είναι η ανάκληση για την αρνητική κατηγορία: μεταξύ των πραγματικά αρνητικών, ποιο ποσοστό απορρίφθηκε σωστά από το μοντέλο;

Ακρίβεια

Accuracy = (TP + TN) / (TP + TN + FP + FN)

Η ακρίβεια είναι χρήσιμη όταν οι κατηγορίες και τα κόστη σφαλμάτων είναι λογικά ισορροπημένα. Μπορεί να είναι παραπλανητική όταν μία κατηγορία κυριαρχεί.

Σκορ F1

F1 = 2 × (Precision × Recall) / (Precision + Recall)

Το F1 συνοψίζει την ακρίβεια και την ανάκληση με έναν αρμονικό μέσο. Αγνοεί τα αληθινά αρνητικά, επομένως δεν είναι η κατάλληλη σύνοψη για κάθε εργασία.

Παράδειγμα εφαρμογής

Ας υποθέσουμε ότι ένα σύνολο δοκιμής περιέχει 1.000 συναλλαγές. Πενήντα είναι δόλιες. Ένα μοντέλο εντοπίζει 40 από αυτές τις δόλιες αλλά σηματοδοτεί 30 νόμιμες συναλλαγές:

  • TP = 40
  • FN = 10
  • FP = 30
  • TN = 920

Το μοντέλο έχει 96% ακρίβεια, αλλά η ακρίβειά του είναι περίπου 57% και η ανάκληση 80%. Η υψηλή ακρίβεια οφείλεται κυρίως στον μεγάλο αριθμό νόμιμων συναλλαγών. Το κατά πόσον αυτό το μοντέλο είναι αποδεκτό εξαρτάται από το κόστος των μη εντοπισμένων απάτων, τη δυνατότητα διερεύνησης και το πόσο καλά έχουν βαθμονομηθεί οι βαθμοί κινδύνου.

Τα όρια (thresholds) αλλάζουν τον πίνακα

Πολλοί ταξινομητές εκδίδουν μια βαθμολογία αντί για μια αναπόφευκτη απάντηση ναι/όχι. Η μείωση του θετικού ορίου συνήθως αυξάνει την ανάκληση και τα ψευδή θετικά· η αύξησή του συνήθως αυξάνει την ακρίβεια ή την ειδικότητα ενώ παραλείπεται περισσότερα θετικά. Το όριο πρέπει να επιλέγεται με χρήση δεδομένων επικύρωσης και πραγματικών κοστών σφάλματος, όχι αυτόματα σταθερό στο 0.5.

Οι καμπύλες ακρίβειας‑ανάκλησης και ROC συνοψίζουν την απόδοση σε διάφορα όρια. Οι καμπύλες ακρίβειας‑ανάκλησης είναι συχνά πιο ενημερωτικές όταν η θετική κατηγορία είναι σπάνια.

Πίνακες σύγχυσης πολλαπλών κατηγοριών

Για K κατηγορίες, ο πίνακας είναι K × K. Οι σωστές προβλέψεις βρίσκονται στη διαγώνιο· τα κελιά εκτός διαγωνίου δείχνουν ποια ζεύγη κατηγοριών συγχέονται. Οι δείκτες ανά κατηγορία μπορούν να ληφθούν κατά μέσο όρο με διαφορετικούς τρόπους:

  • Μακρομέσος: δίνει ίση βαρύτητα σε κάθε κατηγορία.
  • Βαρυμετρικός μέσος: βαρύνει κάθε κατηγορία ανάλογα με τον αριθμό των παραδειγμάτων της.
  • Μικρομέσος: συγκεντρώνει τις μετρήσεις των αποτελεσμάτων πριν υπολογίσει τον δείκτη.

Η αναφορά μόνο ενός μέσου μπορεί να κρύβει κακή απόδοση σε μικρότερες κατηγορίες. Συμπεριλάβετε μετρήσεις υποστήριξης και αποτελέσματα ανά κατηγορία όπου οι διαφορές έχουν σημασία.

Συχνά λάθη

  • Ανάγνωση ενός μετατεθειμένου πίνακα χωρίς έλεγχο των ετικετών των αξόνων.
  • Υπολογισμός δεικτών από τα δεδομένα εκπαίδευσης αντί για ένα κατάλληλο σύνολο διατήρησης.
  • Παράβλεψη της επικράτησης της κατηγορίας, της στρατηγικής δειγματοληψίας ή των διπλότυπων οντοτήτων μεταξύ των διαχωρισμών.
  • Σύγκριση πινάκων που δημιουργήθηκαν σε διαφορετικά όρια χωρίς να σημειωθεί η αλλαγή.
  • Αντιμετώπιση όλων των ψευδών θετικών και ψευδών αρνητικών ως εξίσου δαπανηρά.

Ένας πίνακας σύγχυσης είναι επομένως ένα διαγνωστικό εργαλείο, όχι μια πλήρης αξιολόγηση. Η βαθμονόμηση, η ανάλυση υποομάδων, η ανθεκτικότητα και οι επακόλουθες συνέπειες επίσης ανήκουν σε μια αξιολόγηση ταξινόμησης.

Ανάγνωση κάθε κελιού και εξαγωγή χρήσιμων δεικτών

Για δυαδική ταξινόμηση, ο πίνακας σύγχυσης μετρά αληθινά θετικά, ψευδή θετικά, ψευδή αρνητικά και αληθινά αρνητικά για μια επιλεγμένη θετική κατηγορία και όριο. Η ακρίβεια διαιρεί τις σωστές προβλέψεις με όλες τις περιπτώσεις· η ακρίβεια (precision) ρωτά ποιο ποσοστό των προβλεπόμενων θετικών ήταν σωστό; η ανάκληση ρωτά ποιο ποσοστό των πραγματικών θετικών βρέθηκε· η ειδικότητα μετρά τα πραγματικά αρνητικά που απορρίφθηκαν σωστά. Το F1 είναι ο αρμονικός μέσος της ακρίβειας και της ανάκλησης. Κανένας δεν είναι εγγενώς ο καλύτερος: ο εντοπισμός απάτης, η ιατρική τριάζ και το φιλτράρισμα ανεπιθύμητης αλληλογραφίας αποδίδουν διαφορετικές συνέπειες στα ίδια κελιά.

Για προβλήματα πολλαπλών κατηγοριών, οι γραμμές συνήθως αντιπροσωπεύουν τις πραγματικές κατηγορίες και οι στήλες τις προβλεπόμενες, αν και οι συμβάσεις διαφέρουν, επομένως οι ετικέτες πρέπει να είναι σαφείς. Οι μετρήσεις ένα‑εναν‑εναν‑απομένουν (one‑vs‑rest) παράγουν ακρίβεια και ανάκληση ανά κατηγορία. Ο μακρομέσος βαρύνει τις κατηγορίες εξίσου· ο μικρομέσος συγκεντρώνει τις αποφάσεις και ευνοεί τις κοινές κατηγορίες· ο βαρυμετρικός ακολουθεί την υποστήριξη της κατηγορίας. Οι εργασίες πολλαπλών ετικετών επιτρέπουν πολλές ετικέτες ανά αντικείμενο και απαιτούν ορισμούς ανά ετικέτα ή ανά δείγμα. Κανονικοποιήστε κατά γραμμή για να εξετάσετε τα πρότυπα ανάκλησης ή κατά στήλη για να εξετάσετε τη σύνθεση των προβλέψεων, αλλά διατηρήστε τις ακατέργαστες μετρήσεις ώστε οι σπάνιες ομάδες να μην υπερτονιστούν οπτικά.

Όρια, αβεβαιότητα και επιχειρησιακές αποφάσεις

Ένας πίνακας σύγχυσης συνοψίζει τις σκληρές αποφάσεις σε ένα όριο. Χρησιμοποιήστε τις καμπύλες ακρίβειας‑ανάκλησης ή ROC για να συγκρίνετε τα όρια, έπειτα επιλέξτε ένα σημείο λειτουργίας βάσει της χωρητικότητας, της επικράτησης και του κόστους σφάλματος. Η βαθμονόμηση ελέγχει αν οι προβλεπόμενες πιθανότητες ταιριάζουν με την παρατηρούμενη συχνότητα και είναι ξεχωριστή από την κατάταξη. Όταν η επικράτηση αλλάζει, η ακρίβεια μπορεί να μεταβληθεί ακόμη και αν η ευαισθησία και η ειδικότητα παραμένουν σταθερές. Αναφέρετε διαστήματα εμπιστοσύνης ή διακύμανση bootstrap και αποφύγετε να βγάζετε συμπεράσματα από λίγα σφάλματα σε μια μικρή υποομάδα.

Ελέγξτε τους πίνακες ανά χρόνο, τοποθεσία, συσκευή, γλώσσα και σχετικές ομάδες που επηρεάζονται για να εντοπίσετε συγκεντρωμένα σφάλματα. Συγκρίνετε το μοντέλο με τη υπάρχουσα διαδικασία λήψης αποφάσεων, συμπεριλαμβανομένης της ανθρώπινης αξιολόγησης. Για αλυσίδες, καταγράψτε τα σφάλματα σε κάθε στάδιο: ανάκτηση, ταξινόμηση, οριοθέτηση και ενέργεια. Παρακολουθήστε τις ετικέτες των ζωντανών αποτελεσμάτων με την καθυστέρηση και τη διαδικασία διόρθωσης. Ένα φαινομενικά βελτιωμένο F1 μπορεί ακόμη να αυξήσει τα επιβλαβή ψευδή αρνητικά ή να ξεπεράσει τη χωρητικότητα ελέγχου. Ο πίνακας σύγχυσης είναι ένα λογιστικό βιβλίο αποφάσεων· συνδέστε κάθε κελί με το ποιος βιώνει το σφάλμα και ποια ανταπόκριση ακολουθεί.

Παράδειγμα εφαρμογής: επιλογή ορίου ιατρικής εξέτασης

Ένα μοντέλο μηχανικής μάθησης για έλεγχο εκδίδει έναν δείκτη κινδύνου για μια κατάσταση με χαμηλή επικράτηση. Η ομάδα δημιουργεί πίνακες σύγχυσης σε διάφορα όρια και αναφέρει ευαισθησία, ειδικότητα, ακρίβεια, ψευδείς παραπομπές και χαμένα κρούσματα με διαστήματα εμπιστοσύνης. Επειδή η θετική προβλεπτική αξία εξαρτάται από την επικράτηση, μοντελοποιεί τον προοριζόμενο πληθυσμό αντί να παραθέτει την ακρίβεια ενός μόνο συνόλου δεδομένων. Τα αποτελέσματα τμηματοποιούνται ανά συσκευή, τοποθεσία, ηλικία, φύλο και άλλες κλινικά αιτιολογημένες ομάδες.

Οι κλινικοί επιλέγουν ένα σημείο λειτουργίας που διατηρεί την απαιτούμενη ευαισθησία χωρίς να υπερφορτώνει τις επαληθευτικές εξετάσεις. Ο πίνακας μετατρέπεται σε αναμενόμενες μετρήσεις ανά 10.000 ελεγμένα άτομα ώστε οι συνέπειες να είναι κατανοητές. Σκορ εκτός των επικυρωμένων συνθηκών δεν παράγουν αυτοματοποιημένο συμπέρασμα. Η παρακολούθηση συγκρίνει τις προβλέψεις με καθυστερημένες επιβεβαιωμένες διαγνώσεις, παρακολουθεί τη χωρητικότητα και τη βαθμονόμηση, και ενεργοποιεί έλεγχο όταν η επικράτηση ή η απόκτηση αλλάζουν. Ο πίνακας σύγχυσης παραμένει συνδεδεμένος με το ακριβές μοντέλο, το όριο και τον πληθυσμό.

Απόδειξη υλοποίησης και επιχειρησιακή ετοιμότητα

Μια απόφαση παραγωγής απαιτεί περισσότερα από μια επιτυχημένη επίδειξη. Ορίστε τους προορισμένους χρήστες, το λειτουργικό περιβάλλον, τις εισόδους, τις εξόδους, τις εξαρτήσεις, τον υπεύθυνο και τις συνέπειες κάθε σημαντικής αποτυχίας. Καθιερώστε μια επαναλήψιμη βάση και ένα εκδόσεις αξιολόγησης σύνολο πριν τη ρύθμιση. Δοκιμάστε τυπικές περιπτώσεις, άκρα όρια, εσφαλμένες ή ελλιπείς εισόδους, μεταβολή κατανομής, διακοπή εξαρτήσεων, κακή χρήση και τις ομάδες ή τα περιβάλλοντα που είναι πιο πιθανό να παραμελούνται. Μετρήστε την ποιότητα της εργασίας μαζί με τη βαθμονόμηση ή την αβεβαιότητα, την καθυστέρηση, τη διαπερατότητα, το κόστος πόρων, την προσβασιμότητα, το απόρρητο και την ασφάλεια. Καταγράψτε κάθε μετασχηματισμό και όριο ώστε ένας ανεξάρτητος αξιολογητής να μπορεί να αναπαράγει το αποτέλεσμα και να διακρίνει την απόδειξη από ένα ελκυστικό πρωτότυπο.

Πριν την εκκίνηση, αναθέστε εξουσία για την κυκλοφορία, τις εξαιρέσεις, τις αλλαγές, την επαναφορά και τη συνταγική λήξη. Χρησιμοποιήστε μια σταδιακή κυκλοφορία, διατηρήστε ένα ασφαλές εφεδρικό και επαληθεύστε την παρακολούθηση με σκόπιμα ενσωματωμένες αποτυχίες. Η λειτουργική τηλεμετρία πρέπει να αποκαλύπτει την ποιότητα των εισόδων, τη συμπεριφορά των εξόδων, την έκδοση του μοντέλου ή του κανόνα, την υγεία των εξαρτήσεων, τις ανθρώπινες παρεμβάσεις και τα επιβεβαιωμένα αποτελέσματα χωρίς τη συλλογή περιττών ευαίσθητων δεδομένων. Ορίστε όρια ειδοποιήσεων και έναν υπεύθυνο ανταπόκρισης, έπειτα ελέγξτε τα πραγματικά δεδομένα μετά την υλοποίηση αντί να υποθέτετε ότι η εκτός σύνδεσης απόδοση θα παραμείνει. Επανεκτιμήστε όποτε αλλάζουν οι πηγές δεδομένων, οι χρήστες, τα μοντέλα, οι προμηθευτές, οι πολιτικές, το υλικό ή οι στόχοι. Ένα συντηρημένο σύστημα χρειάζεται επίσης τεκμηριωμένη αποκατάσταση, εκμάθηση περιστατικών, διαδικασίες διαγραφής και διατήρησης, και ένα σαφές σημείο στο οποίο πρέπει να απενεργοποιηθεί ή να αντικατασταθεί.

Συχνές ερωτήσεις

Τι είναι ένας κανονικοποιημένος πίνακας σύγχυσης;

Η κανονικοποίηση διαιρεί τις μετρήσεις με το σύνολο της πραγματικής‑κατηγορίας, το σύνολο της προβλεπόμενης‑κατηγορίας ή όλες τις παρατηρήσεις. Διευκολύνει τη σύγκριση των ποσοστών μεταξύ των κατηγοριών, αλλά η αναφορά πρέπει επίσης να διατηρεί τις ακατέργαστες μετρήσεις υποστήριξης ώστε οι μικρές ομάδες να μην παρερμηνευτούν ως εξίσου μεγάλες.

Μπορεί ένας πίνακας σύγχυσης να αξιολογήσει παλινδρόμηση;

Όχι άμεσα. Ένας πίνακας σύγχυσης απαιτεί διακριτές κατηγορίες. Η ομαδοποίηση ενός συνεχούς στόχου απορρίπτει πληροφορίες· η παλινδρόμηση συνήθως θα πρέπει να χρησιμοποιεί ανάλυση υπολοίπων και δείκτες σχεδιασμένους για συνεχείς τιμές, όπως το MAE ή το RMSE.

Κύριες αναφορές

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.