Βασικές αρχές της AI
Τι είναι ένα Πίνακα Συγχύσεων;
Ένα από τα πιο ισχυρά αναλυτικά εργαλεία στο machine learning και την επιστήμη των δεδομένων είναι ο πίνακας συγχύσεων. Ο πίνακας συγχύσεων είναι ικανός να δώσει στους ερευνητές λεπτομερείς πληροφορίες σχετικά με την απόδοση ενός ταξινομητή machine learning σε σχέση με τις στόχους των τάξεων στο σύνολο δεδομένων. Ένας πίνακας συγχύσεων θα δείξει παραδείγματα που έχουν ταξινομηθεί σωστά έναντι παραδειγμάτων που έχουν ταξινομηθεί λανθασμένα. Ας ρίξουμε μια πιο sâuτική ματιά στο πώς είναι δομημένος ένας πίνακας συγχύσεων και πώς μπορεί να ερμηνευθεί.
Τι είναι ένας Πίνακας Συγχύσεων;
Ας ξεκινήσουμε με μια απλή ορισμό του πίνακα συγχύσεων. Ένας πίνακας συγχύσεων είναι ένα προγνωστικό εργαλείο αναλυτικών. Συγκεκριμένα, είναι ένας πίνακας που εμφανίζει και συγκρίνει τις πραγματικές τιμές με τις προβλεπόμενες τιμές του μοντέλου. Στο πλαίσιο του machine learning, ένας πίνακας συγχύσεων χρησιμοποιείται ως μετρική για την ανάλυση της απόδοσης ενός ταξινομητή machine learning σε ένα σύνολο δεδομένων. Ένας πίνακας συγχύσεων δημιουργεί μια οπτική αναπαράσταση μετρικών όπως η ακρίβεια, η精度, η ειδικότητα και η ανακλησιμότητα.
Ο λόγος που ο πίνακας συγχύσεων είναι ιδιαίτερα χρήσιμος είναι ότι, σε αντίθεση με άλλους τύπους μετρικών ταξινόμησης όπως η απλή ακρίβεια, ο πίνακας συγχύσεων δημιουργεί μια πιο πλήρη εικόνα της απόδοσης του μοντέλου. Η χρήση μόνο ενός μετρήματος όπως η ακρίβεια μπορεί να οδηγήσει σε μια κατάσταση όπου το μοντέλο ταξινομεί完全 και συνεχώς λανθασμένα μια τάξη, αλλά αυτό δεν γίνεται αντιληπτό επειδή η μέση απόδοση είναι καλή. Εν τω μεταξύ, ο πίνακας συγχύσεων δίνει μια σύγκριση διαφόρων τιμών όπως τα Ψευδής Αρνητικά, τα Αληθινά Αρνητικά, τα Ψευδής Θετικά και τα Αληθινά Θετικά.

Ας ορίσουμε τις διαφορετικές μετρικές που αντιπροσωπεύει ένας πίνακας συγχύσεων.
Ανακλησιμότητα σε einen Πίνακα Συγχύσεων
Η ανακλησιμότητα είναι ο αριθμός των πραγματικά θετικών παραδειγμάτων διαιρεμένος με τον αριθμό των ψευδών αρνητικών παραδειγμάτων και των συνολικών θετικών παραδειγμάτων. Με άλλα λόγια, η ανακλησιμότητα είναι αντιπροσωπευτική του ποσοστού των αληθινών θετικών παραδειγμάτων που έχει ταξινομήσει ένα μοντέλο machine learning. Η ανακλησιμότητα δίνεται ως το ποσοστό των θετικών παραδειγμάτων που το μοντέλο ήταν σε θέση να ταξινομήσει από όλα τα θετικά παραδείγματα που περιέχονται στο σύνολο δεδομένων. Αυτή η τιμή μπορεί επίσης να αναφέρεται ως “ποσοστό επιτυχίας” και μια σχετική τιμή είναι η “ευαισθησία”, η οποία περιγράφει την πιθανότητα ανακλησιμότητας ή το ποσοστό των αληθινών θετικών προβλέψεων.
Ακρίβεια σε einen Πίνακα Συγχύσεων
Όπως και η ανακλησιμότητα, η ακρίβεια είναι μια τιμή που παρακολουθεί την απόδοση του μοντέλου σε σχέση με την ταξινόμηση των θετικών παραδειγμάτων. Σε αντίθεση με την ανακλησιμότητα, όμως, η ακρίβεια ασχολείται με το πόσα από τα παραδείγματα που το μοντέλο έταξε ως θετικά ήταν πραγματικά θετικά. Για να υπολογιστεί αυτό, ο αριθμός των αληθινών θετικών παραδειγμάτων διαιρείται με τον αριθμό των ψευδών θετικών παραδειγμάτων συν τα αληθινά θετικά.
Για να κάνουμε τη διαφορά μεταξύ ανακλησιμότητας και ακρίβειας πιο σαφή, η ακρίβεια στοχεύει να βρει το ποσοστό всех παραδειγμάτων που έχουν ταξινομηθεί ως θετικά που ήταν πραγματικά θετικά, ενώ η ανακλησιμότητα παρακολουθεί το ποσοστό всех αληθινών θετικών παραδειγμάτων που το μοντέλο ήταν σε θέση να αναγνωρίσει.
Ειδικότητα σε einen Πίνακα Συγχύσεων
Ενώ η ανακλησιμότητα και η ακρίβεια είναι τιμές που παρακολουθούν τα θετικά παραδείγματα και το ποσοστό των αληθινών θετικών, η ειδικότητα ποσοστού ή ο αριθμός των παραδειγμάτων που το μοντέλο ορίζει ως αρνητικά που ήταν πραγματικά αρνητικά. Αυτό υπολογίζεται με την διαίρεση του αριθμού των παραδειγμάτων που ταξινομήθηκαν ως αρνητικά με τον αριθμό των ψευδών θετικών παραδειγμάτων συν τα αληθινά αρνητικά παραδείγματα.
Κατανόηση του Πίνακα Συγχύσεων

Φωτογραφία: Jackverr via Wikimedia Commons, (https://commons.wikimedia.org/wiki/File:ConfusionMatrix.png), CC BY SA 3.0
Παράδειγμα ενός Πίνακα Συγχύσεων
Μετά την ορισμό των απαραίτητων όρων όπως ακρίβεια, ανακλησιμότητα, ευαισθησία και ειδικότητα, μπορούμε να εξετάσουμε πώς αυτές οι διαφορετικές τιμές αντιπροσωπεύονται σε einen πίνακα συγχύσεων. Ένας πίνακας συγχύσεων δημιουργείται σε περιπτώσεις ταξινόμησης, εφαρμόσιμης όταν υπάρχουν δύο ή περισσότερες τάξεις. Ο πίνακας συγχύσεων που δημιουργείται μπορεί να είναι τόσο ψηλός και широкός όσο είναι απαραίτητο, να κρατάει οποιοδήποτε επιθυμητό αριθμό τάξεων, αλλά για τους σκοπούς της απλότητας, θα εξετάσουμε einen 2 x 2 πίνακα συγχύσεων για μια δυαδική ταξινόμηση.
Ως παράδειγμα, υποθέτουμε ότι ένας ταξινομητής χρησιμοποιείται για να καθορίσει εάν ένας ασθενής έχει μια ασθένεια. Τα χαρακτηριστικά θα εισαχθούν στον ταξινομητή, και ο ταξινομητής θα επιστρέψει μια από τις δύο διαφορετικές ταξινομήσεις – είτε ο ασθενής δεν έχει την ασθένεια είτε την έχει.
Ας ξεκινήσουμε από την αριστερή πλευρά του πίνακα. Η αριστερή πλευρά του πίνακα συγχύσεων αντιπροσωπεύει τις προβλέψεις που ο ταξινομητής έκανε για τις μεμονωμένες τάξεις. Ένα δυαδικό ταξινόμηση θα έχει δύο σειρές εδώ. Σχετικά με το άνω μέρος του πίνακα, αυτό παρακολουθεί τις πραγματικές τιμές, τις πραγματικές ετικέτες τάξης, των στιγμιοτύπων δεδομένων.
Η ερμηνεία ενός πίνακα συγχύσεων μπορεί να γίνει εξετάζοντας το σημείο όπου οι σειρές και οι στήλες διασταυρώνονται. Ελέγξτε τις προβλέψεις του μοντέλου με τις πραγματικές ετικέτες του μοντέλου. Σε αυτή την περίπτωση, η τιμή των Αληθινών Θετικών, ο αριθμός των σωστών θετικών προβλέψεων, βρίσκεται στην πάνω αριστερή γωνία. Τα ψευδής θετικά βρίσκονται στην πάνω δεξιά γωνία, όπου τα παραδείγματα είναι πραγματικά αρνητικά αλλά ο ταξινομητής τα ονόμασε ως θετικά.
Η κάτω αριστερή γωνία του πλέγματος εμφανίζει τις περιπτώσεις που ο ταξινομητής τις ονόμασε ως αρνητικές αλλά ήταν πραγματικά θετικές. Τέλος, η κάτω δεξιά γωνία του πίνακα συγχύσεων είναι όπου βρίσκονται οι Αληθινές Αρνητικές τιμές, ή όπου βρίσκονται τα πραγματικά ψευδής παραδείγματα.
Όταν το σύνολο δεδομένων περιέχει περισσότερες από δύο τάξεις, ο πίνακας μεγαλώνει κατά τον ίδιο αριθμό τάξεων. Για παράδειγμα, εάν υπάρχουν τρεις τάξεις, ο πίνακας θα είναι ένας 3 x 3 πίνακας. Ανεξάρτητα από το μέγεθος του πίνακα συγχύσεων, η μέθοδος για την ερμηνεία τους είναι ακριβώς η ίδια. Η αριστερή πλευρά περιέχει τις προβλεπόμενες τιμές και οι πραγματικές ετικέτες τάξης διατρέχουν την κορυφή. Οι περιπτώσεις που ο ταξινομητής τις έχει προβλέψει σωστά διατρέχουν διαγώνια από την πάνω αριστερή στην κάτω δεξιά. Με την εξέταση του πίνακα, μπορείτε να διακρίνετε τις τέσσερις προγνωστικές μετρικές που συζητήθηκαν παραπάνω.
Για παράδειγμα, μπορείτε να υπολογίσετε την ανακλησιμότητα λαμβάνοντας τα αληθινά θετικά και τα ψευδής αρνητικά, προσθέτοντας τα μαζί και διαιρώντας τα με τον αριθμό των αληθινών θετικών παραδειγμάτων. Εν τω μεταξύ, η ακρίβεια μπορεί να υπολογιστεί συνδυάζοντας τα ψευδής θετικά με τα αληθινά θετικά και διαιρώντας την τιμή με τον συνολικό αριθμό των αληθινών θετικών.
Ενώ κάποιος θα μπορούσε να ξοδέψει χρόνο υπολογίζοντας μετρικά όπως ακρίβεια, ανακλησιμότητα και ειδικότητα, αυτά τα μετρικά είναι τόσο συχνά χρησιμοποιούμενα που οι περισσότερες βιβλιοθήκες machine learning έχουν μεθόδους για την εμφάνισή τους. Για παράδειγμα, η Scikit-learn για Python έχει μια συνάρτηση που δημιουργεί einen πίνακα συγχύσεων.












