Βασικές αρχές της AI

Τι είναι τα Support Vector Machines;

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια support vector machine (SVM) είναι μια μέθοδος εποπτευόμενης μάθησης που βρίσκει ένα όριο απόφασης με το ευρύτερο δυνατό περιθώριο μεταξύ των κλάσεων. Τα παραδείγματα εκπαίδευσης που καθορίζουν αυτό το όριο είναι τα support vectors.

Τα SVM μπορούν να εκτελούν γραμμική ή μη γραμμική ταξινόμηση, παλινδρόμηση και ανίχνευση καινοτομίας. Είναι ιδιαίτερα χρήσιμα για μικρά έως μεσαία σύνολα δεδομένων με πληροφοριακά χαρακτηριστικά, συμπεριλαμβανομένων των υψηλής διάστασης αραιωμένων δεδομένων, αλλά το κόστος εκπαίδευσής τους μπορεί να γίνει μη πρακτικό σε πολύ μεγάλα σύνολα δεδομένων.

Βασικά σημεία

  • Ένα SVM μεγιστοποιεί το ελάχιστο περιθώριο μεταξύ του ορίου και των πλησιέστερων σημείων εκπαίδευσης.
  • Τα support vectors είναι σημεία δεδομένων, όχι επιπλέον υπερεπίπεδα.
  • Η παράμετρος C εξισορροπεί το πλάτος του περιθωρίου με τις ποινές για παραβιάσεις.
  • Οι πυρήνες υπολογίζουν την ομοιότητα σε έναν έμμεσο χώρο χαρακτηριστικών χωρίς να υλοποιούν ρητά κάθε μετασχηματισμένο χαρακτηριστικό.
Support vector machine comparison showing a maximum-margin linear boundary, soft-margin violations controlled by C, and a nonlinear kernel boundary
Τα SVM χρησιμοποιούν support vectors για τον ορισμό ενός ορίου μέγιστου περιθωρίου και πυρήνες για την αναπαράσταση μη γραμμικού διαχωρισμού.

Η ιδέα του μέγιστου περιθωρίου

Για έναν γραμμικό δυαδικό ταξινομητή, το όριο απόφασης είναι ένα υπερεπίπεδο:

w · x + b = 0

Το διάνυσμα w καθορίζει τον προσανατολισμό και το b τη μετατόπιση. Πολλά υπερεπίπεδα μπορούν να διαχωρίσουν τις κλάσεις εκπαίδευσης. Το SVM επιλέγει εκείνο που μεγιστοποιεί την απόσταση προς τα πλησιέστερα παραδείγματα και από τις δύο πλευρές. Αυτά τα πλησιέστερα παραδείγματα είναι τα support vectors και έχουν τη μεγαλύτερη επιρροή στο προσαρμοσμένο όριο.

Ο στόχος δεν είναι να μεγιστοποιηθεί η απόσταση του ορίου από κάθε σημείο ανεξάρτητα. Μεγιστοποιεί το ελάχιστο περιθώριο ενώ ικανοποιεί ή τιμωρεί τους περιορισμούς των κλάσεων.

Σκληρά και μαλακά περιθώρια

Ένα SVM σκληρού περιθωρίου απαιτεί τέλεια γραμμική διάσπαση και είναι ευαίσθητο σε ακραίες τιμές. Τα πραγματικά σύνολα δεδομένων συνήθως χρειάζονται ένα μαλακό περιθώριο, το οποίο εισάγει μεταβλητές χαλαρότητας για παρατηρήσεις εντός του περιθωρίου ή στην λανθασμένη πλευρά του ορίου.

Η υπερπαράμετρος C ελέγχει την ποινή για αυτές τις παραβιάσεις:

  • Ένα μεγαλύτερο C τιμωρεί τις παραβιάσεις πιο έντονα και συχνά παράγει ένα στενότερο περιθώριο που ακολουθεί πιο πιστά τα παραδείγματα εκπαίδευσης.
  • Ένα μικρότερο C επιτρέπει περισσότερες παραβιάσεις σε αντάλλαγμα για ένα ευρύτερο, πιο κανονικοποιημένο περιθώριο.

Ο αριθμός των support vectors είναι αποτέλεσμα των δεδομένων και της λύσης· η αύξηση του C δεν εγγυάται συγκεκριμένο αριθμό support vectors.

Η τεχνική του πυρήνα

Ορισμένες κλάσεις δεν μπορούν να διαχωριστούν με ένα ευθύ υπερεπίπεδο στον αρχικό χώρο χαρακτηριστικών. Ένας πυρήνας αξιολογεί ένα εσωτερικό γινόμενο που αντιστοιχεί σε έναν άλλο χώρο χαρακτηριστικών. Αυτό επιτρέπει στο SVM να προσαρμόσει ένα μη γραμμικό όριο χωρίς να υπολογίζει ρητά κάθε μετασχηματισμένη συντεταγμένη.

Οι συνηθισμένοι πυρήνες περιλαμβάνουν:

  • Linear: αποδοτικός για υψηλής διάστασης αραίους χαρακτηριστικούς όπως το κείμενο.
  • Polynomial: μοντελοποιεί αλληλεπιδράσεις έως ένα επιλεγμένο βαθμό.
  • Radial basis function (RBF): δημιουργεί ευέλικτα τοπικά όρια βάσει απόστασης.
  • Sigmoid: μοιάζει με νευρωνική ενεργοποίηση αλλά είναι λιγότερο συχνά η προεπιλογή.

Για ένα RBF SVM, το gamma ελέγχει πόσο τοπικά κάθε παράδειγμα εκπαίδευσης επηρεάζει το όριο. Μεγάλο gamma μπορεί να δημιουργήσει πολύ λεπτομερείς περιοχές και υπερεκπαιδεύει· μικρό gamma παράγει πιο ομαλή επιρροή.

Πολυκατηγορική ταξινόμηση

Ο κλασικός στόχος του SVM είναι δυαδικός. Οι βιβλιοθήκες το επεκτείνουν χρησιμοποιώντας στρατηγικές όπως one-vs-rest, που εκπαιδεύει έναν ταξινομητή ανά κλάση, ή one-vs-one, που εκπαιδεύει ταξινομητές για ζεύγη κλάσεων και συνδυάζει τις αποφάσεις τους. Τα πολυκατηγορικά SVM δεν σχεδιάζουν απλώς μία γραμμή λιγότερη από τον αριθμό των κλάσεων.

Παλιπλασιαστική παλινδρόμηση με support vector και SVM μιας κλάσης

Η παλινδρόμηση με support vector (SVR) προσαρμόζει μια συνάρτηση αγνοώντας σφάλματα εντός ενός σωλήνα πλάτους epsilon και τιμωρώντας μεγαλύτερες αποκλίσεις. Ένα SVM μιας κλάσης εκτιμά ένα όριο γύρω από τυπικά δεδομένα και μπορεί να υποστηρίξει ανίχνευση καινοτομίας. Ένα ασυνήθιστο σημείο δεν είναι αυτόματα απάτη ή αποτυχία· είναι ασυνήθιστο υπό την προσαρμοσμένη αναπαράσταση.

Πρακτικές απαιτήσεις

Τα SVM εξαρτώνται από αποστάσεις και εσωτερικά γινόμενα, έτσι τα αριθμητικά χαρακτηριστικά γενικά χρειάζονται κλιμάκωση. Οι παράμετροι C, πυρήνας, gamma και βάρη κλάσεων πρέπει να επιλέγονται μέσω επικύρωσης. Οι εκτιμήσεις πιθανότητας δεν είναι ενσωματωμένες στο περιθώριο και συχνά απαιτούν βαθμονόμηση, η οποία προσθέτει κόστος και πρέπει να αξιολογείται ξεχωριστά.

Η εκπαίδευση ενός Kernel SVM μπορεί να κλιμακωθεί μεταξύ τετραγωνικού και κυβικού χρόνου ως προς τον αριθμό των δειγμάτων, ανάλογα με τα δεδομένα και την υλοποίηση. Οι παραλλαγές γραμμικού SVM ή τα στοχαστικά γραμμικά μοντέλα είναι πιο κατάλληλα για πολύ μεγάλα σύνολα δεδομένων. Για ακατέργαστες εικόνες, ήχο ή κείμενο, οι εκπαιδευμένες αναπαραστάσεις από deep learning μπορεί να είναι πιο αποτελεσματικές, ενώ ένα SVM μπορεί ακόμη να ταξινομήσει μια σταθερή ενσωμάτωση.

Δυνάμεις και περιορισμοί των SVM

Τα SVM μπορούν να λειτουργούν καλά με πολλά χαρακτηριστικά, προσφέρουν σαφή κανονικοποιημένο στόχο και εξαρτώνται κυρίως από τα support vectors κατά τη φάση πρόβλεψης. Οι περιορισμοί περιλαμβάνουν ευαισθησία στην κλιμάκωση και τις υπερπαραμέτρους, ενδεχόμενα ακριβό κόστος εκπαίδευσης, μειωμένη ερμηνευσιμότητα υπό μη γραμμικούς πυρήνες και απαιτήσεις βαθμονόμησης πιθανοτήτων.

Περιθώρια, πυρήνες και ο στόχος βελτιστοποίησης

Μια support vector machine επιδιώκει ένα διαχωριστικό υπερεπίπεδο με μεγάλο περιθώριο μεταξύ των κλάσεων. Μόνο τα support vectors που βρίσκονται πάνω ή εντός του περιθωρίου καθορίζουν το όριο. Τα SVM με μαλακό περιθώριο εισάγουν χαλαρότητα για επικάλυψη και λανθασμένα επισημασμένα σημεία· η παράμετρος C ανταλλάσσει ένα ευρύτερο περιθώριο ενάντια σε παραβιάσεις εκπαίδευσης. Τα εισροές συνήθως πρέπει να κλιμακώνονται επειδή η απόσταση και τα εσωτερικά γινόμενα οδηγούν τη λύση. Τα βάρη κλάσεων ή η επαναδειγματοληψία βοηθούν όταν τα κόστη σφάλματος και η επικράτηση δεν είναι ίσα, αλλά τα όρια και οι πιθανότητες εξακολουθούν να απαιτούν ανεξάρτητη επικύρωση.

Η τεχνική του πυρήνα αξιολογεί την ομοιότητα σαν να είχαν οι εισροές χαρτογραφηθεί σε έναν υψηλότερης διάστασης χώρο χαρακτηριστικών. Οι γραμμικοί, πολυωνυμικοί, radial-basis και εξειδικευμένοι πυρήνες κωδικοποιούν διαφορετικές υποθέσεις. Για έναν RBF πυρήνα, το gamma ελέγχει πόσο τοπικά κάθε σημείο επηρεάζει το όριο: υψηλό gamma μπορεί να δημιουργήσει πολύπλοκες περιοχές και να υπερεκπαιδεύσει, ενώ χαμηλό gamma μπορεί να υποεκπαιδεύσει. Οι πίνακες πυρήνα αυξάνονται τετραγωνικά με τον αριθμό των δειγμάτων, καθιστώντας τα μη γραμμικά SVM δαπανηρά σε μεγάλα σύνολα δεδομένων. Οι γραμμικοί αλγόριθμοι ή οι προσεγγιστικές απεικονίσεις χαρακτηριστικών είναι συχνά προτιμότεροι σε μεγάλη κλίμακα.

Χρήση πολυκατηγορίας, βαθμονόμηση και λειτουργικοί περιορισμοί

Τα δυαδικά SVM επεκτείνονται σε πολυκατηγορικά μέσω one-vs-rest, one-vs-one ή δομημένων διατυπώσεων. Οι υπερπαράμετροι πρέπει να ρυθμίζονται μέσα σε διασταυρούμενη επικύρωση, με ομαδοποιημένες ή χρονικές διαχωριστικές δομές όπου απαιτείται. Αξιολογήστε την ακρίβεια και την ανάκληση ανά κλάση, τις κατανομές του περιθωρίου, τη βαθμονόμηση και την απόδοση υπό μεταβολή. Οι ακατέργαστες βαθμολογίες απόφασης δεν είναι πιθανότητες· η κλιμάκωση Platt ή η ισοτονική βαθμονόμηση χρησιμοποιούν ξεχωριστά δεδομένα και μπορεί να υποβαθμιστούν αν η επικράτηση αλλάξει. Συγκρίνετε με λογιστική παλινδρόμηση, δέντρα και σύγχρονες μεθόδους βασισμένες σε αναπαραστάσεις με ισοδύναμη προεπεξεργασία και προσπάθεια ρύθμισης.

Η εξυπηρέτηση απαιτεί τον ακριβή κλιμακωτή, τη σειρά χαρακτηριστικών, τις παραμέτρους του πυρήνα, τα support vectors και το αντιστοίχηση κλάσεων. Το κόστος πρόβλεψης για ένα kernel SVM αυξάνεται με τα support vectors, επομένως μετρήστε την καθυστέρηση και τη μνήμη σε ρεαλιστικές παρτίδες. Εισροές μακριά από τα support vectors εκπαίδευσης μπορούν ακόμη να λάβουν σίγουρες ετικέτες· προσθέστε ελέγχους εκτός κατανομής ή πολιτική αποχής όπου είναι κατάλληλο. Εξετάστε σφάλματα για ευαίσθητες διαμεσολαβήσεις και τεχνουργήματα του συνόλου δεδομένων. Τα SVM παραμένουν ισχυρά για μεσαίου μεγέθους, υψηλής διάστασης προβλήματα, αλλά ένα μέγιστο γεωμετρικό περιθώριο δεν αποτελεί απόδειξη αιτιώδους δομής ή ασφάλειας.

Παράδειγμα εφαρμογής: ένα SVM για σπάνια δρομολόγηση εγγράφων

Μια ομάδα νομικών λειτουργιών ταξινομεί σύντομες υποβολές σε κατηγορίες δρομολόγησης χρησιμοποιώντας χαρακτηριστικά TF–IDF και ένα γραμμικό SVM. Διαχωρίζει τα δεδομένα ανά θέμα και χρόνο για να αποτρέψει διαρροή προτύπων, κλιμακώνει τα βάρη κλάσεων βάσει του κόστους σφάλματος που έχει ελεγχθεί, και ρυθμίζει το C μέσα σε ένθετη επικύρωση. Το γραμμικό μοντέλο συγκρίνεται με λογιστική παλινδρόμηση και έναν μετασχηματιστή. Η ακρίβεια, η ανάκληση, η βαθμονόμηση ανά κλάση και το φορτίο του ελεγκτή έχουν μεγαλύτερη σημασία από τη συνολική ακρίβεια.

Οι βαθμολογίες απόφασης βαθμονομούνται σε ξεχωριστά δεδομένα, και τα έγγραφα με χαμηλό περιθώριο ή μη υποστηριζόμενη γλώσσα μεταφέρονται σε χειροκίνητη επεξεργασία. Το αντικείμενο εξυπηρέτησης περιλαμβάνει τον διαχωριστή, το λεξικό, την βαρύτητα, το μοντέλο, τη βαθμονόμηση και τον χάρτη ετικετών. Η παρακολούθηση καταγράφει νέους όρους, την επικράτηση των κατηγοριών, τα περιθώρια και τις διορθωμένες διαδρομές. Τα έγγραφα και τα support vectors προστατεύονται επειδή τα χαρακτηριστικά κειμένου μπορούν να αποκαλύψουν εμπιστευτικές πληροφορίες. Ένας μη γραμμικός πυρήνας απορρίπτεται όταν το μικρό του κέρδος ποιότητας δεν μπορεί να δικαιολογήσει την καθυστέρηση, τη μνήμη και το κόστος ερμηνευσιμότητας.

Απόδειξη υλοποίησης και ετοιμότητα λειτουργίας

Μια απόφαση παραγωγής απαιτεί περισσότερα από μια επιτυχημένη επίδειξη. Ορίστε τους προοριζόμενους χρήστες, το λειτουργικό περιβάλλον, τις εισροές, τις εξόδους, τις εξαρτήσεις, τον υπεύθυνο και τις συνέπειες κάθε σημαντικής αποτυχίας. Καθιερώστε μια αναπαραγώγιμη βάση και ένα εκδόσιμα σύνολο αξιολόγησης πριν από τη ρύθμιση. Δοκιμάστε κανονικές περιπτώσεις, όρια, εσφαλμένες ή ελλιπείς εισροές, μεταβολή κατανομής, διακοπή εξαρτήσεων, κακή χρήση και τις ομάδες ή τα περιβάλλοντα που είναι πιο πιθανό να υπολειτουργούν. Μετρήστε την ποιότητα του έργου μαζί με τη βαθμονόμηση ή την αβεβαιότητα, την καθυστέρηση, τη διαπερατότητα, το κόστος πόρων, την προσβασιμότητα, το απόρρητο και την ασφάλεια. Καταγράψτε κάθε μετασχηματισμό και όριο ώστε ένας ανεξάρτητος ελεγκτής να μπορεί να αναπαράγει το αποτέλεσμα και να διακρίνει την απόδειξη από ένα ελκυστικό πρωτότυπο.

Πριν την εκκίνηση, αναθέστε την εξουσία για την κυκλοφορία, τις εξαιρέσεις, τις αλλαγές, την επαναφορά και τη συνταγική απόσυρση. Χρησιμοποιήστε σταδιακή κυκλοφορία, διατηρήστε ασφαλή εναλλακτική λύση και επαληθεύστε την παρακολούθηση με σκόπιμα ενσωματωμένες αποτυχίες. Η λειτουργική τηλεμετρία πρέπει να αποκαλύπτει την ποιότητα των εισροών, τη συμπεριφορά των εξόδων, την έκδοση του μοντέλου ή του κανόνα, την υγεία των εξαρτήσεων, τις ανθρώπινες παρεμβάσεις και τα επιβεβαιωμένα αποτελέσματα χωρίς τη συλλογή περιττών ευαίσθητων δεδομένων. Ορίστε όρια ειδοποίησης και έναν υπεύθυνο απόκρισης, και στη συνέχεια ελέγξτε τα αποδεικτικά στοιχεία του πραγματικού κόσμου μετά την ανάπτυξη αντί να υποθέτετε ότι η εκτός σύνδεσης απόδοση θα παραμείνει. Επαναξιολογήστε όποτε αλλάζουν οι πηγές δεδομένων, οι χρήστες, τα μοντέλα, οι προμηθευτές, οι πολιτικές, το υλικό ή οι στόχοι. Ένα συντηρημένο σύστημα χρειάζεται επίσης τεκμηριωμένη ανάκτηση, εκμάθηση περιστατικών, διαδικασίες διαγραφής και διατήρησης, και ένα σαφές σημείο στο οποίο πρέπει να απενεργοποιηθεί ή να αντικατασταθεί.

Συχνές ερωτήσεις

Τα SVM εκτελούν μόνο ταξινόμηση;

Όχι. Η παλινδρόμηση με support vector προβλέπει συνεχείς στόχους, ενώ ένα SVM μιας κλάσης μπορεί να εκτιμήσει ένα όριο καινοτομίας. Κάθε παραλλαγή έχει διαφορετικό στόχο και σύνολο υπερπαραμέτρων.

Πότε ένα γραμμικό SVM είναι ισχυρή επιλογή;

Τα γραμμικά SVM είναι συχνά αποτελεσματικά για υψηλής διάστασης αραίους χαρακτηριστικούς, συμπεριλαμβανομένων των παραδοσιακών αναπαραστάσεων κειμένου, όπου ένας ευέλικτος πυρήνας θα προσθέσει κόστος χωρίς σαφή όφελος.

Κύριες αναφορές

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.