Βασικές αρχές της AI
Τι είναι το Overfitting;
Τι είναι το Overfitting;
Όταν εκπαιδεύετε ένα νευρωνικό δίκτυο, πρέπει να αποφύγετε το overfitting. Το overfitting είναι ένα ζήτημα μέσα στην μηχανική μάθηση και στα στατιστικά όπου ένα μοντέλο μαθαίνει τα πρότυπα ενός συνόλου εκπαίδευσης πολύ καλά, εξηγώντας τέλεια το σύνολο δεδομένων εκπαίδευσης αλλά αποτυγχάνει να γενικεύσει τη προβλεπτική του δύναμη σε άλλα σύνολα δεδομένων.
Για να το εξηγήσω με άλλα λόγια, στην περίπτωση ενός μοντέλου overfitting, θα εμφανίσει συχνά εξαιρετικά υψηλή ακρίβεια στο σύνολο δεδομένων εκπαίδευσης αλλά χαμηλή ακρίβεια στα δεδομένα που συλλέγονται και τρέχονται μέσω του μοντέλου στο μέλλον. Αυτή είναι μια γρήγορη ορισμός του overfitting, αλλά ας εξετάσουμε πιο詳細 το концепτό του overfitting. Ας δούμε πώς συμβαίνει το overfitting και πώς μπορεί να αποφευχθεί.
Κατανόηση του “Fit” και του Underfitting
Είναι χρήσιμο να εξετάσουμε το концепτό του underfitting και του “fit” γενικά όταν συζητάμε το overfitting. Όταν εκπαιδεύουμε ένα μοντέλο, προσπαθούμε να αναπτύξουμε ένα πλαίσιο που είναι ικανό να προβλέψει τη φύση ή την κατηγορία των αντικειμένων σε ένα σύνολο δεδομένων, με βάση τα χαρακτηριστικά που περιγράφουν αυτά τα αντικείμενα. Ένα μοντέλο πρέπει να είναι σε θέση να εξηγήσει ένα πρότυπο σε ένα σύνολο δεδομένων και να προβλέψει τις κατηγορίες των μελλοντικών σημείων δεδομένων με βάση αυτό το πρότυπο. Όσο καλύτερα το μοντέλο εξηγήσει τη σχέση μεταξύ των χαρακτηριστικών του συνόλου εκπαίδευσης, τόσο πιο “fit” είναι το μοντέλο μας.

Η μπλε γραμμή αντιπροσωπεύει τις προβλέψεις ενός μοντέλου που underfits, ενώ η πράσινη γραμμή αντιπροσωπεύει ένα καλύτερο fit μοντέλο. Φωτογραφία: Pep Roca via Wikimedia Commons, CC BY SA 3.0, (https://commons.wikimedia.org/wiki/File:Reg_ls_curvil%C3%ADnia.svg)
Ένα μοντέλο που εξηγήσει κακά τη σχέση μεταξύ των χαρακτηριστικών των δεδομένων εκπαίδευσης και因此 αποτυγχάνει να ταξινομήσει σωστά τα μελλοντικά δεδομένα είναι underfitting τα δεδομένα εκπαίδευσης. Αν Were να γράψουμε τη σχέση μεταξύ των προβλεπόμενων τιμών ενός underfitting μοντέλου και των πραγματικών τιμών, οι προβλέψεις θα απομακρύνθηκαν από το σημείο. Αν είχαμε ένα γράφημα με τις πραγματικές τιμές ενός συνόλου εκπαίδευσης, ένα σοβαρά underfitting μοντέλο θα χάσει δραστικά τα περισσότερα από τα δεδομένα σημεία. Ένα μοντέλο με καλύτερο fit μπορεί να περάσει από το κέντρο των δεδομένων σημείων, με τα μεμονωμένα δεδομένα σημεία να είναι μακριά από τις προβλεπόμενες τιμές μόνο λίγο.
Το underfitting μπορεί συχνά να συμβεί όταν δεν υπάρχει επαρκές δεδομένα για να δημιουργηθεί ένα ακριβές μοντέλο, ή όταν προσπαθούμε να σχεδιάσουμε ένα γραμμικό μοντέλο με μη γραμμικά δεδομένα. Περισσότερα δεδομένα εκπαίδευσης ή περισσότερα χαρακτηριστικά θα βοηθήσουν συχνά να μειώσουν το underfitting.
Γιατί δεν θα δημιουργήσουμε ένα μοντέλο που εξηγήσει κάθε σημείο στο σύνολο δεδομένων εκπαίδευσης τέλεια; Βέβαια, η τέλεια ακρίβεια είναι επιθυμητή; Η δημιουργία ενός μοντέλου που έχει μάθει τα πρότυπα του συνόλου δεδομένων εκπαίδευσης πολύ καλά είναι αυτό που προκαλεί το overfitting. Το σύνολο δεδομένων εκπαίδευσης και άλλα, μελλοντικά σύνολα δεδομένων που θα τρέξουμε μέσω του μοντέλου δεν θα είναι ακριβώς τα ίδια. Θα είναι πιθανότατα πολύ παρόμοια σε πολλά σημεία, αλλά θα διαφέρουν σε κρίσιμους τρόπους.,因此, η σχεδίαση ενός μοντέλου που εξηγήσει το σύνολο δεδομένων εκπαίδευσης τέλεια σημαίνει ότι θα λάβουμε μια θεωρία για τη σχέση μεταξύ των χαρακτηριστικών που δεν γενικεύεται καλά σε άλλα σύνολα δεδομένων.
Κατανόηση του Overfitting
Το overfitting συμβαίνει όταν ένα μοντέλο μαθαίνει τα λεπτομέρειες μέσα στο σύνολο δεδομένων εκπαίδευσης πολύ καλά, προκαλώντας το μοντέλο να υποφέρει όταν γίνονται προβλέψεις σε εξωτερικά δεδομένα. Αυτό μπορεί να συμβεί όταν το μοντέλο όχι μόνο μαθαίνει τα χαρακτηριστικά του συνόλου δεδομένων, αλλά και μαθαίνει τυχαίες διακυμάνσεις ή θόρυβο μέσα στο σύνολο δεδομένων, δίνοντας έμφαση σε αυτές τις τυχαίες/μη σημαντικές εμφανίσεις.
Το overfitting είναι πιο πιθανό να συμβεί όταν χρησιμοποιούνται μη γραμμικά μοντέλα, καθώς είναι πιο ευέλικτα όταν μαθαίνουν χαρακτηριστικά δεδομένων. Οι μη παραμετρικές αλγόριθμοι μηχανικής μάθησης έχουν συχνά διάφορους παραμέτρους και τεχνικές που μπορούν να εφαρμοστούν για να περιορίσουν την ευαισθησία του μοντέλου στα δεδομένα και因此 να μειώσουν το overfitting. Για παράδειγμα, μοντέλα δέντρου αποφάσεων είναι πολύ ευαίσθητα στο overfitting, αλλά μια τεχνική που ονομάζεται pruning μπορεί να χρησιμοποιηθεί για να αφαιρέσει τυχαία κάποια από τα λεπτομέρειες που έχει μάθει το μοντέλο.
Αν Were να γράψουμε τις προβλέψεις του μοντέλου σε άξονες X και Y, θα είχαμε μια γραμμή προβλέψεων που zigzags πίσω και μπροστά, η οποία αντανακλά το γεγονός ότι το μοντέλο έχει προσπαθήσει πολύ να ταιριάξει όλα τα σημεία στο σύνολο δεδομένων στην εξήγηση του.
Έλεγχος του Overfitting
Όταν εκπαιδεύουμε ένα μοντέλο, ιδανικά θέλουμε το μοντέλο να μην κάνει κανένα λάθος. Όταν η απόδοση του μοντέλου συγκλίνει προς την πραγματική πρόβλεψη όλων των σημείων δεδομένων στο σύνολο εκπαίδευσης, το fit γίνεται καλύτερο. Ένα μοντέλο με καλό fit είναι ικανό να εξηγήσει σχεδόν όλα το σύνολο δεδομένων εκπαίδευσης χωρίς overfitting.
Καθώς το μοντέλο εκπαιδεύεται, η απόδοσή του βελτιώνεται με το χρόνο. Το ποσοστό λάθους του μοντέλου θα μειωθεί καθώς περνάει ο χρόνος εκπαίδευσης, αλλά μειώνεται μόνο μέχρι ένα σημείο. Το σημείο στο οποίο η απόδοση του μοντέλου στο σύνολο δοκιμής αρχίζει να αυξάνεται και πάλι είναι τυπικά το σημείο στο οποίο συμβαίνει το overfitting. Για να πάρουμε το καλύτερο fit για ένα μοντέλο, θέλουμε να σταματήσουμε την εκπαίδευση του μοντέλου στο σημείο με το χαμηλότερο λάθος στο σύνολο εκπαίδευσης, πριν αρχίσει να αυξάνεται και πάλι το λάθος. Το ιδανικό σημείο διακοπής μπορεί να καθοριστεί με τη γραφική παράσταση της απόδοσης του μοντέλου κατά τη διάρκεια της εκπαίδευσης και τη διακοπή της εκπαίδευσης όταν το λάθος είναι το χαμηλότερο. jedoch, ένα ρίσκο με αυτή τη μέθοδο ελέγχου του overfitting είναι ότι η καθορισμένη διακοπή της εκπαίδευσης με βάση την απόδοση δοκιμής σημαίνει ότι τα δεδομένα δοκιμής γίνονται κάπως μέρος της διαδικασίας εκπαίδευσης και χάνουν την κατάσταση τους ως ακατάπαυστα “αγγελομένα” δεδομένα.
Υπάρχουν διάφορες μέθοδοι για να καταπολεμήσουμε το overfitting. Μια μέθοδος για τη μείωση του overfitting είναι να χρησιμοποιήσουμε μια τεχνική επαναδειγματοληψίας, η οποία λειτουργεί με την εκτίμηση της ακρίβειας του μοντέλου. Μπορείτε επίσης να χρησιμοποιήσετε ένα σύνολο επικύρωσης εκτός από το σύνολο δοκιμής και να γράψετε την ακρίβεια εκπαίδευσης έναντι του συνόλου επικύρωσης αντί του συνόλου δοκιμής. Αυτό διατηρεί το σύνολο δοκιμής σας αόρατο. Eine δημοφιλής μέθοδος επαναδειγματοληψίας είναι η K-folds cross-validation. Αυτή η τεχνική σας επιτρέπει να διαιρέσετε τα δεδομένα σας σε υποσύνολα που το μοντέλο εκπαιδεύεται και στη συνέχεια η απόδοση του μοντέλου στα υποσύνολα αναλύεται για να εκτιμηθεί πώς το μοντέλο θα εκτελεστεί σε εξωτερικά δεδομένα.
Η χρήση της cross-validation είναι ένας από τους καλύτερους τρόπους για να εκτιμήσετε την ακρίβεια του μοντέλου σε αόρατα δεδομένα, και όταν συνδυάζεται με ένα σύνολο επικύρωσης, το overfitting μπορεί συχνά να μειωθεί στο ελάχιστο.












