Η γωνία του Anderson

Ο Andrew Ng Κριτικάρει τον Πολιτισμό της Υπερπροσαρμογής στη Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Andrew Ng overfitting

Ο Andrew Ng, ένας από τους πιο επιδραστικούς ομιλητές στη μηχανική μάθηση τα τελευταία δέκα χρόνια, εκφράζει σήμερα ανησυχίες για το βαθμό στον οποίο ο τομέας τονίζει τις καινοτομίες στη δομή του μοντέλου πάνω από τα δεδομένα – και συγκεκριμένα, για το βαθμό στον οποίο επιτρέπει τα “υπερπροσαρμοσμένα” αποτελέσματα να απεικονίζονται ως γενικευμένες λύσεις ή προόδους.

Αυτές είναι εκτενείς κριτικές για τον τρέχοντα πολιτισμό της μηχανικής μάθησης, που προέρχονται από μια από τις υψηλότερες αρχές του, και έχουν επιπτώσεις στην εμπιστοσύνη σε ένα τομέα που είναι αντιμετωπίζεται από φόβους για μια τρίτη κατάρρευση της επιχειρηματικής εμπιστοσύνης στην ανάπτυξη της τεχνητής νοημοσύνης σε διάστημα εξήντα ετών.

Ο Ng, καθηγητής στο Πανεπιστήμιο του Στάνφορντ, είναι επίσης ένας από τους ιδρυτές της deeplearning.ai, και τον Μάρτιο δημοσίευσε ένα μηνύμα στον ιστότοπο του οργανισμού, το οποίο κατέλιξε ένα πρόσφατο λόγο του σε δύο βασικές συστάσεις:

Πρώτον, ότι η ερευνητική κοινότητα πρέπει να σταματήσει να παραπονιέται ότι η καθαρισμός των δεδομένων αντιπροσωπεύει το 80% των προκλήσεων στη μηχανική μάθηση, και να προχωρήσει με την ανάπτυξη ρομπούστων μεθοδολογιών και πρακτικών MLOps.

Δεύτερον, ότι πρέπει να απομακρυνθεί από τις “εύκολες νίκες” που μπορούν να επιτευχθούν με την υπερπροσαρμογή των δεδομένων σε ένα μοντέλο μηχανικής μάθησης, ώστε να εκτελεστεί καλά σε αυτό το μοντέλο αλλά να αποτύχει να γενικευτεί ή να παράγει ένα ευρέως εφαρμόσιμο μοντέλο.

Αποδοχή της Πρόκλησης της Αρχιτεκτονικής και της Διαχείρισης των Δεδομένων

“Η άποψή μου”, έγραψε ο Ng, “είναι ότι αν το 80% της δουλειάς μας είναι η προετοιμασία των δεδομένων, τότε η διασφάλιση της ποιότητας των δεδομένων είναι το σημαντικό έργο μιας ομάδας μηχανικής μάθησης.”

Συνέχισε:

‘Αντί να βασίζουμε τους μηχανικούς να βρουν τον καλύτερο τρόπο για να βελτιώσουν ένα σύνολο δεδομένων, ελπίζω να μπορούμε να αναπτύξουμε εργαλεία MLOps που θα βοηθήσουν να κάνουν την κατασκευή συστημάτων τεχνητής νοημοσύνης, συμπεριλαμβανομένης της κατασκευής υψηλής ποιότητας συνόλων δεδομένων, πιο επαναλαμβανόμενη και συστηματική.

‘Η MLOps είναι ένα νεαρό πεδίο, και διαφορετικά άτομα την ορίζουν διαφορετικά. Αλλά νομίζω ότι η πιο σημαντική αρχή οργάνωσης των ομάδων και των εργαλείων MLOps πρέπει να είναι να διασφαλίσουν τη συνεχή και υψηλής ποιότητας ροή των δεδομένων σε όλα τα στάδια ενός έργου. Αυτό θα βοηθήσει πολλά έργα να προχωρήσουν πιο ομαλά.’

Ομιλώντας στο Zoom σε μια ζωντανή συνεδρία ερωτήσεων και απαντήσεων στο τέλος του Απριλίου, ο Ng αναφέρθηκε στην ελλειπή εφαρμοσιμότητα των συστημάτων ανάλυσης μηχανικής μάθησης για την ακτινολογία:

“Βγαίνει ότι όταν συλλέγουμε δεδομένα από το Νοσοκομείο του Στάνφορντ, τότε εκπαιδεύουμε και τεστάρουμε δεδομένα από το ίδιο νοσοκομείο, πράγματι, μπορούμε να δημοσιεύσουμε έγγραφα που δείχνουν [τα αλγόριθμοι] είναι συγκρίσιμοι με τους ανθρώπινους ακτινολόγους στην ανίχνευση ορισμένων καταστάσεων.

“…[Όταν] παίρνουμε το ίδιο μοντέλο, το ίδιο σύστημα τεχνητής νοημοσύνης, σε ένα παλαιότερο νοσοκομείο δίπλα, με μια παλαιότερη μηχανή, και ο τεχνικός χρησιμοποιεί một ελαφρώς διαφορετικό πρωτόκολλο απεικόνισης, τα δεδομένα παρουσιάζουν μια απόκλιση που προκαλεί την απόδοση του συστήματος τεχνητής νοημοσύνης να επιδεινωθεί σημαντικά. Αντίθετα, οποιοσδήποτε ανθρώπινος ακτινολόγος μπορεί να περπατήσει στο παλαιότερο νοσοκομείο και να κάνει καλά.”

Η Υπερπροσαρμογή Δεν Είναι Λύση

Η υπερπροσαρμογή συμβαίνει όταν ένα μοντέλο μηχανικής μάθησης σχεδιάζεται ειδικά για να ταιριάξει τις ιδιοσυγκρασίες ενός συγκεκριμένου συνόλου δεδομένων (ή του τρόπου με τον οποίο τα δεδομένα είναι διαμορφωμένα). Αυτό μπορεί να περιλαμβάνει, για παράδειγμα, την καθορισμό βαρών που θα παράγουν καλά αποτελέσματα από αυτό το σύνολο δεδομένων, αλλά δεν θα “γενικευτούν” σε άλλα δεδομένα.

Σε πολλές περιπτώσεις, τέτοιες παραμέτρους ορίζονται σε “μη-δεδομένα” аспектς του συνόλου εκπαίδευσης, όπως η συγκεκριμένη ανάλυση των συλλεγμένων πληροφοριών, ή άλλες ιδιοσυγκρασίες που δεν εγγυώνται να επαναλαμβάνονται σε άλλα μεταγενέστερα σύνολα δεδομένων.

Αν και θα ήταν ωραίο, η υπερπροσαρμογή δεν είναι ένα πρόβλημα που μπορεί να λυθεί με την τυφλή διεύρυνση του πεδίου ή της ευελιξίας της αρχιτεκτονικής των δεδομένων ή του σχεδιασμού του μοντέλου, όταν αυτό που χρειάζεται είναι ευρέως εφαρμόσιμες και υψηλής σημασίας χαρακτηριστικά που θα εκτελεστούν καλά σε eine σειρά περιβαλλόντων δεδομένων – μια πιο δυσχερής πρόκληση.

ΓENERALLY, αυτό το είδος “υπερπροσαρμογής” οδηγεί στα ίδια προβλήματα που ο Ng έχει περιγράψει πρόσφατα, όπου ένα μοντέλο μηχανικής μάθησης αποτυγχάνει σε μη είδη δεδομένα. Η διαφορά σε αυτή την περίπτωση είναι ότι το μοντέλο αποτυγχάνει όχι επειδή τα δεδομένα ή η μορφοποίηση των δεδομένων είναι διαφορετικά από το υπερπροσαρμοσμένο αρχικό σύνολο εκπαίδευσης, αλλά επειδή το μοντέλο είναι πολύ ευέλικτο αντί για πολύ σκληρό.

Τον Δεκέμβριο του 2020, η έρευνα Η Υπερπροσαρμογή Παρουσιάζει Προκλήσεις για την Πιστότητα στη Μοντέρνα Μηχανική Μάθηση κατηγόρησε έντονα αυτή την πρακτική, και φέρει τα ονόματα τουλάχιστον σαράντα ερευνητών και επιστημόνων της μηχανικής μάθησης από την Google και το MIT, μεταξύ άλλων ιδρυμάτων.

Η έρευνα κριτικάρει την “γρήγορη μάθηση”, και παρατηρεί τον τρόπο με τον οποίο τα υποκαθορισμένα μοντέλα μπορούν να πάρουν άγριες εκτροπές με βάση το τυχαίο σημείο εκκίνησης της εκπαίδευσης του μοντέλου. Οι συντελεστές παρατηρούν:

‘Έχουμε δει ότι η υπερπροσαρμογή είναι πανταχού παρούσα στις πρακτικές διαδικασίες μηχανικής μάθησης σε πολλά πεδία. Πράγματι, χάρη στην υπερπροσαρμογή, ουσιαστικά σημαντικά аспектς των αποφάσεων καθορίζονται από τυχαίες επιλογές, όπως η τυχαία αρχικοποίηση των παραμέτρων.’

Οικονομικές Επιπτώσεις της Αλλαγής του Πολιτισμού

Παρά τα ακαδημαϊκά του προσόντα, ο Ng δεν είναι ένας αέριος ακαδημαϊκός, αλλά έχει βαθιά και υψηλά βιομηχανικά εμπειρία ως συνιδρυτής του Google Brain και του Coursera, ως πρώην επικεφαλής επιστήμονας για τα Μεγάλα Δεδομένα και την Τεχνητή Νοημοσύνη στη Baidu, και ως ιδρυτής της Landing AI, η οποία διαχειρίζεται 175 εκατομμύρια δολάρια για νέες επιχειρήσεις στον τομέα.

Όταν λέει “Όλη η Τεχνητή Νοημοσύνη, όχι μόνο η υγεία, έχει ένα χάσμα από την απόδειξη της концепτός στην παραγωγή”, πρόκειται για ένα ξύπνημα σε einen τομέα που η τρέχουσα του επιπέδου υπερβολής και η spotted ιστορία του έχουν ολοένα και περισσότερο χαρακτηρίσει ως μια αβέβαιη μακροπρόθεσμη επιχειρηματική επένδυση, παρατηρούμενη από προβλήματα ορισμού και εύρους.

Ωστόσο, τα ιδιόκτητα συστήματα μηχανικής μάθησης που λειτουργούν καλά in situ και αποτυγχάνουν σε άλλα περιβάλλοντα αντιπροσωπεύουν το είδος της αγοράς που θα μπορούσε να ανταποκριθεί στην επένδυση της βιομηχανίας. Η παρουσίαση του “προβλήματος της υπερπροσαρμογής” στο контекστό ενός επαγγελματικού κινδύνου προσφέρει έναν απατηλό τρόπο να κερδοσκοπήσει την εταιρική επένδυση στην ανοιχτή έρευνα, και να παράγει (πραγματικά) ιδιόκτητα συστήματα όπου η αναπαραγωγή από τους ανταγωνιστές είναι δυνατή, αλλά προβληματική.

Εάν αυτό το σχέδιο θα δουλέψει μακροπρόθεσμα εξαρτάται από το βαθμό στον οποίο οι πραγματικές προόδους στη μηχανική μάθηση θα συνεχίσουν να απαιτούν πάντα μεγαλύτερα επίπεδα επένδυσης, και εάν όλοι οι παραγωγικοί προγραμματισμοί θα μεταναστεύσουν αναπόφευκτα στη FAANG σε κάποιο βαθμό, λόγω των κολοσσιαίων πόρων που απαιτούνται για τη φιλοξενία και τις λειτουργίες.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai