Μοντέλα και πλατφόρμες AI

LightAutoML: Ένα Πλαίσιο AutoML για τις Υπηρεσίες Χρηματοοικονομικών

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Αν και το AutoML ανέβηκε στην δημοτικότητα πριν από quelques χρόνια, η πρώιμη εργασία στο AutoML χρονολογείται από τις αρχές της δεκαετίας του ’90, όταν οι επιστήμονες δημοσίευσαν τα πρώτα έγγραφα σχετικά με την оптимποίηση των υπερπαραμέτρων. Το 2014, όταν το ICML οργάνωσε το πρώτο εργαστήριο AutoML, το AutoML απέκτησε την προσοχή των développeurs ML. Ένα από τα κύρια焦點 των ετών του AutoML είναι το πρόβλημα της αναζήτησης υπερπαραμέτρων, όπου το μοντέλο εφαρμόζει eine σειρά από μεθόδους βελτιστοποίησης για να καθορίσει τις καλύτερες υπερπαράμετρες σε ένα μεγάλο χώρο υπερπαραμέτρων για ένα συγκεκριμένο μοντέλο μηχανικής μάθησης. Μια άλλη μέθοδος που εφαρμόζεται συχνά από τα μοντέλα AutoML είναι να εκτιμήσει την πιθανότητα μιας συγκεκριμένης υπερπαράμετρου να είναι η βέλτιστη υπερπαράμετρος για ένα δεδομένο μοντέλο μηχανικής μάθησης. Το μοντέλο επιτυγχάνει αυτό εφαρμόζοντας μεθόδους Bayesian που παραδοσιακά χρησιμοποιούν ιστορικά δεδομένα από προηγουμένως εκτιμημένα μοντέλα και άλλα σύνολα δεδομένων.除了 την оптимποίηση των υπερπαραμέτρων, άλλες μέθοδοι προσπαθούν να επιλέξουν τα καλύτερα μοντέλα από ένα χώρο εναλλακτικών μοντέλων.

Σε αυτό το άρθρο, θα καλύψουμε το LightAutoML, ένα σύστημα AutoML που αναπτύχθηκε κυρίως για μια ευρωπαϊκή εταιρεία που λειτουργεί στον χρηματοοικονομικό τομέα μαζί με το οικοσύστημά της. Το πλαίσιο LightAutoML αναπτύσσεται σε διάφορες εφαρμογές και τα αποτελέσματα έδειξαν υπεροχή απόδοση, συγκρίσιμη με το επίπεδο των επιστημόνων δεδομένων, ακόμη και ενώ χτίζουν υψηλής ποιότητας μοντέλα μηχανικής μάθησης. Το πλαίσιο LightAutoML προσπαθεί να κάνει τις ακόλουθες συνεισφορές. Πρώτα, το πλαίσιο LightAutoML αναπτύχθηκε κυρίως για το οικοσύστημα μιας μεγάλης ευρωπαϊκής χρηματοοικονομικής και τραπεζικής εταιρείας. Λόγω του πλαισίου και της αρχιτεκτονικής του, το πλαίσιο LightAutoML είναι σε θέση να υπερβεί τα state-of-the-art πλαίσια AutoML σε διάφορες ανοιχτές βάσεις δεδομένων, καθώς και εφαρμογές του οικοσυστήματος. Η απόδοση του πλαισίου LightAutoML συγκρίνεται επίσης με μοντέλα που έχουν ρυθμιστεί χειροκίνητα από επιστήμονες δεδομένων και τα αποτελέσματα έδειξαν ισχυρότερη απόδοση από το πλαίσιο LightAutoML.

Το άρθρο αυτό έχει ως στόχο να καλύψει το πλαίσιο LightAutoML σε βάθος και να εξετάσει τον μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου μαζί με τη σύγκρισή του με τα state-of-the-art πλαίσια. Έτσι, ας ξεκινήσουμε.

LightAutoML: Ένα Πλαίσιο AutoML για τις Υπηρεσίες Χρηματοοικονομικών

Αν και οι ερευνητές ξεκίνησαν να εργάζονται στο AutoML στις αρχές και τα μέσα της δεκαετίας του ’90, το AutoML απέκτησε μια μεγάλη μερίδα της προσοχής τα τελευταία χρόνια, με einige από τις πιο εξέχουσες βιομηχανικές λύσεις να εφαρμόζουν αυτόματα κατασκευασμένα μοντέλα μηχανικής μάθησης, όπως το AutoGluon της Amazon (AMZN ), το DarwinAI, το H20.ai, το IBM Watson AI, το Microsoft (MSFT ) AzureML και πολλά άλλα. Η πλειοψηφία αυτών των πλαισίων εφαρμόζει μια γενική λύση AutoML που αναπτύσσει μοντέλα ML-βασισμένα αυτόματα σε διάφορες κατηγορίες εφαρμογών, όπως οι χρηματοοικονομικές υπηρεσίες, η υγεία, η εκπαίδευση και πολλά άλλα. Η βασική υπόθεση πίσω από αυτήν την οριζόντια γενική προσέγγιση είναι ότι η διαδικασία ανάπτυξης αυτόματων μοντέλων παραμένει相同 σε όλες τις εφαρμογές. Ωστόσο, το πλαίσιο LightAutoML εφαρμόζει μια κάθετη προσέγγιση για την ανάπτυξη μιας λύσης AutoML που δεν είναι γενική, αλλά κατευθύνεται στις ανάγκες των ατομικών εφαρμογών, σε αυτήν την περίπτωση μιας μεγάλης χρηματοοικονομικής εταιρείας. Το πλαίσιο LightAutoML είναι μια κάθετη λύση AutoML που επικεντρώνεται στις ανάγκες του σύνθετου οικοσυστήματος μαζί με τις ιδιότητές του. Πρώτα, το πλαίσιο LightAutoML παρέχει γρήγορη και σχεδόν βέλτιστη αναζήτηση υπερπαραμέτρων. Αν και το μοντέλο δεν βελτιστοποιεί trực tiếp αυτές τις υπερπαράμετρες, καταφέρνει να παρέχει ικανοποιητικά αποτελέσματα. Επιπλέον, το μοντέλο διατηρεί την ισορροπία μεταξύ ταχύτητας και βελτιστοποίησης υπερπαραμέτρων δυναμικά, για να διασφαλίσει ότι το μοντέλο είναι βέλτιστο σε μικρά προβλήματα και αρκετά γρήγορο σε μεγαλύτερα προβλήματα. Δεύτερον, το πλαίσιο LightAutoML περιορίζει το εύρος των μοντέλων μηχανικής μάθησης σκόπιμα σε δύο τύπους: γραμμικά μοντέλα και GBMs ή gradient boosted decision trees, αντί να εφαρμόζει μεγάλες ensembles διαφορετικών αλγορίθμων. Ο κύριος λόγος πίσω από την περιορισμό του εύρους των μοντέλων μηχανικής μάθησης είναι να επιταχύνει τον χρόνο εκτέλεσης του πλαισίου LightAutoML χωρίς να επηρεάσει αρνητικά την απόδοση για το δεδομένο πρόβλημα και δεδομένα. Τρίτον, το πλαίσιο LightAutoML παρουσιάζει μια μοναδική μέθοδο για την επιλογή schemata προεπεξεργασίας για διαφορετικά χαρακτηριστικά που χρησιμοποιούνται στα μοντέλα με βάση ορισμένες κανόνες επιλογής και μετα-στατιστικών. Το πλαίσιο LightAutoML αξιολογείται σε eine ευρεία ποικιλία ανοιχτών πηγών δεδομένων σε διάφορες εφαρμογές.

LightAutoML: Μεθοδολογία και Αρχιτεκτονική

Το πλαίσιο LightAutoML αποτελείται από μονάδες που ονομάζονται Presets που είναι αφιερωμένες για την ανάπτυξη μοντέλων από την αρχή για τυπικές εργασίες μηχανικής μάθησης. Σήμερα, το πλαίσιο LightAutoML υποστηρίζει μονάδες Preset. Πρώτα, το TabularAutoML Preset επικεντρώνεται στην επίλυση κλασικών προβλημάτων μηχανικής μάθησης που ορίζονται σε πίνακες δεδομένων. Δεύτερον, το White-Box Preset εφαρμόζει απλά ερμηνεύσιμα αλγόριθμα, όπως η Logistic Regression αντί της WoE ή του Weight of Evidence encoding και των διακριτών χαρακτηριστικών για να επιλύσει δ 雙 classification εργασίες σε πίνακες δεδομένων. Η εφαρμογή απλών ερμηνεύσιμων αλγορίθμων είναι μια κοινή πρακτική για να μοντελοποιήσει την πιθανότητα μιας αίτησης λόγω των περιορισμών ερμηνευσιμότητας που επιβάλλονται από διάφορους παράγοντες. Τρίτον, το NLP Preset είναι ικανό να συνδυάσει πίνακες δεδομένων με εργαλεία NLP ή Natural Language Processing, συμπεριλαμβανομένων προ-εκπαιδευμένων μοντέλων βαθιάς μάθησης και συγκεκριμένων εξαγωγέων χαρακτηριστικών. Τέλος, το CV Preset εργάζεται με δεδομένα εικόνας με τη βοήθεια ορισμένων βασικών εργαλείων. Είναι σημαντικό να σημειωθεί ότι αν και το μοντέλο LightAutoML υποστηρίζει όλα τα τέσσερα Presets, το πλαίσιο χρησιμοποιεί μόνο το TabularAutoML στο σύστημα παραγωγής.

Η τυπική διαδικασία του πλαισίου LightAutoML περιλαμβάνεται στην ακόλουθη εικόνα.

Κάθε διαδικασία περιλαμβάνει τρία компоненты. Πρώτα, ο Reader, ένα αντικείμενο που λαμβάνει τον τύπο εργασίας και τα αρχικά δεδομένα ως εισαγωγή, εκτελεί σημαντικές υπολογισμοί μετα-δεδομένων, καθαρίζει τα αρχικά δεδομένα και καθορίζει τις manipulations των δεδομένων που πρέπει να εκτελεστούν πριν από την προσαρμογή των μοντέλων. Επόμενο, τα εσωτερικά σύνολα δεδομένων του LightAutoML περιέχουν CV iterators και μετα-δεδομένα που εφαρμόζουν schemata επικύρωσης για τα σύνολα δεδομένων. Ο τρίτος компонент είναι οι πολλαπλοί πίπες μηχανικής μάθησης που στοίβαζονται και/ή αναμειγνύονται για να ληφθεί μια seule πρόβλεψη. Một πίπη μηχανικής μάθησης μέσα στην αρχιτεκτονική του πλαισίου LightAutoML είναι ένα από τα πολλά μοντέλα μηχανικής μάθησης που μοιράζονται ένα κοινό schema επικύρωσης και προεπεξεργασίας. Το βήμα προεπεξεργασίας μπορεί να έχει μέχρι δύο βήματα επιλογής χαρακτηριστικών, ένα βήμα μηχανικής ή μπορεί να είναι κενό αν δεν χρειάζεται προεπεξεργασία. Οι πίπες ML μπορούν να υπολογιστούν ανεξάρτητα στα ίδια σύνολα δεδομένων και στη συνέχεια να αναμειγνύονται μαζί χρησιμοποιώντας μέσος όρος (ή βαρεμένο μέσος όρος). Εναλλακτικά, μπορεί να χρησιμοποιηθεί ένα schema στοίβαξης για να κατασκευαστούν πολλαπλά επίπεδα ensemble αρχιτεκτονικής.

LightAutoML Tabular Preset

Μέσα στο πλαίσιο LightAutoML, το TabularAutoML είναι η προεπιλεγμένη διαδικασία και εφαρμόζεται στο μοντέλο για να επιλύσει τρεις τύπους εργασιών σε πίνακες δεδομένων: δ 雙 classification, regression και multi-class classification για eine ευρεία ποικιλία μετρικών απόδοσης και συναρτήσεων απώλειας. Ένας πίνακας με τις ακόλουθες τέσσερις στήλες: κατηγορικές ιδιότητες, αριθμητικές ιδιότητες, timestamps και μια seule στήλη στόχου με ετικέτες κλάσεων ή συνεχείς τιμές, τροφοδοτείται στο TabularAutoML ως εισαγωγή. Ένα από τα κύρια αντικείμενα πίσω από το σχεδιασμό του πλαισίου LightAutoML ήταν να σχεδιαστεί ένα εργαλείο για γρήγορη δοκιμή υποθέσεων, ένας κύριος λόγος για τον οποίο το πλαίσιο αποφεύγει να χρησιμοποιεί βрут-φορς μεθόδους για την βελτιστοποίηση της διαδικασίας και επικεντρώνεται μόνο σε τεχνικές και μοντέλα που λειτουργούν σε eine ευρεία ποικιλία συνόλων δεδομένων.

Αυτόματη Τυποποίηση και Προεπεξεργασία Δεδομένων

Για να χειριστεί διαφορετικούς τύπους χαρακτηριστικών με διαφορετικούς τρόπους, το μοντέλο πρέπει να γνωρίζει κάθε τύπο χαρακτηριστικού. Σε περίπτωση που υπάρχει μια seule εργασία με ένα μικρό σύνολο δεδομένων, ο χρήστης μπορεί να ορίσει χειροκίνητα κάθε τύπο χαρακτηριστικού. Ωστόσο, η χειροκίνητη ορισμός κάθε τύπου χαρακτηριστικού δεν είναι πλέον μια βιώσιμη επιλογή σε περιπτώσεις που περιλαμβάνουν εκατοντάδες εργασίες με σύνολα δεδομένων που περιέχουν χιλιάδες χαρακτηριστικά. Για το TabularAutoML Preset, το πλαίσιο LightAutoML χρειάζεται να χαρτογραφήσει χαρακτηριστικά σε τρεις κλάσεις: αριθμητικά, κατηγορικές και datetime. Μια απλή και προφανής λύση είναι να χρησιμοποιηθεί ο τύπος δεδομένων του πίνακα ως πραγματικός τύπος χαρακτηριστικού, δηλαδή να χαρτογραφηθούν στήλες float/int σε αριθμητικά χαρακτηριστικά, timestamp ή string που μπορεί να αναλυθεί ως timestamp — σε datetime και άλλες σε κατηγορικές. Ωστόσο, αυτή η χαρτογράφηση δεν είναι η καλύτερη λόγω της συχνής εμφάνισης αριθμητικών τύπων δεδομένων σε κατηγορικές στήλες.

Σχήματα Επικύρωσης

Τα σχήματα επικύρωσης είναι ένα ζωτικό компонент των πλαισίων AutoML,既然 τα δεδομένα στη βιομηχανία υπόκεινται σε αλλαγές με τον καιρό και αυτό το στοιχείο αλλαγής καθιστά τις υποθέσεις IID ή Independent Identically Distributed άσχετες κατά την ανάπτυξη του μοντέλου. Τα μοντέλα AutoML εφαρμόζουν σχήματα επικύρωσης για να εκτιμήσουν την απόδοσή τους, να αναζητήσουν υπερπαράμετρες και να παράγουν προβλέψεις εκτός του φακέλου. Η διαδικασία TabularAutoML εφαρμόζει τρία σχήματα επικύρωσης:

  • KFold Cross Validation: KFold Cross Validation είναι το προεπιλεγμένο σχήμα επικύρωσης για τη διαδικασία TabularAutoML, συμπεριλαμβανομένων GroupKFold για μοντέλα συμπεριφοράς και stratified KFold για εργασίες ταξινόμησης.
  • Επικύρωση Holdout: Το σχήμα επικύρωσης Holdout εφαρμόζεται εάν ορίζεται το σύνολο Holdout.
  • Προσαρμοσμένα Σχήματα Επικύρωσης: Τα προσαρμοσμένα σχήματα επικύρωσης μπορούν να δημιουργηθούν από τους χρήστες ανάλογα με τις ατομικές τους ανάγκες. Τα προσαρμοσμένα σχήματα επικύρωσης περιλαμβάνουν σχήματα διαίρεσης και σχήματα διαίρεσης χρόνου.

Επιλογή Χαρακτηριστικών

Αν και η επιλογή χαρακτηριστικών είναι ένα κρίσιμο σημείο της ανάπτυξης μοντέλων σύμφωνα με τις βιομηχανικές προδιαγραφές, поскольку διευκολύνει την μείωση του κόστους inference και εφαρμογής του μοντέλου, η πλειοψηφία των λύσεων AutoML δεν επικεντρώνεται πολύ σε αυτό το πρόβλημα. Αντίθετα, η διαδικασία TabularAutoML εφαρμόζει τρεις στρατηγικές επιλογής χαρακτηριστικών: keine επιλογή, επιλογή με βάση την Importance cut off και επιλογή με βάση την Importance-based forward selection. Από αυτές, η επιλογή με βάση την Importance cut off είναι η προεπιλεγμένη. Επιπλέον, υπάρχουν δύο κύριες τρόποι για να εκτιμηθεί η σημασία των χαρακτηριστικών: split-based tree importance και permutation importance του μοντέλου GBM ή gradient boosted decision trees. Ο κύριος στόχος της επιλογής με βάση την Importance cut off είναι να απορρίψει τα χαρακτηριστικά που δεν είναι χρήσιμα για το μοντέλο, επιτρέποντας στο μοντέλο να μειώσει τον αριθμό των χαρακτηριστικών χωρίς να επηρεάσει αρνητικά την απόδοση, μια προσέγγιση που μπορεί να επιταχύνει την inference και την εκπαίδευση του μοντέλου.

Η παραπάνω εικόνα συγκρίνει διαφορετικές στρατηγικές επιλογής σε δ 雙 datasets τράπεζας.

Βελτιστοποίηση Υπερπαραμέτρων

Η διαδικασία TabularAutoML εφαρμόζει διαφορετικές προσεγγίσεις για να ρυθμίσει τις υπερπαράμετρες με βάση το τι ρυθμίζεται.

  • Βελτιστοποίηση Υπερπαραμέτρων με Early Stopping επιλέγει τον αριθμό των επαναλήψεων για όλα τα μοντέλα κατά τη φάση εκπαίδευσης.
  • Βελτιστοποίηση Υπερπαραμέτρων με Expert System είναι ένας απλός τρόπος για να ορίσετε τις υπερπαράμετρες για τα μοντέλα με ικανοποιητικό τρόπο. Αυτό αποτρέπει το τελικό μοντέλο από μια μεγάλη μείωση του σκορ σε σύγκριση με τα μοντέλα που έχουν ρυθμιστεί χειροκίνητα.
  • Tree Structured Parzen Estimation ή TPE για μοντέλα GBM ή gradient boosted decision trees. TPE είναι μια μεικτή στρατηγική βελτιστοποίησης που είναι η προεπιλεγμένη επιλογή στη διαδικασία TabularAutoML. Για κάθε μοντέλο GBM, το πλαίσιο LightAutoML εκπαιδεύει δύο μοντέλα: το πρώτο λαμβάνει υπερπαράμετρες expert, το δεύτερο είναι fine-tuned για να ταιριάζει στο χρόνο προϋπολογισμού.
  • Βελτιστοποίηση Υπερπαραμέτρων με Grid Search εφαρμόζεται στη διαδικασία TabularAutoML για να ρυθμίσει τις παραμέτρους κανονικοποίησης του μοντέλου γραμμικού μαζί με το early stopping και το warm start.

Το μοντέλο ρυθμίζει όλες τις παραμέτρους με την μεγιστοποίηση της μετρικής συνάρτησης, είτε ορίζεται από τον χρήστη είτε είναι η προεπιλεγμένη για την εργασία που λύνεται.

LightAutoML: Πείραμα και Απόδοση

Για να αξιολογήσει την απόδοση, η διαδικασία TabularAutoML μέσα στο πλαίσιο LightAutoML συγκρίνεται με υπάρχουσες ανοιχτές λύσεις σε διάφορες εργασίες και επιβεβαιώνει την υπεροχή απόδοση του πλαισίου LightAutoML. Πρώτα, η σύγκριση πραγματοποιείται στη βάση δεδομένων OpenML που αξιολογείται σε 35 δ 雙 και multi-class classification task datasets. Ο ακόλουθος πίνακας συνοψίζει τη σύγκριση του πλαισίου LightAutoML με τα υπάρχοντα συστήματα AutoML.

Όπως μπορείτε να δείτε, το πλαίσιο LightAutoML υπερβαίνει όλα τα άλλα συστήματα AutoML σε 20 datasets μέσα στη βάση δεδομένων. Ο ακόλουθος πίνακας περιέχει τη λεπτομερή σύγκριση στο контέκστ δεδομένων, υποδεικνύοντας ότι το LightAutoML παρέχει διαφορετική απόδοση σε διαφορετικές κατηγορίες εργασιών. Για δ 雙 classification εργασίες, το LightAutoML υπολείπεται σε απόδοση, ενώ για εργασίες με μεγάλο όγκο δεδομένων, το LightAutoML παρέχει υπεροχή απόδοση.

Ο ακόλουθος πίνακας συγκρίνει την απόδοση του πλαισίου LightAutoML με τα συστήματα AutoML σε 15 datasets τράπεζας που περιέχουν ένα σύνολο διαφορετικών δ 雙 classification εργασιών. Όπως μπορείτε να δείτε, το LightAutoML υπερβαίνει όλα τα συστήματα AutoML σε 12 από τα 15 datasets, ποσοστό νίκης 80.

Τελικές Σκέψεις

Σε αυτό το άρθρο, μιλήσαμε για το LightAutoML, ένα σύστημα AutoML που αναπτύχθηκε κυρίως για μια ευρωπαϊκή εταιρεία που λειτουργεί στον χρηματοοικονομικό τομέα μαζί με το οικοσύστημά της. Το πλαίσιο LightAutoML αναπτύσσεται σε διάφορες εφαρμογές και τα αποτελέσματα έδειξαν υπεροχή απόδοση, συγκρίσιμη με το επίπεδο των επιστημόνων δεδομένων, ακόμη και ενώ χτίζουν υψηλής ποιότητας μοντέλα μηχανικής μάθησης. Το πλαίσιο LightAutoML προσπαθεί να κάνει τις ακόλουθες συνεισφορές. Πρώτα, το πλαίσιο LightAutoML αναπτύχθηκε κυρίως για το οικοσύστημα μιας μεγάλης ευρωπαϊκής χρηματοοικονομικής και τραπεζικής εταιρείας. Λόγω του πλαισίου και της αρχιτεκτονικής του, το LightAutoML είναι σε θέση να υπερβεί τα state-of-the-art πλαίσια AutoML σε διάφορες ανοιχτές βάσεις δεδομένων, καθώς και εφαρμογές του οικοσυστήματος. Η απόδοση του LightAutoML είναι επίσης συγκρίσιμη με μοντέλα που έχουν ρυθμιστεί χειροκίνητα από επιστήμονες δεδομένων και τα αποτελέσματα έδειξαν ισχυρότερη απόδοση από το LightAutoML.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.