Ηγέτες σκέψης
Η Προετοιμασία Ανθρώπινών Δεδομένων για Μηχανική Μάθηση είναι Πηγή-Εντατική: Αυτές οι Δύο Προσεγγίσεις είναι Κρίσιμες για τη Μείωση του Κόστους

Từ: Dattaraj Rao, Chief Data Scientist, Persistent Systems
Όπως και με οποιοδήποτε σύστημα που εξαρτάται από εισροές δεδομένων, η Μηχανική Μάθηση (ML) υπόκειται στον αξίωμα του “σκουπίδι-μέσα-σκουπίδι-έξω”. Καθαρά και ακριβώς επισημασμένα δεδομένα είναι η βάση για την κατασκευή οποιουδήποτε μοντέλου ML. Ένα αλγόριθμο εκπαίδευσης ML κατανοεί τα πρότυπα από τα δεδομένα αλήθειας και από εκεί, μαθαίνει τρόπους να γενικεύσει σε μη είδικα δεδομένα. Αν η ποιότητα των δεδομένων εκπαίδευσης είναι χαμηλή, τότε θα είναι πολύ δύσκολο για τον αλγόριθμο ML να συνεχίσει να μαθαίνει και να εξαγάγει.
Σκεφτείτε το σε σχέση με την εκπαίδευση ενός σκύλου. Αν αποτύχετε να εκπαιδεύσετε σωστά τον σκύλο με θεμελιώδεις εντολές συμπεριφοράς (εισροές) ή το κάνετε λανθασμένα/ακριβώς, δεν μπορείτε ποτέ να περιμένετε ο σκύλος να μάθει και να επεκταθεί μέσω παρατήρησης σε πιο σύνθετες θετικές συμπεριφορές επειδή οι υποκείμενες εισροές ήταν απώντες ή ελαττωματικοί από την αρχή. Η σωστή εκπαίδευση είναι χρονοβόρα και ακόμη και δαπανηρή αν φέρετε έναν εμπειρογνώμονα, αλλά η απόδοση είναι μεγάλη αν το κάνετε σωστά από την αρχή.
Όταν εκπαιδεύετε ένα μοντέλο ML, η δημιουργία ποιότητας δεδομένων απαιτεί από έναν εμπειρογνώμονα τομέα να δαπανήσει χρόνο για την επισημάνση των δεδομένων. Αυτό μπορεί να περιλαμβάνει την επιλογή ενός παραθύρου με το επιθυμητό αντικείμενο σε μια εικόνα ή την ανάθεση ενός επισημάνσεως σε μια εγγραφή κειμένου ή μια εγγραφή βάσης δεδομένων. Ιδιαίτερα για μη δομημένα δεδομένα όπως εικόνες, βίντεο και κείμενο, η ποιότητα της επισημάνσεως παίζει σημαντικό ρόλο στη διαμόρφωση της ποιότητας του μοντέλου. Συνήθως, μη επισημασμένα δεδομένα όπως ακατέργαστες εικόνες και κείμενο είναι άφθωνα – αλλά η επισημάνση είναι εκεί όπου η προσπάθεια πρέπει να βελτιωθεί. Αυτό είναι το ανθρώπινο-στο-βρόχο μέρος του κύκλου ζωής της ML και συνήθως είναι το πιο δαπανηρό και εργατοέξοδο μέρος οποιουδήποτε έργου ML.
Εργαλεία επισημάνσεως δεδομένων όπως το Prodigy, το Amazon Sagemaker Ground Truth, το NVIDIA RAPIDS και το DataRobot human-in-the-loop βελτιώνονται συνεχώς σε ποιότητα και παρέχουν διεπαφές για εμπειρογνώμονες τομέα. Ωστόσο, η ελαχιστοποίηση του χρόνου που απαιτείται από τους εμπειρογνώμονες τομέα για την επισημάνση των δεδομένων είναι ακόμη μια σημαντική πρόκληση για τις επιχειρήσεις σήμερα – ιδιαίτερα σε ένα περιβάλλον όπου ο ταλέντο της επιστήμης των δεδομένων είναι περιορισμένος αλλά και σε υψηλή ζήτηση. Αυτό είναι όπου δύο νέες προσεγγίσεις για την προετοιμασία δεδομένων έρχονται σε juego.
Ενεργός Μάθηση
Η ενεργός μάθηση είναι μια μέθοδος όπου ένα μοντέλο ML ζητάει ενεργά από έναν εμπειρογνώμονα τομέα για συγκεκριμένες επισημάνσεις. Εδώ, ο ενδιαφέρον δεν είναι στην απόκτηση μιας πλήρους επισημάνσεως σε μη επισημασμένα δεδομένα, αλλά μόνο στην απόκτηση των σωστών σημείων δεδομένων που επισημαίνονται ώστε το μοντέλο να μάθει καλύτερα. Πάρτε για παράδειγμα την υγεία και τις επιστήμες της ζωής, μια διαγνωστική εταιρεία που ειδικεύεται στην πρώιμη ανίχνευση του καρκίνου για να βοηθήσει τους κλινικούς να λάβουν ενημερωμένες αποφάσεις για την φροντίδα των ασθενών. Κατά τη διάρκεια της διαγνωστικής διαδικασίας, χρειάζονται να επισημάνουν εικόνες σκαναρίσματος CT με όγκους που πρέπει να υπογραμμιστούν.
Μετά το μοντέλο ML να μάθει από μερικές εικόνες με επισημασμένους όγκους, με την ενεργό μάθηση, το μοντέλο θα ζητήσει τους χρήστες να επισημάνουν εικόνες όπου είναι αβέβαιο για την παρουσία ενός όγκου. Αυτά θα είναι σημεία ορίου, τα οποία όταν επισημανθούν θα αυξήσουν την εμπιστοσύνη του μοντέλου. Όπου το μοντέλο είναι βέβαιο πάνω από ένα συγκεκριμένο όριο, θα κάνει μια αυτο-επισημάνση αντί να ζητήσει από τον χρήστη να επισημάνει. Αυτός είναι ο τρόπος με τον οποίο η ενεργός μάθηση προσπαθεί να βοηθήσει στην κατασκευή ακριβών μοντέλων ενώ μειώνει τον χρόνο και την προσπάθεια που απαιτείται για την επισημάνση των δεδομένων. Πλαίσια όπως το modAL μπορούν να βοηθήσουν στην αύξηση της απόδοσης ταξινόμησης με την έξυπνη ερώτηση των εμπειρογνωμόνων τομέα για την επισημάνση των πιο ενημερωτικών περιπτώσεων.
Ασθενής Εποπτεία
Η ασθενής εποπτεία είναι μια προσέγγιση όπου θορυβώδη και ακατάλληλα δεδομένα ή αφηρημένες έννοιες μπορούν να χρησιμοποιηθούν για να παρέχουν ενδείξεις για την επισημάνση ενός μεγάλου όγκου μη επισημασμένων δεδομένων. Αυτή η προσέγγιση συνήθως χρησιμοποιεί ασθενείς επισημαντές και προσπαθεί να συνδυάσει αυτούς σε μια ενόργανη προσέγγιση για να κατασκευάσει ποιότητα επισημασμένων δεδομένων. Η προσπάθεια είναι να προσπαθήσει να ενσωματώσει γνώσεις τομέα σε μια αυτοματοποιημένη δραστηριότητα επισημάνσεως.
Για παράδειγμα, αν ένας Παρόχης Υπηρεσιών Διαδικτύου (ISP) χρειαζόταν ένα σύστημα για να σηματοδοτήσει συνόλους email ως spam ή όχι spam, θα μπορούσαμε να γράψουμε ασθενείς κανόνες όπως το έλεγχο για φράσεις όπως “πρόταση”, “συγχαρητήρια”, “δωρεάν”, κ.λπ., οι οποίες συνήθως συνδέονται με spam email. Άλλοι κανόνες θα μπορούσαν να είναι email από συγκεκριμένα πρότυπα διευθύνσεων που μπορούν να αναζητηθούν με κανονικές εκφράσεις. Αυτοί οι ασθενείς λειτουργοί θα μπορούσαν να συνδυαστούν από ένα πλαίσιο ασθένειας εποπτείας όπως το Snorkel και το Skweak για να κατασκευάσουν βελτιωμένα ποιότητας δεδομένα εκπαίδευσης.
Η ML στην καρδιά της είναι για να βοηθήσει τις εταιρείες να κλιμακώσουν τις διαδικασίες εκпонεντιαλά σε τρόπους που είναι φυσικά αδύνατο να επιτευχθούν με το χέρι. Ωστόσο, η ML δεν είναι μαγεία και εξακολουθεί να εξαρτάται από τους ανθρώπους για να ρυθμίσουν και να εκπαιδεύσουν τα μοντέλα σωστά από την αρχή και να παρέμβουν όταν χρειάζεται για να διασφαλίσουν ότι το μοντέλο δεν γίνεται τόσο στρεβλό που τα αποτελέσματα δεν είναι πλέον χρήσιμα και μπορεί να είναι αντίθετα ή αρνητικά.
Ο στόχος είναι να βρεθούν τρόποι που βοηθούν να ροηματοποιήσουν και να αυτοματοποιήσουν μέρη της ανθρώπινης συμμετοχής για να αυξήσουν τον χρόνο-σε-αγορά και τα αποτελέσματα, αλλά ενώ παραμένουν μέσα στα φράγματα της βέλτιστης ακρίβειας. Είναι παγκοσμίως αποδεκτό ότι η απόκτηση ποιότητας επισημασμένων δεδομένων είναι το πιο δαπανηρό αλλά εξαιρετικά σημαντικό μέρος ενός έργου ML. Αυτό είναι ένα εξελισσόμενο χώρο, και μια πολλή προσπάθεια είναι σε εξέλιξη για να μειώσει τον χρόνο που δαπανώνται από τους εμπειρογνώμονες τομέα και να βελτιώσει την ποιότητα των επισημασμένων δεδομένων. Η εξερεύνηση και η αξιοποίηση της ενεργού μάθησης και της ασθένειας εποπτείας είναι μια στερεή στρατηγική για την επίτευξη αυτού σε πολλές βιομηχανίες και περιπτώσεις.












