Η γωνία του Anderson
Γιατί η Ιστορική Γλώσσα είναι μια Πρόκληση για την Τεχνητή Νοημοσύνη
Μια από τις κεντρικές προκλήσεις των συστημάτων Επεξεργασίας Φυσικής Γλώσσας (NLP) είναι να εξαγάγουν τις βασικές πληροφορίες από μια μεγάλη ποικιλία γραπτών υλικών. Οι συμβαλλόμενες πηγές για ένα σύνολο δεδομένων εκπαίδευσης για einen νέο αλγόριθμο NLP θα μπορούσαν να είναι τόσο γλωσσικά διαφορετικές όσο το Twitter, οι εφημερίδες και τα επιστημονικά περιοδικά, με όλες τις ιδιαιτερότητες που είναι μοναδικές σε κάθε μία από αυτές τις τρεις πηγές.
Στις περισσότερες περιπτώσεις, αυτό ισχύει μόνο για τα αγγλικά και μόνο για τρέχουσες ή πρόσφατες πηγές κειμένου. Όταν ένας αλγόριθμος NLP πρέπει να εξετάσει υλικό που προέρχεται από πολλές εποχές, συνήθως δυσκολεύεται να συμφιλιώσει τους πολύ διαφορετικούς τρόπους με τους οποίους οι άνθρωποι μιλάουν ή γράφουν σε εθνικές και υποεθνικές κοινότητες, και ιδιαίτερα σε διαφορετικές περιόδους της ιστορίας.
Ωστόσο, η χρήση κειμένων (όπως ιστορικών πραγματειών και αρχαίων επιστημονικών έργων) που διαρκούν εποχές είναι ένας潜 enικός τρόπος για τη δημιουργία μιας ιστορικής επισκόπησης ενός θέματος και για τη διαμόρφωση στατιστικών χρονολογικών ανακατασκευών που προηγούνται της υιοθέτησης και διατήρησης μετρικών για einen τομέα.
Για παράδειγμα, οι πληροφορίες καιρός που συμβάλλουν στα προγνωστικά μοντέλα αλλαγής του κλίματος δεν καταγράφηκαν επαρκώς σε όλο τον κόσμο μέχρι το 1880, ενώ η εξόρυξη κλασικών κειμένων παρέχει παλαιότερες εγγραφές σημαντικών μετεωρολογικών συμβάντων που μπορεί να είναι χρήσιμες για την παροχή προ-βικτωριανών δεδομένων καιρού.
Χρονική Ανταπόκριση
Μια νέα εργασία από το Πανεπιστήμιο του Ουάσινγκτον και το Ινστιτούτο Allen για την Τεχνητή Νοημοσύνη έχει βρει ότι ακόμη και ένα τόσο σύντομο χρονικό διάστημα όσο πέντε χρόνια μπορεί να προκαλέσει χρονική ανταπόκριση η οποία μπορεί να καταστήσει άχρηστο ένα προ-εκπαιδευμένο μοντέλο NLP.

Σε όλες τις περιπτώσεις, οι υψηλότερες βαθμολογίες είναι καλύτερες. Εδώ βλέπουμε einen χάρτη θερμότητας της χρονικής υποβάθμισης σε τέσσερις συλλογές κειμένων που καλύπτουν einen χρονικό διάστημα πέντε ετών. Τέτοιες αναπαραστάσεις μεταξύ των δεδομένων εκπαίδευσης και αξιολόγησης, σύμφωνα με τους συγγραφείς της νέας εργασίας, μπορούν να προκαλέσουν ‘μεγάλη πτώση της απόδοσης’. Πηγή: https://arxiv.org/pdf/2111.07408.pdf
Η εργασία αναφέρει:
‘Βρήκαμε ότι η χρονική ανταπόκριση επηρεάζει τόσο την γενίκευση του μοντέλου γλώσσας όσο και την απόδοση της εργασίας. Βρήκαμε σημαντική ποικιλία στη υποβάθμιση σε διάφορες περιοχές κειμένου και εργασίες. Σε διάστημα πέντε ετών, οι ταξινομητές F1 μπορούν να επιδείξουν υποβάθμιση έως και 40 βαθμούς (πολιτική προσχώρηση στο Twitter) ή έως και 1 βαθμό (βαθμολογίες αναθεωρήσεων Yelp). Δύο διαφορετικές εργασίες που ορίζονται στην ίδια περιοχή μπορούν να δείξουν διαφορετικά επίπεδα υποβάθμισης με την πάροδο του χρόνου.’
Ανίσοες Διαιρέσεις
Το βασικό πρόβλημα είναι ότι τα σύνολα δεδομένων εκπαίδευσης γενικά διαιρούνται σε δύο ομάδες, đôi khi σε ένα αρκετά ανισόβαρο αναλογία 80/20, λόγω της περιορισμένης διαθεσιμότητας δεδομένων. Η μεγαλύτερη ομάδα δεδομένων εκπαιδεύεται σε einen νευρωνικό ιστό, ενώ τα υπόλοιπα δεδομένα χρησιμοποιούνται ως ομάδα ελέγχου για να δοκιμαστεί η ακρίβεια του αποτελέσματος του αλγορίθμου.
Σε μεικτά σύνολα δεδομένων που περιέχουν υλικό που καλύπτει πολλά χρόνια, μια ανίσοη διανομή δεδομένων από διάφορες περιόδους μπορεί να σημαίνει ότι τα δεδομένα αξιολόγησης είναι ακατάλληλα συνθέτημένα από υλικό από μια συγκεκριμένη εποχή.
Αυτό θα προκαλέσει την αδυναμία του να είναι ένας καλός χώρος δοκιμών για ένα μοντέλο που έχει εκπαιδευτεί σε ένα πιο διαφοροποιημένο μείγμα εποχών (δηλαδή σε περισσότερα από τα διαθέσιμα δεδομένα). Στην πραγματικότητα, ανάλογα με το αν η μειοψηφία των δεδομένων αξιολόγησης υπερεκπροσωπεί νεότερο ή παλαιότερο υλικό, είναι σαν να ζητάτε από τον παππού σας να βαθμολογήσει τους τελευταίους K-Pop idols.
Η μακρά λύση θα ήταν να εκπαιδεύσετε πολλά μοντέλα σε πολύ πιο χρονικά περιορισμένα σύνολα δεδομένων και να προσπαθήσετε να συλλέξετε συμβατά χαρακτηριστικά από τα αποτελέσματα κάθε μοντέλου. Ωστόσο, τυχαία αρχικοποίηση μοντέλου μόνο σημαίνει ότι αυτή η προσέγγιση αντιμετωπίζει το δικό της σύνολο προβλημάτων για την επίτευξη ισότητας και δικαιοσύνης μεταξύ των μοντέλων – ακόμη και πριν να ληφθεί υπόψη εάν τα πολλαπλά σύνολα δεδομένων ήταν αρκετά παρόμοια μεταξύ τους για να κάνουν την πείραμα ενδιαφέρον.
Δεδομένα και Εκπαίδευση
Για να αξιολογήσουν την χρονική ανταπόκριση, οι συγγραφείς εκπαίδευσαν τέσσερις συλλογές κειμένων σε τέσσερις περιοχές:
Twitter
…όπου συλλέγαν ανετιμημένα δεδομένα με την εξαγωγή ενός τυχαίου δείγματος 12 εκατομμυρίων tweets ομοιόμορφα κατανεμημένων μεταξύ 2015-2020, όπου μελέτησαν ονομασμένα αντικείμενα (δηλαδή άτομα και οργανισμούς) και πολιτικές προσχωρήσεις.
Επιστημονικά Άρθρα
…όπου οι συγγραφείς απέκτησαν ανετιμημένα δεδομένα από το Σημασιολογικό Ερευνητή, αποτελούμενο από 650.000 έγγραφα που καλύπτουν einen χρονικό διάστημα 30 ετών, και στα οποία μελέτησαν την ταξινόμηση τύπου αναφοράς (SciERC) και την ταξινόμηση του χώρου AI (AIC, η οποία διακρίνει εάν ένα έγγραφο δημοσιεύθηκε στο AAAI ή στο ICML).
Άρθρα Ειδήσεων
…όπου οι συγγραφείς χρησιμοποίησαν εννέα εκατομμύρια άρθρα από το Σύνολο Δεδομένων Ειδήσεων που καλύπτουν einen χρονικό διάστημα 2009-2016, στα οποία εκτέλεσαν τρεις εργασίες: σύνοψη ειδήσεων, ταξινόμηση εκδότη και ταξινόμηση πλαισίων μέσων ενημέρωσης (MFC), η οποία τελευταία εργασία εξετάζει την αντίληψη της προτεραιότητας των διαφόρων θεμάτων στα μέσα ενημέρωσης.
Κριτικές Τροφίμων
…όπου οι ερευνητές χρησιμοποίησαν το Ανοιχτό Σύνολο Δεδομένων Yelp σε μια εργασία: ταξινόμηση βαθμολογίας κριτικής (YELPCLS), μια παραδοσιακή πρόκληση ανάλυσης συναισθήματος τυπική πολλών ερευνών NLP σε αυτόν τον τομέα.
Αποτελέσματα
Τα μοντέλα αξιολογήθηκαν σε GPT-2, με μια σειρά από αποτελέσματα F1 scores. Οι συγγραφείς βρήκαν ότι η απώλεια απόδοσης από την χρονική ανταπόκριση είναι διπλής κατεύθυνσης, που σημαίνει ότι τα μοντέλα που εκπαιδεύονται σε πρόσφατα δεδομένα μπορούν να επηρεαστούν αρνητικά από την επιρροή παλαιότερων δεδομένων, και αντίστροφα (δείτε την εικόνα στην αρχή του άρθρου για γραφικά). Οι συγγραφείς σημειώνουν ότι αυτό έχει ιδιαίτερες επιπτώσεις για τις εφαρμογές των κοινωνικών επιστημών.
Γενικά, τα αποτελέσματα δείχνουν ότι η χρονική ανταπόκριση υποβαθμίζει την απόδοση ‘ουσιαστικά’, και έχει μια ευρεία επίδραση στις περισσότερες εργασίες. Τα σύνολα δεδομένων που καλύπτουν πολύ μακρές περιόδους, όπως δεκαετίες, φυσικά εντείνουν το πρόβλημα.
Οι συγγραφείς παρατηρούν επίσης ότι η χρονική ανταπόκριση επηρεάζει τόσο τα ετικεταρισμένα όσο και τα ανετιμημένα δεδομένα προ-εκπαίδευσης. Επιπλέον, οι προσπάθειές τους να μετριάσουν τις επιπτώσεις μέσω της προσαρμογής τομέα (δείτε παρακάτω) δεν βελτίωσαν σημαντικά την κατάσταση, αν και ισχυρίζονται ότι η λεπτομέρεια των δεδομένων στη βάση δεδομένων μπορεί να βοηθήσει μέχρι certo βαθμό.
Συμπέρασμα
Οι ερευνητές επιβεβαιώνουν προηγούμενες ευρήματα ότι προηγούμενες λύσεις που αφορούν προσαρμογή τομέα (DAPT, όπου γίνεται πρόνοια για την διαφορά δεδομένων) και χρονική προσαρμογή (όπου τα δεδομένα επιλέγονται ανά χρονική περίοδο) δεν κάνουν πολλά για να ανακουφίσουν το πρόβλημα.
Το άρθρο καταλήγει*:
‘Οι πειραματικές μας μελέτες αποκάλυψαν σημαντική ποικιλία στη χρονική υποβάθμιση σε διάφορες εργασίες, περισσότερο από ό,τι βρέθηκε σε προηγούμενες μελέτες. Αυτά τα ευρήματα μας κάνουν να συνεχίσουμε την μελέτη της χρονικής ανταπόκρισης σε διάφορες εφαρμογές της NLP, την εξέταση της σε αξιολογήσεις αναφοράς, και την επιτήρηση από parte των πρακτικών που μπορούν να παρακολουθούν την απόδοση του συστήματος με την πάροδο του χρόνου.
‘Ιδιαίτερα, παρατηρήσαμε ότι η συνεχής εκπαίδευση των ΛΜ σε χρονικά συγχρονισμένα δεδομένα δεν έχει μεγάλη επίδραση, μας κάνει να συνεχίσουμε την έρευνα για την εύρεση αποτελεσματικών μεθόδων χρονικής προσαρμογής που είναι λιγότερο δαπανηρές από τη συνεχής συλλογή ετικεταρισμένων/εμπλουτισμένων συνόλων δεδομένων με την πάροδο του χρόνου.’
Οι συγγραφείς προτείνουν ότι η περαιτέρω διερεύνηση της συνεχούς μάθησης, όπου τα δεδομένα ενημερώνονται συνεχώς, μπορεί να είναι χρήσιμη σε αυτόν τον τομέα, και ότι η ανίχνευση μεταβολών και άλλες μεθόδους ανίχνευσης μεταβολών στη εργασία θα μπορούσαν να είναι ένα χρήσιμο βοήθημα για την ενημέρωση των συνόλων δεδομένων.
* Η μετατροπή μου των εσωτερικών αναφορών σε υπερσύνδεσμους.












