Η γωνία του Anderson
Δημιουργία ενός Μοντέλου Γλώσσας Τύπου GPT για Μια Μονάδικη Ερώτηση

Ερευνητές από την Κίνα έχουν αναπτύξει μια οικονομική μέθοδο για τη δημιουργία συστημάτων επεξεργασίας φυσικής γλώσσας τύπου GPT-3, αποφεύγοντας το ολοένα και πιο δαπανηρό χρόνο και χρήμα που εμπλέκεται στη đào tạo μεγάλων συνόλων δεδομένων – μια αυξανόμενη τάση που αλλιώς απειλεί να αναθέσει τελικά αυτόν τον τομέα του AI σε εταιρείες FAANG και υψηλού επιπέδου επενδυτές.
Το προτεινόμενο πλαίσιο ονομάζεται Task-Driven Language Modeling (TLM). Αντί να εκπαιδεύσετε ένα τεράστιο και σύνθετο μοντέλο σε ένα τεράστιο σώμα δισεκατομμυρίων λέξεων και χιλιάδων ετικετών και κατηγοριών, το TLM εκπαιδεύει ένα πολύ μικρότερο μοντέλο που ενσωματώνει πραγματικά μια ερώτηση μέσα στο μοντέλο.

Αριστερά, μια τυπική προσέγγιση υψηλής κλίμακας για μοντέλα γλώσσας μεγάλου όγκου· δεξιά, η μεθοδος TLM για να εξερευνήσετε ένα μεγάλο σώμα γλώσσας με βάση το θέμα ή την ερώτηση. Source: https://arxiv.org/pdf/2111.04130.pdf
Επίδραση, ένας μοναδικός αλγόριθμος NLP ή μοντέλο παράγεται για να απαντήσει σε μια einz ερώτηση, αντί να δημιουργήσετε ένα τεράστιο και άκαμπτο γενικό μοντέλο γλώσσας που μπορεί να απαντήσει σε μια ευρύτερη ποικιλία ερωτήσεων.
Σε δοκιμές του TLM, οι ερευνητές βρήκαν ότι η νέα προσέγγιση επιτυγχάνει αποτελέσματα που είναι παρόμοια ή καλύτερα από τα προ-εκπαιδευμένα μοντέλα γλώσσας όπως το RoBERTa-Large, και τα υπερ-κλίμακας συστήματα NLP όπως το GPT-3 της OpenAI, το TRILLION Parameter Switch Transformer Μοντέλο της Google, το HyperClover της Ναβερ, το Jurassic 1 των AI21 Labs, και το Megatron-Turing NLG 530B της Microsoft.
Σε δοκιμές του TLM σε οκτώ κατηγορίες κατάταξης σε τέσσερις τομείς, οι συγγραφείς βρήκαν επίσης ότι το σύστημα μειώνει τις απαιτούμενες FLOPs (πλωτές оперαcίες ανά δευτερόλεπτο) κατά δύο τάξεις μεγέθους. Οι ερευνητές ελπίζουν ότι το TLM μπορεί να ‘δημοκρατίσει’ einen τομέα που γίνεται ολοένα και πιο ελίτ, με μοντέλα NLP τόσο μεγάλα που δεν μπορούν να εγκατασταθούν πραγματικά τοπικά, και αντίθετα, στην περίπτωση του GPT-3, πίσω από τις ακριβές και περιορισμένες APIs της OpenAI και, τώρα, Microsoft Azure.
Οι συγγραφείς αναφέρουν ότι η μείωση του χρόνου εκπαίδευσης κατά δύο τάξεις μεγέθους μειώνει το κόστος εκπαίδευσης σε 1.000 GPU για μια μέρα σε ένα απλό 8 GPU για 48 ώρες.
Η νέα αναφορά έχει τον τίτλο NLP From Scratch Without Large-Scale Pretraining: A Simple and Efficient Framework, και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο Tsinghua στην Πεκίνο, και einen ερευνητή από την Κινεζική εταιρεία ανάπτυξης AI, Recurrent AI, Inc.
Απάντηση που δεν είναι οικονομικά βιώσιμη
Το κόστος της εκπαίδευσης αποτελεσματικών, γενικών μοντέλων γλώσσας γίνεται ολοένα και πιο χαρακτηρισμένο ως ένας πιθανός ‘θερμικός περιορισμός’ στο βαθμό με τον οποίο η αποτελεσματική και ακριβής επεξεργασία φυσικής γλώσσας μπορεί πραγματικά να διαχυθεί στην κουλτούρα.

Στατιστικά στοιχεία για την αύξηση των πτυχών στις αρχιτεκτονικές μοντέλων NLP, από μια αναφορά του 2020 από την A121 Labs. Source: https://arxiv.org/pdf/2004.08900.pdf
Το 2019, ένας ερευνητής υπολόγισε ότι το κόστος για την εκπαίδευση του XLNet μοντέλου (αναφερόμενο ως το καλύτερο μοντέλο NLP εκείνη την εποχή) ήταν 61.440 δολάρια ΗΠΑ για 2,5 μέρες σε 512 πυρήνες σε 64 συσκευές, ενώ το GPT-3 εκτιμάται να κόστισε 12 εκατομμύρια δολάρια για την εκπαίδευση – 200 φορές το κόστος της εκπαίδευσης του προκατόχου του, GPT-2 (αν και πρόσφατες εκτιμήσεις ισχυρίζονται ότι θα μπορούσε να εκπαιδευτεί τώρα για ένα απλό 4.600.000 δολάρια στις χαμηλότερες τιμές GPU).
Υποσύνολα Δεδομένων με βάση τις Ανάγκες Ερωτήσεων
Αντίθετα, η νέα προτεινόμενη αρχιτεκτονική αναζητά να εξαγάγει ακριβείς ταξινομήσεις, ετικέτες και γενίκευση χρησιμοποιώντας μια ερώτηση ως ένα είδος φίλτρου για να ορίσει ένα υποσύνολο πληροφοριών από μια μεγάλη βάση δεδομένων γλώσσας που θα εκπαιδευτεί, μαζί με την ερώτηση, για να παρέχει απαντήσεις σε ένα περιορισμένο θέμα.
Οι συγγραφείς αναφέρουν:
‘Το TLM είναι мотивировано από δύο κλειδιά ιδέες. Πρώτα, οι άνθρωποι κατακτώνται μια εργασία χρησιμοποιώντας μόνο μια μικρή ποσότητα γνώσεων του κόσμου (π.χ. οι μαθητές χρειάζονται μόνο να αναθεωρήσουν quelques κεφάλαια, μεταξύ όλων των βιβλίων στον κόσμο, για να κάνουν εξέταση).
‘Υποθέτουμε ότι υπάρχει πολλή επανάληψη στο μεγάλο σώμα για μια συγκεκριμένη εργασία. Δεύτερον, η εκπαίδευση σε εποπτευόμενα δεδομένα με ετικέτες είναι πολύ πιο αποτελεσματική για την απόδοση του κατωτέρω επιπέδου από την βελτιστοποίηση του στόχου μοντέλου γλώσσας σε αμεταχείριστα δεδομένα. Με βάση αυτές τις мотивές, το TLM χρησιμοποιεί τα δεδομένα της εργασίας ως ερωτήσεις για να ανακτήσει ένα μικρό υποσύνολο του γενικού σώματος. Αυτό ακολουθείται από την κοινή βελτιστοποίηση eines εποπτευόμενου στόχου εργασίας και ενός στόχου μοντέλου γλώσσας χρησιμοποιώντας cả τα ανακτημένα δεδομένα και τα δεδομένα της εργασίας.’
Εκτός από το να κάνει την αποτελεσματική εκπαίδευση μοντέλων NLP οικονομικά βιώσιμη, οι συγγραφείς βλέπουν πολλά πλεονεκτήματα στη χρήση μοντέλων NLP που οδηγούνται από εργασίες. Για παράδειγμα, οι ερευνητές μπορούν να απολαύσουν μεγαλύτερη ευελιξία, με προσαρμοσμένες στρατηγικές για το μήκος ακολουθίας, τον τομεασμό, την επιλογή υπερπαραμέτρων και τις αναπαραστάσεις δεδομένων.
Οι ερευνητές προβλέπουν επίσης την ανάπτυξη υβριδικών μελλοντικών συστημάτων που ανταλλάσσουν την περιορισμένη προ-εκπαίδευση ενός PLM (η οποία δεν προβλέπεται στην τρέχουσα υλοποίηση) με μεγαλύτερη ευελιξία και γενίκευση έναντι χρόνων εκπαίδευσης. Θεωρούν το σύστημα ως ένα βήμα προς την πρόοδο των μεθόδων γενίκευσης zero-shot εντός του τομέα.
Δοκιμές και Αποτελέσματα
Το TLM δοκιμάστηκε σε προκλήσεις κατάταξης σε οκτώ εργασίες σε τέσσερις τομείς – βιοϊατρική επιστήμη, ειδήσεις, κριτικές και επιστήμη υπολογιστών. Οι εργασίες χωρίστηκαν σε κατηγορίες υψηλής και χαμηλής πόρων. Οι εργασίες υψηλής πόρων περιελάμβαναν πάνω από 5.000 δεδομένα εργασίας, όπως AGNews και RCT, μεταξύ άλλων· οι εργασίες χαμηλής πόρων περιελάμβαναν ChemProt και ACL-ARC, καθώς και το HyperPartisan dataset ανίχνευσης ειδήσεων.
Οι ερευνητές ανέπτυξαν δύο συνόλα εκπαίδευσης με τίτλο Corpus-BERT και Corpus-RoBERTa, το δεύτερο δέκα φορές μεγαλύτερο από το πρώτο. Οι πειραματικές δοκιμές σύγκριναν τα γενικά προ-εκπαιδευμένα μοντέλα γλώσσας BERT (από την Google) και RoBERTA (από την Facebook ) με τη νέα αρχιτεκτονική.
Το έγγραφο παρατηρεί ότι mặc dù το TLM είναι μια γενική μέθοδος, και θα πρέπει να είναι πιο περιορισμένη σε εύρος και εφαρμογή από τα ευρύτερα και υψηλότερα μοντέλα κράτους-of-the-τέχνη, είναι σε θέση να εκτελέσει κοντά σε μεθόδους fine-tuning εντός του τομέα.

Αποτελέσματα από τη σύγκριση της απόδοσης του TLM με τα σύνολα BERT και RoBERTa. Τα αποτελέσματα περιλαμβάνουν τον μέσο όρο F1 score σε τρεις διαφορετικές κλίμακες εκπαίδευσης, και τον αριθμό παραμέτρων, τον συνολικό υπολογισμό εκπαίδευσης (FLOPs) και το μέγεθος του συνόλου εκπαίδευσης.
Οι συγγραφείς καταλήγουν στο συμπέρασμα ότι το TLM είναι ικανό να επιτύχει αποτελέσματα που είναι συγκρίσιμα ή καλύτερα από τα PLMs, με μια σημαντική μείωση στις FLOPs που απαιτούνται, και απαιτώντας μόνο 1/16 της μεγέθους του συνόλου εκπαίδευσης. Σε μεσαίες και μεγάλες κλίμακες, το TLM φαίνεται να βελτιώνει την απόδοση κατά 0,59 και 0,24 πόντους κατά μέσο όρο, ενώ μειώνει το μέγεθος του συνόλου εκπαίδευσης κατά δύο τάξεις μεγέθους.
‘Αυτά τα αποτελέσματα επιβεβαιώνουν ότι το TLM είναι υψηλά ακριβές και πολύ πιο αποτελεσματικό από τα PLMs. Επιπλέον, το TLM κερδίζει περισσότερα πλεονεκτήματα στην αποτελεσματικότητα σε μεγαλύτερη κλίμακα. Αυτό υποδηλώνει ότι τα μεγαλύτερα PLMs μπορεί να έχουν εκπαιδευτεί για να αποθηκεύσουν περισσότερες γενικές γνώσεις που δεν είναι χρήσιμες για μια συγκεκριμένη εργασία.’












