Μοντέλα και πλατφόρμες AI
Δεδομένο-Βάσει Μεγάλων Γλωσσικών Μοντέλων: Ένας Ολοκληρωμένος Οδηγός
Μεγάλα Γλωσσικά Μοντέλα (LLMs) έχουν επαναπροσδιορίσει το πεδίο της επεξεργασίας φυσικής γλώσσας (NLP) με την επίδειξη εξαιρετικών ικανοτήτων στην παραγωγή ανθρώπινου τύπου κειμένου, την απάντηση ερωτημάτων και την βοήθεια σε eine ευρεία γκάμα γλωσσικών εργασιών. Στο κέντρο αυτών των ισχυρών μοντέλων βρίσκεται η αρχιτεκτονική μετατροπέα μόνο αποκωδικοποιητή, μια παραλλαγή της αρχικής αρχιτεκτονικής μετατροπέα που προτάθηκε στο σεμινάριο “Η Προσοχή είναι Όλα που Χρειάζεστε” από τους Vaswani κ.ά.
Σε αυτόν τον ολοκληρωμένο οδηγό, θα εξερευνήσουμε τις εσωτερικές λειτουργίες των LLMs βάσει αποκωδικοποιητή, εμβαθύνοντας στα θεμελιώδη δομικά στοιχεία, τις αρχιτεκτονικές καινοτομίες και τις λεπτομέρειες υλοποίησης που έχουν ωθήσει αυτά τα μοντέλα στο επίκεντρο της έρευνας και των εφαρμογών NLP.
Η Αρχιτεκτονική του Μετατροπέα: Μια Ανασκόπηση
Πριν εμβαθύνουμε στις ιδιαιτερότητες των LLMs βάσει αποκωδικοποιητή, είναι απαραίτητο να επανεξετάσουμε την αρχιτεκτονική του μετατροπέα, την οποία αποτελούν αυτά τα μοντέλα. Ο μετατροπέας εισήγαγε μια νέα προσέγγιση για το μοντέλο ακολουθίας, βασισμένη αποκλειστικά σε μηχανισμούς προσοχής για την καταγραφή μακροπρόθεσμων εξαρτήσεων στα δεδομένα, χωρίς την ανάγκη για αναδρομικές ή συναγωγικές στρώσεις.
Η αρχική αρχιτεκτονική του μετατροπέα αποτελείται από δύο κύρια компоненты: έναν κωδικοποιητή και έναν αποκωδικοποιητή. Ο κωδικοποιητής επεξεργάζεται την εισαγωγική ακολουθία και παράγει μια περιεκτική αναπαράσταση, η οποία στη συνέχεια καταναλώνεται από τον αποκωδικοποιητή για να παράγει την εξαγωγική ακολουθία. Αυτή η αρχιτεκτονική αρχικά σχεδιάστηκε για εργασίες μετάφρασης μηχανής, όπου ο κωδικοποιητής επεξεργάζεται την εισαγωγική πρόταση στην πηγή γλώσσα και ο αποκωδικοποιητής παράγει την αντίστοιχη πρόταση στη γλώσσα προορισμού.
Αυτο-Προσοχή: Το Κλειδί για την Επιτυχία του Μετατροπέα
Στην καρδιά του μετατροπέα βρίσκεται ο μηχανισμός αυτο-προσοχής, μια ισχυρή τεχνική που επιτρέπει στο μοντέλο να ζυγίζει και να συναθροίζει πληροφορίες από διαφορετικές θέσεις στην εισαγωγική ακολουθία. Σε αντίθεση με τα παραδοσιακά μοντέλα ακολουθίας, τα οποία επεξεργάζονται τα εισαγωγικά σύμβολα σειριακά, η αυτο-προσοχή επιτρέπει στο μοντέλο να καταγράψει εξαρτήσεις μεταξύ οποιωνδήποτε δύο συμβόλων, ανεξάρτητα από τη θέση τους στην ακολουθία.
Η αυτο-προσοχή μπορεί να χωριστεί σε τρία κύρια βήματα:
- Ερωτήσεις, Κλειδιά και Τιμές Προβολών: Η εισαγωγική ακολουθία προβάλλεται σε τρεις ξεχωριστές αναπαραστάσεις: ερωτήσεις (Q), κλειδιά (K) και τιμές (V). Αυτές οι προβολές λαμβάνονται με τη مضίωση της εισαγωγής με μετεπεξεργασμένα βάρη.
- Υπολογισμός Σκορ Προσοχής: Για κάθε θέση στην εισαγωγική ακολουθία, υπολογίζονται σκορ προσοχής λαμβάνοντας το εσωτερικό γινόμενο μεταξύ του αντίστοιχου διανύσματος ερωτήσεων και όλων των διανυσμάτων κλειδιών. Αυτά τα σκορ αντιπροσωπεύουν τη σχετικότητα κάθε θέσης με τη θέση που επεξεργάζεται.
- Βαρυτομετρική Σύνοψη Τιμών: Τα σκορ προσοχής κανονικοποιούνται χρησιμοποιώντας μια σοφτ-μαξ συνάρτηση και τα απανθισμένα βάρη προσοχής χρησιμοποιούνται για να υπολογίσουν μια βαρυτομετρική σύνοψη των διανυσμάτων τιμών, παράγοντας την εξαγωγική αναπαράσταση για την τρέχουσα θέση.
Η πολυ-ερώτηση προσοχής, μια παραλλαγή του μηχανισμού αυτο-προσοχής, επιτρέπει στο μοντέλο να καταγράψει διαφορετικά είδη σχέσεων υπολογίζοντας σκορ προσοχής σε πολλαπλά “κεφάλια” παράλληλα, το καθένα με τη δική του σειρά ερωτήσεων, κλειδιών και τιμών.
Παραλλαγές και Ρυθμίσεις Αρχιτεκτονικής
Ενώ οι βασικές αρχές των LLMs βάσει αποκωδικοποιητή παραμένουν σταθερές, οι ερευνητές έχουν εξερευνήσει διάφορες παραλλαγές και ρυθμίσεις αρχιτεκτονικής για να βελτιώσουν την απόδοση, την αποτελεσματικότητα και τις ικανότητες γενίκευσης. Σε αυτή την ενότητα, θα εμβαθύνουμε στις διαφορετικές αρχιτεκτονικές επιλογές και τις επιπτώσεις τους.
Τύποι Αρχιτεκτονικής
Τα LLMs βάσει αποκωδικοποιητή μπορούν να ταξινομηθούν σε τρεις κύριους τύπους: κωδικοποιητής-αποκωδικοποιητής, αιτιολογικός αποκωδικοποιητής και προθέμα αποκωδικοποιητή. Κάθε τύπος αρχιτεκτονικής παρουσιάζει διαφορετικά πρότυπα προσοχής.
Αρχιτεκτονική Κωδικοποιητή-Αποκωδικοποιητή
Βασισμένη στο μοντέλο μετατροπέα, η αρχιτεκτονική κωδικοποιητή-αποκωδικοποιητή αποτελείται από δύο στοίβες: έναν κωδικοποιητή και έναν αποκωδικοποιητή. Ο κωδικοποιητής χρησιμοποιεί στοιβάζοντες στρώσεις αυτο-προσοχής για να κωδικοποιήσει την εισαγωγική ακολουθία και να παράγει μια περιεκτική αναπαράσταση. Ο αποκωδικοποιητής στη συνέχεια thựcεί δια-προσοχή σε αυτές τις αναπαραστάσεις για να παράγει την εξαγωγική ακολουθία. Αν και αποτελεσματική σε διάφορες εργασίες NLP, λίγα LLMs, όπως το Flan-T5, υιοθετούν αυτή την αρχιτεκτονική.
Αρχιτεκτονική Αιτιολογικού Αποκωδικοποιητή
Η αρχιτεκτονική αιτιολογικού αποκωδικοποιητή ενσωματώνει μια μονοκατευθυντική μάσκα προσοχής, επιτρέποντας σε κάθε εισαγωγικό σύμβολο να προσεγγίσει μόνο τα προηγούμενα σύμβολα και τον εαυτό του. Τα εισαγωγικά και εξαγωγικά σύμβολα επεξεργάζονται εντός του ίδιου αποκωδικοποιητή. Ιδιαίτερα μοντέλα όπως το GPT-1, GPT-2 και GPT-3 βασίζονται σε αυτή την αρχιτεκτονική, με το GPT-3 να παρουσιάζει αξιοσημείωτες ικανότητες μάθησης εντός του контекστού.
Αρχιτεκτονική Προθέματος Αποκωδικοποιητή
Γνωστή και ως μη-αιτιολογική αποκωδικοποιητής, η αρχιτεκτονική προθέματος αποκωδικοποιητή τροποποιεί τον μηχανισμό μάσκας της αιτιολογικής αποκωδικοποιητή για να επιτρέψει διμετρική προσοχή στα σύμβολα προθέματος και μονοκατευθυντική προσοχή στα γεννημένα σύμβολα. Όπως και η αρχιτεκτονική κωδικοποιητή-αποκωδικοποιητή, οι αποκωδικοποιητές προθέματος μπορούν να κωδικοποιήσουν τη σειρά προθέματος διμετρικά και να προβλέψουν τα εξαγωγικά σύμβολα αυτο-αναδρομικά χρησιμοποιώντας κοινά παραμετρικά.
Όλοι οι τρεις τύποι αρχιτεκτονικής μπορούν να επεκταθούν χρησιμοποιώντας την τεχνική μείγμα εμπειρογνωμόνων (MoE), η οποία σπανίως ενεργοποιεί ένα υποσύνολο των νευρωνικών δικτύων για κάθε εισαγωγή. Αυτή η προσέγγιση έχει υιοθετηθεί σε μοντέλα όπως το Switch Transformer και το GLaM, με αύξηση του αριθμού των εμπειρογνωμόνων ή του συνολικού μεγέθους παραμέτρων, που δείχνει σημαντικές βελτιώσεις απόδοσης.
Αποκωδικοποιητής-Μόνο Μετατροπέας: Εμπράθνηση της Αυτο-Αναδρομικής Φύσης
Ενώ η αρχική αρχιτεκτονική του μετατροπέα σχεδιάστηκε για εργασίες ακολουθίας-προς-ακολουθία, όπως η μετάφραση μηχανής, πολλές εργασίες NLP, όπως η μοντελοποίηση γλώσσας και η γεννήτρια κειμένου, μπορούν να διατυπωθούν ως αυτο-αναδρομικά προβλήματα, όπου το μοντέλο παράγει ένα σύμβολο κάθε φορά, υπό την προϋπόθεση των προηγουμένως γεννημένων συμβόλων.
Εισάγεται ο αποκωδικοποιητής-μόνο μετατροπέας, μια απλοποιημένη παραλλαγή της αρχιτεκτονικής του μετατροπέα που διατηρεί μόνο τον αποκωδικοποιητή. Αυτή η αρχιτεκτονική είναι ιδιαίτερα κατάλληλη για αυτο-αναδρομικές εργασίες, καθώς παράγει εξαγωγικά σύμβολα ένα-ένα, εκμεταλλευόμενο τα προηγουμένως γεννημένα σύμβολα ως εισαγωγικό контέκστ.
Αρχιτεκτονικά Στοιχεία των LLMs Βάσει Αποκωδικοποιητή
Ενώ οι βασικές αρχές της αυτο-προσοχής και της μασκαρωμένης αυτο-προσοχής παραμένουν οι ίδιες, τα σύγχρονα LLMs βάσει αποκωδικοποιητή έχουν εισαγάγει διάφορες αρχιτεκτονικές καινοτομίες για να βελτιώσουν την απόδοση, την αποτελεσματικότητα και τις ικανότητες γενίκευσης. Ας εξερευνήσουμε ορισμένα από τα βασικά στοιχεία και τις τεχνικές που χρησιμοποιούνται στα μοντέλα LLMs.
Αναπαράσταση Εισαγωγής
Πριν επεξεργαστεί την εισαγωγική ακολουθία, τα LLMs βάσει αποκωδικοποιητή χρησιμοποιούν τεχνικές τοκενοποίησης και ενσωμάτωσης για να μετατρέψουν το ακατέργαστο κείμενο σε μια αριθμητική αναπαράσταση που είναι κατάλληλη για το μοντέλο.
Τοκενοποίηση: Η διαδικασία τοκενοποίησης μετατρέπει το εισαγωγικό κείμενο σε μια ακολουθία συμβόλων, τα οποία μπορούν να είναι λέξεις, υπο-λέξεις ή ακόμη και μεμονωμένα γράμματα, ανάλογα με την στρατηγική τοκενοποίησης που χρησιμοποιείται. Δημοφιλείς τεχνικές τοκενοποίησης για LLMs περιλαμβάνουν την κωδικοποίηση Byte-Pair (BPE), SentencePiece και WordPiece. Αυτές οι μεθόδοι αποσκοπούν να ισορροπήσουν το μέγεθος του λεξικού και τη λεπτομέρεια της αναπαράστασης, επιτρέποντας στο μοντέλο να χειρίζεται σπάνια ή εκτός-λεξικού λέξεις αποτελεσματικά.
Ενσωμάτωση Συμβόλων: Μετά την τοκενοποίηση, κάθε σύμβολο αντιστοιχεί σε μια πυκνή διανυσματική αναπαράσταση που ονομάζεται ενσωμάτωση συμβόλου. Αυτές οι ενσωματώσεις μαθαίνονται κατά τη διάρκεια της εκπαίδευσης και καταγράφουν σημασιολογικές και συντακτικές σχέσεις μεταξύ συμβόλων.
Θέσης Ενσωμάτωση: Τα μοντέλα μετατροπέα επεξεργάζονται ολόκληρη την εισαγωγική ακολουθία ταυτόχρονα, λείπουν της εγγενής έννοιας της θέσης συμβόλων που υπάρχει στα αναδρομικά μοντέλα. Για να ενσωματωθούν πληροφορίες θέσης, προστίθενται ενσωματώσεις θέσης στις ενσωματώσεις συμβόλων, επιτρέποντας στο μοντέλο να διακρίνει μεταξύ συμβόλων με βάση τη θέση τους στην ακολουθία. Τα πρώιμα LLMs χρησιμοποιούσαν σταθερές ενσωματώσεις θέσης με βάση τις ημιτονοειδείς συναρτήσεις, ενώ πιο πρόσφατα μοντέλα έχουν εξερευνήσει μαθητέες ενσωματώσεις θέσης ή εναλλακτικές τεχνικές κωδικοποίησης θέσης όπως οι περιστροφικές ενσωματώσεις θέσης.
Μπλοκ Πολυ-Κεφαλής Προσοχής
Τα βασικά δομικά στοιχεία των LLMs βάσει αποκωδικοποιητή είναι οι στρώσεις πολυ-κεφαλής προσοχής, οι οποίες πραγματοποιούν την εργασία της μασκαρωμένης αυτο-προσοχής που περιγράφηκε νωρίτερα. Αυτές οι στρώσεις στοιβάζονται πολλαπλά, με κάθε στρώση να προσεγγίζει την εξαγωγή της προηγούμενης στρώσης, επιτρέποντας στο μοντέλο να καταγράψει ολοένα και πιο σύνθετες εξαρτήσεις και αναπαραστάσεις.
Κεφαλές Προσοχής: Κάθε στρώση πολυ-κεφαλής προσοχής αποτελείται από πολλαπλά “κεφάλια” προσοχής, το καθένα με τη δική του σειρά ερωτήσεων, κλειδιών και τιμών. Αυτό επιτρέπει στο μοντέλο να προσεγγίσει διαφορετικά аспектς ταυτόχρονα, καταγράφοντας διαφορετικές σχέσεις και μοτίβα.
Συνδεσμοί Υπολοίπου και Κανονικοποίηση Στρώσης: Για να διευκολύνουν την εκπαίδευση βαθιάς δικτύου και να μετριάσουν το πρόβλημα της εξαφάνισης του γрадиέντα, τα LLMs βάσει αποκωδικοποιητή χρησιμοποιούν συνδεσμούς υπολοίπου και τεχνικές κανονικοποίησης στρώσης. Οι συνδεσμοί υπολοίπου προσθέτουν την εισαγωγή μιας στρώσης στην εξαγωγή της, επιτρέποντας στους γрадиέντες να ρέουν πιο εύκολα κατά τη διάρκεια της αντίστροφης伝播. Η κανονικοποίηση στρώσης βοηθά στην σταθεροποίηση των ενεργειών και των γрадиέντων, βελτιώνοντας περαιτέρω τη σταθερότητα εκπαίδευσης και απόδοση.
Στρώσεις Προώθησης
Εκτός από τις στρώσεις πολυ-κεφαλής προσοχής, τα LLMs βάσει αποκωδικοποιητή ενσωματώνουν στρώσεις προώθησης, οι οποίες εφαρμόζουν ένα απλό νευρωνικό δίκτυο σε κάθε θέση της ακολουθίας. Αυτές οι στρώσεις εισάγουν μη-γραμμικότητες και επιτρέπουν στο μοντέλο να μάθει πιο σύνθετες αναπαραστάσεις.
Συνάρτηση Ενεργοποίησης: Η επιλογή της συνάρτησης ενεργοποίησης στις στρώσεις προώθησης μπορεί να επηρεάσει σημαντικά την απόδοση του μοντέλου. Ενώ τα πρώιμα LLMs βασίζονταν στην ευρέως χρησιμοποιούμενη συνάρτηση ενεργοποίησης ReLU, πιο πρόσφατα μοντέλα έχουν υιοθετήσει πιο εξελιγμένες συνάρτησεις ενεργοποίησης όπως η Γαουσιανή Συνάρτηση Σφάλματος Lineαρή Μονάδας (GELU) ή η SwiGLU ενεργοποίηση, οι οποίες έχουν δείξει βελτιωμένη απόδοση.
Σπάνια Προσοχή και Αποτελεσματικοί Μετατροπείς
Ενώ ο μηχανισμός αυτο-προσοχής είναι ισχυρός, συνοδεύεται από eine τετραγωνική υπολογιστική πολυπλοκότητα ως προς το μήκος της ακολουθίας, καθιστώντας το υπολογιστικά ακριβό για μεγάλες ακολουθίες. Για να αντιμετωπίσουν αυτή την πρόκληση, έχουν προταθεί διάφορες τεχνικές για να μειώσουν τις υπολογιστικές και μνημικές απαιτήσεις της αυτο-προσοχής, επιτρέποντας την αποτελεσματική επεξεργασία μεγαλύτερων ακολουθιών.
Σπάνια Προσοχή: Τεχνικές σπάνιας προσοχής, όπως αυτή που χρησιμοποιείται στο μοντέλο GPT-3, προσεγγίζουν επιλεκτικά ένα υποσύνολο θέσεων στην εισαγωγική ακολουθία, αντί να υπολογίζουν σκορ προσοχής για όλες τις θέσεις. Αυτό μπορεί να μειώσει σημαντικά την υπολογιστική πολυπλοκότητα ενώ διατηρεί μια λογική απόδοση.
Προσοχή Παράθυρου Ολίσθησης: Η προσοχή παράθυρου ολίσθησης (SWA), που εισήχθη στο μοντέλο Mistral 7B, είναι μια απλή αλλά αποτελεσματική τεχνική που περιορίζει το πεδίο προσοχής κάθε συμβόλου σε ένα σταθερό μέγεθος παράθυρου. Αυτή η προσέγγιση αξιοποιεί την ικανότητα των στρώσεων μετατροπέα να μεταφέρουν πληροφορίες σε πολλαπλά στρώματα, αποτελεσματικά αυξάνοντας το πεδίο προσοχής χωρίς την τετραγωνική πολυπλοκότητα της πλήρους αυτο-προσοχής.
Κάππα Cache Παράθυρου Ολίσθησης: Για να μειώσουν περαιτέρω τις απαιτήσεις μνήμης, ιδιαίτερα για μεγάλες ακολουθίες, το μοντέλο Mistral 7B χρησιμοποιεί μια κάππα cache παράθυρου ολίσθησης. Αυτή η τεχνική αποθηκεύει και επαναχρησιμοποιεί τους υπολογισμένους διανύσματος κλειδιών και τιμών για ένα σταθερό μέγεθος παράθυρου, αποφεύγοντας υπολογιστικά και μειώνοντας τη χρήση μνήμης.
Ομαδοποιημένη Προσοχή Ερωτήσεων: Η ομαδοποιημένη προσοχή ερωτήσεων (GQA), που εισήχθη στο μοντέλο LLaMA 2, είναι μια παραλλαγή του μηχανισμού πολυ-ερώτησης που διαιρεί τις κεφαλές προσοχής σε ομάδες, με κάθε ομάδα να μοιράζεται ένα κοινό κλειδί και διανύσματα τιμών. Αυτή η προσέγγιση ισορροπεί την αποτελεσματικότητα της πολυ-ερώτησης προσοχής και την απόδοση της τυπικής αυτο-προσοχής, παρέχοντας βελτιωμένα χρόνους συλλογής ενώ διατηρεί υψηλής ποιότητας αποτελέσματα.
















