Μοντέλα και πλατφόρμες AI

Η Άνοδος των Mixture-of-Experts για Αποτελεσματικά Μεγάλες Γλωσσικές Μοντέλα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Στον κόσμο της επεξεργασίας φυσικής γλώσσας (NLP), η αναζήτηση για την κατασκευή μεγαλύτερων και πιο ικανών γλωσσικών μοντέλων έχει sido μια κινητήρια δύναμη πίσω από πολλές πρόσφατες προόδους. Ωστόσο, καθώς αυτά τα μοντέλα μεγεθύνονται σε μέγεθος, οι υπολογιστικές απαιτήσεις για την εκπαίδευση και την εύρεση γίνονται ολοένα και πιο απαιτητικές, πιέζοντας τα όρια των διαθέσιμων πόρων υλικού.

Εισάγετε το Mixture-of-Experts (MoE), μια τεχνική που υπόσχεται να ανακουφίσει αυτό το υπολογιστικό βάρος ενώ επιτρέπει την εκπαίδευση μεγαλύτερων και πιο ισχυρών γλωσσικών μοντέλων. Παρακάτω, θα συζητήσουμε το MoE, θα εξερευνήσουμε τις προελεύσεις του, την εσωτερική λειτουργία του και τις εφαρμογές του σε μοντέλα γλωσσικών μετασχηματιστών.

Οι Προελεύσεις των Mixture-of-Experts

Η έννοια των Mixture-of-Experts (MoE) μπορεί να αναχθεί στις αρχές της δεκαετίας του 1990, όταν οι ερευνητές εξέτασαν την ιδέα της υπολογιστικής συνάρτησης, όπου μέρη ενός νευρωνικού δικτύου ενεργοποιούνται επιλεκτικά με βάση τα δεδομένα εισόδου. Một από τα πρωτοποριακά έργα σε αυτό το πεδίο ήταν η εργασία “Adaptive Mixture of Local Experts” από τους Jacobs et al. το 1991, η οποία πρότεινε ένα πλαίσιο εκπαίδευσης για ένα σύνολο νευρωνικών δικτύων, κάθε ένα από τα οποία ειδικεύεται σε διαφορετική περιοχή του χώρου εισόδου.

Η βασική ιδέα πίσω από το MoE είναι να υπάρχουν πολλά “ειδικοί” δικτύα, κάθε ένα από τα οποία είναι υπεύθυνο για την επεξεργασία ενός υποσυνόλου των δεδομένων εισόδου. Ένα μηχανισμό πύλης, συνήθως ένα νευρωνικό δίκτυο, καθορίζει ποιοι ειδικοί πρέπει να επεξεργαστούν μια δεδομένη είσοδο. Αυτή η προσέγγιση επιτρέπει στο μοντέλο να διανείμει τους υπολογιστικούς του πόρους πιο αποτελεσματικά, ενεργοποιώντας μόνο τους σχετικούς ειδικούς για κάθε είσοδο, αντί να απασχολεί όλη τη δυνατότητα του μοντέλου για κάθε είσοδο.

Στα χρόνια που ακολούθησαν, διάφοροι ερευνητές εξέτασαν και επέκτειναν την ιδέα της υπολογιστικής συνάρτησης, οδηγώντας σε εξελίξεις όπως ιεραρχικά MoE, χαμηλού βαθμού προσεγγίσεις για την υπολογιστική συνάρτηση και τεχνικές για την εκτίμηση των gradient μέσω των στοχαστικών νευρώνων και των σκληρών-ενεργοποιητικών συναρτήσεων.

Mixture-of-Experts σε Μετασχηματιστές

Mixture of Experts

Mixture of Experts

Ενώ η ιδέα των MoE έχει υπάρξει για δεκαετίες, η εφαρμογή τους σε μοντέλα γλωσσικών μετασχηματιστών είναι σχετικά πρόσφατη. Οι μετασχηματιστές, οι οποίοι έχουν γίνει το de facto πρότυπο για τα μοντέλα γλωσσικής estado-of-the-art, αποτελούνται από πολλά στρώματα, κάθε ένα από τα οποία περιέχει einen μηχανισμό αυτοπροσοχής και ένα πυκνό νευρωνικό δίκτυο (FFN).

Η κλειδί καινοτομία στην εφαρμογή των MoE σε μετασχηματιστές είναι να αντικαταστήσει τα πυκνά στρώματα FFN με σπάνια MoE στρώματα, κάθε ένα από τα οποία αποτελείται από πολλαπλά ειδικά FFN και einen μηχανισμό πύλης. Ο μηχανισμός πύλης καθορίζει ποιοι ειδικοί πρέπει να επεξεργαστούν κάθε token εισόδου, επιτρέποντας στο μοντέλο να ενεργοποιήσει επιλεκτικά μόνο ένα υποσέτ των ειδικών για μια δεδομένη ακολουθία εισόδου.

Μια από τις πρώτες εργασίες που επέδειξε το δυναμικό των MoE σε μετασχηματιστές ήταν η εργασία “Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer” από τους Shazeer et al. το 2017. Αυτή η εργασία εισήγαγε την έννοια ενός σπάνια-πυλωμένου στρώματος MoE, το οποίο χρησιμοποιούσε einen μηχανισμό πύλης που πρόσθετε σπαρότητα και θόρυβο στη διαδικασία επιλογής των ειδικών, εξασφαλίζοντας ότι μόνο ένα υποσέτ των ειδικών ενεργοποιούνταν για κάθε είσοδο.

Από τότε, πολλές άλλες εργασίες έχουν προωθήσειさらに την εφαρμογή των MoE σε μετασχηματιστές, αντιμετωπίζοντας προκλήσεις όπως η αστάθεια κατά την εκπαίδευση, η ισορροπία φορτίου και η αποτελεσματική εύρεση. Σημαντικά παραδείγματα περιλαμβάνουν τον Switch Transformer (Fedus et al., 2021), ST-MoE (Zoph et al., 2022) και GLaM (Du et al., 2022).

Πλεονεκτήματα των Mixture-of-Experts για Γλωσσικά Μοντέλα

Το κύριο πλεονέκτημα της χρήσης των MoE σε γλωσσικά μοντέλα είναι η ικανότητα να αυξήσει το μέγεθος του μοντέλου ενώ διατηρείται μια σχετικά σταθερή υπολογιστική κόστος κατά την εύρεση. Ενεργοποιώντας επιλεκτικά μόνο ένα υποσέτ των ειδικών για κάθε token εισόδου, τα μοντέλα MoE μπορούν να επιτύχουν την εκφραστική δύναμη πολύ μεγαλύτερων πυκνών μοντέλων ενώ απαιτούν σημαντικά λιγότερη υπολογιστική δύναμη.

Για παράδειγμα, θεωρήστε ένα γλωσσικό μοντέλο με ένα πυκνό στρώμα FFN 7 δισεκατομμυρίων παραμέτρων. Αν αντικαταστήσουμε αυτό το στρώμα με ένα MoE στρώμα που αποτελείται από οκτώ ειδικούς, κάθε ένας από τους οποίους έχει 7 δισεκατομμύρια παραμέτρους, ο συνολικός αριθμός παραμέτρων αυξάνεται σε 56 δισεκατομμύρια. Ωστόσο, κατά την εύρεση, αν ενεργοποιήσουμε μόνο δύο ειδικούς ανά token, το υπολογιστικό κόστος είναι ισοδύναμο με ένα πυκνό μοντέλο 14 δισεκατομμυρίων παραμέτρων, поскольку υπολογίζουμε δύο πυρήνες 7 δισεκατομμυρίων παραμέτρων.

Αυτή η υπολογιστική αποτελεσματικότητα κατά την εύρεση είναι ιδιαίτερα πολύτιμη σε σενάρια ανάπτυξης όπου οι πόροι είναι περιορισμένοι, όπως κινητές συσκευές ή περιβάλλοντα edge computing. Επιπλέον, η μειωμένη υπολογιστική απαιτηση κατά την εκπαίδευση μπορεί να οδηγήσει σε σημαντική εξοικονόμηση ενέργειας και μια χαμηλότερη ενεργειακή αποτύπωση, συμφωνώντας με την αυξανόμενη έμφαση στις βιώσιμες πρακτικές AI.

Προκλήσεις και Συστάσεις

Ενώ τα μοντέλα MoE προσφέρουν ελκυστικά πλεονεκτήματα, η υιοθέτησή τους και ανάπτυξή τους συνοδεύονται επίσης από πολλές προκλήσεις και συστάσεις:

  1. Αστάθεια κατά την Εκπαίδευση: Τα μοντέλα MoE είναι γνωστά ότι είναι πιο ευαίσθητα σε αστάθειες κατά την εκπαίδευση σε σύγκριση με τα πυκνά αντίστοιχά τους. Αυτό το ζήτημα προκύπτει από τη σπάνια και προϋποθετική φύση των ενεργοποιήσεων των ειδικών, η οποία μπορεί να οδηγήσει σε προκλήσεις στην προώθηση και σύγκλιση των gradient. Τεχνικές όπως η router z-loss (Zoph et al., 2022) έχουν προταθεί για την μείωση αυτών των ασταθειών, αλλά περαιτέρω έρευνα είναι ακόμη αναγκαία.
  2. Επιμερισμός και Υπερ-προσαρμογή: Τα μοντέλα MoE έχουν την τάση να υπερ-προσαρμόζονται πιο εύκολα κατά τον επιμερισμό, ιδιαίτερα όταν η κάτω-ροή εργασία έχει ένα σχετικά μικρό σύνολο δεδομένων. Αυτή η συμπεριφορά αποδίδεται στην αυξημένη ικανότητα και σπαρότητα των μοντέλων MoE, η οποία μπορεί να οδηγήσει σε υπερ-ειδικότητα στα δεδομένα εκπαίδευσης. Προσεκτική κανονικοποίηση και στρατηγικές επιμερισμού απαιτούνται για την μείωση αυτού του ζητήματος.
  3. Απαιτήσεις Μνήμης: Ενώ τα μοντέλα MoE μπορούν να μειώσουν τα υπολογιστικά κόστη κατά την εύρεση, συχνά έχουν υψηλότερες απαιτήσεις μνήμης σε σύγκριση με τα πυκνά μοντέλα του ίδιου μεγέθους. Αυτό οφείλεται στο γεγονός ότι όλα τα βάρη των ειδικών πρέπει να φορτωθούν στη μνήμη, ακόμη και αν μόνο ένα υποσέτ των ειδικών ενεργοποιείται για κάθε είσοδο. Οι περιορισμοί μνήμης μπορούν να περιορίσουν την κλιμάκωση των μοντέλων MoE σε συσκευές με περιορισμένους πόρους.
  4. Ισορροπία Φορτίου: Για να επιτύχουν την βέλτιστη υπολογιστική αποτελεσματικότητα, είναι κρίσιμο να ισορροπήσουν το φορτίο μεταξύ των ειδικών, εξασφαλίζοντας ότι κανένας ειδικός δεν είναι υπερφορτωμένος ενώ άλλοι παραμένουν υπο-χρησιμοποιημένοι. Αυτή η ισορροπία φορτίου επιτυγχάνεται συνήθως μέσω βοηθητικών απωλειών κατά την εκπαίδευση και προσεκτικής ρύθμισης του παράγοντα ικανότητας, ο οποίος καθορίζει τον μέγιστο αριθμό token που μπορούν να ανατεθούν σε κάθε ειδικό.
  5. Επικοινωνιακή Υπερβολή: Σε σενάρια κατανεμημένης εκπαίδευσης και εύρεσης, τα μοντέλα MoE μπορούν να εισαγάγουν πρόσθετη επικοινωνιακή υπερβολή λόγω της ανάγκης ανταλλαγής πληροφοριών ενεργοποίησης και gradient μεταξύ ειδικών που κατοικούν σε διαφορετικές συσκευές ή επιταχυντές. Αποτελεσματικές στρατηγικές επικοινωνίας και σχεδιασμός μοντέλου που λαμβάνει υπόψη το υλικό είναι απαραίτητοι για την μείωση αυτής της υπερβολής.

Παρά αυτές τις προκλήσεις, το δυναμικό των μοντέλων MoE για την ενεργοποίηση μεγαλύτερων και πιο ικανών γλωσσικών μοντέλων έχει προκαλέσει σημαντικές ερευνητικές προσπάθειες για την αντιμετώπιση και μείωση αυτών των ζητημάτων.

Παράδειγμα: Mixtral 8x7B και GLaM

Για να εικονογραφήσουμε την πρακτική εφαρμογή των MoE σε γλωσσικά μοντέλα, ας εξετάσουμε δύο αξιοσημείωτα παραδείγματα: Mixtral 8x7B και GLaM.

Το Mixtral 8x7B είναι μια παραλλαγή MoE του μοντέλου γλωσσικής Mistral, που αναπτύχθηκε από την Anthropic. Συνίσταται από οκτώ ειδικούς, κάθε ένας από τους οποίους έχει 7 δισεκατομμύρια παραμέτρους, οδηγώντας σε συνολικό αριθμό 56 δισεκατομμυρίων παραμέτρων. Ωστόσο, κατά την εύρεση, μόνο δύο ειδικοί ενεργοποιούνται ανά token, μειώνοντας αποτελεσματικά το υπολογιστικό κόστος σε εκείνο ενός πυκνού μοντέλου 14 δισεκατομμυρίων παραμέτρων.

Το Mixtral 8x7B έχει επιδείξει εντυπωσιακή απόδοση, ξεπερνώντας το μοντέλο Llama 70 δισεκατομμυρίων παραμέτρων ενώ προσφέρει πολύ ταχύτερες χρόνους εύρεσης. Ένα μοντέλο Mixtral-8x7B που έχει επιμεριστεί για οδηγίες, ονομάζεται Mixtral-8x7B-Instruct-v0.1, έχει επίσης κυκλοφορήσει, ενισχύοντας περαιτέρω τις ικανότητές του στην ακολουθία φυσικών γλωσσικών οδηγιών.

Ένα άλλο αξιοσημείωτο παράδειγμα είναι το GLaM (Google (GOOGL ) Language Model), ένα μεγάλο μοντέλο MoE που αναπτύχθηκε από την Google. Το GLaM χρησιμοποιεί μια αρχιτεκτονική μετασχηματιστή-μόνο και εκπαιδεύτηκε σε ένα τεράστιο σύνολο δεδομένων 1,6 τρισεκατομμυρίων token. Το μοντέλο επιτυγχάνει εντυπωσιακή απόδοση σε αξιολογήσεις few-shot και one-shot, ισοδυναμώντας με την ποιότητα του GPT-3 ενώ χρησιμοποιεί μόνο το ένα τρίτο της ενέργειας που απαιτείται για την εκπαίδευση του GPT-3.

Η επιτυχία του GLaM μπορεί να αποδοθεί στην αποτελεσματική αρχιτεκτονική MoE, η οποία επέτρεψε την εκπαίδευση ενός μοντέλου με τεράστιο αριθμό παραμέτρων ενώ διατηρούσε合理ες υπολογιστικές απαιτήσεις. Το μοντέλο έχει επίσης επιδείξει το δυναμικό των μοντέλων MoE να είναι πιο ενεργειακά αποτελεσματικά και περιβαλλοντικά βιώσιμα σε σύγκριση με τα πυκνά αντίστοιχά τους.

Η Αρχιτεκτονική Grok-1

GROK MIXTURE OF EXPERT

GROK MIXTURE OF EXPERT

Grok-1 είναι ένα μοντέλο μετασχηματιστή-με- MoE με μια μοναδική αρχιτεκτονική που σχεδιάστηκε για να μεγιστοποιήσει την αποτελεσματικότητα και την απόδοση. Ας εμβαθύνουμε στις βασικές προδιαγραφές:

  1. Παράμετροι: Με 314 δισεκατομμύρια παράμετροι, το Grok-1 είναι το μεγαλύτερο ανοιχτό LLM μέχρι σήμερα. Ωστόσο, χάρη στην αρχιτεκτονική MoE, μόνο το 25% των βαρών (περίπου 86 δισεκατομμύρια παράμετροι) είναι ενεργά κάθε φορά, ενισχύοντας τις δυνατότητες επεξεργασίας.
  2. Αρχιτεκτονική: Το Grok-1 χρησιμοποιεί μια αρχιτεκτονική Mixture-of-8-Experts, με κάθε token να επεξεργάζεται από δύο ειδικούς κατά την εύρεση.
  3. Στρώματα: Το μοντέλο αποτελείται από 64 στρώματα μετασχηματιστή, κάθε ένα από τα οποία περιλαμβάνει μηχανισμό αυτοπροσοχής και πυκνά μπλοκ.
  4. Τokenization: Το Grok-1 χρησιμοποιεί einen SentencePiece tokenizer με μέγεθος λεξικού 131.072 token.
  5. Ενσωματώσεις και Ποジσιόνικη Κωδικοποίηση: Το μοντέλο διαθέτει ενσωματώσεις 6.144 διαστάσεων και χρησιμοποιεί περιστροφικές ποζισιόνικες ενσωματώσεις, επιτρέποντας μια πιο δυναμική ερμηνεία των δεδομένων σε σύγκριση με τις παραδοσιακές σταθερές ποζισιόνικες κωδικοποιήσεις.
  6. Προσοχή: Το Grok-1 χρησιμοποιεί 48 κεφαλές προσοχής για ερωτήματα και 8 κεφαλές προσοχής για κλειδιά και τιμές, κάθε μια από τις οποίες έχει μέγεθος 128.
  7. Μήκος Κειμένου: Το μοντέλο μπορεί να επεξεργαστεί ακολουθίες μέχρι 8.192 token, χρησιμοποιώντας ακρίβεια bfloat16 για αποτελεσματική επεξεργασία.

Πληροφορίες Απόδοσης και Υλοποίησης

Το Grok-1 έχει επιδείξει εντυπωσιακή απόδοση, ξεπερνώντας το LLaMa 2 70B και το Mixtral 8x7B με ένα MMLU score 73%, επιδεικνύοντας την αποτελεσματικότητά του και την ακρίβειά του σε διάφορες αξιολογήσεις.

Ωστόσο, είναι σημαντικό να σημειωθεί ότι το Grok-1 απαιτεί σημαντικούς πόρους GPU λόγω του μεγέθους του. Η τρέχουσα υλοποίηση στην ανοιχτή έκδοση επικεντρώνεται στην επαλήθευση της ορθότητας του μοντέλου και χρησιμοποιεί μια μη αποτελεσματική υλοποίηση του στρώματος MoE για να αποφευχθεί η ανάγκη για προσαρμοσμένα πυρήνες.

Παρά ταύτα, το μοντέλο υποστηρίζει sharding ενεργοποίησης και 8-bit quantization, τα οποία μπορούν να βελτιώσουν την απόδοση και να μειώσουν τις απαιτήσεις μνήμης.

Σε ένα αξιοσημείωτο βήμα, η xAI έχει κυκλοφορήσει το Grok-1 υπό την άδεια Apache 2.0, καθιστώντας τα βάρη και την αρχιτεκτονική του διαθέσιμα στην παγκόσμια κοινότητα για χρήση και συνεισφορές.

Η ανοιχτή έκδοση περιλαμβάνει ένα αποθετήριο κώδικα JAX που δείχνει πώς να φορτώσετε και να εκτελέσετε το μοντέλο Grok-1. Οι χρήστες μπορούν να κατεβάσουν τα βάρη των checkpoints χρησιμοποιώντας einen client torrent ή απευθείας μέσω του HuggingFace Hub, διευκολύνοντας την πρόσβαση σε αυτό το πρωτοποριακό μοντέλο.

Το Μέλλον των Mixture-of-Experts σε Γλωσσικά Μοντέλα

Καθώς η ζήτηση για μεγαλύτερα και πιο ικανά γλωσσικά μοντέλα συνεχίζει να αυξάνεται, η υιοθέτηση των τεχνικών MoE αναμένεται να κερδίσει περαιτέρω ορμή. Οι συνεχιζόμενες ερευνητικές προσπάθειες εστιάζονται στην αντιμετώπιση των υπολειπόμενων προκλήσεων, όπως η βελτίωση της σταθερότητας κατά την εκπαίδευση, η μείωση της υπερ-προσαρμογής κατά τον επιμερισμό και η оптимποίηση των απαιτήσεων μνήμης και επικοινωνίας.

Μια υποσχόμενη κατεύθυνση είναι η εξέταση των ιεραρχικών αρχιτεκτονικών MoE, όπου κάθε ειδικός είναι himself αποτελείται από πολλαπλά υπο-ειδικά. Αυτή η προσέγγιση θα μπορούσε pot να επιτρέψει ακόμη μεγαλύτερη κλιμάκωση και υπολογιστική αποτελεσματικότητα ενώ διατηρεί την εκφραστική δύναμη μεγάλων μοντέλων.

Επιπλέον, η ανάπτυξη υλικού και λογισμικού που είναι βελτιστοποιημένα για τα μοντέλα MoE είναι ένα ενεργό πεδίο έρευνας. Ειδικοί επιταχυντές και κατανεμημένα πλαίσια εκπαίδευσης που σχεδιάστηκαν για να χειρίζονται αποτελεσματικά τις σπάνιες και προϋποθετικές υπολογιστικές μοτίβους των μοντέλων MoE θα μπορούσαν να βελτιώσουν περαιτέρω την απόδοση και την κλιμάκωση τους.

Περαιτέρω, η ενσωμάτωση των τεχνικών MoE με άλλες προόδους στα γλωσσικά μοντέλα, όπως οι σπάνιες μηχανισμοί προσοχής, οι αποτελεσματικές στρατηγικές tokenization και οι πολυ-τροπικές αναπαραστάσεις, θα μπορούσε να οδηγήσει σε ακόμη πιο ισχυρά και ποικίλα γλωσσικά μοντέλα που μπορούν να αντιμετωπίσουν ένα ευρύ φάσμα εργασιών.

Συμπέρασμα

Η τεχνική Mixture-of-Experts έχει αναδυθεί ως ένα ισχυρό εργαλείο στην αναζήτηση για μεγαλύτερα και πιο ικανά γλωσσικά μοντέλα. Ενεργοποιώντας επιλεκτικά τους ειδικούς με βάση τα δεδομένα εισόδου, τα μοντέλα MoE προσφέρουν μια υποσχόμενη λύση στα υπολογιστικά προβλήματα που συνδέονται με την κλιμάκωση των πυκνών μοντέλων. Ενώ υπάρχουν ακόμη προκλήσεις να αντιμετωπιστούν, όπως η αστάθεια κατά την εκπαίδευση, η υπερ-προσαρμογή και οι απαιτήσεις μνήμης, τα πλεονεκτήματα των μοντέλων MoE σε όρους υπολογιστικής αποτελεσματικότητας, κλιμάκωσης και περιβαλλοντικής βιωσιμότητας τα καθιστούν ένα ενδιαφέρον πεδίο έρευνας και ανάπτυξης.

Καθώς το πεδίο της επεξεργασίας φυσικής γλώσσας συνεχίζει να推 τα όρια του τι είναι δυνατό, η υιοθέτηση των τεχνικών MoE είναι πιθανό να παίξει einen κρίσιμο ρόλο στην ενεργοποίηση της επόμενης γενιάς γλωσσικών μοντέλων. Συνδυάζοντας τις τεχνικές MoE με άλλες προόδους στην αρχιτεκτονική μοντέλων, τις τεχνικές εκπαίδευσης και την βελτιστοποίηση του υλικού, μπορούμε να αναμένουμε ακόμη πιο ισχυρά και ποικίλα γλωσσικά μοντέλα που μπορούν να κατανοήσουν και να επικοινωνήσουν με τους ανθρώπους σε ένα φυσικό και ομαλό τρόπο.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.