Μοντέλα και πλατφόρμες AI

Η τελευταία Μixture of Experts (MoE) του Mistral AI 8x7B

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Mistral AI

που είναι μια εταιρεία ανοικτού κώδικα με έδρα το Παρίσι, έχει προκαλέσει τα νόρμς με την κυκλοφορία του τελευταίου μεγάλου μοντέλου γλώσσας (LLM), MoE 8x7B, μέσω ενός απλού σύνδεσμου torrent. Αυτό αντιπαραβάλλεται με την παραδοσιακή προσέγγιση της Google με την κυκλοφορία του Gemini, προκαλώντας συζητήσεις και ενθουσιασμό στην κοινότητα του AI.

Η προσέγγιση του Mistral AI στις κυκλοφορίες έχει πάντα ήταν αντίστοιχη. Συχνά παραλείποντας τους συνήθεις συνοδούς εγγράφων, blog ή δημοσιευμάτων, η στρατηγική τους έχει ήταν μοναδικά αποτελεσματική στην κατοχή της προσοχής της κοινότητας του AI.

Πρόσφατα, η εταιρεία πέτυχε ένα εξαιρετικό $2 δισεκατομμύρια αξιολόγηση μετά από μια στρογγυλή χρηματοδότησης που ηγήθηκε η Andreessen Horowitz. Αυτή η στρογγυλή χρηματοδότησης ήταν ιστορική, θέτοντας ένα ρεκόρ με μια $118 εκατομμύρια στρογγυλή χρηματοδότησης, την μεγαλύτερη στην ευρωπαϊκή ιστορία. Πέρα από τις επιτυχίες της χρηματοδότησης, η ενεργός συμμετοχή του Mistral AI στις συζητήσεις γύρω από τον νόμο AI της ΕΕ, υποστηρίζοντας τη μείωση της ρύθμισης στον ανοικτό κώδικα AI.

Γιατί το MoE 8x7B προκαλεί προσοχή

Περιγραφόμενο ως “μείωση του GPT-4”, το Mixtral 8x7B χρησιμοποιεί ένα πλαίσιο Μixture of Experts (MoE) με οκτώ εμπειρογνώμονες. Κάθε εμπειρογνώμων έχει 111B παραμέτρους, σε συνδυασμό με 55B κοινές παραμέτρους προσοχής, για να δώσει συνολικά 166B παραμέτρους ανά μοντέλο. Αυτή η επιλογή σχεδιασμού είναι σημαντική, καθώς επιτρέπει μόνο δύο εμπειρογνώμονες να συμμετέχουν στη συλλογή κάθε token, υπογραμμίζοντας μια μετατόπιση προς πιο αποτελεσματική και εστιασμένη επεξεργασία AI.

Ένα από τα κύρια χαρακτηριστικά του Mixtral είναι η ικανότητά του να διαχειρίζεται một εκτεταμένο контέκστ 32.000 token, παρέχοντας άφθονη εμβέλεια για την αντιμετώπιση σύνθετων εργασιών. Οι πολυγλωσσικές ικανότητες του μοντέλου περιλαμβάνουν ισχυρή υποστήριξη για τα αγγλικά, τα γαλλικά, τα ιταλικά, τα γερμανικά και τα ισπανικά, εξυπηρετώντας μια παγκόσμια κοινότητα αναπτυξιακών.

Η προ-εκπαίδευση του Mixtral περιλαμβάνει δεδομένα από το ανοιχτό Web, με μια ταυτόχρονη προσέγγιση εκπαίδευσης για τους εμπειρογνώμονες και τους ρουτέρ. Αυτή η μέθοδος εξασφαλίζει ότι το μοντέλο δεν είναι μόνο εκτενές στο χώρο παραμέτρων του, αλλά και καλά调τισμένο στις ιδιομορφίες των εκτενών δεδομένων που έχει εκτεθεί.

Mixtral 8x7B επιτυγχάνει ένα εντυπωσιακό σκορ

Mixtral 8x7B επιτυγχάνει ένα εντυπωσιακό σκορ

Το Mixtral 8x7B υπερβαίνει το LLaMA 2 70B και αντιπαραβάλλεται με το GPT-3.5, ιδιαίτερα αξιοσημείωτο στη εργασία MBPP με ποσοστό επιτυχίας 60,7%, σημαντικά υψηλότερο από τους ανταγωνιστές του. Ακόμη και στην αυστηρή εργασία MT-Bench, που προορίζεται για μοντέλα που ακολουθούν οδηγίες, το Mixtral 8x7B επιτυγχάνει ένα εντυπωσιακό σκορ, σχεδόν ισάξιο με το GPT-3.5

Κατανόηση του Πλαίσιο Μixture of Experts (MoE)

Το μοντέλο Μixture of Experts (MoE), ενώ έχει πρόσφατα προκαλέσει προσοχή λόγω της ενσωμάτωσής του σε μοντέλα γλώσσας υψηλής απόδοσης όπως το MoE 8x7B του Mistral AI, έχει τις ρίζες του σε θεμελιώδεις έννοιες που χρονολογούνται αρκετά χρόνια. Ας αναβιώσουμε τις αρχές αυτής της ιδέας μέσω σεμιναλικών ερευνητικών εργασιών.

Η Έννοια του MoE

Το Μixture of Experts (MoE) αντιπροσωπεύει μια μετατόπιση παραδείγματος στις αρχιτεκτονικές νευρωνικών δικτύων. Αντιθέτως με τα παραδοσιακά μοντέλα που χρησιμοποιούν ένα ενιαίο, ομοιογενές δίκτυο για την επεξεργασία όλων των τύπων δεδομένων, το MoE υιοθετεί μια πιο εξειδικευμένη και modulaire προσέγγιση. Συνίσταται από πολλαπλά “εμπειρογνώμονες” δίκτυα, κάθε ένα από τα οποία σχεδιάζεται για να χειρίζεται συγκεκριμένους τύπους δεδομένων ή εργασίες, υπό την εποπτεία ενός “δικτύου πυλών” που κατευθύνει δυναμικά τα δεδομένα εισόδου προς τον πιο κατάλληλο εμπειρογνώμονα.

Ένα στρώμα Μixture of Experts (MoE) ενσωματωμένο σε ένα μοντέλο γλώσσας αναδρομής

Ένα στρώμα Μixture of Experts (MoE) ενσωματωμένο σε ένα μοντέλο γλώσσας αναδρομής (Πηγή)

 

Η παραπάνω εικόνα παρουσιάζει μια υψηλή προβολή ενός στρώματος MoE ενσωματωμένου σε ένα μοντέλο γλώσσας. Στο κέντρο του, το στρώμα MoE αποτελείται από πολλαπλά feed-forward υπο-δικτύα, που ονομάζονται “εμπειρογνώμονες”, κάθε ένα από τα οποία έχει τη δυνατότητα να εξειδικευτεί στην επεξεργασία διαφορετικών аспектών των δεδομένων. Ένα δίκτυο πυλών, που υπογραμμίζεται στο διάγραμμα, καθορίζει ποιοι από αυτούς τους εμπειρογνώμονες θα ενεργοποιηθούν για μια δεδομένη είσοδο. Αυτή η συνθήκη ενεργοποίησης επιτρέπει στο δίκτυο να αυξήσει σημαντικά την ικανότητά του χωρίς μια αντίστοιχη αύξηση της υπολογιστικής ζήτησης.

Λειτουργία του Στρώματος MoE

Στην πράξη, το δίκτυο πυλών αξιολογεί την είσοδο (που ονομάζεται G(x) στο διάγραμμα) και επιλέγει ένα σπάνιο σύνολο εμπειρογνώμονων για να την επεξεργαστεί. Αυτή η επιλογή ρυθμίζεται από τις εξόδους του δικτύου πυλών, καθορίζοντας αποτελεσματικά τη “ψηφοφορία” ή τη συμβολή κάθε εμπειρογνώμονα στην τελική έξοδο. Για παράδειγμα, όπως φαίνεται στο διάγραμμα, μόνο δύο εμπειρογνώμονες μπορεί να επιλεγούν για τον υπολογισμό της έξοδου για κάθε συγκεκριμένο token, καθιστώντας τη διαδικασία αποτελεσματική με τη συγκέντρωση των υπολογιστικών πόρων εκεί όπου είναι πιο απαραίτητοι.

 

Transformer Encoder με Στρώματα MoE (Πηγή)

Η δεύτερη εικόνα αντίθετα με ένα παραδοσιακό Transformer Encoder με ένα που έχει ενσωματωμένα στρώματα MoE. Η αρχιτεκτονική Transformer, ευρέως γνωστή για την αποτελεσματικότητά της σε εργασίες που σχετίζονται με τη γλώσσα, παραδοσιακά αποτελείται από στρώματα αυτο-προσοχής και feed-forward που στοιβάζονται σε序. Η εισαγωγή των στρωμάτων MoE αντικαθιστά κάποια από αυτά τα στρώματα feed-forward, επιτρέποντας στο μοντέλο να κλιμακωθεί σε σχέση με την ικανότητά του πιο αποτελεσματικά.

Στο αυξημένο μοντέλο, τα στρώματα MoE είναι κομμάτια σε πολλαπλά συσκευές, παρουσιάζοντας μια προσέγγιση μοντέλου-παράλληλης. Αυτό είναι κρίσιμο όταν κλιμακώνεται σε πολύ μεγάλες μονάδες, καθώς επιτρέπει τη διανομή της υπολογιστικής φόρτισης και των απαιτήσεων μνήμης σε ένα cluster συσκευών, όπως GPU ή TPU. Αυτή η κομμάτια είναι απαραίτητη για την εκπαίδευση και την ανάπτυξη μοντέλων με δισεκατομμύρια παραμέτρους αποτελεσματικά, όπως αποδεικνύεται από την εκπαίδευση μοντέλων με εκατοντάδες δισεκατομμύρια έως πάνω από ένα τρισεκατομμύριο παραμέτρους σε μεγάλους υπολογιστικούς clusters.

Η Σπάνια Προσέγγιση MoE με Εργασία Οδηγών σε LLM

Το έγγραφο με τίτλο “Σπάνια Μixture-of-Experts (MoE) για Αναλογική Μοντελοποίηση Γλώσσας” συζητά μια καινοτόμο προσέγγιση για τη βελτίωση των Μεγάλων Μοντέλων Γλώσσας (LLM) με την ενσωμάτωση της αρχιτεκτονικής Μixture of Experts με τεχνικές εργασίας οδηγών.

Υπογραμμίζει μια κοινή πρόκληση όπου τα μοντέλα MoE υποπερφέρουν σε σύγκριση με πυκνά μοντέλα ίσης υπολογιστικής ικανότητας όταν εξειδικεύονται για συγκεκριμένες εργασίες λόγω διακρυμμένων μεταξύ γενικής προ-εκπαίδευσης και εργασίας-ειδικής εξειδίκευσης.

Η εργασία οδηγών είναι μια μεθοδολογία εκπαίδευσης όπου τα μοντέλα εξειδικεύονται για να ακολουθούν φυσικές οδηγίες γλώσσας, ενισχύοντας αποτελεσματικά την απόδοσή τους. Το έγγραφο υποδηλώνει ότι τα μοντέλα MoE παρουσιάζουν μια αξιοσημείωτη βελτίωση όταν συνδυάζονται με εργασία οδηγών, περισσότερο από τα πυκνά αντίστοιχά τους. Αυτή η τεχνική ευθυγραμμίζει τις προ-εκπαιδευμένες αναπαραστάσεις του μοντέλου για να ακολουθούν οδηγίες πιο αποτελεσματικά, οδηγώντας σε σημαντικές βελτιώσεις απόδοσης.

Οι ερευνητές διεξήγαγαν μελέτες σε τρεις πειραματικές διατάξεις, αποκαλύπτοντας ότι τα μοντέλα MoE αρχικά υποπερφέρουν στη直接η εξειδίκευση για συγκεκριμένες εργασίες. Ωστόσο, όταν εφαρμόζεται η εργασία οδηγών, τα μοντέλα MoE ξεχωρίζουν, ιδιαίτερα όταν συμπληρώνονται με εξειδίκευση εργασίας. Αυτό υποδηλώνει ότι η εργασία οδηγών είναι ένα κρίσιμο βήμα για τα μοντέλα MoE για να υπερβούν τα πυκνά μοντέλα σε εργασίες ροής.

Η επίδραση της εργασίας οδηγών στο MOE

Η επίδραση της εργασίας οδηγών στο MOE

Επίσης, εισάγει το FLAN-MOE32B, ένα μοντέλο που αποδεικνύει την επιτυχημένη εφαρμογή αυτών των εννοιών. Ιδιαίτερα, υπερβαίνει το FLAN-PALM62B, ένα πυκνό μοντέλο, σε εργασίες αναφοράς ενώ χρησιμοποιεί μόνο το ένα τρίτο των υπολογιστικών πόρων. Αυτό δείχνει το потенシャル για σπάνια μοντέλα MoE σε συνδυασμό με εργασία οδηγών για να θέσουν νέους προτύπους για την αποτελεσματικότητα και την απόδοση των LLM.

Εφαρμογή του Μixture of Experts σε Πραγματικές Περιπτώσεις

Η πολυπλοκότητα των μοντέλων MoE τα κάνει ιδανικά για eine σειρά από εφαρμογές:

  • Επεξεργασία Φυσικής Γλώσσας (NLP): Τα μοντέλα MoE μπορούν να χειριστούν τις ιδιομορφίες και τις phứcότητες της ανθρώπινης γλώσσας πιο αποτελεσματικά, τα καθιστώντας ιδανικά για προηγμένες εργασίες NLP.
  • Επεξεργασία Εικόνων και Βίντεο: Σε εργασίες που απαιτούν υψηλής ανάλυσης επεξεργασία, το MoE μπορεί να χειριστεί διαφορετικούς аспектούς εικόνων ή καδρών βίντεο, βελτιώνοντας και την ποιότητα και την ταχύτητα επεξεργασίας.
  • Προσαρμόσιμες Λύσεις AI: Οι επιχειρήσεις και οι ερευνητές μπορούν να προσαρμόσουν τα μοντέλα MoE σε συγκεκριμένες εργασίες, οδηγώντας σε πιο στοχευμένες και αποτελεσματικές λύσεις AI.

Προκλήσεις και Σκέψεις

Ενώ τα μοντέλα MoE προσφέρουν πολλά οφέλη, επίσης παρουσιάζουν μοναδικές προκλήσεις:

  • Συμπλοκή στην Εκπαίδευση και την Εξειδίκευση: Η κατανεμημένη φύση των μοντέλων MoE μπορεί να complikate την διαδικασία εκπαίδευσης, απαιτώντας προσεκτική ισορροπία και εξειδίκευση των εμπειρογνώμονων και του δικτύου πυλών.
  • Διαχείριση Πόρων: Η αποτελεσματική διαχείριση των υπολογιστικών πόρων σε πολλαπλούς εμπειρογνώμονες είναι κρίσιμη για την μεγιστοποίηση των οφελών των μοντέλων MoE.

Η ενσωμάτωση των στρωμάτων MoE σε νευρωνικά δίκτυα, ιδιαίτερα στον τομέα των μοντέλων γλώσσας, προσφέρει einen δρόμο προς την κλιμάκωση μοντέλων σε μεγέθη που προηγουμένως ήταν ακατόρθωτα λόγω υπολογιστικών περιορισμών. Η συνθήκη υπολογισμού που ενεργοποιείται από τα στρώματα MoE επιτρέπει μια πιο αποτελεσματική διανομή των υπολογιστικών πόρων, καθιστώντας δυνατή την εκπαίδευση μεγαλύτερων, πιο ικανοποιητικών μοντέλων. Όσο συνεχίζουμε να ζητάμε περισσότερα από τα συστήματα AI μας, αρχιτεκτονικές όπως το Transformer με στρώματα MoE είναι πιθανό να γίνουν ο προτύπος για την αντιμετώπιση σύνθετων, μεγάλης κλίμακας εργασιών σε διάφορους τομείς.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.