Μοντέλα και πλατφόρμες AI

MoE-LLaVA: Μίξη Εкспέρτων για Μεγάλες Μοντέλα Όρασης-Γλώσσας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι πρόσφατες προόδους στα Μεγάλες Μοντέλα Όρασης-Γλώσσας (LVLMs) έχουν δείξει ότι η κλιμάκωση αυτών των πλαισίων αυξάνει σημαντικά την απόδοση σε eine ποικιλία καθηκόντων. Τα LVLMs, συμπεριλαμβανομένων των MiniGPT, LLaMA και άλλων, έχουν επιτύχει εξαιρετικές ικανότητες ενσωματώνοντας στρώματα προβολής οράσεως και κωδικοποιητές εικόνας στη δομή τους. Με την εφαρμογή αυτών των στοιχείων, τα LVLMs βελτιώνουν τις ικανότητες αντίληψης οράσεως των Μεγάλων Μοντέλων Γλώσσας (LLMs). Η απόδοση μπορεί να βελτιωθεί περαιτέρω αυξάνοντας το μέγεθος του μοντέλου και τον αριθμό παραμέτρων, καθώς και επεκτείνοντας την κλίμακα του συνόλου δεδομένων.

Μοντέλα όπως το InternVL έχουν επεκτείνει τον κωδικοποιητή εικόνας σε πάνω από 6 δισεκατομμύρια παραμέτρους, ενώ άλλα έχουν επεκτείνει το backend των LVLMs σε 13 δισεκατομμύρια παραμέτρους, επιτυγχάνοντας υπεροχή απόδοση σε eine ποικιλία καθηκόντων. Το IDEFICS έχει εκπαιδεύσει ένα LVLM με πάνω από 80 δισεκατομμύρια παραμέτρους. Αυτές οι μεθόδους κλιμάκωσης έχουν ισοφαρίσει ή υπερβεί την απόδοση των LLMs που έχουν προ-εκπαιδευτεί σε πάνω από 34, 70 ή ακόμη και 100 δισεκατομμύρια παραμέτρους. Ωστόσο, η κλιμάκωση έχει μια πλευρά: αυξάνει σημαντικά το κόστος εκπαίδευσης και συλλογής. Αυτό οφείλεται στο ότι απαιτεί όλες τις παραμέτρους να είναι ενεργές για κάθε token σε υπολογισμό, οδηγώντας σε υψηλές υπολογιστικές ανάγκες και, κατά συνέπεια, υψηλότερα κόστη.

Αυτό το άρθρο συζητά το MoE-LLaVA, μια αρχιτεκτονική LVLM με βάση το Μίξη Εкспέρτων (MoE) που χρησιμοποιεί μια αποτελεσματική στρατηγική εκπαίδευσης, MoE-Tuning, για LVLMs. Το MoE-Tuning αντιμετωπίζει καινοτομικά την υποβάθμιση της απόδοσης στη μάθηση σπαρσότητας multi-μοντέλων, οδηγώντας σε ένα μοντέλο με ένα μεγάλο αριθμό παραμέτρων αλλά συνεπείς κόστη εκπαίδευσης και συλλογής. Η αρχιτεκτονική του MoE-LLaVA έχει σχεδιαστεί να ενεργοποιεί μόνο τους κορυφαίους-κ experts κατά τη διάρκεια της ανάπτυξης, giữοντας τους υπόλοιπους experts ανενεργούς.

Θα εξετάσουμε το πλαίσιο MoE-LLaVA, εξετάζοντας τη μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική και πώς συγκρίνεται με τα κορυφαία πλαίσια γεννήσεων εικόνας και βίντεο.

MoE-LLaVA: Κλιμάκωση Μεγάλων Μοντέλων Όρασης-Γλώσσας με Οικονομία

Εκτός από τη χρήση στρωμάτων προβολής οράσεως και κωδικοποιητών εικόνας, τα Μεγάλες Μοντέλα Όρασης-Γλώσσας κλιμακώνουν επίσης το μέγεθος του μοντέλου αυξάνοντας τον αριθμό παραμέτρων για να βελτιώσουν την απόδοση του μοντέλου. Κάποια αξιοσημείωτα παραδείγματα Μεγάλων Μοντέλων Όρασης-Γλώσσας που έχουν ακολουθήσει αυτήν την προσέγγιση για να βελτιώσουν την απόδοσή τους είναι τα MiniGPT-4, InternGPT, InternVL και άλλα. Σε πραγματικές εφαρμογές, η κλιμάκωση ενός Μεγάλου Μοντέλου Γλώσσας ή ενός Μεγάλου Μοντέλου Όρασης-Γλώσσας με υψηλής ποιότητας δεδομένα εκπαίδευσης συχνά γίνεται αναγκαιότητα για να βελτιωθεί η απόδοση του μοντέλου. Αν και η κλιμάκωση του μεγέθους του μοντέλου βελτιώνει την απόδοση, αυξάνει επίσης το κόστος εκπαίδευσης και συλλογής του μοντέλου, και αυξάνει τις επιπλοκές και την αποτελεσματικότητα της ανάπτυξης του μοντέλου σε παράλληλες συσκευές ταυτόχρονα. Ένας σημαντικός λόγος πίσω από την αύξηση του κόστους εκπαίδευσης και συλλογής, μαζί με τις υπολογιστικές απαιτήσεις, είναι ότι κάθε token στο πλαίσιο απαιτεί υπολογισμό με κάθε einzelνή παραμέτρω στο μοντέλο, γνωστό ως πυκνό μοντέλο.

Από την άλλη πλευρά, τα σπάρσα MoE ή Μίξη Εкспέρτων Μοντέλων έχουν δείξει αποτελεσματική κλιμάκωση πλαισίων με επεξεργασία δεδομένων με τη βοήθεια ενεργοποιημένων παραμέτρων, μια προσέγγιση που έχει υιοθετηθεί ευρέως στον τομέα της Επεξεργασίας Φυσικής Γλώσσας. Ωστόσο, η χρήση Μίξης Εкспέρτων για να εκπαιδεύσει σπάρσα Μεγάλες Μοντέλα Όρασης-Γλώσσας απευθείας είναι μια πρόκληση, поскольку η μετατροπή LLMs σε LVLMs και η σπαρσότητα του μοντέλου ταυτόχρονα οδηγούν σε σημαντική υποβάθμιση της απόδοσης. Για να εφαρμόσετε Μίξη Εкспέρτων για να κλιμακώσετε LLMs και LVLMs, είναι απαραίτητο να αρχικοποιήσετε το LVLM για σπαρσότητα. Για να επιτύχετε αυτό, το πλαίσιο MoE-LLaVA εισάγει το MoE-Tuning, μια απλή αλλά αποτελεσματική τρι-φασική στρατηγική εκπαίδευσης.

Όπως φαίνεται στην παραπάνω εικόνα, η διαδικασία MoE-Tuning πρώτα εκπαιδεύει ένα MLP ή ένα Πολυστρωματικό Περίπλοκο που προσαρμόζει τα οπτικά tokens σε ένα Μεγάλο Μοντέλο Γλώσσας στο πρώτο στάδιο. Το πλαίσιο στη συνέχεια εκπαιδεύει όλες τις παραμέτρους του LLM για να προ-ενδυναμώσει το Μεγάλο Μοντέλο Όρασης-Γλώσσας με γενικές ικανότητες κατανόησης multi-μοντέλων. Τέλος, στο τρίτο στάδιο, το πλαίσιο αναπαράγει το FFN ή το Feed Forward Network ως αρχικοποίηση βαρών για τους experts, και εκπαιδεύει μόνο τις στρώσεις Μίξης Εкспέρτων. Συνολικά, η διαδικασία εκπαίδευσης βοηθά στην σταδιακή μετάβαση του σπάρσου μοντέλου από μια αρχικοποίηση LVLM σε μια σπάρση Μίξη Εкспέρτων μοντέλων.

Με την ολοκλήρωση της διαδικασίας εκπαίδευσης, ας ρίξουμε φως στο MoE-LLaVA, μια βάση για Μεγάλες Μοντέλα Όρασης-Γλώσσας με Μίξη Εкспέρτων μοντέλων που ενσωματώνει ρουτέρ με μάθηση και MoE μοντέλων. Στο κέντρο του, το μοντέλο MoE-LLaVA αποτελείται από πολλαπλά σπάρσα μονοπάτια, και το πλαίσιο χρησιμοποιεί αυτά τα μονοπάτια για να στείλει κάθε token σε διαφορετικούς experts μέσω του ρουτέρ με μάθηση. Οι tokens στη συνέχεια επεξεργάζονται συλλογικά από τους ενεργοποιημένους experts ενώ οι ανενεργοί δρόμοι παραμένουν σιωπηλοί. Το πλαίσιο στη συνέχεια στοιβάζει τις στρώσεις Μίξης Εкспέρτων κωδικοποιητών για να προσφέρει ένα σπάρσο μονοπάτι προς ένα μεγαλύτερο και πιο ισχυρό LVLM.

Χάρη στην προσέγγιση που εφαρμόζεται από το πλαίσιο MoE-LLaVA, είναι σε θέση να υπερβεί μοντέλα με παρόμοιο αριθμό ενεργοποιημένων παραμέτρων και να υπερβεί αυτά με μεγάλη διαφορά στο POPE object hallucination benchmark, παρά το ότι έχει μόνο 2,2 δισεκατομμύρια παραμέτρους. Επιπλέον, το πλαίσιο MoE-LLaVA με 2,2 δισεκατομμύρια παραμέτρους είναι σε θέση να επιτύχει απόδοση συγκρίσιμη με το InternVL-Chat-19B πλαίσιο με σχεδόν 8 φορές τον αριθμό ενεργοποιημένων παραμέτρων.

Ισχυρά Μεγάλες Μοντέλα Γλώσσας με ισχυρές γενικές και ικανότητες ακολουθίας οδηγιών έχουν εφαρμοστεί σε Μεγάλες Μοντέλα Όρασης-Γλώσσας. Πρώιμα LLMs όπως το BLIP κωδικοποίησαν σήματα οράσεως σε μια σειρά οπτικών tokens, επιτρέποντας τους να προσαρμόσουν την όραση στα LLMs με επιτυχία χρησιμοποιώντας πολλαπλά στρώματα προβολής. Ταυτόχρονα, πρόσφατες εργασίες εστιάζουν στην βελτίωση της απόδοσης του μοντέλου εφαρμόζοντας μεθόδους όπως η επέκταση του συνόλου δεδομένων instruction-tuning, η αύξηση της ανάλυσης της εικόνας, η βελτίωση των στρατηγικών εκπαίδευσης, η ευθυγράμμιση της εισόδου, η βελτίωση των κωδικοποιητών εικόνας και πολλά άλλα. Αυτές οι προσεγγίσεις έχουν βοηθήσει να ενδυναμώσουν τα LVLMs με ισχυρές ικανότητες κατανόησης οράσεως, επεκτείνοντας το συνόλο δεδομένων instruction fine-tuning και την κλίμακα του μοντέλου. Επιπλέον, κάποια LVLMs επίσης διαθέτουν ικανότητες κατανόησης εικόνας fine-grained, όπως region και multi-region κατανόηση, μαζί με pixel-wise grounding ικανότητες. Ωστόσο, το κόστος που συνοδεύει την κλιμάκωση της πυκνής οπτικής δεδομένων και μοντέλων είναι συχνά πολύ υψηλό, καθιστώντας το eine πρόκληση. Από την άλλη πλευρά, το πλαίσιο MoE-LLaVA στοχεύει να κάνει την έρευνα LVLM πιο οικονομική, αξιοποιώντας τις ικανότητες των MoE μοντέλων.

MoE-LLaVA: Μέθοδος και Αρχιτεκτονική

Στο κέντρο του, το πλαίσιο MoE-LLaVA αποτελείται από ένα στρώμα προβολής οράσεως (Πολυστρωματικό Περίπλοκο), einen κωδικοποιητή εικόνας, MoE μπλοκ, πολλαπλά στοιβάζοντα LLM μπλοκ και einen στρώμα ενσωμάτωσης λέξεων.

Αρχιτεκτονική

Ο παρακάτω πίνακας συνοψίζει τις λεπτομερείς ρυθμίσεις του πλαισίου MoE-LLaVA.

Για μια δεδομένη RGB εικόνα, ο κωδικοποιητής εικόνας επεξεργάζεται τις εικόνες για να λάβει μια σειρά οπτικών tokens με ένα στρώμα προβολής οράσεως που χαρτογραφεί την οπτική token σειρά σε είσοδο εικόνας. Οι εισόδους κειμένου επεξεργάζονται από το στρώμα ενσωμάτωσης λέξεων που στη συνέχεια προβάλλει για να λάβει την σειρά tokens. Ταυτόχρονα, το πλαίσιο MoE-LLaVA συνδέει τα κείμενα και οπτικά tokens μαζί και τα στείλει στο LLM. Ωστόσο, το πλαίσιο εκπαιδεύει μόνο το στρώμα προβολής οράσεως με το μεγάλο μοντέλο γλώσσας που αποτελείται από FFN ή Feedforward Neural Networks και Multi-Head Self Attention Layers. Τέλος, το πλαίσιο εφαρμόζει συνδέσεις υπολοίπων και κανονικοποίηση στρώματος σε κάθε μπλοκ.

Συνεχίζοντας, το πλαίσιο MoE-LLaVA αναπαράγει το FFN ή Feedforward Neural Networks από το δεύτερο στάδιο για να σχηματίσει μια ομάδα εμπειρογνωμόνων ως αρχικοποίηση. Ο ρουτέρ, ως ένας γραμμικός слой, προβλέπει την πιθανότητα κάθε token να ανατεθεί σε κάθε εμπειρογνώμονα. Κάθε token επεξεργάζεται από τους κορυφαίους-κ εμπειρογνώμονες με τη μέγιστη πιθανότητα και υπολογίζει το σταθμισμένο άθροισμα με βάση το αποτέλεσμα softmax των πιθανοτήτων.

MoE-Tuning

Το MoE-Tuning είναι μια απλή αλλά αποτελεσματική τρι-φασική στρατηγική εκπαίδευσης που πρώτα εκπαιδεύει ένα MLP ή ένα Πολυστρωματικό Περίπλοκο που προσαρμόζει τα οπτικά tokens σε ένα Μεγάλο Μοντέλο Γλώσσας στο πρώτο στάδιο. Το πλαίσιο στη συνέχεια εκπαιδεύει όλες τις παραμέτρους του LLM για να προ-ενδυναμώσει το Μεγάλο Μοντέλο Όρασης-Γλώσσας με γενικές ικανότητες κατανόησης multi-μοντέλων. Τέλος, στο τρίτο στάδιο, το πλαίσιο αναπαράγει το FFN ή Feed Forward Network ως αρχικοποίηση βαρών για τους εμπειρογνώμονες και εκπαιδεύει μόνο τις στρώσεις Μίξης Εμπειρογνωμόνων.

Στάδιο 1

Στο πρώτο στάδιο, ο основικός στόχος είναι να προσαρμόσει τα οπτικά tokens στο μεγάλο μοντέλο γλώσσας που επιτρέπει στο LLM να κατανοήσει τις περιπτώσεις στην εικόνα. Το πλαίσιο MoE-LLaVA χρησιμοποιεί ένα Πολυστρωματικό Περίπλοκο για να προβάλλει τα οπτικά tokens στο εισοδικό πεδίο του μεγάλου μοντέλου γλώσσας και αντιμετωπίζει τα οπτικά tokens ως ψευδο-κείμενο tokens. Σε αυτό το στάδιο, το πλαίσιο MoE-LLaVA εκπαιδεύει το LLM για να περιγράψει τις εικόνες και δεν εφαρμόζει τις στρώσεις MoE στο LLM κατά τη διάρκεια αυτού του σταδίου.

Στάδιο 2

Στο δεύτερο στάδιο, το MoE-LLaVA προσπαθεί να βελτιώσει τις ικανότητες και τον έλεγχο του πλαισίου με την προσαρμογή του μοντέλου με multi-μοντέλο οδηγίες. Το πλαίσιο MoE-LLaVA επιτυγχάνει αυτό με την προσαρμογή του LLM για να γίνει ένα LVLM με multi-μοντέλο ικανότητες κατανόησης. Το πλαίσιο χρησιμοποιεί πιο σύνθετες οδηγίες, συμπεριλαμβανομένων αναγνώρισης κειμένου και λογικής οπτικής συλλογισμού, που απαιτούν από το μοντέλο να διαθέτει ισχυρότερες multi-μοντέλο ικανότητες. Παραδοσιακά, η διαδικασία εκπαίδευσης για πυκνά μοντέλα θεωρείται ολοκληρωμένη σε αυτό το βήμα. Ωστόσο, το πλαίσιο MoE-LLaVA αντιμετώπισε προκλήσεις στην μετατροπή του LLM σε LVLM ταυτόχρονα με την σπαρσότητα του LVLM. Για να αντιμετωπιστούν αυτές οι προκλήσεις, το πλαίσιο χρησιμοποιεί τα βάρη από το στάδιο ως αρχικοποίηση για το επόμενο στάδιο, σε μια προσπάθεια να ανακουφίσει τη δυσκολία μάθησης του σπάρσου μοντέλου.

Στάδιο 3

Στο τρίτο στάδιο, το μοντέλο αναπαράγει το Feed Forward Network πολλές φορές για να αρχικοποιήσει τους εμπειρογνώμονες ως αρχικοποίηση. Το πλαίσιο στη συνέχεια στείλει τα κείμενα και οπτικά tokens στις στρώσεις Μίξης Εμπειρογνωμόνων, μετά από które ο ρουτέρ υπολογίζει τα βαρέα μεταξύ των εμπειρογνωμόνων και κάθε token. Κάθε token επεξεργάζεται από τους κορυφαίους-κ εμπειρογνώμονες με το σταθμισμένο άθροισμα που υπολογίζεται με βάση τα βαρέα του ρουτέρ. Μόλις οι κορυφαίοι-κ εμπειρογνώμονες ενεργοποιηθούν, το μοντέλο κλείνει τους υπόλοιπους εμπειρογνώμονες, μια προσέγγιση που εξοπλίζει το πλαίσιο MoE-LLaVA με απεριόριστα δυνατά σπάρσα μονοπάτια, εξοπλίζοντας το μοντέλο με eine ευρεία γκάμα ικανοτήτων.

MoE-LLaVA: Αποτελέσματα και Πειράματα

Το πλαίσιο MoE-LLaVA υιοθετεί το CLIP-Large ως τον κωδικοποιητή εικόνας με το Πολυστρωματικό Περίπλοκο που αποτελείται από δύο στρώματα με ένα GELU ενεργοποιητικό στρώμα που χωρίζει τα δύο. Κατά προεπιλογή, το πλαίσιο χρησιμοποιεί μια εναλλακτική αντικατάσταση των Feed Forward Networks με τις στρώσεις Μίξης Εμπειρογνωμόνων, που σημαίνει ότι οι στρώσεις Μίξης Εμπειρογνωμόνων αποτελούν το 50% του tổngικού αριθμού στρωμάτων. Ο παρακάτω πίνακας περιέχει τα διαφορετικά συνόλα δεδομένων μαζί με το μέγεθος του δείγματος που χρησιμοποιείται για την εκπαίδευση και την αξιολόγηση του πλαισίου MoE-LLaVA.

Zero-Shot Image Question Answering

Η παρακάτω εικόνα δείχνει ότι το MoE-LLaVA είναι ένα σπάρσο μοντέλο με ένα ρουτέρ με βάση LVLM. Το πλαίσιο αξιολογείται σε 5 image question answering benchmarks, και όπως φαίνεται, το MoE-LLaVA δείχνει εξαιρετικές ικανότητες κατανόησης εικόνας και επιτυγχάνει απόδοση συγκρίσιμη με το state of the art LLaVA 1.5 πλαίσιο σε πέντε διαφορετικά benchmarks.

Αξιολόγηση Hallucination Αντικειμένου

Για την αξιολόγηση της hallucination αντικειμένου, το πλαίσιο MoE-LLaVA υιοθετεί την πηγή POPE, μια μεθοδολογία ψηφοφορίας, και τα αποτελέσματα παρουσιάζονται στον παρακάτω πίνακα. Όπως φαίνεται, το MoE-LLaVA επιτυγχάνει τα ισχυρότερα αποτελέσματα, δείχνοντας την ικανότητα του πλαισίου να γεννήσει αντικείμενα που είναι συνεπή με την είσοδο εικόνας. Επιπλέον, είναι αξιοσημείωτο ότι το MoE-LLaVA πλαίσιο ισορροπεί καλά το yes ratio, δείχνοντας την ικανότητα του σπάρσου μοντέλου να παρέχει ακριβή ανατροφοδότηση για την δεδομένη ερώτηση.

Η παρακάτω εικόνα περιέχει την κατανομή των φορτίων εμπειρογνωμόνων, όπου οι διακεκομμένες γραμμές αντιπροσωπεύουν μια καλά ισορροπημένη κατανομή των tokens μεταξύ των εμπειρογνωμόνων. Η πρώτη εικόνα δείχνει το φορτίο μέσα στους εμπειρογνώμονες, ενώ οι υπόλοιπες εικόνες δείχνουν την απόδοση των εμπειρογνωμόνων σε διαφορετικά μονοπάτια.

Επιπλέον, η παρακάτω εικόνα δείχνει την κατανομή των μονοπατιών μεταξύ των εμπειρογνωμόνων.

Τελικές Σκέψεις

Σε αυτό το άρθρο, έχουμε συζητήσει το MoE-LLaVA, μια βάση για Μεγάλες Μοντέλα Όρασης-Γλώσσας με Μίξη Εμπειρογνωμόνων μοντέλων που ενσωματώνει ρουτέρ με μάθηση και MoE μοντέλων. Στο κέντρο του, το μοντέλο MoE-LLaVA αποτελείται από πολλαπλά σπάρσα μονοπάτια, και το πλαίσιο χρησιμοποιεί αυτά τα μονοπάτια για να στείλει κάθε token σε διαφορετικούς εμπειρογνώμονες μέσω του ρουτέρ με μάθηση. Οι tokens στη συνέχεια επεξεργάζονται συλλογικά από τους ενεργοποιημένους εμπειρογνώμονες ενώ οι ανενεργοί δρόμοι παραμένουν σιωπηλοί. Το πλαίσιο στη συνέχεια στοιβάζει τις στρώσεις Μίξης Εμπειρογνωμόνων κωδικοποιητών για να προσφέρει ένα σπάρσο μονοπάτι προς ένα μεγαλύτερο και πιο ισχυρό LVLM. Η στρατηγική MoE-Tuning αντιμετωπίζει καινοτομικά την υποβάθμιση της απόδοσης στη μάθηση σπαρσότητας multi-μοντέλων, οδηγώντας σε ένα μοντέλο με ένα μεγάλο αριθμό παραμέτρων αλλά συνεπείς κόστη εκπαίδευσης και συλλογής. Η αρχιτεκτονική του MoE-LLaVA έχει σχεδιαστεί να ενεργοποιεί μόνο τους κορυφαίους-κ εμπειρογνώμονες κατά τη διάρκεια της ανάπτυξης, giữοντας τους υπόλοιπους εμπειρογνώμονες ανενεργούς.

Ο Kunal Kejriwal είναι μηχανικός back‑end που ειδικεύεται στην Python, PostgreSQL, Redis και στην υποδομή cloud στο GCP και το AWS. Με τρία χρόνια εμπειρίας στην κατασκευή και κλιμάκωση συστημάτων παραγωγής, γράφει για την υποδομή AI, τα κατανεμημένα συστήματα και την αρχιτεκτονική πίσω από την ανάπτυξη φορτίων εργασίας μηχανικής μάθησης.