Μοντέλα και πλατφόρμες AI
MiniGPT-5: Εναλλασσόμενο Όραμα και Γλώσσα Γεννήτρια μέσω Γεννητικών Vokens
Τις τελευταίες années, τα Μεγάλα Μοντέλα Γλώσσας (LLM) έχουν κερδίσει την προσοχή των développers AI σε όλο τον κόσμο λόγω των προόδων στην Επεξεργασία Φυσικής Γλώσσας (NLP). Αυτά τα μοντέλα έχουν θέσει νέα standards στην γεννήτρια κειμένου και κατανόηση. Ωστόσο, παρά την πρόοδο στην γεννήτρια κειμένου, η παραγωγή εικόνων που αντιστοιχούν συνεχώς σε αφηγήσεις κειμένου παραμένει μια πρόκληση. Για να αντιμετωπίσουν αυτό, οι développers έχουν εισαγάγει μια καινοτόμο προσέγγιση όρασης και γλώσσας γεννήτριας βασισμένη σε “γεννητικά vokens”, γεφυρώνοντας το χάσμα για εναρμονισμένες εξόδους κειμένου-εικόνας.
Η βάση του MiniGPT-5 είναι μια διφασική στρατηγική εκπαίδευσης που επικεντρώνεται έντονα στην περιγραφή-ελεύθερη γεννήτρια πολυμεσικών δεδομένων όπου τα δεδομένα εκπαίδευσης δεν απαιτούν καμία περιεκτική περιγραφή εικόνας. Επιπλέον, για να ενισχύσουν την ακεραιότητα του μοντέλου, το μοντέλο ενσωματώνει ένα σύστημα καθοδήγησης χωρίς ταξινομητή που βελτιώνει την αποτελεσματικότητα ενός voken για γεννήτρια εικόνας. Στην αρχική φάση, το πλαίσιο MiniGPT-5 έχει αποδείξει ισχυρή απόδοση και σημαντική βελτίωση σε σχέση με το βασικό μοντέλο Divter που έχει εκπαιδευτεί στο σύνολο δεδομένων MMDialog και έχει αποδείξει συνεχώς την ικανότητά του να παράγει συγκρίσιμες και ακόμη και ανώτερες πολυμεσικές εξόδους στις ανθρώπινες αξιολογήσεις που thựcθηκαν στο σύνολο δεδομένων VIST, το οποίο υπογραμμίζει περαιτέρω την απόδοσή του και την αποτελεσματικότητά του σε διάφορες βάσεις.
MiniGPT5: Μια Εισαγωγή
Με τις πρόσφατες εξελίξεις των πλαισίων LLM και των εφαρμογών που βασίζονται σε αυτά τα πλαισια, η ενοποίηση πολυμεσικών χαρακτηριστικών είναι ένα πεδίο που έχει δει μια αύξηση στη δημοτικότητά του, καθώς αποδεικνύεται επίσης ότι είναι một ζωτικής σημασίας πρόοδος που ενδυναμώνει ένα ευρύ φάσμα εφαρμογών, από εργαλεία δημιουργίας περιεχομένου στοιχείων μέχρι προηγμένα μοντέλα διαλόγου πολυμέσων. Με τη συνεχιζόμενη έρευνα και ανάπτυξη, τα μοντέλα γλώσσας και όρασης βρίσκονται σε ένα σημείο όπου η εργασία γίνεται για να τους επιτρέψει να παράγουν και κείμενο και δεδομένα εικόνας ομαλά. Η ικανότητα των LLM να παράγουν πολυμεσικά δεδομένα ομαλά θα βοηθήσει στην ενίσχυση των αλληλεπιδράσεων σε διάφορα πεδία, συμπεριλαμβανομένων του εμπορίου, των μέσων μαζικής ενημέρωσης και της εικονικής πραγματικότητας.

Τελικά, ο στόχος είναι να επιτρέψει στα μοντέλα να συνθέτουν, αναγνωρίζουν και να ανταποκρίνονται με συνεχή και λογική τρόπο χρησιμοποιώντας και τις κειμενικές και τις οπτικές modalities, παίζοντας ainsi einen κρίσιμο ρόλο στην εναρμόνιση του ρεύματος της πληροφορίας και τη δημιουργία λογικών και συνετών αφηγήσεων. Η ανάγκη για επίτευξη μιας σύνθεσης κειμενικών και οπτικών modalities είναι κατηγορούμενη κυρίως από την ανάγκη για πιο ρευστές, ενοποιημένες και διαδραστικές πολυμεσικές αλληλεπιδράσεις στα LLM και τελικά την επίτευξη της εναλλασσόμενης γλώσσας και όρασης γεννήτριας. Ωστόσο, η επίτευξη ενοποιημένων και διαδραστικών πολυμεσικών αλληλεπιδράσεων στα LLM είναι μια περίπλοκη εργασία που είναι γεμάτη με πολλές προκλήσεις, συμπεριλαμβανομένων
- Αν και τα τρέχοντα LLM είναι εξαιρετικά αποτελεσματικά και ικανά όταν πρόκειται για γεννήτρια κειμένου και επεξεργασία ζευγών κειμένου-εικόνας, δεν παρέχουν ικανοποιητική απόδοση όταν πρόκειται για γεννήτρια εικόνας.
- Η ανάπτυξη αυτών των μοντέλων όρασης και γλώσσας βασίζεται σε μεγάλο βαθμό σε δεδομένα που επικεντρώνονται σε συγκεκριμένα θέματα, καθιστώντας δύσκολο για τα μοντέλα να ευθυγραμμίσουν το γεννημένο κείμενο με τις αντίστοιχες εικόνες.
- Τέλος, υπάρχει ανάγκη για πιο αποτελεσματικές στρατηγικές, καθώς με την αύξηση των ικανοτήτων τους, οι απαιτήσεις μνήμης των LLM αυξάνονται επίσης, ιδιαίτερα όταν thựcθούν εργασίες κατάρτισης.
Το πλαίσιο MiniGPT-5, μια τεχνική εναλλασσόμενης γλώσσας και όρασης γεννήτριας που εισάγει την έννοια των “γεννητικών vokens” σε μια προσπάθεια να αντιμετωπίσει τις προκλήσεις που αναφέρθηκαν παραπάνω. Το πλαίσιο MiniGPT-5 προτείνει μια νέα προσέγγιση για γεννήτρια πολυμεσικών δεδομένων με τη συνδυασμένη χρήση Μεγάλων Μοντέλων Γλώσσας με τεχνικές Stable Diffusion χρησιμοποιώντας ειδικούς οπτικούς συμβολισμούς. Η προτεινόμενη διφασική μέθοδος εκπαίδευσης που χρησιμοποιείται από το πλαίσιο MiniGPT-5 υπογραμμίζει την σημασία ενός θεμελιώδους σταδίου ελεύθερου από περιγραφές και την προετοιμασία του μοντέλου για να παρέχει αποτελεσματική απόδοση ακόμη και σε σενάρια με περιορισμένα δεδομένα.

Αλλά τι διακρίνει το μοντέλο MiniGPT-5 από τα τρέχοντα πλαισια είναι ότι τα γενικά στάδια του πλαισίου MiniGPT-5 δεν αποτελούνται από domaine-ειδικές αναφορές. Επιπλέον, για να διασφαλιστεί ότι το γεννημένο κείμενο και οι αντίστοιχες εικόνες είναι σε αρμονία μεταξύ τους, το πλαίσιο MiniGPT-5 αναπτύσσει μια στρατηγική διπλού στόχου που ενισχύει περαιτέρω την προσέγγιση του MiniGPT-5 για τη χρήση καθοδήγησης χωρίς ταξινομητή και γεννητικών vokens. Το πλαίσιο MiniGPT-5 βελτιώνει την αποτελεσματικότητα της εκπαίδευσης και αντιμετωπίζει τις περιορισμούς μνήμης χάρη στις παραμετρικές στρατηγικές για την εκπαίδευση του μοντέλου.
Για να σας παρέχουμε μια σύντομη περίληψη, το πλαίσιο MiniGPT-5
- Προτείνει μια μέθοδο που χρησιμοποιεί πολυμεσικούς κωδικοποιητές που αντιπροσωπεύουν μια νέα και γενική μέθοδο που έχει αποδειχθεί ιστορικά πιο αποτελεσματική από τα παραδοσιακά LLM και χρησιμοποιεί γεννητικά vokens σε συνδυασμό με τεχνικές Stable Diffusion για τη γεννήτρια εναλλασσόμενων γλώσσας και όρασης.
- Προτείνει μια διφασική στρατηγική εκπαίδευσης για τη γεννήτρια περιγραφής-ελεύθερων πολυμεσικών εξόδων και την ενσωμάτωση της καθοδήγησης χωρίς ταξινομητή κατά την εκπαίδευση για να βελτιώσει περαιτέρω την ποιότητα των δεδομένων που παράγονται.
Το μοντέλο MiniGPT-5 είναι εμπνευσμένο σε μεγάλο βαθμό από τις προηγούμενες έρευνες και εργασίες που έχουν thựcться στα πεδία
- Γεννήτρια Κειμένου σε Εικόνα: Για να διευκολύνουν τη μετατροπή κειμενικών περιγραφών σε αντίστοιχες οπτικές αναπαραστάσεις και μοντέλα κειμένου-εικόνας.
- MLLMs ή Πολυμεσικά Μεγάλα Μοντέλα Γλώσσας: Χρησιμοποιώντας προ-εκπαιδευμένα μοντέλα LLM για να εξερευνήσουν τις εφαρμογές και την αποτελεσματικότητά τους στη γεννήτρια πολυμεσικών δεδομένων.
- Πολυμεσική Γεννήτρια με Μεγάλα Μοντέλα Γλώσσας: Για να ενισχύσουν τις ικανότητες ενός LLM να ομαλοποιήσει την γεννήτρια γλώσσας και δεδομένων εικόνας.
MiniGPT-5: Μέθοδος, Αρχιτεκτονική και Πλαίσιο
Για να ενδυναμώσουν τα μεγάλα μοντέλα γλώσσας με ικανότητες γεννήτριας πολυμεσικών δεδομένων, το μοντέλο MiniGPT-5 εισάγει ένα πλαίσιο που στοχεύει στην ενοποίηση μοντέλων γεννήτριας κειμένου-εικόνας και προ-εκπαιδευμένων πολυμεσικών μεγάλων μοντέλων γλώσσας. Το πλαίσιο MiniGPT-5 εισάγει επίσης τα “γεννητικά vokens”, ειδικούς οπτικούς συμβολισμούς που επιτρέπουν στους développers να αντιμετωπίσουν τις ανισότητες που εμφανίζονται σε διάφορα πεδία, εκπαιδεύοντας trực tiếp σε ακατέργαστες εικόνες. Για να βελτιώσει περαιτέρω την ποιότητα των πολυμεσικών δεδομένων που παράγονται από τα LLM, το πλαίσιο MiniGPT-5 εισάγει μια στρατηγική καθοδήγησης χωρίς ταξινομητή σε συνδυασμό με μια προηγμένη διφασική μέθοδο εκπαίδευσης. Ας δούμε πιο αναλυτικά το πλαίσιο MiniGPT-5.
Πολυμεσικό Στάδιο Εισόδου
Οι εξελίξεις των LLM τις τελευταίες années έχουν φέρει τις ικανότητες πολυμεσικής κατανόησης των LLM στο φως, επιτρέποντας την επεξεργασία εικόνων ως συνεχούς εισόδου. Το πλαίσιο MiniGPT-5 χρησιμοποιεί ειδικά σχεδιασμένα γεννητικά vokens για την εξομοίωση οπτικών χαρακτηριστικών σε μια προσπάθεια να επεκτείνει τις ικανότητες πολυμεσικής κατανόησης των LLM σε γεννήτρια πολυμεσικών δεδομένων. Επιπλέον, το πλαίσιο MiniGPT-5 χρησιμοποιεί παραμετρικές στρατηγικές για την εκπαίδευση του μοντέλου για την πολυμεσική έξοδο με το πλαίσιο LLM.
Πολυμεσικός Κωδικοποιητής
Ο προ-εκπαιδευμένος οπτικός κωδικοποιητής στο πλαίσιο MiniGPT-5 μετατρέπει κάθε εισαγόμενο εικόνα σε μια χαρακτηριστική, και κάθε κειμενικό σύμβολο ενσωματώνεται ως διανυσμα, και τα χαρακτηριστικά εισαγωγής δημιουργούνται όταν αυτά τα ενσωματώσεις συνδυάζονται.
Προσθήκη Vokens σε Μεγάλα Μοντέλα Γλώσσας
Παραδοσιακά, το λεξιλόγιο των Μεγάλων Μοντέλων Γλώσσας αποτελείται μόνο από κειμενικά σύμβολα, και γι’ αυτό οι développers που εργάζονται στο πλαίσιο MiniGPT-5 έπρεπε να γεφυρώσουν το χάσμα μεταξύ των γεννητικών και των παραδοσιακών LLM. Το πλαίσιο MiniGPT-5 εισάγει ένα σύνολο ειδικών συμβολισμών ως γεννητικά vokens στο λεξιλόγιο του LLM. Το πλαίσιο χρησιμοποιεί την κρυφή έξοδο του LLM για αυτά τα ειδικά vokens για την επόμενη γεννήτρια εικόνας, και η εισαγωγή εναλλασσόμενων εικόνων αντιπροσωπεύεται από τη θέση των vokens.
PEFT ή Παραμετρική Εκπαίδευση
Η PEFT ή Παραμετρική Εκπαίδευση είναι một κρίσιμη έννοια που χρησιμοποιείται για την εκπαίδευση των LLM, και ωστόσο, οι εφαρμογές της PEFT σε πολυμεσικά περιβάλλοντα είναι ακόμη ανεξερεύνητες σε μεγάλο βαθμό. Το πλαίσιο MiniGPT-5 χρησιμοποιεί την Παραμετρική Εκπαίδευση πάνω στον κωδικοποιητή του πλαισίου MiniGPT-4 για να εκπαιδεύσει το μοντέλο να κατανοήσει τις οδηγίες ή τις εντολές καλύτερα και να βελτιώσει την συνολική απόδοση του μοντέλου σε περιβάλλοντα zero-shot ή καινούρια.
Πολυμεσική Γεννήτρια Έξοδου
Για να ευθυγραμμίσει το γεννητικό μοντέλο με τα γεννητικά vokens ακριβώς, το πλαίσιο MiniGPT-5 διαμορφώνει ένα συμπαγές μοντέλο αντιστοίχισης για την αντιστοίχιση των διαστάσεων και την ενσωμάτωση επιτηρούμενων απωλειών, συμπεριλαμβανομένης της απώλειας του μοντέλου Latent Diffusion και της απώλειας του χώρου κειμένου. Η απώλεια του μοντέλου Latent Diffusion ευθυγραμμίζει τα κατάλληλα οπτικά χαρακτηριστικά με τα vokens trực tiếp, ενώ η απώλεια του χώρου κειμένου βοηθά το μοντέλο να μάθει τις σωστές θέσεις των vokens. Επειδή τα γεννητικά vokens στο πλαίσιο MiniGPT-5 καθοδηγούνται trực tiếp από τις εικόνες, το πλαίσιο MiniGPT-5 δεν απαιτεί εικόνες να έχουν μια περιεκτική περιγραφή, οδηγώντας σε μια περιγραφή-ελεύθερη μάθηση.
Γεννήτρια Χώρου Κειμένου
Το πλαίσιο MiniGPT-5 ακολουθεί τη μέθοδο της αιτιοκρατικής μοντελοποίησης γλώσσας για τη γεννήτρια και των vokens και των κειμένων στο χώρο κειμένου ομαλά, και κατά τη διάρκεια της εκπαίδευσης, οι développers προσθέτουν τα vokens στη θέση των εικόνων ground truth και εκπαιδεύουν το μοντέλο να προβλέψει vokens μέσα στη γεννήτρια κειμένου.
Αντιστοίχιση Χαρακτηριστικών Voken για Γεννήτρια Εικόνας
Μετά τη γεννήτρια του χώρου κειμένου, το πλαίσιο ευθυγραμμίζει την κρυφή έξοδο με τον χώρο χαρακτηριστικών της συνθήκης κειμένου-εικόνας του μοντέλου γεννήτριας κειμένου-εικόνας. Το πλαίσιο υποστηρίζει επίσης ένα μοντέλο αντιστοίχισης χαρακτηριστικών που περιλαμβάνει ένα μοντέλο MLP δύο στρωμάτων, μια ακολουθία αποκωδικοποιητή με δυνατότητα μάθησης και ένα μοντέλο μετασχηματισμού encoder-decoder τεσσάρων στρωμάτων.
Γεννήτρια Εικόνας με LDM ή Μοντέλο Latent Diffusion
Για να παράγει τις απαιτούμενες εικόνες στη διαδικασία αποσάρωσης, το πλαίσιο χρησιμοποιεί τα χαρακτηριστικά αντιστοίχισης ως συνθήκη εισόδου. Το πλαίσιο χρησιμοποιεί επίσης ένα LDM ή Μοντέλο Latent Diffusion για καθοδήγηση, καθώς κατά τη διάρκεια της εκπαίδευσης, η εικόνα ground truth μετατρέπεται πρώτα σε μια χαρακτηριστική latente χρησιμοποιώντας ένα προ-εκπαιδευμένο VAE, μετά την οποία οι développers λαμβάνουν την χαρακτηριστική θορύβου latente προσθέτοντας κάποιο θόρυβο.
Η ολοκληρωμένη προσέγγιση που χρησιμοποιείται από το πλαίσιο MiniGPT-5 επιτρέπει στους développers να έχουν μια συνεχή κατανόηση και γεννήτρια και οπτικών και κειμενικών στοιχείων, χρησιμοποιώντας ειδικούς συμβολισμούς, αξιοποιώντας τις ικανότητες προ-εκπαιδευμένων μοντέλων και χρησιμοποιώντας καινοτόμες μεθόδους εκπαίδευσης.
MiniGPT-5: Εκπαίδευση και Αποτελέσματα
Όταν εργαζόμαστε στο πλαίσιο MiniGPT-5, οι développers παρατήρησαν ότι η εκπαίδευση σε ένα περιορισμένο σύνολο δεδομένων εναλλασσόμενου κειμένου και εικόνας μπορεί να οδηγήσει σε εικόνες με μειωμένη ποιότητα και σε μη ευθυγραμμισμένες εικόνες, δεδομένου του σημαντικού μετασχηματισμού πεδίου μεταξύ του πεδίου εικόνας και κειμένου. Για να μετριάσει αυτό το ζήτημα, οι développers υιοθέτησαν δύο διαφορετικές στρατηγικές εκπαίδευσης,
- Περιλαμβάνοντας την ενσωμάτωση τεχνικών καθοδήγησης χωρίς ταξινομητή που αυξάνουν την αποτελεσματικότητα των γεννητικών vokens κατά τη διάρκεια της διαδικασίας αποσάρωσης.
- Η δεύτερη στρατηγική χωρίζεται σε δύο στάδια
- Ένα αρχικό στάδιο προ-εκπαίδευσης που επικεντρώνεται κυρίως στην ευθυγράμμιση χονδρικών χαρακτηριστικών.
- Ένα στάδιο εκπαίδευσης που διευκολύνει την εκμάθηση χαρακτηριστικών.
CFG ή Καθοδήγηση Χωρίς Ταξινομητή
Η ιδέα να αξιοποιήσουμε πρώτα την CFG για τη γεννήτρια πολυμεσικών δεδομένων προήλθε από μια προσπάθεια να ενισχύσουμε τη συνεχή και τη λογική μεταξύ των γεννημένων εικόνων και κειμένων, και η CFG εισάγεται κατά τη διάρκεια της διαδικασίας αποσάρωσης κειμένου-εικόνας. Αυτή η μέθοδος παρατηρεί ότι με την εκπαίδευση και σε ανεπίσημη και σε συνθήκη γεννήτριας με conditioning dropout, το γεννητικό μοντέλο μπορεί να επιτύχει ενισχυμένα συνθήκη-εξαρτώμενα αποτελέσματα.
Διφασική Στρατηγική Εκπαίδευσης
Δεδομένου του σημαντικού μετασχηματισμού πεδίου μεταξύ της γεννήτριας εικόνας-κειμένου και της καθαρής γεννήτριας κειμένου, το πλαίσιο MiniGPT-5 χρησιμοποιεί μια διφασική στρατηγική εκπαίδευσης
- Στάδιο Ευθυγράμμισης Μονόπλευρης, ή UAS,
- Στάδιο Πολυμεσικής Μάθησης, ή MLS.
Αρχικά, το πλαίσιο ευθυγραμμίζει τα χαρακτηριστικά της γεννήτριας εικόνας με τα χαρακτηριστικά voken σε σύνολα δεδομένων ζευγών κειμένου-εικόνας όπου κάθε δείγμα δεδομένων περιέχει μόνο ένα κείμενο και μόνο μια εικόνα, και το κείμενο είναι συνήθως η λεζάντα της εικόνας. Σε αυτό το στάδιο, το πλαίσιο επιτρέπει στο LLM να παράγει vokens χρησιμοποιώντας τις λεζάντες ως εισόδους LLM.
Μόλις το UAS έχει εκτελεστεί επιτυχώς, το μοντέλο μπορεί να παράγει εικόνες για単ές περιγραφές κειμένου, αλλά έχει δυσκολίες με την εναλλασσόμενη γεννήτρια γλώσσας και όρασης, συμπεριλαμβανομένων των ζευγών κειμένου-εικόνας και της σύνθετης λογικής που απαιτείται για τη γεννήτρια εικόνας και κειμένου. Για να αντιμετωπίσουν αυτό το εμπόδιο, οι développers έχουν περαιτέρω εκπαιδεύσει το πλαίσιο MiniGPT-5 χρησιμοποιώντας παραμετρικές στρατηγικές με την χρήση του συνόλου δεδομένων VIST. Κατά τη διάρκεια αυτού του σταδίου, το πλαίσιο δημιουργεί τρεις διαφορετικές εργασίες από το σύνολο δεδομένων
- Γεννήτρια Κειμένου Μόνο: Παράγει το σχετικό κείμενο που αντιστοιχεί στην επόμενη εικόνα.
- Γεννήτρια Εικόνας Μόνο: Παράγει την σχετική εικόνα που αντιστοιχεί στο επόμενο κείμενο.
- Πολυμεσική Γεννήτρια: Παράγει ζεύγη κειμένου-εικόνας χρησιμοποιώντας το δεδομένο контекστ.
MiniGPT-5: Βάσεις και Αποτελέσματα
Για να αξιολογήσει την απόδοσή του στην πολυμεσική γεννήτρια ολοκληρωμένα, η ομάδα ανάπτυξης του MiniGPT-5 συγκρίνει την απόδοσή του με άλλα προεξέχοντα μοντέλα βάσης, συμπεριλαμβανομένων των Divter, GILL και του μοντέλου Fine Tuned Unimodal Generation, και η σύγκριση παρουσιάζεται στον πίνακα παρακάτω.

Το πλαίσιο MiniGPT-5 κατανοεί ότι η πολυμεσική έξοδος μπορεί να είναι σημαντική σύμφωνα με το контекστ, αλλά μπορεί να διαφέρει από την πραγματικότητα, που είναι ο κύριος λόγος για τον οποίο το πλαίσιο MiniGPT-5 ενσωματώνει επίσης ανθρώπινες εισόδους για να αξιολογήσει και να αξιολογήσει την απόδοσή του. Συνολικά, η αποτελεσματικότητα του πλαισίου MiniGPT-5 για πολυμεσικές εργασίες μετράται από τρεις οπτικές.
- Συνέχεια Γλώσσας: Αξιολογώντας αν το γεννημένο περιεχόμενο ευθυγραμμίζεται με το δεδομένο контекστ ομαλά.
- Ποιότητα Εικόνας: Αξιολογώντας την σχετικότητα και την καθαρότητα της παραγόμενης εικόνας.
- Πολυμεσική Ευθυγράμμιση: Για να καθορίσει αν η συνδυασμένη έξοδος κειμένου-εικόνας είναι σε αρμονία με το αρχικό контекστ.
Αξιολόγηση VIST Τελικού Βήματος
Στο πρώτο στάδιο των πειραμάτων, το πλαίσιο MiniGPT-5 στοχεύει στην παραγωγή των αντίστοιχων εικόνων, και ο πίνακας παρακάτω συνοψίζει τα αποτελέσματα που λαμβάνονται από αυτή τη ρύθμιση.

Όπως φαίνεται, το πλαίσιο MiniGPT-5 σε όλα τα τρία σενάρια μπορεί να υπερβεί το μοντέλο Fine-Tuned SD2, υπογραμμίζοντας την αποτελεσματικότητα του πλαισίου MiniGPT-5.

Το παραπάνω σχήμα συγκρίνει την απόδοση του πλαισίου MiniGPT-5 με το μοντέλο Fine-Tuned MiniGPT-4 στο S-BERT, Rouge-L και Meteor. Τα αποτελέσματα δείχνουν ότι η χρήση των γεννητικών vokens δεν επηρεάζει αρνητικά την απόδοση του πλαισίου όταν εκτελείται σε εργασίες πολυμεσικής κατανόησης. Τα αποτελέσματα επίσης δείχνουν ότι το πλαίσιο MiniGPT-5 είναι ικανό να αξιοποιήσει μεγάλες οριζόντιες πολυμεσικές εισόδους σε ένα ευρύ φάσμα δεδομένων για να παράγει υψηλής ποιότητας και συνεχή εικόνες χωρίς να επηρεάζει την ικανότητα του αρχικού μοντέλου για πολυμεσική κατανόηση.

Ο πίνακας παραπάνω συγκρίνει την απόδοση τριών πλαισίων σε 5.000 δείγματα για πολυμεσική γεννήτρια από τις απόψεις της Πολυμεσικής Ευθυγράμμισης, Ποιότητας Εικόνας και Συνέχειας Γλώσσας. Όπως φαίνεται, το πλαίσιο MiniGPT-5 υπερβεί τα άλλα δύο μοντέλα βάσης σε περισσότερες από 70% των περιπτώσεων. Από την άλλη πλευρά, ο πίνακας παρακάτω δείχνει την απόδοση του πλαισίου MiniGPT-5 στο σύνολο δεδομένων CC3M για την παραγωγή μονής εικόνας. Λόγω περιορισμών δεδομένων, οι développers βρήκαν ένα χάσμα για την ευθυγράμμιση voken όταν χρησιμοποιείται με Stable Diffusion. Παρά τον περιορισμό αυτό, το πλαίσιο MiniGPT-5 υπερβεί το τρέχον μοντέλο GILL σε όλα τα μετρικά.


Συμπέρασμα
Σε αυτό το άρθρο, μιλήσαμε για το MiniGPT-5, μια εναλλασσόμενη γλώσσας και όρασης γεννήτριας τεχνική που εισάγει την έννοια των “γεννητικών vokens” σε μια προσπάθεια να αξιοποιήσει τις ικανότητες των LLM για τη γεννήτρια πολυμεσικών δεδομένων, ευθυγραμμίζοντας το μεγάλο μοντέλο γλώσσας με ένα προ-εκπαιδευμένο μοντέλο γεννήτριας κειμένου-εικόνας. Μιλήσαμε για τα βασικά στοιχεία και την αρχιτεκτονική του πλαισίου MiniGPT-5, καθώς και τα αποτελέσματα που δείχνουν σημαντικές βελτιώσεις στην απόδοση και την αποτελεσματικότητα σε σύγκριση με τα τρέχοντα μοντέλα βάσης και τα μοντέλα της κατάστασης. Το MiniGPT-5 στοχεύει να θέσει ένα νέο standard στην περιοχή της πολυμεσικής γεννήτριας περιεχομένου και δεδομένων και στοχεύει να αντιμετωπίσει τις προκλήσεις που αντιμετωπίζουν τα προηγούμενα μοντέλα όταν προσπαθούν να λύσουν το ίδιο πρόβλημα.












